diff --git a/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/README.md b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..ba8ee3eb4209338f475e9bee0a53c3da7f2e22fb --- /dev/null +++ b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/README.md @@ -0,0 +1,28 @@ +# Franka Stack Bowl RECAP Value SFT Checkpoint + +This checkpoint is a RECAP value/critic model trained for the Franka stack-bowl task using labeled rollout data. + +Important: this is not a direct action-policy checkpoint. It is the RECAP value model checkpoint produced by `examples/offline_rl/advantage_labeling/recap/train_value.py`. + +## Run + +- Model family in config: `pi05` +- Task: `Stack the three bowls in size order: the purple bowl first, then the beige bowl.` +- Dataset: stack-bowl RECAP rollout labels, 34 episodes, 196579 frames +- Labels: 22 success / 12 failure +- Return sidecar: `returns_fail300.parquet` +- Training: resumed from `global_step_5000`, completed to `global_step_8000` +- Final checkpoint: `global_step_8000` + +## Final eval metrics + +- `eval/loss`: 2.1 +- `eval/mae`: 0.0219 +- `eval/cat_acc_best`: 0.287 +- `eval/cat_acc_neighbor`: 0.44 + +## Files + +- `checkpoints/global_step_8000/actor/model_state_dict/full_weights.pt`: full actor/value model state dict +- `run_value_sft_fail300_resume5000.sh`: resume training command +- `value_sft_fail300_resume5000_mb2_tmux.log`: training log from the successful resume segment diff --git a/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/checkpoints/global_step_8000/actor/model_state_dict/full_weights.pt b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/checkpoints/global_step_8000/actor/model_state_dict/full_weights.pt new file mode 100644 index 0000000000000000000000000000000000000000..536113af5ff724b8782bbb190798c1cbde9f00c0 --- /dev/null +++ b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/checkpoints/global_step_8000/actor/model_state_dict/full_weights.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3c42f0df0c54fa5003707307333cdb040c9a653335279a03aae487f1aa6653c6 +size 1799192037 diff --git a/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/logs/value_sft_fail300_resume5000_mb2_tmux.log b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/logs/value_sft_fail300_resume5000_mb2_tmux.log new file mode 100644 index 0000000000000000000000000000000000000000..3e05442fc882bfede2587bfd64658a5e422e5bba --- /dev/null +++ b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/logs/value_sft_fail300_resume5000_mb2_tmux.log @@ -0,0 +1,3324 @@ +Did not find any active Ray processes. +Usage stats collection is disabled. + +Local node IP: 192.168.10.114 + +-------------------- +Ray runtime started. +-------------------- + +Next steps + Note: The following commands are intended for use on + the head node or within the cluster network. + + To add another node to this Ray cluster, run +  ray start --address='192.168.10.114:6379' + + To connect to this Ray cluster: + import ray + ray.init() + + To submit a Ray job using the Ray Jobs CLI: +  RAY_API_SERVER_ADDRESS='http://127.0.0.1:8265' ray job submit --working-dir . -- python my_script.py + + See https://docs.ray.io/en/latest/cluster/running-applications/job-submission/index.html + for more information on submitting Ray jobs to the Ray cluster. + + To terminate the Ray runtime, run +  ray stop + + To view the status of the cluster, use + ray status + + To monitor and debug Ray, view the dashboard at + 127.0.0.1:8265 + + If connection to the dashboard fails, check your firewall settings and network configuration. +INFO:datasets:JAX version 0.5.0 available. +INFO:absl:Handler "orbax.checkpoint._src.handlers.array_checkpoint_handler.ArrayCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.proto_checkpoint_handler.ProtoCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.json_checkpoint_handler.JsonCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.base_pytree_checkpoint_handler.BasePyTreeCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.pytree_checkpoint_handler.PyTreeCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.standard_checkpoint_handler.StandardCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.random_key_checkpoint_handler.JaxRandomKeyCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint._src.handlers.random_key_checkpoint_handler.NumpyRandomKeyCheckpointHandler" already exists in the registry with associated type . Skipping registration. +INFO:absl:Handler "orbax.checkpoint.test_utils.ErrorCheckpointHandler" already exists in the registry with associated type . Skipping registration. +/data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/transformers/utils/hub.py:110: FutureWarning: Using `TRANSFORMERS_CACHE` is deprecated and will be removed in v5 of Transformers. Use `HF_HOME` instead. + warnings.warn( +/data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/hydra/_internal/hydra.py:119: UserWarning: Future Hydra versions will no longer change working directory at job runtime by default. +See https://hydra.cc/docs/1.2/upgrades/1.1_to_1.2/changes_to_job_working_dir/ for more information. + ret = run_job( +2026-09-03 17:02:27,271 INFO worker.py:1833 -- Connecting to existing Ray cluster at address: 192.168.10.114:6379... +2026-09-03 17:02:27,326 INFO worker.py:2015 -- Connected to Ray cluster. View the dashboard at 127.0.0.1:8265  +[INFO 17:02:30 RLinf] RLinf is running on a cluster with 1 node and 1 accelerator. The nodes' details are: +node_labels: [] +node_rank: 0 +ray_id: e1bdaa9176468450853e2037ea2c1974906e8a2965b39ff2eac00c3c +node_ip: 192.168.10.114 +num_cpus: 48 +python_interpreter_path: /data/lfwj/miniconda3/envs/lerobot/bin/python +hardware_resources: +- type: Accelerator + infos: + - type: Accelerator + model: NV_GPU:RTX 4090 D +profiler_backends: +- nsight + +Node groups' details are: +label: cluster +nodes: '0' +hardware_type: Accelerator +ignore_hardware: false +env_configs: null + +label: node +nodes: '0' +hardware_type: null +ignore_hardware: true +env_configs: null + +[INFO 17:02:30 FlexiblePlacementStrategy] +[INFO 17:02:30 FlexiblePlacementStrategy] Using flexible placement with hardware ranks: [[0]], node groups: ['cluster']. +[INFO 17:02:30 FlexiblePlacementStrategy] +[INFO 17:02:30 FlexiblePlacementStrategy] Using flexible placement with hardware ranks: [[0]], node groups: ['cluster']. +[INFO 17:02:30 FlexiblePlacementStrategy] Generated 1 placements: [Placement(rank=0, cluster_node_rank=0, placement_node_rank=0, local_accelerator_rank=0, accelerator_type='NV_GPU', local_rank=0, local_world_size=1, visible_accelerators=['0'], isolate_accelerator=True, local_hardware_ranks=[0], node_group_label='cluster')]. +(_RemoteNodeProbe pid=3730303) /data/yangky/test/RealWorld-RLinf/rlinf/scheduler/cluster/node.py:532: UserWarning: Python interpreter used to launch Ray on node with IP 192.168.10.114 is different from that on the head node /data/lfwj/miniconda3/envs/lerobot/bin/python. Keep using the current interpreter /data/lfwj/miniconda3/envs/lerobot/bin/python3.10 on this node. +(_RemoteNodeProbe pid=3730303) warnings.warn( +(pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/transformers/utils/hub.py:110: FutureWarning: Using `TRANSFORMERS_CACHE` is deprecated and will be removed in v5 of Transformers. Use `HF_HOME` instead. +(pid=3732960) warnings.warn( +(FSDPValueSftWorker pid=3732960) INFO:rlinf.data.datasets.recap.utils:Loaded returns sidecar: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc/meta/returns_fail300.parquet (34 episodes) +(FSDPValueSftWorker pid=3732960) INFO:rlinf.data.datasets.recap.value_dataset:ReturnNormalizer: return_min=-20713.0000, return_max=0.0000, range=(-1, 0) +(FSDPValueSftWorker pid=3732960) INFO:rlinf.data.datasets.recap.value_dataset:ValueDataset: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc, 196579 samples +(FSDPValueSftWorker pid=3732960) INFO:rlinf.data.datasets.recap.utils:Loaded returns sidecar: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc/meta/returns_fail300.parquet (34 episodes) +(FSDPValueSftWorker pid=3732960) INFO:rlinf.data.datasets.recap.value_dataset:ReturnNormalizer: return_min=-20713.0000, return_max=0.0000, range=(-1, 0) +(FSDPValueSftWorker pid=3732960) INFO:rlinf.data.datasets.recap.value_dataset:ValueDataset: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc, 4096 samples +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Creating ValueCriticModel: expert=gemma_1m +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.value_expert:Creating ValueExpert: experts=['value'], freeze_vision_encoder=False, freeze_vlm=False +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.value_expert: Loading SigLIP2 from /data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/siglip2-so400m-patch14-224 +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.value_expert: Loading Gemma3 from /data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/gemma-3-270m +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.value_expert: Fresh projection: 1152 → 640 (randomly initialized) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.value_expert: Expert 'value': width=128, depth=4, head_dim=256 +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.value_expert:Applying mixed precision: bf16 backbone + fp32 for selected layers +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap:Created ValueCriticModel (V function) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap:No model_path provided; using from_pretrained() weights. +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:859: UserWarning: `_get_pg_default_device` will be deprecated, it only stays for backward-compatiblity reason. If you need to find a device for object collectives, please use `_get_object_coll_device`. If you need to query the device types supported by group, please use `_device_capability(group)`. +(ActorGroup(rank=0) pid=3732960) warnings.warn( +{ + "actor": { + "model": { + "model_type": "recap_value_model", + "precision": "bf16", + "is_lora": false, + "siglip_path": "/data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/siglip2-so400m-patch14-224", + "gemma3_path": "/data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/gemma-3-270m", + "tokenizer_path": "/data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/gemma-3-270m", + "critic_expert_variant": "gemma_1m", + "num_bins": 201, + "v_min": -1.0, + "v_max": 0.0, + "value_dropout": 0.0, + "action_dim": 7, + "action_horizon": 10, + "max_token_len": 200, + "action_expert_variant": "gemma_300m", + "freeze_vision_encoder": false, + "train_expert_only": false, + "forward_mode": "vla", + "max_language_len": 50, + "stop_gradient_to_vlm": false, + "freeze_vlm": false + }, + "fsdp_config": { + "strategy": "fsdp", + "sharding_strategy": "no_shard", + "gradient_checkpointing": false, + "cpu_offload": false, + "offload_pin_memory": false, + "reshard_after_forward": true, + "enable_gradient_accumulation": true, + "forward_prefetch": false, + "limit_all_gathers": false, + "backward_prefetch": null, + "use_orig_params": false, + "use_liger_kernel": false, + "mixed_precision": { + "param_dtype": "bf16", + "reduce_dtype": "bf16", + "buffer_dtype": "bf16" + }, + "amp_autocast": { + "enabled": false, + "precision": "bf16" + }, + "grad_scaler": { + "enabled": false, + "init_scale": null, + "growth_interval": null + } + }, + "group_name": "ActorGroup", + "training_backend": "fsdp", + "micro_batch_size": 2, + "global_batch_size": 16, + "seed": 0, + "optim": { + "lr": 5e-05, + "value_lr": 0.0001, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_eps": 1e-08, + "weight_decay": 1e-10, + "clip_grad": 1.0, + "lr_scheduler": "constant", + "lr_warmup_steps": 500, + "total_training_steps": 8000 + } + }, + "cluster": { + "num_nodes": 1, + "component_placement": { + "actor,env,rollout": "all" + }, + "tracer": { + "enable": false + } + }, + "runner": { + "task_type": "sft", + "logger": { + "log_path": "/data2/yangky/test/recap_stack_bowls/logs/recap_stack_bowls_training/value_sft", + "project_name": "rlinf", + "experiment_name": "stack_bowls_recap_value_sft_fail300", + "logger_backends": [ + "tensorboard" + ] + }, + "max_epochs": 30000, + "max_steps": 8000, + "val_check_interval": 500, + "save_interval": 1000, + "resume_dir": "/data2/yangky/test/recap_stack_bowls/logs/recap_stack_bowls_training/value_sft/stack_bowls_recap_value_sft_fail300/checkpoints/global_step_5000", + "per_worker_log": false, + "per_worker_log_path": null + }, + "data": { + "tag": "fail300", + "train_data_paths": [ + { + "dataset_path": "/data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc", + "type": "rollout", + "weight": 1.0, + "robot_type": "franka", + "model_type": "pi05" + } + ], + "eval_data_paths": [ + { + "dataset_path": "/data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc", + "max_samples": 4096, + "robot_type": "franka", + "model_type": "pi05" + } + ], + "train_num_workers": 2, + "eval_num_workers": 1, + "prefetch_factor": 4, + "persistent_workers": false, + "pin_memory": false, + "include_state": true, + "gamma": 1.0, + "action_horizon": 10, + "normalize_to_minus_one_zero": true, + "include_next_obs": false, + "action_dim": 7, + "robot_type": "franka", + "model_type": "pi05", + "balance_weights": true, + "seed": 42, + "return_min": -20713, + "return_max": 0 + }, + "algorithm": { + "adv_type": "gae" + }, + "reward": { + "use_reward_model": false + }, + "critic": { + "use_critic_model": false + } +} +(FSDPValueSftWorker pid=3732960) [WARNING 17:02:38 ActorGroup-Rank-0][fsdp_model_manager.py:79] Provided there is sufficient GPU memory, set the actor.model.precision parameter to fp32 to allow the optimizer to run in fp32 for better convergence. Meanwhile, setting mixed_precision.param_dtype to 16-bit dtype can help maximize speed, as it will automatically convert fp32 to fp16 during operator execution. +(FSDPValueSftWorker pid=3732960) [INFO 17:02:38 ActorGroup-Rank-0][fsdp_model_manager.py:133] [FSDP] AMP is disabled. +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:285] [ValueSFT] Using global return range from config: [-20713, 0] +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:338] [ValueSFT] Loaded: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc (type=rollout, 196579 samples, weight=1.0) +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:351] [ValueSFT] Total samples: 196579 +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:373] [ValueSFT] Train DataLoader workers: num_workers=2, prefetch_factor=4, persistent_workers=False, pin_memory=False +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:447] [ValueSFT] Eval dataset 'stack_bowls_recap_rollout_rc' loaded: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc (4096 samples, max_samples=4096, norm_range=train_global:[-20713, 0]) +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:455] [ValueSFT] 1 eval dataset(s) registered: ['stack_bowls_recap_rollout_rc'] +(FSDPValueSftWorker pid=3732960) [INFO 17:02:39 ActorGroup-Rank-0][fsdp_value_sft_worker.py:459] [ValueSFT] Eval DataLoader workers: num_workers=1, prefetch_factor=4, persistent_workers=False, pin_memory=False +(ActorGroup(rank=0) pid=3732960) [INFO 17:02:42 ActorGroup-Rank-0][fsdp_model_manager.py:294] [FSDP] Gradient checkpointing is disabled + Global Step: 62%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5000/8000 [00:00Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5001/8000 [00:05<4:11:55, 5.04s/it, time/step=5.04, time/training=5.03, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.67, train/loss=3.57, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.271, train/predicted_value_std=0.129, train/target_value_mean=-0.174, train/target_value_std=0.12, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5002/8000 [00:08<3:25:57, 4.12s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.86, train/loss=3.03, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.235, train/predicted_value_std=0.0841, train/target_value_mean=-0.234, train/target_value_std=0.107, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5003/8000 [00:11<3:09:55, 3.80s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.35, train/loss=4.46, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.327, train/predicted_value_std=0.0806, train/target_value_mean=-0.343, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5004/8000 [00:15<3:02:37, 3.66s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.31, train/loss=3.52, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.2, train/predicted_value_std=0.0959, train/target_value_mean=-0.177, train/target_value_std=0.147, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5005/8000 [00:18<2:58:54, 3.58s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=10.2, train/loss=3.48, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.247, train/predicted_value_std=0.139, train/target_value_mean=-0.267, train/target_value_std=0.225, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5006/8000 [00:22<2:56:48, 3.54s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.74, train/loss=3.44, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.277, train/predicted_value_std=0.149, train/target_value_mean=-0.282, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5007/8000 [00:25<2:55:08, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=10.2, train/loss=3.48, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.349, train/predicted_value_std=0.24, train/target_value_mean=-0.292, train/target_value_std=0.252, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5008/8000 [00:29<2:54:23, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.44, train/loss=4.03, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.329, train/predicted_value_std=0.173, train/target_value_mean=-0.361, train/target_value_std=0.289, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5009/8000 [00:32<2:53:42, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.26, train/loss=3.85, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.3, train/predicted_value_std=0.137, train/target_value_mean=-0.235, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5010/8000 [00:36<2:53:16, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.19, train/loss=3.85, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.346, train/predicted_value_std=0.196, train/target_value_mean=-0.305, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5011/8000 [00:39<2:58:27, 3.58s/it, time/step=3.82, time/training=3.82, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7, train/loss=3.62, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.353, train/predicted_value_std=0.21, train/target_value_mean=-0.333, train/target_value_std=0.266, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5012/8000 [00:43<2:57:08, 3.56s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.57, train/loss=3.91, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.389, train/predicted_value_std=0.169, train/target_value_mean=-0.383, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5013/8000 [00:46<2:55:22, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.74, train/loss=4.11, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.278, train/predicted_value_std=0.123, train/target_value_mean=-0.24, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5014/8000 [00:50<2:54:08, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.55, train/loss=2.67, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.219, train/predicted_value_std=0.133, train/target_value_mean=-0.184, train/target_value_std=0.136, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5015/8000 [00:53<2:53:16, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.54, train/loss=4.23, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.419, train/predicted_value_std=0.155, train/target_value_mean=-0.409, train/target_value_std=0.292, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5016/8000 [00:57<2:52:44, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.53, train/loss=4.28, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.284, train/predicted_value_std=0.177, train/target_value_mean=-0.246, train/target_value_std=0.171, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5017/8000 [01:00<2:52:22, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.17, train/loss=3.31, train/lr=5e-5, train/mae=0.0475, train/predicted_value_mean=-0.312, train/predicted_value_std=0.165, train/target_value_mean=-0.307, train/target_value_std=0.258, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5018/8000 [01:04<2:52:18, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=5.92, train/loss=4.22, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.394, train/predicted_value_std=0.158, train/target_value_mean=-0.363, train/target_value_std=0.217, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5019/8000 [01:07<2:52:13, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.91, train/loss=4.51, train/lr=5e-5, train/mae=0.175, train/predicted_value_mean=-0.312, train/predicted_value_std=0.144, train/target_value_mean=-0.311, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5020/8000 [01:11<2:51:47, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.3, train/loss=4.1, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.35, train/predicted_value_std=0.154, train/target_value_mean=-0.348, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5021/8000 [01:14<2:51:54, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=5.68, train/loss=3.35, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.298, train/predicted_value_std=0.138, train/target_value_mean=-0.302, train/target_value_std=0.105, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5022/8000 [01:18<2:55:10, 3.53s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=13, train/loss=3.74, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.266, train/predicted_value_std=0.134, train/target_value_mean=-0.28, train/target_value_std=0.141, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5023/8000 [01:21<2:53:36, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.4, train/loss=3.61, train/lr=5e-5, train/mae=0.0722, train/predicted_value_mean=-0.189, train/predicted_value_std=0.118, train/target_value_mean=-0.15, train/target_value_std=0.106, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5024/8000 [01:25<2:52:34, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.77, train/loss=3.89, train/lr=5e-5, train/mae=0.0947, train/predicted_value_mean=-0.327, train/predicted_value_std=0.15, train/target_value_mean=-0.314, train/target_value_std=0.173, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5025/8000 [01:28<2:51:35, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.71, train/loss=3.83, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.332, train/predicted_value_std=0.135, train/target_value_mean=-0.316, train/target_value_std=0.206, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5026/8000 [01:31<2:51:13, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.73, train/loss=3.55, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.251, train/predicted_value_std=0.0929, train/target_value_mean=-0.22, train/target_value_std=0.117, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5027/8000 [01:35<2:51:06, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.34, train/loss=3.91, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.268, train/predicted_value_std=0.113, train/target_value_mean=-0.275, train/target_value_std=0.109, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5028/8000 [01:38<2:51:03, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.19, train/loss=3.5, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.278, train/predicted_value_std=0.0871, train/target_value_mean=-0.267, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5029/8000 [01:42<2:51:00, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.69, train/loss=3.92, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.324, train/predicted_value_std=0.158, train/target_value_mean=-0.355, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5030/8000 [01:45<2:50:27, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.86, train/loss=3.62, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.346, train/predicted_value_std=0.12, train/target_value_mean=-0.345, train/target_value_std=0.199, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5031/8000 [01:49<2:49:32, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=12.4, train/loss=3.22, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.221, train/predicted_value_std=0.116, train/target_value_mean=-0.19, train/target_value_std=0.161, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5032/8000 [01:52<2:49:00, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.05, train/loss=3.25, train/lr=5e-5, train/mae=0.0709, train/predicted_value_mean=-0.302, train/predicted_value_std=0.18, train/target_value_mean=-0.259, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5033/8000 [01:55<2:49:12, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.57, train/loss=3.79, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.301, train/predicted_value_std=0.185, train/target_value_mean=-0.232, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5034/8000 [01:59<2:53:33, 3.51s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.51, train/loss=3.58, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.384, train/predicted_value_std=0.133, train/target_value_mean=-0.348, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5035/8000 [02:03<2:52:35, 3.49s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.57, train/loss=3.44, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.299, train/predicted_value_std=0.162, train/target_value_mean=-0.275, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5036/8000 [02:06<2:52:18, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=14.2, train/loss=3.66, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.283, train/predicted_value_std=0.133, train/target_value_mean=-0.271, train/target_value_std=0.223, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5037/8000 [02:10<2:51:47, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=5.71, train/loss=3.48, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.262, train/predicted_value_std=0.108, train/target_value_mean=-0.187, train/target_value_std=0.146, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5038/8000 [02:13<2:51:30, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.37, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.289, train/predicted_value_std=0.166, train/target_value_mean=-0.265, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5039/8000 [02:16<2:50:57, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=5.97, train/loss=3.87, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.321, train/predicted_value_std=0.142, train/target_value_mean=-0.318, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5040/8000 [02:20<2:50:33, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.11, train/loss=3.83, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.301, train/predicted_value_std=0.16, train/target_value_mean=-0.258, train/target_value_std=0.162, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5041/8000 [02:23<2:49:58, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.77, train/loss=4.21, train/lr=5e-5, train/mae=0.187, train/predicted_value_mean=-0.343, train/predicted_value_std=0.157, train/target_value_mean=-0.272, train/target_value_std=0.148, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5042/8000 [02:27<2:48:46, 3.42s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.26, train/loss=3.22, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.281, train/predicted_value_std=0.0935, train/target_value_mean=-0.242, train/target_value_std=0.117, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5043/8000 [02:30<2:47:41, 3.40s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.69, train/loss=3.16, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.361, train/predicted_value_std=0.181, train/target_value_mean=-0.302, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5044/8000 [02:33<2:46:43, 3.38s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.38, train/loss=3.89, train/lr=5e-5, train/mae=0.182, train/predicted_value_mean=-0.361, train/predicted_value_std=0.187, train/target_value_mean=-0.348, train/target_value_std=0.226, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5045/8000 [02:37<2:50:01, 3.45s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.01, train/loss=3.53, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.256, train/predicted_value_std=0.0551, train/target_value_mean=-0.235, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5046/8000 [02:40<2:49:09, 3.44s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.22, train/loss=3.79, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.31, train/predicted_value_std=0.163, train/target_value_mean=-0.269, train/target_value_std=0.181, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5047/8000 [02:44<2:48:27, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.26, train/loss=3.48, train/lr=5e-5, train/mae=0.0463, train/predicted_value_mean=-0.27, train/predicted_value_std=0.147, train/target_value_mean=-0.214, train/target_value_std=0.155, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5048/8000 [02:47<2:48:37, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.26, train/loss=3.89, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.357, train/predicted_value_std=0.173, train/target_value_mean=-0.368, train/target_value_std=0.246, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5049/8000 [02:51<2:48:19, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=5.68, train/loss=3.22, train/lr=5e-5, train/mae=0.0547, train/predicted_value_mean=-0.221, train/predicted_value_std=0.119, train/target_value_mean=-0.216, train/target_value_std=0.163, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5050/8000 [02:54<2:48:22, 3.42s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.41, train/loss=3.21, train/lr=5e-5, train/mae=0.0628, train/predicted_value_mean=-0.354, train/predicted_value_std=0.212, train/target_value_mean=-0.3, train/target_value_std=0.267, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5051/8000 [02:57<2:48:19, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.24, train/loss=2.95, train/lr=5e-5, train/mae=0.0575, train/predicted_value_mean=-0.252, train/predicted_value_std=0.135, train/target_value_mean=-0.239, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5052/8000 [03:01<2:48:17, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.4, train/loss=3.6, train/lr=5e-5, train/mae=0.0631, train/predicted_value_mean=-0.295, train/predicted_value_std=0.131, train/target_value_mean=-0.206, train/target_value_std=0.172, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5053/8000 [03:04<2:48:28, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.72, train/loss=3.98, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.286, train/predicted_value_std=0.137, train/target_value_mean=-0.233, train/target_value_std=0.0943, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5054/8000 [03:08<2:48:43, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.99, train/loss=3.94, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.325, train/predicted_value_std=0.0769, train/target_value_mean=-0.328, train/target_value_std=0.0843, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5055/8000 [03:11<2:50:01, 3.46s/it, time/step=3.53, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.77, train/loss=3.7, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.307, train/predicted_value_std=0.106, train/target_value_mean=-0.253, train/target_value_std=0.127, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5056/8000 [03:15<2:51:14, 3.49s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.2, train/loss=3.72, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.255, train/predicted_value_std=0.0774, train/target_value_mean=-0.243, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5057/8000 [03:19<2:54:12, 3.55s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.08, train/loss=3.4, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.303, train/predicted_value_std=0.11, train/target_value_mean=-0.218, train/target_value_std=0.121, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5058/8000 [03:22<2:52:29, 3.52s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.89, train/loss=3, train/lr=5e-5, train/mae=0.0209, train/predicted_value_mean=-0.228, train/predicted_value_std=0.108, train/target_value_mean=-0.192, train/target_value_std=0.114, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5059/8000 [03:25<2:51:43, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.13, train/loss=3.72, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.325, train/predicted_value_std=0.122, train/target_value_mean=-0.316, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5060/8000 [03:29<2:50:50, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.47, train/loss=3.67, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.275, train/predicted_value_std=0.115, train/target_value_mean=-0.229, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5061/8000 [03:32<2:50:33, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=15.8, train/loss=3.7, train/lr=5e-5, train/mae=0.0594, train/predicted_value_mean=-0.281, train/predicted_value_std=0.19, train/target_value_mean=-0.242, train/target_value_std=0.198, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5062/8000 [03:36<2:50:16, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.58, train/loss=3.86, train/lr=5e-5, train/mae=0.188, train/predicted_value_mean=-0.272, train/predicted_value_std=0.137, train/target_value_mean=-0.316, train/target_value_std=0.23, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5063/8000 [03:39<2:49:22, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.68, train/loss=3.73, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.311, train/predicted_value_std=0.188, train/target_value_mean=-0.316, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5064/8000 [03:43<2:48:49, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.38, train/loss=4.23, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.279, train/predicted_value_std=0.0567, train/target_value_mean=-0.264, train/target_value_std=0.186, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5065/8000 [03:46<2:48:03, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.07, train/loss=3.57, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.369, train/predicted_value_std=0.122, train/target_value_mean=-0.333, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5066/8000 [03:49<2:46:12, 3.40s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.49, train/loss=4.25, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.251, train/predicted_value_std=0.0768, train/target_value_mean=-0.153, train/target_value_std=0.0539, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5067/8000 [03:53<2:45:20, 3.38s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.54, train/loss=4, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.272, train/predicted_value_std=0.0677, train/target_value_mean=-0.242, train/target_value_std=0.122, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5068/8000 [03:56<2:49:26, 3.47s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.08, train/loss=4.19, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.342, train/predicted_value_std=0.061, train/target_value_mean=-0.28, train/target_value_std=0.1, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5069/8000 [04:00<2:47:52, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.07, train/loss=3.71, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.229, train/predicted_value_std=0.0941, train/target_value_mean=-0.211, train/target_value_std=0.116, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5070/8000 [04:03<2:47:39, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.3, train/loss=3.52, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.306, train/predicted_value_std=0.207, train/target_value_mean=-0.312, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5071/8000 [04:07<2:47:23, 3.43s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.29, train/loss=3.49, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.234, train/predicted_value_std=0.0777, train/target_value_mean=-0.186, train/target_value_std=0.166, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5072/8000 [04:10<2:47:24, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.8, train/loss=4.06, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.292, train/predicted_value_std=0.174, train/target_value_mean=-0.317, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5073/8000 [04:14<2:48:25, 3.45s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.37, train/loss=3.56, train/lr=5e-5, train/mae=0.0697, train/predicted_value_mean=-0.272, train/predicted_value_std=0.121, train/target_value_mean=-0.217, train/target_value_std=0.111, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5074/8000 [04:17<2:48:18, 3.45s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.65, train/loss=3.9, train/lr=5e-5, train/mae=0.187, train/predicted_value_mean=-0.364, train/predicted_value_std=0.141, train/target_value_mean=-0.345, train/target_value_std=0.165, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5075/8000 [04:20<2:48:06, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.76, train/loss=4.12, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.359, train/predicted_value_std=0.196, train/target_value_mean=-0.408, train/target_value_std=0.363, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5076/8000 [04:24<2:48:25, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.93, train/loss=3.98, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.332, train/predicted_value_std=0.203, train/target_value_mean=-0.405, train/target_value_std=0.326, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5077/8000 [04:27<2:48:17, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.06, train/loss=3.48, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.244, train/predicted_value_std=0.116, train/target_value_mean=-0.25, train/target_value_std=0.155, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5078/8000 [04:31<2:47:50, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=6.95, train/loss=3.52, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.338, train/predicted_value_std=0.137, train/target_value_mean=-0.407, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 63%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5079/8000 [04:34<2:47:34, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=11.8, train/loss=3.62, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.301, train/predicted_value_std=0.151, train/target_value_mean=-0.335, train/target_value_std=0.272, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5080/8000 [04:38<2:51:19, 3.52s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.78, train/loss=3.27, train/lr=5e-5, train/mae=0.0344, train/predicted_value_mean=-0.28, train/predicted_value_std=0.168, train/target_value_mean=-0.267, train/target_value_std=0.151, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5081/8000 [04:41<2:49:41, 3.49s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.59, train/loss=3.92, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.289, train/predicted_value_std=0.0755, train/target_value_mean=-0.24, train/target_value_std=0.139, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5082/8000 [04:45<2:48:28, 3.46s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.3, train/loss=3.49, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.243, train/predicted_value_std=0.117, train/target_value_mean=-0.19, train/target_value_std=0.126, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5083/8000 [04:48<2:47:47, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.1, train/loss=3.47, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.305, train/predicted_value_std=0.182, train/target_value_mean=-0.338, train/target_value_std=0.269, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5084/8000 [04:52<2:47:25, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.15, train/loss=3.08, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.29, train/predicted_value_std=0.18, train/target_value_mean=-0.253, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5085/8000 [04:55<2:48:02, 3.46s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.11, train/loss=3.58, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.198, train/predicted_value_std=0.104, train/target_value_mean=-0.245, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5086/8000 [04:59<2:48:18, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.75, train/loss=2.98, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.292, train/predicted_value_std=0.127, train/target_value_mean=-0.3, train/target_value_std=0.155, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5087/8000 [05:02<2:48:49, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=10, train/loss=3.74, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.297, train/predicted_value_std=0.117, train/target_value_mean=-0.274, train/target_value_std=0.127, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5088/8000 [05:06<2:49:03, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.35, train/loss=3.04, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.286, train/predicted_value_std=0.174, train/target_value_mean=-0.274, train/target_value_std=0.252, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5089/8000 [05:09<2:49:07, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.87, train/loss=3.83, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.268, train/predicted_value_std=0.143, train/target_value_mean=-0.298, train/target_value_std=0.225, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5090/8000 [05:13<2:49:04, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.79, train/loss=3.41, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.273, train/predicted_value_std=0.215, train/target_value_mean=-0.235, train/target_value_std=0.199, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5091/8000 [05:16<2:53:30, 3.58s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.24, train/loss=3.17, train/lr=5e-5, train/mae=0.0578, train/predicted_value_mean=-0.269, train/predicted_value_std=0.138, train/target_value_mean=-0.235, train/target_value_std=0.0995, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5092/8000 [05:20<2:52:12, 3.55s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.23, train/loss=3.86, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.296, train/predicted_value_std=0.119, train/target_value_mean=-0.285, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5093/8000 [05:23<2:51:14, 3.53s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.99, train/loss=3.44, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.233, train/predicted_value_std=0.104, train/target_value_mean=-0.234, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5094/8000 [05:27<2:50:39, 3.52s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.27, train/loss=3.49, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.32, train/predicted_value_std=0.145, train/target_value_mean=-0.368, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5095/8000 [05:30<2:49:12, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.5, train/loss=3.58, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.247, train/predicted_value_std=0.0846, train/target_value_mean=-0.218, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5096/8000 [05:34<2:48:52, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=9.81, train/loss=3.23, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.225, train/predicted_value_std=0.0794, train/target_value_mean=-0.231, train/target_value_std=0.115, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5097/8000 [05:37<2:48:21, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=12.6, train/loss=2.88, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.274, train/predicted_value_std=0.0829, train/target_value_mean=-0.22, train/target_value_std=0.0379, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5098/8000 [05:41<2:47:30, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.92, train/loss=3.64, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.357, train/predicted_value_std=0.136, train/target_value_mean=-0.333, train/target_value_std=0.155, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5099/8000 [05:44<2:46:54, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.25, train/loss=3.87, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.305, train/predicted_value_std=0.0905, train/target_value_mean=-0.284, train/target_value_std=0.171, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5100/8000 [05:47<2:46:41, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.59, train/loss=3.34, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.245, train/predicted_value_std=0.157, train/target_value_mean=-0.244, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5101/8000 [05:51<2:47:13, 3.46s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.81, train/loss=3.16, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.226, train/predicted_value_std=0.0989, train/target_value_mean=-0.198, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5102/8000 [05:54<2:46:51, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.21, train/loss=4.12, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.301, train/predicted_value_std=0.117, train/target_value_mean=-0.291, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5103/8000 [05:58<2:50:17, 3.53s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.51, train/loss=3.46, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.285, train/predicted_value_std=0.125, train/target_value_mean=-0.34, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5104/8000 [06:02<2:48:47, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.06, train/loss=3.69, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.276, train/predicted_value_std=0.189, train/target_value_mean=-0.281, train/target_value_std=0.254, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5105/8000 [06:05<2:47:56, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.82, train/loss=4.03, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.326, train/predicted_value_std=0.0678, train/target_value_mean=-0.3, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5106/8000 [06:08<2:47:03, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.23, train/loss=3.78, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.269, train/predicted_value_std=0.128, train/target_value_mean=-0.324, train/target_value_std=0.241, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5107/8000 [06:12<2:46:15, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7, train/loss=3.88, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.34, train/predicted_value_std=0.112, train/target_value_mean=-0.211, train/target_value_std=0.203, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5108/8000 [06:15<2:46:03, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=11.9, train/loss=3.7, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.347, train/predicted_value_std=0.104, train/target_value_mean=-0.355, train/target_value_std=0.122, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5109/8000 [06:19<2:46:02, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.14, train/loss=3.51, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.247, train/predicted_value_std=0.15, train/target_value_mean=-0.259, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5110/8000 [06:22<2:45:50, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.34, train/loss=3.49, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.297, train/predicted_value_std=0.181, train/target_value_mean=-0.287, train/target_value_std=0.259, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5111/8000 [06:26<2:45:48, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.96, train/loss=2.94, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.248, train/predicted_value_std=0.108, train/target_value_mean=-0.25, train/target_value_std=0.149, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5112/8000 [06:29<2:44:57, 3.43s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.98, train/loss=2.98, train/lr=5e-5, train/mae=0.0688, train/predicted_value_mean=-0.221, train/predicted_value_std=0.132, train/target_value_mean=-0.189, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5113/8000 [06:32<2:44:49, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=8.47, train/loss=2.45, train/lr=5e-5, train/mae=0.0181, train/predicted_value_mean=-0.236, train/predicted_value_std=0.186, train/target_value_mean=-0.191, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5114/8000 [06:36<2:49:03, 3.51s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.68, train/loss=3.08, train/lr=5e-5, train/mae=0.0903, train/predicted_value_mean=-0.227, train/predicted_value_std=0.164, train/target_value_mean=-0.209, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5115/8000 [06:40<2:47:53, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.62, train/loss=4.06, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.379, train/predicted_value_std=0.165, train/target_value_mean=-0.41, train/target_value_std=0.227, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5116/8000 [06:43<2:47:09, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.7, train/loss=4.41, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.371, train/predicted_value_std=0.186, train/target_value_mean=-0.385, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5117/8000 [06:46<2:46:09, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.75, train/loss=3.53, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.241, train/predicted_value_std=0.115, train/target_value_mean=-0.215, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5118/8000 [06:50<2:45:21, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.1, train/loss=3.36, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.283, train/predicted_value_std=0.126, train/target_value_mean=-0.26, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5119/8000 [06:53<2:45:28, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.51, train/loss=3.83, train/lr=5e-5, train/mae=0.242, train/predicted_value_mean=-0.359, train/predicted_value_std=0.181, train/target_value_mean=-0.339, train/target_value_std=0.257, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5120/8000 [06:57<2:45:06, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.8, train/loss=3.2, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.189, train/predicted_value_std=0.0964, train/target_value_mean=-0.143, train/target_value_std=0.0918, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5121/8000 [07:00<2:45:31, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.91, train/loss=3.28, train/lr=5e-5, train/mae=0.0428, train/predicted_value_mean=-0.265, train/predicted_value_std=0.12, train/target_value_mean=-0.176, train/target_value_std=0.11, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5122/8000 [07:04<2:46:38, 3.47s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.19, train/loss=3.48, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.268, train/predicted_value_std=0.174, train/target_value_mean=-0.201, train/target_value_std=0.183, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5123/8000 [07:07<2:46:40, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.6, train/loss=4.25, train/lr=5e-5, train/mae=0.212, train/predicted_value_mean=-0.318, train/predicted_value_std=0.129, train/target_value_mean=-0.308, train/target_value_std=0.275, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5124/8000 [07:11<2:46:38, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.15, train/loss=3.47, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.345, train/predicted_value_std=0.204, train/target_value_mean=-0.352, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5125/8000 [07:14<2:47:27, 3.49s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.93, train/loss=3.31, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.255, train/predicted_value_std=0.14, train/target_value_mean=-0.228, train/target_value_std=0.149, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5126/8000 [07:18<2:52:34, 3.60s/it, time/step=3.85, time/training=3.85, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.53, train/loss=3.49, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.334, train/predicted_value_std=0.199, train/target_value_mean=-0.306, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5127/8000 [07:22<2:51:28, 3.58s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.51, train/loss=3.02, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.314, train/predicted_value_std=0.154, train/target_value_mean=-0.292, train/target_value_std=0.279, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5128/8000 [07:25<2:50:07, 3.55s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.58, train/loss=3.32, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.251, train/predicted_value_std=0.142, train/target_value_mean=-0.221, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5129/8000 [07:29<2:48:47, 3.53s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.54, train/loss=3.49, train/lr=5e-5, train/mae=0.0562, train/predicted_value_mean=-0.298, train/predicted_value_std=0.146, train/target_value_mean=-0.277, train/target_value_std=0.244, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5130/8000 [07:32<2:47:16, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.25, train/loss=3.6, train/lr=5e-5, train/mae=0.0728, train/predicted_value_mean=-0.315, train/predicted_value_std=0.13, train/target_value_mean=-0.268, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5131/8000 [07:35<2:46:14, 3.48s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.24, train/loss=3.6, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.302, train/predicted_value_std=0.106, train/target_value_mean=-0.246, train/target_value_std=0.155, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5132/8000 [07:39<2:45:42, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.94, train/loss=3.42, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.317, train/predicted_value_std=0.211, train/target_value_mean=-0.317, train/target_value_std=0.298, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5133/8000 [07:42<2:45:04, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.72, train/loss=3.06, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.27, train/predicted_value_std=0.128, train/target_value_mean=-0.276, train/target_value_std=0.214, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5134/8000 [07:46<2:44:43, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.2, train/loss=3.31, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.345, train/predicted_value_std=0.153, train/target_value_mean=-0.305, train/target_value_std=0.245, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5135/8000 [07:49<2:44:30, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.02, train/loss=3.38, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.226, train/predicted_value_std=0.135, train/target_value_mean=-0.237, train/target_value_std=0.19, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5136/8000 [07:53<2:44:54, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.62, train/loss=3.69, train/lr=5e-5, train/mae=0.0903, train/predicted_value_mean=-0.312, train/predicted_value_std=0.19, train/target_value_mean=-0.283, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5137/8000 [07:56<2:49:19, 3.55s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.53, train/loss=3.4, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.264, train/predicted_value_std=0.135, train/target_value_mean=-0.243, train/target_value_std=0.172, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5138/8000 [08:00<2:48:19, 3.53s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.26, train/loss=4.06, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.327, train/predicted_value_std=0.116, train/target_value_mean=-0.371, train/target_value_std=0.147, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5139/8000 [08:03<2:47:46, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.29, train/loss=4.02, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.316, train/predicted_value_std=0.206, train/target_value_mean=-0.286, train/target_value_std=0.176, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5140/8000 [08:07<2:47:22, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=8.98, train/loss=3.25, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.273, train/predicted_value_std=0.106, train/target_value_mean=-0.316, train/target_value_std=0.143, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5141/8000 [08:10<2:47:10, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.28, train/loss=3.84, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.223, train/predicted_value_std=0.133, train/target_value_mean=-0.272, train/target_value_std=0.205, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5142/8000 [08:14<2:46:43, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.73, train/loss=3.59, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0869, train/target_value_mean=-0.265, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5143/8000 [08:17<2:46:08, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.99, train/loss=3.28, train/lr=5e-5, train/mae=0.0681, train/predicted_value_mean=-0.234, train/predicted_value_std=0.118, train/target_value_mean=-0.204, train/target_value_std=0.105, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5144/8000 [08:21<2:45:50, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.05, train/loss=3.8, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.291, train/predicted_value_std=0.139, train/target_value_mean=-0.309, train/target_value_std=0.227, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5145/8000 [08:24<2:45:24, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.56, train/loss=3.59, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.32, train/predicted_value_std=0.168, train/target_value_mean=-0.376, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5146/8000 [08:28<2:45:49, 3.49s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.15, train/loss=3.84, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.279, train/predicted_value_std=0.131, train/target_value_mean=-0.271, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5147/8000 [08:31<2:46:28, 3.50s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.62, train/loss=3.09, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.221, train/predicted_value_std=0.12, train/target_value_mean=-0.207, train/target_value_std=0.144, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5148/8000 [08:35<2:46:15, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.76, train/loss=3.44, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.32, train/predicted_value_std=0.116, train/target_value_mean=-0.316, train/target_value_std=0.148, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5149/8000 [08:39<2:50:13, 3.58s/it, time/step=3.78, time/training=3.77, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.02, train/loss=3.47, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.308, train/predicted_value_std=0.0666, train/target_value_mean=-0.264, train/target_value_std=0.0749, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5150/8000 [08:42<2:46:18, 3.50s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.83, train/loss=4, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.372, train/predicted_value_std=0.0849, train/target_value_mean=-0.35, train/target_value_std=0.081, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5151/8000 [08:45<2:44:30, 3.46s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.11, train/loss=4.18, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.329, train/predicted_value_std=0.147, train/target_value_mean=-0.311, train/target_value_std=0.184, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5152/8000 [08:49<2:44:31, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.72, train/loss=3.73, train/lr=5e-5, train/mae=0.182, train/predicted_value_mean=-0.298, train/predicted_value_std=0.186, train/target_value_mean=-0.289, train/target_value_std=0.261, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5153/8000 [08:52<2:43:59, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.73, train/loss=3.59, train/lr=5e-5, train/mae=0.225, train/predicted_value_mean=-0.322, train/predicted_value_std=0.147, train/target_value_mean=-0.382, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5154/8000 [08:56<2:43:30, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.72, train/loss=4.1, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.322, train/predicted_value_std=0.157, train/target_value_mean=-0.301, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5155/8000 [08:59<2:43:14, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.46, train/loss=3.46, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.26, train/predicted_value_std=0.215, train/target_value_mean=-0.245, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5156/8000 [09:02<2:43:14, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.74, train/loss=3.38, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.26, train/predicted_value_std=0.191, train/target_value_mean=-0.237, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5157/8000 [09:06<2:43:12, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.68, train/loss=4.2, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.322, train/predicted_value_std=0.146, train/target_value_mean=-0.243, train/target_value_std=0.137, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5158/8000 [09:09<2:43:05, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=11.5, train/loss=4.05, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.274, train/predicted_value_std=0.102, train/target_value_mean=-0.298, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5159/8000 [09:13<2:42:55, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.38, train/loss=3.43, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.379, train/predicted_value_std=0.164, train/target_value_mean=-0.367, train/target_value_std=0.189, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 64%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5160/8000 [09:17<2:47:05, 3.53s/it, time/step=3.74, time/training=3.73, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.54, train/loss=3.14, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.296, train/predicted_value_std=0.177, train/target_value_mean=-0.229, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5161/8000 [09:20<2:45:39, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.61, train/loss=4.11, train/lr=5e-5, train/mae=0.248, train/predicted_value_mean=-0.342, train/predicted_value_std=0.167, train/target_value_mean=-0.426, train/target_value_std=0.188, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5162/8000 [09:23<2:44:47, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.3, train/loss=3.58, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.277, train/predicted_value_std=0.106, train/target_value_mean=-0.257, train/target_value_std=0.129, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5163/8000 [09:27<2:43:54, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.21, train/loss=3.85, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.299, train/predicted_value_std=0.185, train/target_value_mean=-0.27, train/target_value_std=0.234, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5164/8000 [09:30<2:41:45, 3.42s/it, time/step=3.32, time/training=3.31, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.97, train/loss=3.8, train/lr=5e-5, train/mae=0.0822, train/predicted_value_mean=-0.281, train/predicted_value_std=0.135, train/target_value_mean=-0.23, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5165/8000 [09:33<2:40:32, 3.40s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.84, train/loss=4.36, train/lr=5e-5, train/mae=0.198, train/predicted_value_mean=-0.351, train/predicted_value_std=0.104, train/target_value_mean=-0.322, train/target_value_std=0.181, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5166/8000 [09:37<2:39:34, 3.38s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.38, train/loss=3.49, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.23, train/predicted_value_std=0.104, train/target_value_mean=-0.202, train/target_value_std=0.131, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5167/8000 [09:40<2:40:22, 3.40s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.57, train/loss=4, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.419, train/predicted_value_std=0.19, train/target_value_mean=-0.398, train/target_value_std=0.309, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5168/8000 [09:44<2:41:58, 3.43s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.43, train/loss=3.48, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.321, train/predicted_value_std=0.182, train/target_value_mean=-0.343, train/target_value_std=0.262, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5169/8000 [09:47<2:42:06, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.77, train/loss=4.2, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.319, train/predicted_value_std=0.114, train/target_value_mean=-0.314, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5170/8000 [09:51<2:42:07, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.85, train/loss=3.61, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.265, train/predicted_value_std=0.153, train/target_value_mean=-0.277, train/target_value_std=0.264, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5171/8000 [09:54<2:42:34, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.42, train/loss=4.23, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0905, train/target_value_mean=-0.331, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5172/8000 [09:58<2:46:50, 3.54s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.16, train/loss=3.96, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.404, train/predicted_value_std=0.174, train/target_value_mean=-0.331, train/target_value_std=0.26, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5173/8000 [10:01<2:45:46, 3.52s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.59, train/loss=3.82, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.344, train/predicted_value_std=0.064, train/target_value_mean=-0.325, train/target_value_std=0.131, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5174/8000 [10:05<2:45:02, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.72, train/loss=3.38, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.306, train/predicted_value_std=0.184, train/target_value_mean=-0.324, train/target_value_std=0.307, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5175/8000 [10:08<2:44:17, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.3, train/loss=4.45, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.31, train/predicted_value_std=0.133, train/target_value_mean=-0.311, train/target_value_std=0.296, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5176/8000 [10:12<2:41:48, 3.44s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=7.74, train/loss=3.81, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.243, train/predicted_value_std=0.107, train/target_value_mean=-0.251, train/target_value_std=0.177, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5177/8000 [10:15<2:41:11, 3.43s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.5, train/loss=3.91, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.395, train/predicted_value_std=0.139, train/target_value_mean=-0.399, train/target_value_std=0.177, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5178/8000 [10:18<2:40:31, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.37, train/loss=4.15, train/lr=5e-5, train/mae=0.176, train/predicted_value_mean=-0.307, train/predicted_value_std=0.0933, train/target_value_mean=-0.297, train/target_value_std=0.146, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5179/8000 [10:22<2:40:19, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.78, train/loss=3.92, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.259, train/predicted_value_std=0.114, train/target_value_mean=-0.26, train/target_value_std=0.202, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5180/8000 [10:25<2:40:23, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=11.5, train/loss=4.21, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.316, train/predicted_value_std=0.138, train/target_value_mean=-0.318, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5181/8000 [10:29<2:41:42, 3.44s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.9, train/loss=3.77, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.208, train/predicted_value_std=0.0909, train/target_value_mean=-0.241, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5182/8000 [10:32<2:42:40, 3.46s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.28, train/loss=3.63, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.334, train/predicted_value_std=0.209, train/target_value_mean=-0.323, train/target_value_std=0.305, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5183/8000 [10:36<2:47:00, 3.56s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.26, train/loss=3.58, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.288, train/predicted_value_std=0.154, train/target_value_mean=-0.279, train/target_value_std=0.194, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5184/8000 [10:39<2:45:51, 3.53s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.56, train/loss=4.05, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.267, train/predicted_value_std=0.155, train/target_value_mean=-0.246, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5185/8000 [10:43<2:44:58, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.69, train/loss=3.51, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.239, train/predicted_value_std=0.132, train/target_value_mean=-0.148, train/target_value_std=0.0926, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5186/8000 [10:46<2:44:34, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.12, train/loss=3.51, train/lr=5e-5, train/mae=0.0775, train/predicted_value_mean=-0.351, train/predicted_value_std=0.209, train/target_value_mean=-0.32, train/target_value_std=0.264, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5187/8000 [10:50<2:44:01, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.95, train/loss=3.24, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.361, train/predicted_value_std=0.178, train/target_value_mean=-0.369, train/target_value_std=0.176, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5188/8000 [10:53<2:43:40, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.8, train/loss=4.17, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.274, train/predicted_value_std=0.114, train/target_value_mean=-0.28, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5189/8000 [10:57<2:43:10, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=6.8, train/loss=3.2, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.206, train/predicted_value_std=0.0966, train/target_value_mean=-0.13, train/target_value_std=0.0811, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5190/8000 [11:00<2:42:14, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.59, train/loss=4.06, train/lr=5e-5, train/mae=0.176, train/predicted_value_mean=-0.262, train/predicted_value_std=0.118, train/target_value_mean=-0.323, train/target_value_std=0.196, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5191/8000 [11:04<2:42:11, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.89, train/loss=3.64, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.381, train/predicted_value_std=0.13, train/target_value_mean=-0.265, train/target_value_std=0.153, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5192/8000 [11:07<2:41:26, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.08, train/loss=3.34, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.239, train/predicted_value_std=0.0893, train/target_value_mean=-0.246, train/target_value_std=0.122, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5193/8000 [11:11<2:40:53, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.42, train/loss=3.38, train/lr=5e-5, train/mae=0.0578, train/predicted_value_mean=-0.308, train/predicted_value_std=0.168, train/target_value_mean=-0.296, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5194/8000 [11:14<2:40:21, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.3, train/loss=3.81, train/lr=5e-5, train/mae=0.0903, train/predicted_value_mean=-0.31, train/predicted_value_std=0.163, train/target_value_mean=-0.307, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5195/8000 [11:18<2:43:35, 3.50s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.7, train/loss=3.23, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.332, train/predicted_value_std=0.142, train/target_value_mean=-0.313, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5196/8000 [11:21<2:42:31, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.64, train/loss=3.45, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.288, train/predicted_value_std=0.21, train/target_value_mean=-0.247, train/target_value_std=0.136, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5197/8000 [11:25<2:41:55, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.29, train/loss=3.54, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.346, train/predicted_value_std=0.0981, train/target_value_mean=-0.303, train/target_value_std=0.13, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5198/8000 [11:28<2:42:20, 3.48s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.33, train/loss=3.26, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.29, train/predicted_value_std=0.131, train/target_value_mean=-0.221, train/target_value_std=0.115, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5199/8000 [11:31<2:41:47, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.31, train/loss=3.19, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.292, train/predicted_value_std=0.118, train/target_value_mean=-0.303, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5200/8000 [11:35<2:41:09, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.34, train/loss=3.75, train/lr=5e-5, train/mae=0.0987, train/predicted_value_mean=-0.329, train/predicted_value_std=0.081, train/target_value_mean=-0.315, train/target_value_std=0.107, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5201/8000 [11:38<2:41:12, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.87, train/loss=3.72, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.301, train/predicted_value_std=0.16, train/target_value_mean=-0.295, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5202/8000 [11:42<2:41:12, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.31, train/loss=3.49, train/lr=5e-5, train/mae=0.194, train/predicted_value_mean=-0.28, train/predicted_value_std=0.105, train/target_value_mean=-0.281, train/target_value_std=0.181, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5203/8000 [11:45<2:40:40, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.78, train/loss=3.73, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.343, train/predicted_value_std=0.168, train/target_value_mean=-0.354, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5204/8000 [11:49<2:40:17, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.3, train/loss=2.9, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.287, train/predicted_value_std=0.149, train/target_value_mean=-0.293, train/target_value_std=0.213, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5205/8000 [11:52<2:40:44, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.47, train/loss=3.52, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.255, train/predicted_value_std=0.14, train/target_value_mean=-0.261, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5206/8000 [11:56<2:45:04, 3.54s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.14, train/loss=3.78, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.345, train/predicted_value_std=0.189, train/target_value_mean=-0.347, train/target_value_std=0.244, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5207/8000 [11:59<2:43:42, 3.52s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.14, train/loss=3.4, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.265, train/predicted_value_std=0.143, train/target_value_mean=-0.214, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5208/8000 [12:03<2:43:09, 3.51s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.35, train/loss=3.26, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.32, train/predicted_value_std=0.14, train/target_value_mean=-0.282, train/target_value_std=0.163, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5209/8000 [12:06<2:42:33, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=11, train/loss=3.74, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.317, train/predicted_value_std=0.123, train/target_value_mean=-0.28, train/target_value_std=0.117, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5210/8000 [12:10<2:40:09, 3.44s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.26, train/loss=3.49, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.306, train/predicted_value_std=0.108, train/target_value_mean=-0.257, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5211/8000 [12:13<2:39:27, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.69, train/loss=3.68, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.341, train/predicted_value_std=0.126, train/target_value_mean=-0.292, train/target_value_std=0.206, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5212/8000 [12:16<2:39:13, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.03, train/loss=3.44, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.308, train/predicted_value_std=0.126, train/target_value_mean=-0.34, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5213/8000 [12:20<2:39:32, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.46, train/loss=4.21, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.301, train/predicted_value_std=0.119, train/target_value_mean=-0.331, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5214/8000 [12:23<2:39:53, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.52, train/loss=3.88, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.355, train/predicted_value_std=0.162, train/target_value_mean=-0.361, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5215/8000 [12:27<2:40:08, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.5, train/loss=3.08, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.324, train/predicted_value_std=0.208, train/target_value_mean=-0.307, train/target_value_std=0.247, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5216/8000 [12:30<2:40:21, 3.46s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.05, train/loss=3.86, train/lr=5e-5, train/mae=0.199, train/predicted_value_mean=-0.283, train/predicted_value_std=0.136, train/target_value_mean=-0.312, train/target_value_std=0.314, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5217/8000 [12:34<2:40:46, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.87, train/loss=3.57, train/lr=5e-5, train/mae=0.0575, train/predicted_value_mean=-0.167, train/predicted_value_std=0.088, train/target_value_mean=-0.151, train/target_value_std=0.114, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5218/8000 [12:38<2:44:50, 3.56s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.51, train/loss=3.62, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.391, train/predicted_value_std=0.174, train/target_value_mean=-0.459, train/target_value_std=0.187, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5219/8000 [12:41<2:43:18, 3.52s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.7, train/loss=3.73, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.258, train/predicted_value_std=0.115, train/target_value_mean=-0.246, train/target_value_std=0.198, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5220/8000 [12:44<2:41:53, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.65, train/loss=3.74, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.309, train/predicted_value_std=0.12, train/target_value_mean=-0.335, train/target_value_std=0.18, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5221/8000 [12:48<2:40:44, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.07, train/loss=3.78, train/lr=5e-5, train/mae=0.2, train/predicted_value_mean=-0.346, train/predicted_value_std=0.12, train/target_value_mean=-0.473, train/target_value_std=0.0879, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5222/8000 [12:51<2:40:06, 3.46s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.83, train/loss=3.48, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.252, train/predicted_value_std=0.162, train/target_value_mean=-0.215, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5223/8000 [12:55<2:39:31, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.21, train/loss=4.09, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.294, train/predicted_value_std=0.0572, train/target_value_mean=-0.256, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5224/8000 [12:58<2:39:47, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.48, train/loss=3.44, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.263, train/predicted_value_std=0.123, train/target_value_mean=-0.201, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5225/8000 [13:02<2:39:45, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.8, train/loss=3.26, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.316, train/predicted_value_std=0.152, train/target_value_mean=-0.266, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5226/8000 [13:05<2:40:23, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.46, train/loss=2.99, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.185, train/predicted_value_std=0.123, train/target_value_mean=-0.165, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5227/8000 [13:09<2:40:30, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.69, train/loss=2.64, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.282, train/predicted_value_std=0.192, train/target_value_mean=-0.253, train/target_value_std=0.202, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5228/8000 [13:12<2:40:57, 3.48s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.71, train/loss=3.97, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.355, train/predicted_value_std=0.0953, train/target_value_mean=-0.352, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5229/8000 [13:16<2:45:15, 3.58s/it, time/step=3.8, time/training=3.79, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.4, train/loss=3.86, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.277, train/predicted_value_std=0.176, train/target_value_mean=-0.282, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5230/8000 [13:19<2:42:53, 3.53s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=11.5, train/loss=3.61, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.3, train/predicted_value_std=0.15, train/target_value_mean=-0.247, train/target_value_std=0.159, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5231/8000 [13:23<2:40:53, 3.49s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.85, train/loss=3.65, train/lr=5e-5, train/mae=0.196, train/predicted_value_mean=-0.272, train/predicted_value_std=0.178, train/target_value_mean=-0.278, train/target_value_std=0.257, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5232/8000 [13:26<2:38:59, 3.45s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.8, train/loss=3.85, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.264, train/predicted_value_std=0.131, train/target_value_mean=-0.246, train/target_value_std=0.136, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5233/8000 [13:29<2:37:52, 3.42s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.06, train/loss=3.7, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.313, train/predicted_value_std=0.209, train/target_value_mean=-0.306, train/target_value_std=0.3, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5234/8000 [13:33<2:36:37, 3.40s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.77, train/loss=3.95, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.293, train/predicted_value_std=0.121, train/target_value_mean=-0.349, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5235/8000 [13:36<2:35:47, 3.38s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.58, train/loss=4.17, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.336, train/predicted_value_std=0.134, train/target_value_mean=-0.288, train/target_value_std=0.226, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5236/8000 [13:39<2:35:22, 3.37s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8, train/loss=4.19, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.287, train/predicted_value_std=0.138, train/target_value_mean=-0.216, train/target_value_std=0.139, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5237/8000 [13:43<2:35:13, 3.37s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.07, train/loss=3.55, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.333, train/predicted_value_std=0.206, train/target_value_mean=-0.332, train/target_value_std=0.255, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5238/8000 [13:46<2:34:53, 3.36s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.65, train/loss=3.42, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.269, train/predicted_value_std=0.119, train/target_value_mean=-0.278, train/target_value_std=0.147, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 65%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5239/8000 [13:50<2:34:59, 3.37s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.24, train/loss=3.59, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.33, train/predicted_value_std=0.19, train/target_value_mean=-0.322, train/target_value_std=0.268, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5240/8000 [13:53<2:34:54, 3.37s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=9.7, train/loss=3.66, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.323, train/predicted_value_std=0.21, train/target_value_mean=-0.331, train/target_value_std=0.215, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5241/8000 [13:57<2:39:44, 3.47s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.95, train/loss=4.03, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.388, train/predicted_value_std=0.243, train/target_value_mean=-0.413, train/target_value_std=0.314, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5242/8000 [14:00<2:38:46, 3.45s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.38, train/loss=3.78, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.264, train/predicted_value_std=0.099, train/target_value_mean=-0.244, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5243/8000 [14:03<2:37:12, 3.42s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.69, train/loss=3.34, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.325, train/predicted_value_std=0.12, train/target_value_mean=-0.322, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5244/8000 [14:07<2:36:13, 3.40s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.62, train/loss=3.72, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.323, train/predicted_value_std=0.162, train/target_value_mean=-0.318, train/target_value_std=0.189, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5245/8000 [14:10<2:35:13, 3.38s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.01, train/loss=3.63, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.304, train/predicted_value_std=0.142, train/target_value_mean=-0.366, train/target_value_std=0.266, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5246/8000 [14:13<2:34:46, 3.37s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.58, train/loss=3.42, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.273, train/predicted_value_std=0.15, train/target_value_mean=-0.267, train/target_value_std=0.134, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5247/8000 [14:17<2:34:13, 3.36s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.43, train/loss=3.03, train/lr=5e-5, train/mae=0.06, train/predicted_value_mean=-0.35, train/predicted_value_std=0.22, train/target_value_mean=-0.37, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5248/8000 [14:20<2:33:50, 3.35s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.5, train/loss=3.57, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.327, train/predicted_value_std=0.175, train/target_value_mean=-0.316, train/target_value_std=0.197, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5249/8000 [14:23<2:34:00, 3.36s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.16, train/loss=3.03, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.223, train/predicted_value_std=0.111, train/target_value_mean=-0.231, train/target_value_std=0.154, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5250/8000 [14:27<2:34:06, 3.36s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.29, train/loss=3.74, train/lr=5e-5, train/mae=0.0794, train/predicted_value_mean=-0.292, train/predicted_value_std=0.106, train/target_value_mean=-0.269, train/target_value_std=0.113, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5251/8000 [14:30<2:33:56, 3.36s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.77, train/loss=3.3, train/lr=5e-5, train/mae=0.0388, train/predicted_value_mean=-0.26, train/predicted_value_std=0.127, train/target_value_mean=-0.267, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5252/8000 [14:34<2:37:26, 3.44s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.31, train/loss=4.03, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.323, train/predicted_value_std=0.125, train/target_value_mean=-0.356, train/target_value_std=0.206, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5253/8000 [14:37<2:35:57, 3.41s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.98, train/loss=3.76, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.291, train/predicted_value_std=0.214, train/target_value_mean=-0.311, train/target_value_std=0.27, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5254/8000 [14:41<2:36:10, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.5, train/loss=3.67, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.362, train/predicted_value_std=0.175, train/target_value_mean=-0.351, train/target_value_std=0.244, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5255/8000 [14:44<2:36:07, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.41, train/loss=3.77, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.28, train/predicted_value_std=0.172, train/target_value_mean=-0.225, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5256/8000 [14:47<2:36:13, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.86, train/loss=3.52, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.311, train/predicted_value_std=0.142, train/target_value_mean=-0.313, train/target_value_std=0.257, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5257/8000 [14:51<2:36:30, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.54, train/loss=4.29, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.352, train/predicted_value_std=0.21, train/target_value_mean=-0.377, train/target_value_std=0.266, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5258/8000 [14:54<2:37:19, 3.44s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.53, train/loss=3.63, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.292, train/predicted_value_std=0.0899, train/target_value_mean=-0.274, train/target_value_std=0.106, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5259/8000 [14:58<2:37:48, 3.45s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.91, train/loss=3.6, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.384, train/predicted_value_std=0.189, train/target_value_mean=-0.343, train/target_value_std=0.256, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5260/8000 [15:01<2:37:56, 3.46s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=11.5, train/loss=4.17, train/lr=5e-5, train/mae=0.282, train/predicted_value_mean=-0.4, train/predicted_value_std=0.157, train/target_value_mean=-0.386, train/target_value_std=0.256, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5261/8000 [15:05<2:37:55, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.67, train/loss=3.63, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.366, train/predicted_value_std=0.196, train/target_value_mean=-0.321, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5262/8000 [15:08<2:37:45, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.1, train/loss=3.49, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.267, train/predicted_value_std=0.147, train/target_value_mean=-0.182, train/target_value_std=0.155, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5263/8000 [15:12<2:37:36, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.15, train/loss=3.84, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.339, train/predicted_value_std=0.074, train/target_value_mean=-0.286, train/target_value_std=0.0849, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5264/8000 [15:15<2:42:01, 3.55s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11, train/loss=3.23, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.276, train/predicted_value_std=0.151, train/target_value_mean=-0.252, train/target_value_std=0.154, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5265/8000 [15:19<2:40:15, 3.52s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.43, train/loss=3.63, train/lr=5e-5, train/mae=0.166, train/predicted_value_mean=-0.359, train/predicted_value_std=0.138, train/target_value_mean=-0.367, train/target_value_std=0.149, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5266/8000 [15:22<2:39:05, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.19, train/loss=3.94, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.342, train/predicted_value_std=0.16, train/target_value_mean=-0.311, train/target_value_std=0.248, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5267/8000 [15:26<2:38:09, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.2, train/loss=3.59, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.298, train/predicted_value_std=0.15, train/target_value_mean=-0.244, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5268/8000 [15:29<2:37:45, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.77, train/loss=3.18, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.27, train/predicted_value_std=0.144, train/target_value_mean=-0.277, train/target_value_std=0.134, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5269/8000 [15:33<2:38:00, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.11, train/loss=3.2, train/lr=5e-5, train/mae=0.0734, train/predicted_value_mean=-0.234, train/predicted_value_std=0.127, train/target_value_mean=-0.165, train/target_value_std=0.148, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5270/8000 [15:36<2:38:29, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=12.7, train/loss=3.01, train/lr=5e-5, train/mae=0.0794, train/predicted_value_mean=-0.442, train/predicted_value_std=0.267, train/target_value_mean=-0.368, train/target_value_std=0.402, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5271/8000 [15:40<2:39:00, 3.50s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.35, train/loss=3.87, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.314, train/predicted_value_std=0.111, train/target_value_mean=-0.348, train/target_value_std=0.217, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5272/8000 [15:43<2:38:38, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.44, train/loss=4.01, train/lr=5e-5, train/mae=0.214, train/predicted_value_mean=-0.365, train/predicted_value_std=0.0888, train/target_value_mean=-0.369, train/target_value_std=0.235, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5273/8000 [15:47<2:37:43, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.66, train/loss=3.64, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.284, train/predicted_value_std=0.146, train/target_value_mean=-0.258, train/target_value_std=0.141, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5274/8000 [15:50<2:37:02, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.01, train/loss=3.77, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.367, train/predicted_value_std=0.113, train/target_value_mean=-0.276, train/target_value_std=0.129, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5275/8000 [15:54<2:40:14, 3.53s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.19, train/loss=3.03, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.25, train/predicted_value_std=0.104, train/target_value_mean=-0.171, train/target_value_std=0.0928, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5276/8000 [15:57<2:37:35, 3.47s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.84, train/loss=3.43, train/lr=5e-5, train/mae=0.0709, train/predicted_value_mean=-0.29, train/predicted_value_std=0.149, train/target_value_mean=-0.295, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5277/8000 [16:00<2:36:29, 3.45s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.38, train/loss=3.69, train/lr=5e-5, train/mae=0.0541, train/predicted_value_mean=-0.348, train/predicted_value_std=0.122, train/target_value_mean=-0.33, train/target_value_std=0.14, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5278/8000 [16:04<2:37:19, 3.47s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.71, train/loss=3.56, train/lr=5e-5, train/mae=0.0544, train/predicted_value_mean=-0.286, train/predicted_value_std=0.21, train/target_value_mean=-0.229, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5279/8000 [16:07<2:37:17, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.08, train/loss=2.9, train/lr=5e-5, train/mae=0.0556, train/predicted_value_mean=-0.24, train/predicted_value_std=0.0667, train/target_value_mean=-0.199, train/target_value_std=0.0905, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5280/8000 [16:11<2:37:35, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.5, train/loss=3.96, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.272, train/predicted_value_std=0.125, train/target_value_mean=-0.222, train/target_value_std=0.112, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5281/8000 [16:14<2:37:41, 3.48s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.16, train/loss=3.36, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.259, train/predicted_value_std=0.134, train/target_value_mean=-0.251, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5282/8000 [16:18<2:37:20, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.12, train/loss=3.95, train/lr=5e-5, train/mae=0.208, train/predicted_value_mean=-0.363, train/predicted_value_std=0.175, train/target_value_mean=-0.404, train/target_value_std=0.265, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5283/8000 [16:21<2:37:59, 3.49s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.86, train/loss=3.11, train/lr=5e-5, train/mae=0.0578, train/predicted_value_mean=-0.234, train/predicted_value_std=0.0976, train/target_value_mean=-0.194, train/target_value_std=0.08, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5284/8000 [16:25<2:37:39, 3.48s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=10.1, train/loss=3.07, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.337, train/predicted_value_std=0.16, train/target_value_mean=-0.312, train/target_value_std=0.232, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5285/8000 [16:28<2:37:30, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.26, train/loss=3.99, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.353, train/predicted_value_std=0.206, train/target_value_mean=-0.306, train/target_value_std=0.261, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5286/8000 [16:32<2:36:36, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.86, train/loss=3.81, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.268, train/predicted_value_std=0.114, train/target_value_mean=-0.254, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5287/8000 [16:35<2:40:23, 3.55s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.43, train/loss=4.32, train/lr=5e-5, train/mae=0.196, train/predicted_value_mean=-0.323, train/predicted_value_std=0.083, train/target_value_mean=-0.296, train/target_value_std=0.153, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5288/8000 [16:39<2:39:18, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.81, train/loss=4.16, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.395, train/predicted_value_std=0.187, train/target_value_mean=-0.401, train/target_value_std=0.217, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5289/8000 [16:42<2:37:19, 3.48s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.2, train/loss=4.26, train/lr=5e-5, train/mae=0.304, train/predicted_value_mean=-0.349, train/predicted_value_std=0.153, train/target_value_mean=-0.397, train/target_value_std=0.319, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5290/8000 [16:46<2:37:20, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.78, train/loss=3.83, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.315, train/predicted_value_std=0.183, train/target_value_mean=-0.32, train/target_value_std=0.307, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5291/8000 [16:49<2:37:27, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.69, train/loss=3.36, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.309, train/predicted_value_std=0.166, train/target_value_mean=-0.287, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5292/8000 [16:53<2:37:32, 3.49s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.38, train/loss=3.43, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.298, train/predicted_value_std=0.165, train/target_value_mean=-0.305, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5293/8000 [16:56<2:38:03, 3.50s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.11, train/loss=3.32, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.238, train/predicted_value_std=0.158, train/target_value_mean=-0.275, train/target_value_std=0.239, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5294/8000 [17:00<2:38:00, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.6, train/loss=3.61, train/lr=5e-5, train/mae=0.197, train/predicted_value_mean=-0.393, train/predicted_value_std=0.147, train/target_value_mean=-0.328, train/target_value_std=0.256, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5295/8000 [17:03<2:38:05, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.68, train/loss=3.81, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.318, train/predicted_value_std=0.153, train/target_value_mean=-0.324, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5296/8000 [17:07<2:37:59, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.73, train/loss=3.84, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.361, train/predicted_value_std=0.144, train/target_value_mean=-0.394, train/target_value_std=0.216, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5297/8000 [17:10<2:37:52, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.2, train/loss=3.57, train/lr=5e-5, train/mae=0.0987, train/predicted_value_mean=-0.265, train/predicted_value_std=0.188, train/target_value_mean=-0.258, train/target_value_std=0.261, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5298/8000 [17:14<2:41:12, 3.58s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.77, train/loss=2.88, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.281, train/predicted_value_std=0.143, train/target_value_mean=-0.258, train/target_value_std=0.161, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5299/8000 [17:17<2:37:48, 3.51s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.76, train/loss=3.11, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.299, train/predicted_value_std=0.184, train/target_value_mean=-0.304, train/target_value_std=0.282, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5300/8000 [17:21<2:35:23, 3.45s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.09, train/loss=3.83, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.358, train/predicted_value_std=0.0975, train/target_value_mean=-0.34, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5301/8000 [17:24<2:34:42, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.93, train/loss=2.98, train/lr=5e-5, train/mae=0.05, train/predicted_value_mean=-0.238, train/predicted_value_std=0.153, train/target_value_mean=-0.196, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5302/8000 [17:28<2:34:13, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.59, train/loss=3.45, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.276, train/predicted_value_std=0.0814, train/target_value_mean=-0.289, train/target_value_std=0.0922, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5303/8000 [17:31<2:33:51, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=5.78, train/loss=3.68, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.373, train/predicted_value_std=0.137, train/target_value_mean=-0.344, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5304/8000 [17:34<2:33:44, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.5, train/loss=3.68, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.259, train/predicted_value_std=0.144, train/target_value_mean=-0.32, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5305/8000 [17:38<2:33:42, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.55, train/loss=3.18, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.276, train/predicted_value_std=0.166, train/target_value_mean=-0.202, train/target_value_std=0.131, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5306/8000 [17:41<2:33:44, 3.42s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.41, train/loss=4, train/lr=5e-5, train/mae=0.203, train/predicted_value_mean=-0.353, train/predicted_value_std=0.163, train/target_value_mean=-0.299, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5307/8000 [17:45<2:34:58, 3.45s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.39, train/loss=3.55, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.335, train/predicted_value_std=0.0709, train/target_value_mean=-0.327, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5308/8000 [17:48<2:36:28, 3.49s/it, time/step=3.57, time/training=3.56, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.78, train/loss=3.79, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.292, train/predicted_value_std=0.114, train/target_value_mean=-0.328, train/target_value_std=0.202, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5309/8000 [17:52<2:37:18, 3.51s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.09, train/loss=4.01, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.367, train/predicted_value_std=0.117, train/target_value_mean=-0.384, train/target_value_std=0.188, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5310/8000 [17:56<2:41:31, 3.60s/it, time/step=3.82, time/training=3.82, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.87, train/loss=3.75, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.325, train/predicted_value_std=0.0768, train/target_value_mean=-0.327, train/target_value_std=0.0879, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5311/8000 [17:59<2:39:30, 3.56s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.71, train/loss=3.88, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.252, train/predicted_value_std=0.0927, train/target_value_mean=-0.275, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5312/8000 [18:03<2:39:33, 3.56s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.26, train/loss=3.33, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.244, train/predicted_value_std=0.129, train/target_value_mean=-0.177, train/target_value_std=0.128, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5313/8000 [18:06<2:38:08, 3.53s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.9, train/loss=4.05, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.339, train/predicted_value_std=0.144, train/target_value_mean=-0.359, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5314/8000 [18:10<2:36:55, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.02, train/loss=2.95, train/lr=5e-5, train/mae=0.0353, train/predicted_value_mean=-0.317, train/predicted_value_std=0.139, train/target_value_mean=-0.298, train/target_value_std=0.153, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5315/8000 [18:13<2:35:49, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.52, train/loss=3.84, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.235, train/predicted_value_std=0.0889, train/target_value_mean=-0.161, train/target_value_std=0.0884, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5316/8000 [18:17<2:35:10, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.24, train/loss=3.21, train/lr=5e-5, train/mae=0.0666, train/predicted_value_mean=-0.298, train/predicted_value_std=0.179, train/target_value_mean=-0.232, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5317/8000 [18:20<2:35:01, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=14, train/loss=3.42, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.288, train/predicted_value_std=0.156, train/target_value_mean=-0.264, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5318/8000 [18:23<2:34:39, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=6.24, train/loss=3.99, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0999, train/target_value_mean=-0.327, train/target_value_std=0.127, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5319/8000 [18:27<2:34:18, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.94, train/loss=3.96, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.349, train/predicted_value_std=0.124, train/target_value_mean=-0.361, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 66%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5320/8000 [18:30<2:34:03, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.95, train/loss=4.05, train/lr=5e-5, train/mae=0.198, train/predicted_value_mean=-0.275, train/predicted_value_std=0.1, train/target_value_mean=-0.31, train/target_value_std=0.178, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5321/8000 [18:34<2:37:29, 3.53s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.98, train/loss=3.53, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.307, train/predicted_value_std=0.159, train/target_value_mean=-0.283, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5322/8000 [18:38<2:37:03, 3.52s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.17, train/loss=3.55, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.297, train/predicted_value_std=0.113, train/target_value_mean=-0.257, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5323/8000 [18:41<2:36:44, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.26, train/loss=3.93, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.341, train/predicted_value_std=0.101, train/target_value_mean=-0.246, train/target_value_std=0.0871, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5324/8000 [18:45<2:36:27, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.7, train/loss=3.68, train/lr=5e-5, train/mae=0.191, train/predicted_value_mean=-0.275, train/predicted_value_std=0.139, train/target_value_mean=-0.221, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5325/8000 [18:48<2:36:35, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.61, train/loss=3.99, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.334, train/predicted_value_std=0.0711, train/target_value_mean=-0.341, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5326/8000 [18:52<2:36:06, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.78, train/loss=3.8, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.294, train/predicted_value_std=0.0914, train/target_value_mean=-0.32, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5327/8000 [18:55<2:35:17, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=10.1, train/loss=2.69, train/lr=5e-5, train/mae=0.0387, train/predicted_value_mean=-0.261, train/predicted_value_std=0.16, train/target_value_mean=-0.23, train/target_value_std=0.171, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5328/8000 [18:58<2:34:38, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.35, train/loss=3.55, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.271, train/predicted_value_std=0.164, train/target_value_mean=-0.215, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5329/8000 [19:02<2:35:30, 3.49s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.11, train/loss=3.22, train/lr=5e-5, train/mae=0.0656, train/predicted_value_mean=-0.346, train/predicted_value_std=0.183, train/target_value_mean=-0.386, train/target_value_std=0.222, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5330/8000 [19:05<2:34:46, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.89, train/loss=3.71, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.329, train/predicted_value_std=0.134, train/target_value_mean=-0.314, train/target_value_std=0.126, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5331/8000 [19:09<2:33:20, 3.45s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.86, train/loss=3.87, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.308, train/predicted_value_std=0.121, train/target_value_mean=-0.286, train/target_value_std=0.227, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5332/8000 [19:12<2:33:25, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.42, train/loss=3.4, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.292, train/predicted_value_std=0.134, train/target_value_mean=-0.304, train/target_value_std=0.229, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5333/8000 [19:16<2:37:20, 3.54s/it, time/step=3.75, time/training=3.74, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.07, train/loss=3.55, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.242, train/predicted_value_std=0.166, train/target_value_mean=-0.239, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5334/8000 [19:19<2:35:53, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.36, train/loss=3.82, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.328, train/predicted_value_std=0.107, train/target_value_mean=-0.293, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5335/8000 [19:23<2:35:11, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.94, train/loss=3.86, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.337, train/predicted_value_std=0.137, train/target_value_mean=-0.271, train/target_value_std=0.124, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5336/8000 [19:26<2:34:24, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.23, train/loss=3.86, train/lr=5e-5, train/mae=0.0616, train/predicted_value_mean=-0.385, train/predicted_value_std=0.167, train/target_value_mean=-0.419, train/target_value_std=0.221, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5337/8000 [19:30<2:33:58, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.97, train/loss=3.31, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.267, train/predicted_value_std=0.163, train/target_value_mean=-0.244, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5338/8000 [19:33<2:33:59, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.53, train/loss=3.7, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.322, train/predicted_value_std=0.144, train/target_value_mean=-0.269, train/target_value_std=0.118, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5339/8000 [19:37<2:34:33, 3.48s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.83, train/loss=3.73, train/lr=5e-5, train/mae=0.0569, train/predicted_value_mean=-0.258, train/predicted_value_std=0.173, train/target_value_mean=-0.225, train/target_value_std=0.15, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5340/8000 [19:40<2:33:53, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.9, train/loss=3.36, train/lr=5e-5, train/mae=0.0928, train/predicted_value_mean=-0.262, train/predicted_value_std=0.158, train/target_value_mean=-0.285, train/target_value_std=0.244, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5341/8000 [19:44<2:33:09, 3.46s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.94, train/loss=3.25, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.269, train/predicted_value_std=0.161, train/target_value_mean=-0.223, train/target_value_std=0.177, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5342/8000 [19:47<2:33:13, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.28, train/loss=3.2, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.282, train/predicted_value_std=0.183, train/target_value_mean=-0.247, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5343/8000 [19:51<2:33:19, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=5.83, train/loss=3.47, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.303, train/predicted_value_std=0.105, train/target_value_mean=-0.269, train/target_value_std=0.175, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5344/8000 [19:54<2:38:54, 3.59s/it, time/step=3.88, time/training=3.88, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.95, train/loss=3.53, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.281, train/predicted_value_std=0.124, train/target_value_mean=-0.162, train/target_value_std=0.128, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5345/8000 [19:58<2:37:49, 3.57s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=6.87, train/loss=3.56, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.302, train/predicted_value_std=0.162, train/target_value_mean=-0.31, train/target_value_std=0.147, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5346/8000 [20:01<2:35:48, 3.52s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.5, train/loss=3.7, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.31, train/predicted_value_std=0.12, train/target_value_mean=-0.302, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5347/8000 [20:05<2:34:30, 3.49s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.42, train/loss=3.65, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.329, train/predicted_value_std=0.121, train/target_value_mean=-0.329, train/target_value_std=0.168, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5348/8000 [20:08<2:33:37, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.38, train/loss=3.73, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.314, train/predicted_value_std=0.185, train/target_value_mean=-0.301, train/target_value_std=0.257, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5349/8000 [20:12<2:32:46, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.88, train/loss=3.55, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.354, train/predicted_value_std=0.135, train/target_value_mean=-0.321, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5350/8000 [20:15<2:32:11, 3.45s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.37, train/loss=3.19, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.258, train/predicted_value_std=0.114, train/target_value_mean=-0.225, train/target_value_std=0.15, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5351/8000 [20:19<2:32:21, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.93, train/loss=3.12, train/lr=5e-5, train/mae=0.0444, train/predicted_value_mean=-0.26, train/predicted_value_std=0.118, train/target_value_mean=-0.237, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5352/8000 [20:22<2:32:29, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.72, train/loss=3.87, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.323, train/predicted_value_std=0.142, train/target_value_mean=-0.291, train/target_value_std=0.104, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5353/8000 [20:25<2:32:29, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.8, train/loss=3.79, train/lr=5e-5, train/mae=0.0512, train/predicted_value_mean=-0.261, train/predicted_value_std=0.0913, train/target_value_mean=-0.176, train/target_value_std=0.0846, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5354/8000 [20:29<2:33:03, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.43, train/loss=3.03, train/lr=5e-5, train/mae=0.0309, train/predicted_value_mean=-0.313, train/predicted_value_std=0.229, train/target_value_mean=-0.251, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5355/8000 [20:33<2:34:01, 3.49s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.36, train/loss=3.26, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.297, train/predicted_value_std=0.13, train/target_value_mean=-0.325, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5356/8000 [20:36<2:38:27, 3.60s/it, time/step=3.83, time/training=3.83, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.1, train/loss=3.54, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.283, train/predicted_value_std=0.0761, train/target_value_mean=-0.287, train/target_value_std=0.113, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5357/8000 [20:40<2:37:25, 3.57s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.47, train/loss=3.95, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.328, train/predicted_value_std=0.142, train/target_value_mean=-0.293, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5358/8000 [20:43<2:35:12, 3.52s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.13, train/loss=3.43, train/lr=5e-5, train/mae=0.174, train/predicted_value_mean=-0.328, train/predicted_value_std=0.255, train/target_value_mean=-0.332, train/target_value_std=0.364, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5359/8000 [20:47<2:33:50, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.67, train/loss=3.72, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.338, train/predicted_value_std=0.131, train/target_value_mean=-0.361, train/target_value_std=0.218, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5360/8000 [20:50<2:32:51, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.33, train/loss=3.59, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.358, train/predicted_value_std=0.167, train/target_value_mean=-0.429, train/target_value_std=0.306, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5361/8000 [20:54<2:32:13, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.61, train/loss=3.32, train/lr=5e-5, train/mae=0.0947, train/predicted_value_mean=-0.329, train/predicted_value_std=0.075, train/target_value_mean=-0.336, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5362/8000 [20:57<2:31:44, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11.4, train/loss=3.7, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.314, train/predicted_value_std=0.136, train/target_value_mean=-0.321, train/target_value_std=0.14, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5363/8000 [21:00<2:31:15, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=9.68, train/loss=3.33, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.378, train/predicted_value_std=0.246, train/target_value_mean=-0.39, train/target_value_std=0.319, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5364/8000 [21:04<2:29:38, 3.41s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=9.5, train/loss=2.93, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.249, train/predicted_value_std=0.13, train/target_value_mean=-0.329, train/target_value_std=0.274, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5365/8000 [21:07<2:28:40, 3.39s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.35, train/loss=3.67, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.266, train/predicted_value_std=0.167, train/target_value_mean=-0.273, train/target_value_std=0.225, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5366/8000 [21:10<2:28:01, 3.37s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.86, train/loss=3.69, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.339, train/predicted_value_std=0.131, train/target_value_mean=-0.312, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5367/8000 [21:14<2:33:44, 3.50s/it, time/step=3.81, time/training=3.81, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.48, train/loss=4.03, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.293, train/predicted_value_std=0.0948, train/target_value_mean=-0.275, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5368/8000 [21:18<2:33:07, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.37, train/loss=3.22, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.24, train/predicted_value_std=0.129, train/target_value_mean=-0.182, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5369/8000 [21:21<2:31:30, 3.46s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.23, train/loss=3.73, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.306, train/predicted_value_std=0.169, train/target_value_mean=-0.304, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5370/8000 [21:24<2:30:01, 3.42s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.52, train/loss=3.88, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.269, train/predicted_value_std=0.102, train/target_value_mean=-0.268, train/target_value_std=0.225, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5371/8000 [21:28<2:29:38, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=12.2, train/loss=3.48, train/lr=5e-5, train/mae=0.0437, train/predicted_value_mean=-0.221, train/predicted_value_std=0.104, train/target_value_mean=-0.236, train/target_value_std=0.144, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5372/8000 [21:31<2:30:20, 3.43s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.95, train/loss=3.06, train/lr=5e-5, train/mae=0.0897, train/predicted_value_mean=-0.3, train/predicted_value_std=0.138, train/target_value_mean=-0.23, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5373/8000 [21:35<2:30:36, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.18, train/loss=3.98, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.354, train/predicted_value_std=0.0976, train/target_value_mean=-0.317, train/target_value_std=0.213, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5374/8000 [21:38<2:30:26, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.01, train/loss=2.89, train/lr=5e-5, train/mae=0.0647, train/predicted_value_mean=-0.26, train/predicted_value_std=0.124, train/target_value_mean=-0.203, train/target_value_std=0.146, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5375/8000 [21:42<2:30:47, 3.45s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=3.78, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.318, train/predicted_value_std=0.16, train/target_value_mean=-0.343, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5376/8000 [21:45<2:29:39, 3.42s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.1, train/loss=3.19, train/lr=5e-5, train/mae=0.0409, train/predicted_value_mean=-0.39, train/predicted_value_std=0.214, train/target_value_mean=-0.369, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5377/8000 [21:48<2:28:58, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.16, train/loss=3.56, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.238, train/predicted_value_std=0.137, train/target_value_mean=-0.228, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5378/8000 [21:52<2:29:51, 3.43s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.19, train/loss=3.42, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.261, train/predicted_value_std=0.132, train/target_value_mean=-0.229, train/target_value_std=0.142, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5379/8000 [21:56<2:34:36, 3.54s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.75, train/loss=3.97, train/lr=5e-5, train/mae=0.0722, train/predicted_value_mean=-0.269, train/predicted_value_std=0.142, train/target_value_mean=-0.211, train/target_value_std=0.163, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5380/8000 [21:59<2:33:33, 3.52s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7, train/loss=3.7, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.337, train/predicted_value_std=0.113, train/target_value_mean=-0.311, train/target_value_std=0.124, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5381/8000 [22:03<2:33:11, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.28, train/loss=3.42, train/lr=5e-5, train/mae=0.0369, train/predicted_value_mean=-0.268, train/predicted_value_std=0.145, train/target_value_mean=-0.208, train/target_value_std=0.163, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5382/8000 [22:06<2:32:43, 3.50s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.65, train/loss=3.61, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0949, train/target_value_mean=-0.217, train/target_value_std=0.108, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5383/8000 [22:10<2:33:01, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=14.5, train/loss=3.93, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.289, train/predicted_value_std=0.0776, train/target_value_mean=-0.238, train/target_value_std=0.0948, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5384/8000 [22:13<2:33:24, 3.52s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.05, train/loss=3.68, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.312, train/predicted_value_std=0.151, train/target_value_mean=-0.294, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5385/8000 [22:17<2:33:19, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.55, train/loss=3.29, train/lr=5e-5, train/mae=0.0878, train/predicted_value_mean=-0.261, train/predicted_value_std=0.125, train/target_value_mean=-0.255, train/target_value_std=0.161, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5386/8000 [22:20<2:32:40, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.38, train/loss=3.43, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.241, train/predicted_value_std=0.121, train/target_value_mean=-0.249, train/target_value_std=0.192, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5387/8000 [22:24<2:32:03, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.35, train/loss=3.7, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.328, train/predicted_value_std=0.196, train/target_value_mean=-0.287, train/target_value_std=0.237, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5388/8000 [22:27<2:31:40, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.88, train/loss=3.11, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.257, train/predicted_value_std=0.165, train/target_value_mean=-0.275, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5389/8000 [22:30<2:30:41, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.15, train/loss=3.31, train/lr=5e-5, train/mae=0.06, train/predicted_value_mean=-0.303, train/predicted_value_std=0.192, train/target_value_mean=-0.226, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5390/8000 [22:34<2:33:26, 3.53s/it, time/step=3.68, time/training=3.67, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.95, train/loss=3.79, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.33, train/predicted_value_std=0.171, train/target_value_mean=-0.361, train/target_value_std=0.26, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5391/8000 [22:38<2:31:02, 3.47s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.18, train/loss=3.99, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.34, train/predicted_value_std=0.108, train/target_value_mean=-0.335, train/target_value_std=0.114, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5392/8000 [22:41<2:30:08, 3.45s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.21, train/loss=3.43, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.316, train/predicted_value_std=0.203, train/target_value_mean=-0.3, train/target_value_std=0.234, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5393/8000 [22:44<2:29:47, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.77, train/loss=3.62, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.277, train/predicted_value_std=0.116, train/target_value_mean=-0.223, train/target_value_std=0.114, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5394/8000 [22:48<2:28:56, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.6, train/loss=3.75, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.288, train/predicted_value_std=0.174, train/target_value_mean=-0.284, train/target_value_std=0.299, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5395/8000 [22:51<2:28:21, 3.42s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.38, train/loss=3.87, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.306, train/predicted_value_std=0.117, train/target_value_mean=-0.335, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5396/8000 [22:55<2:28:29, 3.42s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.09, train/loss=3.51, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.239, train/predicted_value_std=0.148, train/target_value_mean=-0.217, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5397/8000 [22:58<2:27:19, 3.40s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.96, train/loss=3.82, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.278, train/predicted_value_std=0.0986, train/target_value_mean=-0.291, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5398/8000 [23:01<2:26:30, 3.38s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=5.92, train/loss=3.64, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.375, train/predicted_value_std=0.124, train/target_value_mean=-0.367, train/target_value_std=0.214, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 67%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5399/8000 [23:05<2:25:49, 3.36s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.92, train/loss=3.62, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.287, train/predicted_value_std=0.109, train/target_value_mean=-0.28, train/target_value_std=0.142, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5400/8000 [23:08<2:25:10, 3.35s/it, time/step=3.32, time/training=3.31, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=5.42, train/loss=3.86, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.294, train/predicted_value_std=0.124, train/target_value_mean=-0.26, train/target_value_std=0.144, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5401/8000 [23:11<2:26:15, 3.38s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.12, train/loss=3.95, train/lr=5e-5, train/mae=0.0734, train/predicted_value_mean=-0.299, train/predicted_value_std=0.151, train/target_value_mean=-0.271, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5402/8000 [23:15<2:31:13, 3.49s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.31, train/loss=3.15, train/lr=5e-5, train/mae=0.0403, train/predicted_value_mean=-0.28, train/predicted_value_std=0.196, train/target_value_mean=-0.242, train/target_value_std=0.201, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5403/8000 [23:18<2:29:55, 3.46s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.65, train/loss=3.29, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.304, train/predicted_value_std=0.0802, train/target_value_mean=-0.294, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5404/8000 [23:22<2:30:05, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.25, train/loss=3.39, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.237, train/predicted_value_std=0.121, train/target_value_mean=-0.211, train/target_value_std=0.18, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5405/8000 [23:25<2:29:37, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.77, train/loss=3.66, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.241, train/predicted_value_std=0.143, train/target_value_mean=-0.224, train/target_value_std=0.117, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5406/8000 [23:29<2:28:46, 3.44s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.91, train/loss=3.25, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.27, train/predicted_value_std=0.124, train/target_value_mean=-0.236, train/target_value_std=0.12, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5407/8000 [23:32<2:26:55, 3.40s/it, time/step=3.3, time/training=3.3, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.29, train/loss=3.29, train/lr=5e-5, train/mae=0.0888, train/predicted_value_mean=-0.245, train/predicted_value_std=0.179, train/target_value_mean=-0.216, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5408/8000 [23:36<2:27:13, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.53, train/loss=3.31, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.294, train/predicted_value_std=0.174, train/target_value_mean=-0.297, train/target_value_std=0.235, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5409/8000 [23:39<2:27:50, 3.42s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=10.5, train/loss=3.53, train/lr=5e-5, train/mae=0.0534, train/predicted_value_mean=-0.263, train/predicted_value_std=0.19, train/target_value_mean=-0.232, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5410/8000 [23:42<2:27:17, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.5, train/loss=3.3, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.242, train/predicted_value_std=0.0866, train/target_value_mean=-0.179, train/target_value_std=0.102, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5411/8000 [23:46<2:25:58, 3.38s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.45, train/loss=3.44, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.259, train/predicted_value_std=0.129, train/target_value_mean=-0.201, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5412/8000 [23:49<2:25:10, 3.37s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=12.5, train/loss=3.5, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.333, train/predicted_value_std=0.107, train/target_value_mean=-0.285, train/target_value_std=0.183, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5413/8000 [23:53<2:27:56, 3.43s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.7, train/loss=4.3, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.345, train/predicted_value_std=0.148, train/target_value_mean=-0.334, train/target_value_std=0.19, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5414/8000 [23:56<2:27:50, 3.43s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8.53, train/loss=3.95, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.294, train/predicted_value_std=0.188, train/target_value_mean=-0.263, train/target_value_std=0.198, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5415/8000 [23:59<2:27:43, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=10.4, train/loss=3.64, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.407, train/predicted_value_std=0.231, train/target_value_mean=-0.402, train/target_value_std=0.256, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5416/8000 [24:03<2:27:39, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.4, train/loss=2.9, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.226, train/predicted_value_std=0.131, train/target_value_mean=-0.23, train/target_value_std=0.154, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5417/8000 [24:06<2:27:48, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.76, train/loss=3.54, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.223, train/predicted_value_std=0.102, train/target_value_mean=-0.217, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5418/8000 [24:10<2:28:20, 3.45s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.65, train/loss=4.16, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.315, train/predicted_value_std=0.15, train/target_value_mean=-0.232, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5419/8000 [24:13<2:29:05, 3.47s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.63, train/loss=3.63, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.294, train/predicted_value_std=0.196, train/target_value_mean=-0.265, train/target_value_std=0.219, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5420/8000 [24:17<2:29:01, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.8, train/loss=3.63, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.288, train/predicted_value_std=0.117, train/target_value_mean=-0.179, train/target_value_std=0.124, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5421/8000 [24:20<2:29:17, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.24, train/loss=3.43, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.328, train/predicted_value_std=0.25, train/target_value_mean=-0.301, train/target_value_std=0.273, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5422/8000 [24:24<2:29:44, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=7.66, train/loss=3.15, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.308, train/predicted_value_std=0.206, train/target_value_mean=-0.272, train/target_value_std=0.254, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5423/8000 [24:27<2:29:52, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.77, train/loss=3.59, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.304, train/predicted_value_std=0.117, train/target_value_mean=-0.309, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5424/8000 [24:31<2:29:44, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.89, train/loss=3.06, train/lr=5e-5, train/mae=0.0487, train/predicted_value_mean=-0.246, train/predicted_value_std=0.116, train/target_value_mean=-0.209, train/target_value_std=0.118, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5425/8000 [24:35<2:33:19, 3.57s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.69, train/loss=2.96, train/lr=5e-5, train/mae=0.0406, train/predicted_value_mean=-0.288, train/predicted_value_std=0.121, train/target_value_mean=-0.263, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5426/8000 [24:38<2:31:42, 3.54s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.08, train/loss=3.34, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.222, train/predicted_value_std=0.128, train/target_value_mean=-0.203, train/target_value_std=0.108, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5427/8000 [24:41<2:31:06, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.57, train/loss=3.83, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.352, train/predicted_value_std=0.143, train/target_value_mean=-0.35, train/target_value_std=0.212, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5428/8000 [24:45<2:30:32, 3.51s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.64, train/loss=3.33, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.303, train/predicted_value_std=0.127, train/target_value_mean=-0.341, train/target_value_std=0.2, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5429/8000 [24:48<2:29:58, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.62, train/loss=3.82, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.347, train/predicted_value_std=0.156, train/target_value_mean=-0.302, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5430/8000 [24:52<2:29:47, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=9.28, train/loss=4.03, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.309, train/predicted_value_std=0.0874, train/target_value_mean=-0.276, train/target_value_std=0.119, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5431/8000 [24:55<2:29:46, 3.50s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=11.8, train/loss=3.52, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.278, train/predicted_value_std=0.164, train/target_value_mean=-0.251, train/target_value_std=0.17, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5432/8000 [24:59<2:29:54, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.72, train/loss=3.45, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.221, train/predicted_value_std=0.0877, train/target_value_mean=-0.212, train/target_value_std=0.154, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5433/8000 [25:02<2:29:54, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.17, train/loss=3.23, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.356, train/predicted_value_std=0.172, train/target_value_mean=-0.403, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5434/8000 [25:06<2:30:04, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10, train/loss=3.36, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.328, train/predicted_value_std=0.218, train/target_value_mean=-0.401, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5435/8000 [25:09<2:29:22, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.32, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.281, train/predicted_value_std=0.206, train/target_value_mean=-0.254, train/target_value_std=0.202, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5436/8000 [25:13<2:31:44, 3.55s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.5, train/loss=3.34, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.276, train/predicted_value_std=0.136, train/target_value_mean=-0.227, train/target_value_std=0.0812, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5437/8000 [25:17<2:30:00, 3.51s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.625, train/grad_norm=6.44, train/loss=2.51, train/lr=5e-5, train/mae=0.0541, train/predicted_value_mean=-0.215, train/predicted_value_std=0.121, train/target_value_mean=-0.175, train/target_value_std=0.115, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5438/8000 [25:20<2:28:38, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.52, train/loss=3.26, train/lr=5e-5, train/mae=0.0656, train/predicted_value_mean=-0.281, train/predicted_value_std=0.107, train/target_value_mean=-0.224, train/target_value_std=0.127, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5439/8000 [25:23<2:28:44, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.96, train/loss=3.44, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.252, train/predicted_value_std=0.14, train/target_value_mean=-0.262, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5440/8000 [25:27<2:29:05, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.88, train/loss=3.27, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.292, train/predicted_value_std=0.16, train/target_value_mean=-0.27, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5441/8000 [25:30<2:29:00, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=5.99, train/loss=3.35, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.236, train/predicted_value_std=0.152, train/target_value_mean=-0.221, train/target_value_std=0.183, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5442/8000 [25:34<2:28:17, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.79, train/loss=3.49, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.287, train/predicted_value_std=0.178, train/target_value_mean=-0.281, train/target_value_std=0.231, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5443/8000 [25:37<2:27:00, 3.45s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.27, train/loss=3.23, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.273, train/predicted_value_std=0.157, train/target_value_mean=-0.322, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5444/8000 [25:41<2:26:09, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.27, train/loss=3.5, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.28, train/predicted_value_std=0.116, train/target_value_mean=-0.313, train/target_value_std=0.261, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5445/8000 [25:44<2:26:12, 3.43s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.562, train/grad_norm=7.2, train/loss=3.21, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.288, train/predicted_value_std=0.131, train/target_value_mean=-0.271, train/target_value_std=0.142, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5446/8000 [25:48<2:26:04, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.07, train/loss=3.61, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.287, train/predicted_value_std=0.165, train/target_value_mean=-0.284, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5447/8000 [25:51<2:25:43, 3.42s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.78, train/loss=3.34, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.356, train/predicted_value_std=0.211, train/target_value_mean=-0.381, train/target_value_std=0.276, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5448/8000 [25:55<2:30:25, 3.54s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.16, train/loss=3.97, train/lr=5e-5, train/mae=0.0978, train/predicted_value_mean=-0.288, train/predicted_value_std=0.117, train/target_value_mean=-0.328, train/target_value_std=0.107, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5449/8000 [25:58<2:30:03, 3.53s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.97, train/loss=3.71, train/lr=5e-5, train/mae=0.193, train/predicted_value_mean=-0.318, train/predicted_value_std=0.18, train/target_value_mean=-0.244, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5450/8000 [26:02<2:29:09, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.38, train/loss=3.85, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.293, train/predicted_value_std=0.134, train/target_value_mean=-0.242, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5451/8000 [26:05<2:27:54, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.51, train/loss=2.9, train/lr=5e-5, train/mae=0.0778, train/predicted_value_mean=-0.229, train/predicted_value_std=0.123, train/target_value_mean=-0.212, train/target_value_std=0.129, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5452/8000 [26:08<2:26:21, 3.45s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.39, train/loss=3.75, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.302, train/predicted_value_std=0.115, train/target_value_mean=-0.284, train/target_value_std=0.151, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5453/8000 [26:12<2:25:37, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.41, train/loss=3.43, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.303, train/predicted_value_std=0.132, train/target_value_mean=-0.29, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5454/8000 [26:15<2:25:46, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.81, train/loss=3.29, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0926, train/target_value_mean=-0.268, train/target_value_std=0.247, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5455/8000 [26:19<2:26:51, 3.46s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.49, train/loss=3.46, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.286, train/predicted_value_std=0.168, train/target_value_mean=-0.317, train/target_value_std=0.214, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5456/8000 [26:22<2:27:15, 3.47s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.98, train/loss=3.94, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.293, train/predicted_value_std=0.102, train/target_value_mean=-0.29, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5457/8000 [26:26<2:28:28, 3.50s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.5, train/cat_acc_neighbor=0.5, train/grad_norm=8.11, train/loss=2.92, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.261, train/predicted_value_std=0.132, train/target_value_mean=-0.313, train/target_value_std=0.256, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5458/8000 [26:29<2:26:26, 3.46s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.23, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.252, train/predicted_value_std=0.122, train/target_value_mean=-0.27, train/target_value_std=0.203, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5459/8000 [26:33<2:27:57, 3.49s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.06, train/loss=3.4, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.286, train/predicted_value_std=0.16, train/target_value_mean=-0.253, train/target_value_std=0.145, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5460/8000 [26:36<2:25:53, 3.45s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.02, train/loss=3.57, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.243, train/predicted_value_std=0.138, train/target_value_mean=-0.204, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5461/8000 [26:39<2:24:03, 3.40s/it, time/step=3.3, time/training=3.3, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.85, train/loss=3.41, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.284, train/predicted_value_std=0.189, train/target_value_mean=-0.265, train/target_value_std=0.249, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5462/8000 [26:43<2:23:10, 3.38s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.63, train/loss=3.13, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.25, train/predicted_value_std=0.137, train/target_value_mean=-0.171, train/target_value_std=0.0824, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5463/8000 [26:46<2:22:48, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.62, train/loss=3.87, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.322, train/predicted_value_std=0.203, train/target_value_mean=-0.346, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5464/8000 [26:50<2:22:25, 3.37s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.5, train/loss=3.33, train/lr=5e-5, train/mae=0.0928, train/predicted_value_mean=-0.305, train/predicted_value_std=0.233, train/target_value_mean=-0.288, train/target_value_std=0.276, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5465/8000 [26:53<2:21:49, 3.36s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.67, train/loss=3.68, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.365, train/predicted_value_std=0.196, train/target_value_mean=-0.377, train/target_value_std=0.31, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5466/8000 [26:56<2:21:41, 3.35s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.41, train/loss=4.21, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.331, train/predicted_value_std=0.159, train/target_value_mean=-0.273, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5467/8000 [27:00<2:22:13, 3.37s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=9.82, train/loss=4.31, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.36, train/predicted_value_std=0.136, train/target_value_mean=-0.383, train/target_value_std=0.244, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5468/8000 [27:03<2:22:16, 3.37s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.5, train/loss=3.74, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.297, train/predicted_value_std=0.126, train/target_value_mean=-0.281, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5469/8000 [27:06<2:21:47, 3.36s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.49, train/loss=3.21, train/lr=5e-5, train/mae=0.0547, train/predicted_value_mean=-0.286, train/predicted_value_std=0.129, train/target_value_mean=-0.219, train/target_value_std=0.111, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5470/8000 [27:10<2:21:34, 3.36s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.26, train/loss=3.76, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.348, train/predicted_value_std=0.193, train/target_value_mean=-0.356, train/target_value_std=0.293, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5471/8000 [27:13<2:25:18, 3.45s/it, time/step=3.65, time/training=3.65, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.47, train/loss=3.33, train/lr=5e-5, train/mae=0.0597, train/predicted_value_mean=-0.229, train/predicted_value_std=0.128, train/target_value_mean=-0.146, train/target_value_std=0.107, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5472/8000 [27:17<2:25:39, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.01, train/loss=3.72, train/lr=5e-5, train/mae=0.0362, train/predicted_value_mean=-0.365, train/predicted_value_std=0.112, train/target_value_mean=-0.342, train/target_value_std=0.151, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5473/8000 [27:20<2:25:34, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.65, train/loss=3.7, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.31, train/predicted_value_std=0.172, train/target_value_mean=-0.269, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5474/8000 [27:24<2:25:44, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.15, train/loss=4.41, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.358, train/predicted_value_std=0.123, train/target_value_mean=-0.381, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5475/8000 [27:27<2:23:52, 3.42s/it, time/step=3.32, time/training=3.31, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.85, train/loss=3.03, train/lr=5e-5, train/mae=0.0878, train/predicted_value_mean=-0.294, train/predicted_value_std=0.254, train/target_value_mean=-0.256, train/target_value_std=0.249, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5476/8000 [27:30<2:23:06, 3.40s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.88, train/loss=3.45, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.279, train/predicted_value_std=0.128, train/target_value_mean=-0.263, train/target_value_std=0.162, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5477/8000 [27:34<2:22:17, 3.38s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=7.42, train/loss=3.03, train/lr=5e-5, train/mae=0.0284, train/predicted_value_mean=-0.307, train/predicted_value_std=0.139, train/target_value_mean=-0.283, train/target_value_std=0.162, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5478/8000 [27:37<2:22:23, 3.39s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.02, train/loss=3.66, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.281, train/predicted_value_std=0.126, train/target_value_mean=-0.256, train/target_value_std=0.155, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5479/8000 [27:41<2:21:39, 3.37s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.61, train/loss=3.18, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.192, train/predicted_value_std=0.0838, train/target_value_mean=-0.157, train/target_value_std=0.103, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 68%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5480/8000 [27:44<2:21:08, 3.36s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.12, train/loss=3.43, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.302, train/predicted_value_std=0.133, train/target_value_mean=-0.309, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5481/8000 [27:47<2:21:50, 3.38s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.68, train/loss=3.9, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.289, train/predicted_value_std=0.102, train/target_value_mean=-0.323, train/target_value_std=0.115, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5482/8000 [27:51<2:26:41, 3.50s/it, time/step=3.77, time/training=3.76, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.65, train/loss=3.89, train/lr=5e-5, train/mae=0.21, train/predicted_value_mean=-0.364, train/predicted_value_std=0.223, train/target_value_mean=-0.414, train/target_value_std=0.284, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5483/8000 [27:55<2:26:15, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.33, train/loss=3.05, train/lr=5e-5, train/mae=0.0912, train/predicted_value_mean=-0.282, train/predicted_value_std=0.14, train/target_value_mean=-0.297, train/target_value_std=0.279, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5484/8000 [27:58<2:26:22, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.39, train/loss=3.81, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.296, train/predicted_value_std=0.0883, train/target_value_mean=-0.279, train/target_value_std=0.137, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5485/8000 [28:01<2:26:02, 3.48s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.27, train/loss=2.86, train/lr=5e-5, train/mae=0.0416, train/predicted_value_mean=-0.292, train/predicted_value_std=0.165, train/target_value_mean=-0.285, train/target_value_std=0.179, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5486/8000 [28:05<2:24:53, 3.46s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.08, train/loss=3.74, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.319, train/predicted_value_std=0.125, train/target_value_mean=-0.369, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5487/8000 [28:08<2:23:50, 3.43s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.03, train/loss=4.07, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.32, train/predicted_value_std=0.167, train/target_value_mean=-0.352, train/target_value_std=0.246, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5488/8000 [28:12<2:22:57, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.76, train/loss=3.16, train/lr=5e-5, train/mae=0.0466, train/predicted_value_mean=-0.286, train/predicted_value_std=0.132, train/target_value_mean=-0.267, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5489/8000 [28:15<2:21:59, 3.39s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.88, train/loss=3.83, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.393, train/predicted_value_std=0.116, train/target_value_mean=-0.372, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5490/8000 [28:18<2:21:29, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.77, train/loss=4.13, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.329, train/predicted_value_std=0.134, train/target_value_mean=-0.307, train/target_value_std=0.143, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5491/8000 [28:22<2:20:36, 3.36s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.13, train/loss=3.75, train/lr=5e-5, train/mae=0.0678, train/predicted_value_mean=-0.346, train/predicted_value_std=0.137, train/target_value_mean=-0.384, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5492/8000 [28:25<2:20:17, 3.36s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.57, train/loss=4.19, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.294, train/predicted_value_std=0.151, train/target_value_mean=-0.297, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5493/8000 [28:28<2:20:04, 3.35s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.87, train/loss=3.23, train/lr=5e-5, train/mae=0.175, train/predicted_value_mean=-0.272, train/predicted_value_std=0.0832, train/target_value_mean=-0.209, train/target_value_std=0.0703, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5494/8000 [28:32<2:23:12, 3.43s/it, time/step=3.6, time/training=3.6, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.4, train/loss=3.61, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.288, train/predicted_value_std=0.133, train/target_value_mean=-0.278, train/target_value_std=0.204, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5495/8000 [28:35<2:22:34, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.99, train/loss=3.32, train/lr=5e-5, train/mae=0.0912, train/predicted_value_mean=-0.22, train/predicted_value_std=0.111, train/target_value_mean=-0.229, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5496/8000 [28:39<2:23:15, 3.43s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=13.3, train/loss=4, train/lr=5e-5, train/mae=0.182, train/predicted_value_mean=-0.303, train/predicted_value_std=0.12, train/target_value_mean=-0.273, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5497/8000 [28:42<2:23:32, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.45, train/loss=3.29, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.29, train/predicted_value_std=0.171, train/target_value_mean=-0.242, train/target_value_std=0.25, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5498/8000 [28:46<2:23:41, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.33, train/loss=3.12, train/lr=5e-5, train/mae=0.0506, train/predicted_value_mean=-0.254, train/predicted_value_std=0.114, train/target_value_mean=-0.216, train/target_value_std=0.121, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5499/8000 [28:49<2:24:22, 3.46s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.36, train/loss=4.1, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.309, train/predicted_value_std=0.0864, train/target_value_mean=-0.3, train/target_value_std=0.109, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #1] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 69%|▋| 5500/8000 [34:11<68:39:59, 98.88s/it, time/step=322, time/training=3.51, time/evaluate=318, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.84, train/loss=3.74, train/lr=5e-5, train/mae=0.187, train/predicted_value_mean=-0.318, train/predicted_value_std=0.135, train/target_value_mean=-0.235, train/target_value_std=0.0775, train/value_spearman=0.75, eval/cat_acc_best=0.296, eval/cat_acc_neighbor=0.43, eval/loss=2.38, eval/mae=0.0211, eval/predicted_value_mean=-0.113, eval/predicted_value_std=0.00119, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.296, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.43, eval/stack_bowls_recap_rollout_rc/loss=2.38, eval/stack_bowls_recap_rollout_rc/mae=0.0211, eval/stack_bowls_recap_rollout_rc/predicted_va(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5501/8000 [34:14<48:46:42, 70.27s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.36, train/loss=4.04, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.318, train/predicted_value_std=0.139, train/target_value_mean=-0.222, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5502/8000 [34:18<34:51:29, 50.24s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.88, train/loss=3.02, train/lr=5e-5, train/mae=0.0306, train/predicted_value_mean=-0.244, train/predicted_value_std=0.117, train/target_value_mean=-0.211, train/target_value_std=0.144, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5503/8000 [34:22<25:10:52, 36.30s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8, train/loss=3.92, train/lr=5e-5, train/mae=0.214, train/predicted_value_mean=-0.336, train/predicted_value_std=0.0973, train/target_value_mean=-0.345, train/target_value_std=0.187, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5504/8000 [34:25<18:20:40, 26.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.8, train/loss=3.97, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.321, train/predicted_value_std=0.13, train/target_value_mean=-0.396, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5505/8000 [34:28<13:33:34, 19.57s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.71, train/loss=3.44, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.322, train/predicted_value_std=0.197, train/target_value_mean=-0.305, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5506/8000 [34:32<10:12:54, 14.75s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.87, train/loss=3.12, train/lr=5e-5, train/mae=0.0444, train/predicted_value_mean=-0.257, train/predicted_value_std=0.131, train/target_value_mean=-0.203, train/target_value_std=0.156, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5507/8000 [34:35<7:51:24, 11.35s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.29, train/loss=3.68, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.272, train/predicted_value_std=0.124, train/target_value_mean=-0.27, train/target_value_std=0.178, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5508/8000 [34:39<6:12:25, 8.97s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.81, train/loss=3.61, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.28, train/predicted_value_std=0.128, train/target_value_mean=-0.226, train/target_value_std=0.102, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5509/8000 [34:42<5:03:45, 7.32s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.31, train/loss=3.76, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.27, train/predicted_value_std=0.148, train/target_value_mean=-0.211, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5510/8000 [34:46<4:15:11, 6.15s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.36, train/loss=3.42, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.286, train/predicted_value_std=0.12, train/target_value_mean=-0.268, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5511/8000 [34:49<3:40:05, 5.31s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=12, train/loss=3.85, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.335, train/predicted_value_std=0.212, train/target_value_mean=-0.344, train/target_value_std=0.267, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5512/8000 [34:52<3:15:42, 4.72s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.07, train/loss=3.7, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.274, train/predicted_value_std=0.173, train/target_value_mean=-0.301, train/target_value_std=0.196, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5513/8000 [34:56<2:58:50, 4.31s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.23, train/loss=4.06, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.389, train/predicted_value_std=0.149, train/target_value_mean=-0.433, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5514/8000 [34:59<2:50:43, 4.12s/it, time/step=3.67, time/training=3.66, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8, train/loss=3.89, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.286, train/predicted_value_std=0.153, train/target_value_mean=-0.266, train/target_value_std=0.244, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5515/8000 [35:03<2:41:01, 3.89s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.21, train/loss=3.89, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.387, train/predicted_value_std=0.147, train/target_value_mean=-0.39, train/target_value_std=0.27, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5516/8000 [35:06<2:34:57, 3.74s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.04, train/loss=3.21, train/lr=5e-5, train/mae=0.0356, train/predicted_value_mean=-0.335, train/predicted_value_std=0.18, train/target_value_mean=-0.347, train/target_value_std=0.224, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5517/8000 [35:10<2:30:50, 3.65s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10.1, train/loss=3.67, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.301, train/predicted_value_std=0.0909, train/target_value_mean=-0.264, train/target_value_std=0.189, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5518/8000 [35:13<2:28:19, 3.59s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.3, train/loss=3.48, train/lr=5e-5, train/mae=0.0681, train/predicted_value_mean=-0.302, train/predicted_value_std=0.171, train/target_value_mean=-0.326, train/target_value_std=0.219, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5519/8000 [35:17<2:26:45, 3.55s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.02, train/loss=3.85, train/lr=5e-5, train/mae=0.163, train/predicted_value_mean=-0.32, train/predicted_value_std=0.0973, train/target_value_mean=-0.259, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5520/8000 [35:20<2:25:25, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.17, train/loss=3.64, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.285, train/predicted_value_std=0.145, train/target_value_mean=-0.241, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5521/8000 [35:23<2:24:35, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.53, train/loss=3.64, train/lr=5e-5, train/mae=0.0762, train/predicted_value_mean=-0.288, train/predicted_value_std=0.159, train/target_value_mean=-0.282, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5522/8000 [35:27<2:24:02, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.55, train/loss=3.08, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.283, train/predicted_value_std=0.117, train/target_value_mean=-0.295, train/target_value_std=0.164, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5523/8000 [35:30<2:23:14, 3.47s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.12, train/loss=3.54, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.333, train/predicted_value_std=0.104, train/target_value_mean=-0.29, train/target_value_std=0.159, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5524/8000 [35:34<2:23:20, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.1, train/loss=3.42, train/lr=5e-5, train/mae=0.0794, train/predicted_value_mean=-0.238, train/predicted_value_std=0.147, train/target_value_mean=-0.205, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5525/8000 [35:37<2:23:16, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.83, train/loss=3.78, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.367, train/predicted_value_std=0.162, train/target_value_mean=-0.358, train/target_value_std=0.272, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5526/8000 [35:41<2:26:58, 3.56s/it, time/step=3.78, time/training=3.77, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.36, train/loss=3.52, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.253, train/predicted_value_std=0.131, train/target_value_mean=-0.221, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5527/8000 [35:45<2:25:47, 3.54s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.29, train/loss=3.1, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.223, train/predicted_value_std=0.15, train/target_value_mean=-0.223, train/target_value_std=0.211, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5528/8000 [35:48<2:24:46, 3.51s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.32, train/loss=3.46, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.27, train/predicted_value_std=0.101, train/target_value_mean=-0.267, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5529/8000 [35:51<2:23:53, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.12, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.27, train/predicted_value_std=0.225, train/target_value_mean=-0.264, train/target_value_std=0.274, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5530/8000 [35:55<2:23:19, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.98, train/loss=3.67, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.31, train/predicted_value_std=0.105, train/target_value_mean=-0.335, train/target_value_std=0.187, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5531/8000 [35:58<2:23:11, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.03, train/loss=3.74, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.275, train/predicted_value_std=0.101, train/target_value_mean=-0.268, train/target_value_std=0.0839, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5532/8000 [36:02<2:22:30, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.44, train/loss=3.73, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.321, train/predicted_value_std=0.201, train/target_value_mean=-0.245, train/target_value_std=0.18, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5533/8000 [36:05<2:22:03, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.2, train/loss=3.54, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.314, train/predicted_value_std=0.148, train/target_value_mean=-0.349, train/target_value_std=0.258, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5534/8000 [36:09<2:22:04, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.9, train/loss=3.31, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.227, train/predicted_value_std=0.14, train/target_value_mean=-0.219, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5535/8000 [36:12<2:22:32, 3.47s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.52, train/loss=4.02, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.312, train/predicted_value_std=0.217, train/target_value_mean=-0.293, train/target_value_std=0.213, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5536/8000 [36:16<2:22:10, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.46, train/loss=3.3, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.273, train/predicted_value_std=0.137, train/target_value_mean=-0.263, train/target_value_std=0.172, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5537/8000 [36:19<2:25:50, 3.55s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=9.42, train/loss=3.34, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.297, train/predicted_value_std=0.185, train/target_value_mean=-0.271, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5538/8000 [36:23<2:24:34, 3.52s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.55, train/loss=3.2, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.27, train/predicted_value_std=0.15, train/target_value_mean=-0.329, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5539/8000 [36:26<2:23:25, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.71, train/loss=3.31, train/lr=5e-5, train/mae=0.0528, train/predicted_value_mean=-0.229, train/predicted_value_std=0.11, train/target_value_mean=-0.209, train/target_value_std=0.139, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5540/8000 [36:30<2:22:54, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.8, train/loss=3.81, train/lr=5e-5, train/mae=0.208, train/predicted_value_mean=-0.352, train/predicted_value_std=0.16, train/target_value_mean=-0.448, train/target_value_std=0.221, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5541/8000 [36:33<2:22:42, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.08, train/loss=3.66, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.239, train/predicted_value_std=0.0822, train/target_value_mean=-0.275, train/target_value_std=0.102, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5542/8000 [36:37<2:22:30, 3.48s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.79, train/loss=3.21, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.263, train/predicted_value_std=0.155, train/target_value_mean=-0.227, train/target_value_std=0.196, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5543/8000 [36:40<2:22:16, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.23, train/loss=3.59, train/lr=5e-5, train/mae=0.0578, train/predicted_value_mean=-0.219, train/predicted_value_std=0.119, train/target_value_mean=-0.184, train/target_value_std=0.124, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5544/8000 [36:44<2:21:48, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.04, train/loss=2.84, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.286, train/predicted_value_std=0.142, train/target_value_mean=-0.262, train/target_value_std=0.098, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5545/8000 [36:47<2:21:07, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=6.63, train/loss=4.25, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.336, train/predicted_value_std=0.135, train/target_value_mean=-0.312, train/target_value_std=0.0912, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5546/8000 [36:50<2:21:11, 3.45s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.29, train/loss=3.36, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.29, train/predicted_value_std=0.147, train/target_value_mean=-0.279, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5547/8000 [36:54<2:21:25, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=7.12, train/loss=3.76, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.371, train/predicted_value_std=0.179, train/target_value_mean=-0.308, train/target_value_std=0.261, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5548/8000 [36:57<2:21:28, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.66, train/loss=3.76, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.333, train/predicted_value_std=0.169, train/target_value_mean=-0.33, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5549/8000 [37:01<2:25:08, 3.55s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.94, train/loss=3.61, train/lr=5e-5, train/mae=0.0947, train/predicted_value_mean=-0.299, train/predicted_value_std=0.144, train/target_value_mean=-0.276, train/target_value_std=0.149, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5550/8000 [37:05<2:23:28, 3.51s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.01, train/loss=3.21, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.329, train/predicted_value_std=0.239, train/target_value_mean=-0.406, train/target_value_std=0.385, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5551/8000 [37:08<2:22:35, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.11, train/loss=3.22, train/lr=5e-5, train/mae=0.0494, train/predicted_value_mean=-0.261, train/predicted_value_std=0.12, train/target_value_mean=-0.255, train/target_value_std=0.0978, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5552/8000 [37:11<2:21:13, 3.46s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.47, train/loss=3.55, train/lr=5e-5, train/mae=0.0625, train/predicted_value_mean=-0.3, train/predicted_value_std=0.0906, train/target_value_mean=-0.284, train/target_value_std=0.118, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5553/8000 [37:15<2:20:03, 3.43s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.63, train/loss=3.35, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.302, train/predicted_value_std=0.149, train/target_value_mean=-0.294, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5554/8000 [37:18<2:19:03, 3.41s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=12.4, train/loss=3.74, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.307, train/predicted_value_std=0.198, train/target_value_mean=-0.233, train/target_value_std=0.217, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5555/8000 [37:22<2:18:48, 3.41s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.45, train/loss=2.97, train/lr=5e-5, train/mae=0.0487, train/predicted_value_mean=-0.262, train/predicted_value_std=0.172, train/target_value_mean=-0.228, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5556/8000 [37:25<2:19:00, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=19, train/loss=3.61, train/lr=5e-5, train/mae=0.0722, train/predicted_value_mean=-0.3, train/predicted_value_std=0.142, train/target_value_mean=-0.265, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5557/8000 [37:28<2:18:58, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.7, train/loss=3.81, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.285, train/predicted_value_std=0.127, train/target_value_mean=-0.14, train/target_value_std=0.11, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5558/8000 [37:32<2:19:08, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.59, train/loss=3.36, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.362, train/predicted_value_std=0.223, train/target_value_mean=-0.353, train/target_value_std=0.271, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 69%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5559/8000 [37:35<2:19:25, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.15, train/loss=4.05, train/lr=5e-5, train/mae=0.188, train/predicted_value_mean=-0.355, train/predicted_value_std=0.153, train/target_value_mean=-0.394, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5560/8000 [37:39<2:23:35, 3.53s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.5, train/loss=3.72, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.292, train/predicted_value_std=0.0462, train/target_value_mean=-0.285, train/target_value_std=0.0666, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5561/8000 [37:42<2:22:04, 3.50s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.42, train/loss=3.26, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.334, train/predicted_value_std=0.206, train/target_value_mean=-0.335, train/target_value_std=0.257, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5562/8000 [37:46<2:20:04, 3.45s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.46, train/loss=3.61, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.323, train/predicted_value_std=0.104, train/target_value_mean=-0.317, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5563/8000 [37:49<2:18:40, 3.41s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.37, train/loss=3.23, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.318, train/predicted_value_std=0.203, train/target_value_mean=-0.343, train/target_value_std=0.273, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5564/8000 [37:53<2:18:29, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.17, train/loss=3.37, train/lr=5e-5, train/mae=0.0506, train/predicted_value_mean=-0.31, train/predicted_value_std=0.213, train/target_value_mean=-0.265, train/target_value_std=0.183, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5565/8000 [37:56<2:18:34, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.73, train/loss=3.69, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.259, train/predicted_value_std=0.138, train/target_value_mean=-0.213, train/target_value_std=0.155, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5566/8000 [37:59<2:18:37, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.29, train/loss=3.08, train/lr=5e-5, train/mae=0.0787, train/predicted_value_mean=-0.296, train/predicted_value_std=0.183, train/target_value_mean=-0.274, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5567/8000 [38:03<2:18:58, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.53, train/loss=2.94, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.251, train/predicted_value_std=0.177, train/target_value_mean=-0.243, train/target_value_std=0.217, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5568/8000 [38:06<2:18:55, 3.43s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.95, train/loss=3.78, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.336, train/predicted_value_std=0.083, train/target_value_mean=-0.277, train/target_value_std=0.154, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5569/8000 [38:10<2:18:46, 3.43s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=9.05, train/loss=3.36, train/lr=5e-5, train/mae=0.0272, train/predicted_value_mean=-0.334, train/predicted_value_std=0.187, train/target_value_mean=-0.331, train/target_value_std=0.239, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5570/8000 [38:13<2:18:53, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.66, train/loss=3.22, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.296, train/predicted_value_std=0.123, train/target_value_mean=-0.245, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5571/8000 [38:17<2:19:03, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=8.26, train/loss=3.13, train/lr=5e-5, train/mae=0.0616, train/predicted_value_mean=-0.219, train/predicted_value_std=0.0824, train/target_value_mean=-0.22, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5572/8000 [38:20<2:22:21, 3.52s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.9, train/loss=3.83, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.32, train/predicted_value_std=0.137, train/target_value_mean=-0.326, train/target_value_std=0.308, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5573/8000 [38:24<2:21:34, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.42, train/loss=3.45, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.232, train/predicted_value_std=0.137, train/target_value_mean=-0.21, train/target_value_std=0.153, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5574/8000 [38:27<2:20:58, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.83, train/loss=3.87, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.315, train/predicted_value_std=0.151, train/target_value_mean=-0.314, train/target_value_std=0.24, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5575/8000 [38:31<2:20:37, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=11.4, train/loss=3.31, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.27, train/predicted_value_std=0.133, train/target_value_mean=-0.262, train/target_value_std=0.163, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5576/8000 [38:34<2:20:07, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.7, train/loss=3.19, train/lr=5e-5, train/mae=0.0544, train/predicted_value_mean=-0.231, train/predicted_value_std=0.151, train/target_value_mean=-0.234, train/target_value_std=0.239, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5577/8000 [38:38<2:19:46, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.82, train/loss=3.31, train/lr=5e-5, train/mae=0.0816, train/predicted_value_mean=-0.282, train/predicted_value_std=0.142, train/target_value_mean=-0.212, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5578/8000 [38:41<2:19:45, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.62, train/loss=3.67, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.3, train/predicted_value_std=0.161, train/target_value_mean=-0.282, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5579/8000 [38:44<2:19:34, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.68, train/loss=3.49, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.338, train/predicted_value_std=0.163, train/target_value_mean=-0.287, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5580/8000 [38:48<2:19:17, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.7, train/loss=3.32, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.251, train/predicted_value_std=0.118, train/target_value_mean=-0.214, train/target_value_std=0.0958, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5581/8000 [38:51<2:19:15, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.56, train/loss=3.69, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.288, train/predicted_value_std=0.178, train/target_value_mean=-0.335, train/target_value_std=0.23, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5582/8000 [38:55<2:19:03, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.87, train/loss=3.9, train/lr=5e-5, train/mae=0.216, train/predicted_value_mean=-0.35, train/predicted_value_std=0.131, train/target_value_mean=-0.407, train/target_value_std=0.334, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5583/8000 [38:59<2:22:36, 3.54s/it, time/step=3.75, time/training=3.74, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.94, train/loss=3.35, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.243, train/predicted_value_std=0.0819, train/target_value_mean=-0.245, train/target_value_std=0.145, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5584/8000 [39:02<2:21:21, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.11, train/loss=3.97, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.302, train/predicted_value_std=0.117, train/target_value_mean=-0.331, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5585/8000 [39:05<2:20:28, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.03, train/loss=3.87, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.374, train/predicted_value_std=0.135, train/target_value_mean=-0.394, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5586/8000 [39:09<2:20:04, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.37, train/loss=3.64, train/lr=5e-5, train/mae=0.194, train/predicted_value_mean=-0.416, train/predicted_value_std=0.139, train/target_value_mean=-0.456, train/target_value_std=0.34, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5587/8000 [39:12<2:19:59, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.26, train/loss=3.37, train/lr=5e-5, train/mae=0.025, train/predicted_value_mean=-0.254, train/predicted_value_std=0.0835, train/target_value_mean=-0.205, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5588/8000 [39:16<2:19:36, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.29, train/loss=3.91, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.285, train/predicted_value_std=0.112, train/target_value_mean=-0.33, train/target_value_std=0.173, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5589/8000 [39:19<2:19:14, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=7.76, train/loss=3.77, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.373, train/predicted_value_std=0.171, train/target_value_mean=-0.4, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5590/8000 [39:23<2:19:10, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.52, train/loss=3.63, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.355, train/predicted_value_std=0.197, train/target_value_mean=-0.353, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5591/8000 [39:26<2:19:07, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.71, train/loss=3.27, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.331, train/predicted_value_std=0.0996, train/target_value_mean=-0.355, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5592/8000 [39:30<2:19:16, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.99, train/loss=3.41, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.312, train/predicted_value_std=0.171, train/target_value_mean=-0.294, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5593/8000 [39:33<2:18:52, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.38, train/loss=3.59, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.312, train/predicted_value_std=0.214, train/target_value_mean=-0.298, train/target_value_std=0.275, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5594/8000 [39:37<2:18:37, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.94, train/loss=3.99, train/lr=5e-5, train/mae=0.178, train/predicted_value_mean=-0.323, train/predicted_value_std=0.102, train/target_value_mean=-0.349, train/target_value_std=0.157, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5595/8000 [39:40<2:22:06, 3.55s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.95, train/loss=3.19, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.326, train/predicted_value_std=0.241, train/target_value_mean=-0.299, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5596/8000 [39:44<2:21:39, 3.54s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.6, train/loss=3.66, train/lr=5e-5, train/mae=0.0697, train/predicted_value_mean=-0.31, train/predicted_value_std=0.082, train/target_value_mean=-0.262, train/target_value_std=0.142, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5597/8000 [39:47<2:20:33, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.31, train/loss=3.62, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.303, train/predicted_value_std=0.137, train/target_value_mean=-0.214, train/target_value_std=0.132, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5598/8000 [39:51<2:19:23, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=12.9, train/loss=3.7, train/lr=5e-5, train/mae=0.163, train/predicted_value_mean=-0.305, train/predicted_value_std=0.175, train/target_value_mean=-0.324, train/target_value_std=0.267, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5599/8000 [39:54<2:18:20, 3.46s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=13.6, train/loss=3.7, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.237, train/predicted_value_std=0.0781, train/target_value_mean=-0.181, train/target_value_std=0.0927, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5600/8000 [39:57<2:17:32, 3.44s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.63, train/loss=2.99, train/lr=5e-5, train/mae=0.0625, train/predicted_value_mean=-0.263, train/predicted_value_std=0.123, train/target_value_mean=-0.238, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5601/8000 [40:01<2:16:57, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.63, train/loss=3.88, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.318, train/predicted_value_std=0.154, train/target_value_mean=-0.365, train/target_value_std=0.268, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5602/8000 [40:04<2:16:46, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.1, train/loss=4.29, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.288, train/predicted_value_std=0.165, train/target_value_mean=-0.264, train/target_value_std=0.163, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5603/8000 [40:08<2:16:18, 3.41s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.61, train/loss=4.06, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.331, train/predicted_value_std=0.16, train/target_value_mean=-0.33, train/target_value_std=0.263, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5604/8000 [40:11<2:15:42, 3.40s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.27, train/loss=3.54, train/lr=5e-5, train/mae=0.163, train/predicted_value_mean=-0.373, train/predicted_value_std=0.155, train/target_value_mean=-0.376, train/target_value_std=0.128, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5605/8000 [40:14<2:15:30, 3.39s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.4, train/loss=3.86, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.233, train/predicted_value_std=0.146, train/target_value_mean=-0.26, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5606/8000 [40:18<2:18:19, 3.47s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.8, train/loss=3.64, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.236, train/predicted_value_std=0.116, train/target_value_mean=-0.226, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5607/8000 [40:21<2:16:53, 3.43s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.33, train/loss=3.96, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.297, train/predicted_value_std=0.125, train/target_value_mean=-0.304, train/target_value_std=0.214, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5608/8000 [40:25<2:16:22, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.37, train/loss=3.66, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.303, train/predicted_value_std=0.122, train/target_value_mean=-0.312, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5609/8000 [40:28<2:15:59, 3.41s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.96, train/loss=3.19, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.356, train/predicted_value_std=0.213, train/target_value_mean=-0.359, train/target_value_std=0.259, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5610/8000 [40:32<2:15:42, 3.41s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.92, train/loss=3.44, train/lr=5e-5, train/mae=0.0566, train/predicted_value_mean=-0.287, train/predicted_value_std=0.244, train/target_value_mean=-0.26, train/target_value_std=0.27, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5611/8000 [40:35<2:15:41, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.19, train/loss=3.99, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.322, train/predicted_value_std=0.149, train/target_value_mean=-0.278, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5612/8000 [40:38<2:15:33, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.23, train/loss=2.92, train/lr=5e-5, train/mae=0.0403, train/predicted_value_mean=-0.258, train/predicted_value_std=0.15, train/target_value_mean=-0.262, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5613/8000 [40:42<2:16:02, 3.42s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.44, train/loss=3.02, train/lr=5e-5, train/mae=0.05, train/predicted_value_mean=-0.396, train/predicted_value_std=0.192, train/target_value_mean=-0.418, train/target_value_std=0.252, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5614/8000 [40:45<2:16:30, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.66, train/loss=4.02, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.335, train/predicted_value_std=0.205, train/target_value_mean=-0.315, train/target_value_std=0.242, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5615/8000 [40:49<2:16:44, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.22, train/loss=3.34, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.378, train/predicted_value_std=0.199, train/target_value_mean=-0.323, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5616/8000 [40:52<2:17:01, 3.45s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.44, train/loss=3.59, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.29, train/predicted_value_std=0.167, train/target_value_mean=-0.257, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5617/8000 [40:56<2:17:11, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.28, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.338, train/predicted_value_std=0.301, train/target_value_mean=-0.289, train/target_value_std=0.315, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5618/8000 [40:59<2:20:45, 3.55s/it, time/step=3.76, time/training=3.75, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.11, train/loss=3.47, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.303, train/predicted_value_std=0.145, train/target_value_mean=-0.246, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5619/8000 [41:03<2:19:42, 3.52s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.25, train/loss=3.41, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.289, train/predicted_value_std=0.102, train/target_value_mean=-0.261, train/target_value_std=0.118, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5620/8000 [41:06<2:18:34, 3.49s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.02, train/loss=3.51, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.316, train/predicted_value_std=0.115, train/target_value_mean=-0.268, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5621/8000 [41:10<2:18:04, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.54, train/loss=3.82, train/lr=5e-5, train/mae=0.0969, train/predicted_value_mean=-0.323, train/predicted_value_std=0.147, train/target_value_mean=-0.229, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5622/8000 [41:13<2:17:36, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.97, train/loss=3.73, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.281, train/predicted_value_std=0.148, train/target_value_mean=-0.235, train/target_value_std=0.177, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5623/8000 [41:17<2:17:11, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.91, train/loss=3.39, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.305, train/predicted_value_std=0.162, train/target_value_mean=-0.226, train/target_value_std=0.173, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5624/8000 [41:20<2:16:59, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.9, train/loss=3.4, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.219, train/predicted_value_std=0.11, train/target_value_mean=-0.161, train/target_value_std=0.0924, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5625/8000 [41:24<2:16:37, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.55, train/loss=3.16, train/lr=5e-5, train/mae=0.0622, train/predicted_value_mean=-0.24, train/predicted_value_std=0.126, train/target_value_mean=-0.216, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5626/8000 [41:27<2:16:23, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.19, train/loss=3.81, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.318, train/predicted_value_std=0.116, train/target_value_mean=-0.322, train/target_value_std=0.143, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5627/8000 [41:30<2:16:18, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.28, train/loss=4.46, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.375, train/predicted_value_std=0.0939, train/target_value_mean=-0.366, train/target_value_std=0.148, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5628/8000 [41:34<2:16:14, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.562, train/grad_norm=8.25, train/loss=2.78, train/lr=5e-5, train/mae=0.0338, train/predicted_value_mean=-0.265, train/predicted_value_std=0.111, train/target_value_mean=-0.274, train/target_value_std=0.135, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5629/8000 [41:38<2:19:17, 3.52s/it, time/step=3.71, time/training=3.7, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.23, train/loss=3.05, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.231, train/predicted_value_std=0.144, train/target_value_mean=-0.154, train/target_value_std=0.142, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5630/8000 [41:41<2:18:17, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.52, train/loss=3.49, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.308, train/predicted_value_std=0.142, train/target_value_mean=-0.228, train/target_value_std=0.128, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5631/8000 [41:45<2:17:40, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=6.66, train/loss=4.12, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.342, train/predicted_value_std=0.203, train/target_value_mean=-0.412, train/target_value_std=0.327, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5632/8000 [41:48<2:17:28, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.77, train/loss=3.82, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.343, train/predicted_value_std=0.119, train/target_value_mean=-0.382, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5633/8000 [41:51<2:16:45, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.24, train/loss=3.3, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.223, train/predicted_value_std=0.135, train/target_value_mean=-0.188, train/target_value_std=0.166, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5634/8000 [41:55<2:16:23, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.21, train/loss=2.99, train/lr=5e-5, train/mae=0.0475, train/predicted_value_mean=-0.303, train/predicted_value_std=0.0985, train/target_value_mean=-0.253, train/target_value_std=0.116, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5635/8000 [41:58<2:16:11, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.55, train/loss=3.29, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.277, train/predicted_value_std=0.205, train/target_value_mean=-0.288, train/target_value_std=0.259, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5636/8000 [42:02<2:16:15, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.55, train/loss=3.78, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.355, train/predicted_value_std=0.0928, train/target_value_mean=-0.301, train/target_value_std=0.107, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5637/8000 [42:05<2:15:54, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.04, train/loss=3.72, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.286, train/predicted_value_std=0.112, train/target_value_mean=-0.272, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5638/8000 [42:09<2:15:40, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.34, train/loss=3.65, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.296, train/predicted_value_std=0.0802, train/target_value_mean=-0.267, train/target_value_std=0.109, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5639/8000 [42:12<2:15:27, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.08, train/loss=3.56, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.296, train/predicted_value_std=0.151, train/target_value_mean=-0.326, train/target_value_std=0.253, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 70%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5640/8000 [42:16<2:15:21, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.19, train/loss=3.87, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.3, train/predicted_value_std=0.0895, train/target_value_mean=-0.314, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5641/8000 [42:19<2:18:12, 3.52s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.22, train/loss=3.45, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.268, train/predicted_value_std=0.132, train/target_value_mean=-0.231, train/target_value_std=0.126, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5642/8000 [42:23<2:17:08, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.57, train/loss=3.7, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.276, train/predicted_value_std=0.145, train/target_value_mean=-0.272, train/target_value_std=0.164, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5643/8000 [42:26<2:16:29, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.81, train/loss=3.61, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.337, train/predicted_value_std=0.188, train/target_value_mean=-0.347, train/target_value_std=0.233, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5644/8000 [42:30<2:16:04, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.19, train/loss=3.61, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.224, train/predicted_value_std=0.104, train/target_value_mean=-0.17, train/target_value_std=0.0959, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5645/8000 [42:33<2:16:09, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.61, train/loss=3.91, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.356, train/predicted_value_std=0.212, train/target_value_mean=-0.322, train/target_value_std=0.284, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5646/8000 [42:36<2:14:48, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.8, train/loss=3.69, train/lr=5e-5, train/mae=0.0825, train/predicted_value_mean=-0.336, train/predicted_value_std=0.191, train/target_value_mean=-0.314, train/target_value_std=0.217, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5647/8000 [42:40<2:13:55, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.94, train/loss=3.47, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.285, train/predicted_value_std=0.163, train/target_value_mean=-0.271, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5648/8000 [42:43<2:13:58, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.09, train/loss=3.53, train/lr=5e-5, train/mae=0.0937, train/predicted_value_mean=-0.276, train/predicted_value_std=0.167, train/target_value_mean=-0.31, train/target_value_std=0.238, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5649/8000 [42:47<2:15:29, 3.46s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.38, train/loss=3.88, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.331, train/predicted_value_std=0.0937, train/target_value_mean=-0.323, train/target_value_std=0.188, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5650/8000 [42:50<2:15:09, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.4, train/loss=3.72, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.301, train/predicted_value_std=0.17, train/target_value_mean=-0.281, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5651/8000 [42:54<2:14:49, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=11.8, train/loss=3.46, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.272, train/predicted_value_std=0.129, train/target_value_mean=-0.248, train/target_value_std=0.213, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5652/8000 [42:57<2:17:34, 3.52s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.09, train/loss=3.21, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.301, train/predicted_value_std=0.277, train/target_value_mean=-0.335, train/target_value_std=0.386, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5653/8000 [43:01<2:16:33, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.79, train/loss=3.06, train/lr=5e-5, train/mae=0.0272, train/predicted_value_mean=-0.322, train/predicted_value_std=0.213, train/target_value_mean=-0.319, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5654/8000 [43:04<2:16:03, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11.1, train/loss=3.6, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.278, train/predicted_value_std=0.143, train/target_value_mean=-0.277, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5655/8000 [43:08<2:15:27, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.4, train/loss=4.34, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.359, train/predicted_value_std=0.121, train/target_value_mean=-0.41, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5656/8000 [43:11<2:15:09, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.94, train/loss=3.42, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.303, train/predicted_value_std=0.0872, train/target_value_mean=-0.343, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5657/8000 [43:14<2:14:54, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.6, train/loss=4.13, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.355, train/predicted_value_std=0.168, train/target_value_mean=-0.321, train/target_value_std=0.253, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5658/8000 [43:18<2:14:54, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.87, train/loss=3.93, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.287, train/predicted_value_std=0.125, train/target_value_mean=-0.28, train/target_value_std=0.179, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5659/8000 [43:21<2:14:32, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.92, train/loss=3.42, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.322, train/predicted_value_std=0.168, train/target_value_mean=-0.283, train/target_value_std=0.192, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5660/8000 [43:25<2:14:28, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.3, train/loss=4.13, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.395, train/predicted_value_std=0.198, train/target_value_mean=-0.338, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5661/8000 [43:28<2:14:16, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=10.2, train/loss=4.24, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.307, train/predicted_value_std=0.155, train/target_value_mean=-0.266, train/target_value_std=0.18, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5662/8000 [43:32<2:14:26, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.49, train/loss=3.51, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.274, train/predicted_value_std=0.15, train/target_value_mean=-0.274, train/target_value_std=0.217, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5663/8000 [43:35<2:14:33, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=16.7, train/loss=3.8, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.348, train/predicted_value_std=0.127, train/target_value_mean=-0.275, train/target_value_std=0.282, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5664/8000 [43:39<2:17:22, 3.53s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.21, train/loss=3.11, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.259, train/predicted_value_std=0.141, train/target_value_mean=-0.213, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5665/8000 [43:42<2:16:03, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.52, train/loss=3.53, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.322, train/predicted_value_std=0.148, train/target_value_mean=-0.346, train/target_value_std=0.205, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5666/8000 [43:46<2:14:25, 3.46s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.05, train/loss=2.92, train/lr=5e-5, train/mae=0.0259, train/predicted_value_mean=-0.28, train/predicted_value_std=0.147, train/target_value_mean=-0.256, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5667/8000 [43:49<2:12:56, 3.42s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.32, train/loss=3.72, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.245, train/predicted_value_std=0.132, train/target_value_mean=-0.252, train/target_value_std=0.249, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5668/8000 [43:52<2:12:57, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.01, train/loss=3.88, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.331, train/predicted_value_std=0.0653, train/target_value_mean=-0.345, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5669/8000 [43:56<2:12:18, 3.41s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.28, train/loss=3.13, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.258, train/predicted_value_std=0.201, train/target_value_mean=-0.244, train/target_value_std=0.236, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5670/8000 [43:59<2:11:19, 3.38s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.49, train/loss=4.25, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.349, train/predicted_value_std=0.188, train/target_value_mean=-0.378, train/target_value_std=0.23, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5671/8000 [44:02<2:10:50, 3.37s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.3, train/loss=3.85, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.384, train/predicted_value_std=0.144, train/target_value_mean=-0.389, train/target_value_std=0.153, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5672/8000 [44:06<2:11:36, 3.39s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.06, train/loss=3.22, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.26, train/predicted_value_std=0.125, train/target_value_mean=-0.24, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5673/8000 [44:09<2:11:54, 3.40s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.74, train/loss=3.52, train/lr=5e-5, train/mae=0.0456, train/predicted_value_mean=-0.264, train/predicted_value_std=0.175, train/target_value_mean=-0.205, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5674/8000 [44:13<2:12:41, 3.42s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.64, train/loss=3.78, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.266, train/predicted_value_std=0.147, train/target_value_mean=-0.272, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5675/8000 [44:16<2:15:44, 3.50s/it, time/step=3.69, time/training=3.68, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.19, train/loss=3.41, train/lr=5e-5, train/mae=0.0522, train/predicted_value_mean=-0.237, train/predicted_value_std=0.101, train/target_value_mean=-0.231, train/target_value_std=0.145, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5676/8000 [44:20<2:15:11, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.36, train/loss=3.24, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.324, train/predicted_value_std=0.17, train/target_value_mean=-0.33, train/target_value_std=0.224, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5677/8000 [44:23<2:14:48, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.19, train/loss=3.63, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.299, train/predicted_value_std=0.109, train/target_value_mean=-0.262, train/target_value_std=0.195, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5678/8000 [44:27<2:14:26, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=11.5, train/loss=3.53, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.22, train/predicted_value_std=0.161, train/target_value_mean=-0.165, train/target_value_std=0.138, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5679/8000 [44:30<2:14:13, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.11, train/loss=3.81, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.308, train/predicted_value_std=0.122, train/target_value_mean=-0.341, train/target_value_std=0.107, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5680/8000 [44:34<2:14:14, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=9.14, train/loss=3.93, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.361, train/predicted_value_std=0.175, train/target_value_mean=-0.432, train/target_value_std=0.305, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5681/8000 [44:37<2:14:15, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.34, train/loss=3.41, train/lr=5e-5, train/mae=0.0625, train/predicted_value_mean=-0.235, train/predicted_value_std=0.103, train/target_value_mean=-0.186, train/target_value_std=0.127, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5682/8000 [44:41<2:14:15, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.24, train/loss=3.57, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.365, train/predicted_value_std=0.198, train/target_value_mean=-0.346, train/target_value_std=0.231, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5683/8000 [44:44<2:14:15, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.24, train/loss=3.64, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.227, train/predicted_value_std=0.0975, train/target_value_mean=-0.236, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5684/8000 [44:48<2:14:11, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.88, train/loss=3.63, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.283, train/predicted_value_std=0.139, train/target_value_mean=-0.281, train/target_value_std=0.254, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5685/8000 [44:51<2:14:06, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.61, train/loss=3.41, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.279, train/predicted_value_std=0.15, train/target_value_mean=-0.232, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5686/8000 [44:55<2:13:57, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.68, train/loss=3.81, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.318, train/predicted_value_std=0.163, train/target_value_mean=-0.245, train/target_value_std=0.219, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5687/8000 [44:58<2:17:34, 3.57s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.7, train/loss=3.27, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0984, train/target_value_mean=-0.212, train/target_value_std=0.112, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5688/8000 [45:02<2:16:13, 3.54s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.74, train/loss=3.69, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.304, train/predicted_value_std=0.17, train/target_value_mean=-0.267, train/target_value_std=0.193, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5689/8000 [45:05<2:15:27, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.5, train/loss=4.05, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.324, train/predicted_value_std=0.0875, train/target_value_mean=-0.324, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5690/8000 [45:09<2:14:43, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.55, train/loss=3.69, train/lr=5e-5, train/mae=0.211, train/predicted_value_mean=-0.356, train/predicted_value_std=0.133, train/target_value_mean=-0.395, train/target_value_std=0.138, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5691/8000 [45:12<2:13:50, 3.48s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.85, train/loss=3.43, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.259, train/predicted_value_std=0.147, train/target_value_mean=-0.238, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5692/8000 [45:16<2:13:43, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.88, train/loss=3.63, train/lr=5e-5, train/mae=0.0612, train/predicted_value_mean=-0.335, train/predicted_value_std=0.157, train/target_value_mean=-0.307, train/target_value_std=0.287, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5693/8000 [45:19<2:13:34, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=10.2, train/loss=3.15, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.312, train/predicted_value_std=0.143, train/target_value_mean=-0.293, train/target_value_std=0.181, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5694/8000 [45:23<2:13:15, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.94, train/loss=4.25, train/lr=5e-5, train/mae=0.239, train/predicted_value_mean=-0.36, train/predicted_value_std=0.0729, train/target_value_mean=-0.37, train/target_value_std=0.159, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5695/8000 [45:26<2:13:31, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.29, train/loss=3.88, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.33, train/predicted_value_std=0.145, train/target_value_mean=-0.295, train/target_value_std=0.188, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5696/8000 [45:30<2:14:44, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.84, train/loss=4.23, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.382, train/predicted_value_std=0.14, train/target_value_mean=-0.294, train/target_value_std=0.174, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5697/8000 [45:33<2:14:32, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=5.73, train/loss=2.98, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.289, train/predicted_value_std=0.147, train/target_value_mean=-0.257, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5698/8000 [45:37<2:17:30, 3.58s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.19, train/loss=3.13, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.262, train/predicted_value_std=0.13, train/target_value_mean=-0.288, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5699/8000 [45:40<2:15:52, 3.54s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.8, train/loss=3.69, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.339, train/predicted_value_std=0.176, train/target_value_mean=-0.312, train/target_value_std=0.277, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5700/8000 [45:44<2:15:15, 3.53s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.9, train/loss=3.8, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.325, train/predicted_value_std=0.123, train/target_value_mean=-0.329, train/target_value_std=0.25, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5701/8000 [45:47<2:15:01, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.14, train/loss=3.26, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.246, train/predicted_value_std=0.144, train/target_value_mean=-0.211, train/target_value_std=0.145, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5702/8000 [45:51<2:14:24, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.76, train/loss=3.24, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.291, train/predicted_value_std=0.147, train/target_value_mean=-0.299, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5703/8000 [45:54<2:14:00, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.56, train/loss=3.89, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.292, train/predicted_value_std=0.136, train/target_value_mean=-0.165, train/target_value_std=0.129, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5704/8000 [45:58<2:14:04, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.3, train/loss=3.75, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.304, train/predicted_value_std=0.145, train/target_value_mean=-0.331, train/target_value_std=0.251, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5705/8000 [46:01<2:13:19, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.72, train/loss=3.69, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.284, train/predicted_value_std=0.122, train/target_value_mean=-0.323, train/target_value_std=0.173, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5706/8000 [46:05<2:12:46, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.48, train/loss=2.94, train/lr=5e-5, train/mae=0.04, train/predicted_value_mean=-0.222, train/predicted_value_std=0.13, train/target_value_mean=-0.202, train/target_value_std=0.204, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5707/8000 [46:08<2:12:21, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.28, train/loss=3.37, train/lr=5e-5, train/mae=0.175, train/predicted_value_mean=-0.338, train/predicted_value_std=0.136, train/target_value_mean=-0.396, train/target_value_std=0.274, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5708/8000 [46:12<2:12:25, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=10.8, train/loss=3.19, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.325, train/predicted_value_std=0.123, train/target_value_mean=-0.312, train/target_value_std=0.224, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5709/8000 [46:15<2:11:58, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=22.3, train/loss=2.88, train/lr=5e-5, train/mae=0.0225, train/predicted_value_mean=-0.238, train/predicted_value_std=0.199, train/target_value_mean=-0.206, train/target_value_std=0.259, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5710/8000 [46:19<2:15:05, 3.54s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.7, train/loss=3.69, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.259, train/predicted_value_std=0.133, train/target_value_mean=-0.273, train/target_value_std=0.219, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5711/8000 [46:22<2:14:13, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.27, train/loss=3.81, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.302, train/predicted_value_std=0.135, train/target_value_mean=-0.286, train/target_value_std=0.145, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5712/8000 [46:26<2:12:30, 3.47s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.11, train/loss=3.23, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.323, train/predicted_value_std=0.185, train/target_value_mean=-0.335, train/target_value_std=0.245, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5713/8000 [46:29<2:11:02, 3.44s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.92, train/loss=3.2, train/lr=5e-5, train/mae=0.0587, train/predicted_value_mean=-0.372, train/predicted_value_std=0.263, train/target_value_mean=-0.341, train/target_value_std=0.3, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5714/8000 [46:32<2:10:28, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.96, train/loss=3.85, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.295, train/predicted_value_std=0.177, train/target_value_mean=-0.281, train/target_value_std=0.156, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5715/8000 [46:36<2:10:38, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.56, train/loss=3.99, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.368, train/predicted_value_std=0.178, train/target_value_mean=-0.347, train/target_value_std=0.229, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5716/8000 [46:39<2:10:03, 3.42s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.35, train/loss=3.64, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.335, train/predicted_value_std=0.156, train/target_value_mean=-0.269, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5717/8000 [46:43<2:09:08, 3.39s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.04, train/loss=3.59, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.342, train/predicted_value_std=0.162, train/target_value_mean=-0.316, train/target_value_std=0.203, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5718/8000 [46:46<2:08:40, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.56, train/loss=3.87, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.357, train/predicted_value_std=0.186, train/target_value_mean=-0.318, train/target_value_std=0.23, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 71%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5719/8000 [46:49<2:08:07, 3.37s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=12.4, train/loss=3.14, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.294, train/predicted_value_std=0.207, train/target_value_mean=-0.317, train/target_value_std=0.314, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5720/8000 [46:53<2:07:24, 3.35s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.4, train/loss=3.35, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.316, train/predicted_value_std=0.084, train/target_value_mean=-0.285, train/target_value_std=0.0485, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5721/8000 [46:56<2:10:57, 3.45s/it, time/step=3.67, time/training=3.67, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.34, train/loss=3.47, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.28, train/predicted_value_std=0.151, train/target_value_mean=-0.281, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5722/8000 [47:00<2:09:25, 3.41s/it, time/step=3.32, time/training=3.31, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.95, train/loss=3.25, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.225, train/predicted_value_std=0.163, train/target_value_mean=-0.215, train/target_value_std=0.187, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5723/8000 [47:03<2:08:32, 3.39s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=6.77, train/loss=3.01, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.216, train/predicted_value_std=0.145, train/target_value_mean=-0.188, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5724/8000 [47:06<2:08:09, 3.38s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.61, train/loss=3.18, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.316, train/predicted_value_std=0.196, train/target_value_mean=-0.292, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5725/8000 [47:10<2:08:08, 3.38s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.92, train/loss=3.85, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.326, train/predicted_value_std=0.148, train/target_value_mean=-0.288, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5726/8000 [47:13<2:08:10, 3.38s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=10.1, train/loss=3.46, train/lr=5e-5, train/mae=0.0987, train/predicted_value_mean=-0.271, train/predicted_value_std=0.179, train/target_value_mean=-0.212, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5727/8000 [47:16<2:07:42, 3.37s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.97, train/loss=3.98, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.334, train/predicted_value_std=0.151, train/target_value_mean=-0.345, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5728/8000 [47:20<2:07:31, 3.37s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.51, train/loss=2.89, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.252, train/predicted_value_std=0.194, train/target_value_mean=-0.242, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5729/8000 [47:23<2:08:16, 3.39s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.2, train/loss=3.52, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.262, train/predicted_value_std=0.161, train/target_value_mean=-0.268, train/target_value_std=0.233, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5730/8000 [47:27<2:08:32, 3.40s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.17, train/loss=3.91, train/lr=5e-5, train/mae=0.21, train/predicted_value_mean=-0.3, train/predicted_value_std=0.137, train/target_value_mean=-0.325, train/target_value_std=0.289, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5731/8000 [47:30<2:09:02, 3.41s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.72, train/loss=3.68, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.257, train/predicted_value_std=0.124, train/target_value_mean=-0.222, train/target_value_std=0.134, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5732/8000 [47:34<2:09:02, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=11.8, train/loss=3.5, train/lr=5e-5, train/mae=0.0825, train/predicted_value_mean=-0.27, train/predicted_value_std=0.166, train/target_value_mean=-0.271, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5733/8000 [47:37<2:12:25, 3.50s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.61, train/loss=3.55, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.254, train/predicted_value_std=0.159, train/target_value_mean=-0.22, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5734/8000 [47:41<2:11:16, 3.48s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.25, train/loss=3.97, train/lr=5e-5, train/mae=0.176, train/predicted_value_mean=-0.309, train/predicted_value_std=0.0907, train/target_value_mean=-0.386, train/target_value_std=0.112, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5735/8000 [47:44<2:10:37, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.81, train/loss=3.82, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.275, train/predicted_value_std=0.155, train/target_value_mean=-0.239, train/target_value_std=0.204, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5736/8000 [47:47<2:10:07, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.43, train/loss=3.65, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.279, train/predicted_value_std=0.0871, train/target_value_mean=-0.267, train/target_value_std=0.161, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5737/8000 [47:51<2:10:06, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.75, train/loss=3.7, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.301, train/predicted_value_std=0.134, train/target_value_mean=-0.333, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5738/8000 [47:54<2:09:59, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=6.57, train/loss=3.31, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.277, train/predicted_value_std=0.208, train/target_value_mean=-0.262, train/target_value_std=0.236, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5739/8000 [47:58<2:09:40, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=14, train/loss=3.7, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.297, train/predicted_value_std=0.0999, train/target_value_mean=-0.286, train/target_value_std=0.139, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5740/8000 [48:01<2:10:05, 3.45s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.48, train/loss=3.36, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.259, train/predicted_value_std=0.0736, train/target_value_mean=-0.234, train/target_value_std=0.108, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5741/8000 [48:05<2:10:37, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=9.63, train/loss=3.29, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.26, train/predicted_value_std=0.166, train/target_value_mean=-0.254, train/target_value_std=0.227, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5742/8000 [48:08<2:10:37, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=17.7, train/loss=4.28, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.358, train/predicted_value_std=0.168, train/target_value_mean=-0.312, train/target_value_std=0.307, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5743/8000 [48:12<2:10:13, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.82, train/loss=3.78, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.262, train/predicted_value_std=0.144, train/target_value_mean=-0.271, train/target_value_std=0.262, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5744/8000 [48:15<2:13:23, 3.55s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=5.85, train/loss=3.06, train/lr=5e-5, train/mae=0.0378, train/predicted_value_mean=-0.294, train/predicted_value_std=0.21, train/target_value_mean=-0.256, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5745/8000 [48:19<2:11:47, 3.51s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.92, train/loss=3.42, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.315, train/predicted_value_std=0.185, train/target_value_mean=-0.339, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5746/8000 [48:22<2:09:45, 3.45s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.08, train/loss=3.06, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.275, train/predicted_value_std=0.184, train/target_value_mean=-0.236, train/target_value_std=0.159, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5747/8000 [48:26<2:08:22, 3.42s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=5.99, train/loss=4.07, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.334, train/predicted_value_std=0.162, train/target_value_mean=-0.406, train/target_value_std=0.258, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5748/8000 [48:29<2:07:41, 3.40s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.96, train/loss=3.68, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.255, train/predicted_value_std=0.111, train/target_value_mean=-0.216, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5749/8000 [48:32<2:07:11, 3.39s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=10.9, train/loss=3.06, train/lr=5e-5, train/mae=0.0509, train/predicted_value_mean=-0.342, train/predicted_value_std=0.2, train/target_value_mean=-0.358, train/target_value_std=0.221, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5750/8000 [48:36<2:06:43, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.22, train/loss=3.17, train/lr=5e-5, train/mae=0.0469, train/predicted_value_mean=-0.259, train/predicted_value_std=0.124, train/target_value_mean=-0.183, train/target_value_std=0.1, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5751/8000 [48:39<2:06:27, 3.37s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=5.94, train/loss=3.35, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.304, train/predicted_value_std=0.0993, train/target_value_mean=-0.288, train/target_value_std=0.185, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5752/8000 [48:42<2:06:18, 3.37s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.09, train/loss=2.77, train/lr=5e-5, train/mae=0.0137, train/predicted_value_mean=-0.284, train/predicted_value_std=0.2, train/target_value_mean=-0.283, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5753/8000 [48:46<2:05:59, 3.36s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=6.59, train/loss=3.22, train/lr=5e-5, train/mae=0.0541, train/predicted_value_mean=-0.299, train/predicted_value_std=0.156, train/target_value_mean=-0.319, train/target_value_std=0.243, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5754/8000 [48:49<2:05:38, 3.36s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.97, train/loss=3.69, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.252, train/predicted_value_std=0.11, train/target_value_mean=-0.272, train/target_value_std=0.211, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5755/8000 [48:52<2:05:54, 3.37s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.42, train/loss=4.25, train/lr=5e-5, train/mae=0.187, train/predicted_value_mean=-0.32, train/predicted_value_std=0.123, train/target_value_mean=-0.341, train/target_value_std=0.163, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5756/8000 [48:56<2:09:02, 3.45s/it, time/step=3.65, time/training=3.65, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.63, train/loss=3.37, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.246, train/predicted_value_std=0.0357, train/target_value_mean=-0.226, train/target_value_std=0.103, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5757/8000 [48:59<2:08:28, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.59, train/loss=3.62, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.277, train/predicted_value_std=0.136, train/target_value_mean=-0.271, train/target_value_std=0.224, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5758/8000 [49:03<2:07:57, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.4, train/loss=3.02, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.22, train/predicted_value_std=0.21, train/target_value_mean=-0.256, train/target_value_std=0.304, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5759/8000 [49:06<2:08:00, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10, train/loss=3.75, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.34, train/predicted_value_std=0.213, train/target_value_mean=-0.323, train/target_value_std=0.284, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5760/8000 [49:10<2:07:53, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.81, train/loss=3.44, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.289, train/predicted_value_std=0.114, train/target_value_mean=-0.279, train/target_value_std=0.208, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5761/8000 [49:13<2:07:51, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=15.4, train/loss=3.9, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.315, train/predicted_value_std=0.136, train/target_value_mean=-0.229, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5762/8000 [49:17<2:07:43, 3.42s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.24, train/loss=3.91, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.416, train/predicted_value_std=0.12, train/target_value_mean=-0.423, train/target_value_std=0.283, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5763/8000 [49:20<2:08:08, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.45, train/loss=3.61, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.259, train/predicted_value_std=0.16, train/target_value_mean=-0.234, train/target_value_std=0.178, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5764/8000 [49:24<2:08:22, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.47, train/loss=3.36, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.271, train/predicted_value_std=0.149, train/target_value_mean=-0.289, train/target_value_std=0.213, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5765/8000 [49:27<2:08:50, 3.46s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=17.1, train/loss=2.98, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.262, train/predicted_value_std=0.117, train/target_value_mean=-0.201, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5766/8000 [49:30<2:08:52, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.2, train/loss=3.22, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.297, train/predicted_value_std=0.146, train/target_value_mean=-0.304, train/target_value_std=0.178, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5767/8000 [49:34<2:12:16, 3.55s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.1, train/loss=3.75, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.295, train/predicted_value_std=0.167, train/target_value_mean=-0.256, train/target_value_std=0.134, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5768/8000 [49:38<2:11:34, 3.54s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.16, train/loss=4.15, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.321, train/predicted_value_std=0.164, train/target_value_mean=-0.348, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5769/8000 [49:41<2:11:08, 3.53s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.11, train/loss=3.62, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.209, train/predicted_value_std=0.141, train/target_value_mean=-0.193, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5770/8000 [49:45<2:09:51, 3.49s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.26, train/loss=3.05, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.318, train/predicted_value_std=0.119, train/target_value_mean=-0.218, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5771/8000 [49:48<2:09:26, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.12, train/loss=3.42, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.284, train/predicted_value_std=0.129, train/target_value_mean=-0.219, train/target_value_std=0.093, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5772/8000 [49:52<2:08:43, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.58, train/loss=3.44, train/lr=5e-5, train/mae=0.0978, train/predicted_value_mean=-0.287, train/predicted_value_std=0.211, train/target_value_mean=-0.246, train/target_value_std=0.213, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5773/8000 [49:55<2:07:12, 3.43s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.47, train/loss=3.32, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.269, train/predicted_value_std=0.117, train/target_value_mean=-0.17, train/target_value_std=0.0848, train/value_spearman=-0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5774/8000 [49:58<2:06:17, 3.40s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.55, train/loss=3.64, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.28, train/predicted_value_std=0.139, train/target_value_mean=-0.199, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5775/8000 [50:02<2:05:46, 3.39s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.17, train/loss=3.05, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.293, train/predicted_value_std=0.149, train/target_value_mean=-0.269, train/target_value_std=0.23, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5776/8000 [50:05<2:05:15, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.01, train/loss=3.51, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.345, train/predicted_value_std=0.186, train/target_value_mean=-0.349, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5777/8000 [50:08<2:04:48, 3.37s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.27, train/loss=3.62, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.277, train/predicted_value_std=0.174, train/target_value_mean=-0.275, train/target_value_std=0.188, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5778/8000 [50:12<2:04:26, 3.36s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.3, train/loss=3.27, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.291, train/predicted_value_std=0.123, train/target_value_mean=-0.308, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5779/8000 [50:15<2:07:09, 3.44s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.3, train/loss=3.46, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.297, train/predicted_value_std=0.122, train/target_value_mean=-0.278, train/target_value_std=0.141, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5780/8000 [50:19<2:06:06, 3.41s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=8.13, train/loss=3.3, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.238, train/predicted_value_std=0.126, train/target_value_mean=-0.276, train/target_value_std=0.127, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5781/8000 [50:22<2:05:18, 3.39s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.9, train/loss=3.41, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.248, train/predicted_value_std=0.113, train/target_value_mean=-0.231, train/target_value_std=0.116, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5782/8000 [50:25<2:05:54, 3.41s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.77, train/loss=3.48, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.336, train/predicted_value_std=0.178, train/target_value_mean=-0.349, train/target_value_std=0.219, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5783/8000 [50:29<2:06:37, 3.43s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.88, train/loss=3.67, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.329, train/predicted_value_std=0.156, train/target_value_mean=-0.375, train/target_value_std=0.29, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5784/8000 [50:32<2:06:26, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.6, train/loss=3.62, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.275, train/predicted_value_std=0.147, train/target_value_mean=-0.292, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5785/8000 [50:36<2:06:32, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.22, train/loss=3.73, train/lr=5e-5, train/mae=0.194, train/predicted_value_mean=-0.308, train/predicted_value_std=0.143, train/target_value_mean=-0.338, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5786/8000 [50:39<2:06:23, 3.43s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=10.8, train/loss=2.63, train/lr=5e-5, train/mae=0.06, train/predicted_value_mean=-0.208, train/predicted_value_std=0.158, train/target_value_mean=-0.208, train/target_value_std=0.2, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5787/8000 [50:43<2:06:25, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.42, train/loss=3.57, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.305, train/predicted_value_std=0.155, train/target_value_mean=-0.279, train/target_value_std=0.224, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5788/8000 [50:46<2:06:12, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.02, train/loss=3.6, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.275, train/predicted_value_std=0.09, train/target_value_mean=-0.281, train/target_value_std=0.206, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5789/8000 [50:49<2:05:10, 3.40s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.18, train/loss=3.84, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.366, train/predicted_value_std=0.169, train/target_value_mean=-0.356, train/target_value_std=0.211, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5790/8000 [50:53<2:07:32, 3.46s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.97, train/loss=3.19, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.257, train/predicted_value_std=0.0859, train/target_value_mean=-0.238, train/target_value_std=0.156, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5791/8000 [50:56<2:06:58, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.36, train/loss=3.81, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.27, train/predicted_value_std=0.0701, train/target_value_mean=-0.199, train/target_value_std=0.117, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5792/8000 [51:00<2:06:49, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.98, train/loss=3.47, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.331, train/predicted_value_std=0.131, train/target_value_mean=-0.34, train/target_value_std=0.163, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5793/8000 [51:03<2:06:52, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.78, train/loss=3.51, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.297, train/predicted_value_std=0.176, train/target_value_mean=-0.304, train/target_value_std=0.242, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5794/8000 [51:07<2:06:15, 3.43s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.34, train/loss=3.79, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.275, train/predicted_value_std=0.104, train/target_value_mean=-0.269, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5795/8000 [51:10<2:06:39, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=6.45, train/loss=4.01, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.41, train/predicted_value_std=0.178, train/target_value_mean=-0.4, train/target_value_std=0.228, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5796/8000 [51:14<2:06:23, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.67, train/loss=3.44, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.358, train/predicted_value_std=0.147, train/target_value_mean=-0.312, train/target_value_std=0.221, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5797/8000 [51:17<2:06:19, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.02, train/loss=3.35, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.282, train/predicted_value_std=0.105, train/target_value_mean=-0.252, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5798/8000 [51:20<2:06:03, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.69, train/loss=3.1, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.215, train/predicted_value_std=0.12, train/target_value_mean=-0.159, train/target_value_std=0.125, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5799/8000 [51:24<2:06:21, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.04, train/loss=3.83, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.288, train/predicted_value_std=0.0695, train/target_value_mean=-0.261, train/target_value_std=0.0881, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 72%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5800/8000 [51:27<2:06:19, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.99, train/loss=3.5, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.241, train/predicted_value_std=0.0889, train/target_value_mean=-0.268, train/target_value_std=0.149, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5801/8000 [51:31<2:06:04, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.38, train/loss=4.7, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.361, train/predicted_value_std=0.128, train/target_value_mean=-0.258, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5802/8000 [51:34<2:09:12, 3.53s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.25, train/loss=4.06, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.372, train/predicted_value_std=0.101, train/target_value_mean=-0.336, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5803/8000 [51:38<2:07:50, 3.49s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.63, train/loss=3.76, train/lr=5e-5, train/mae=0.0937, train/predicted_value_mean=-0.307, train/predicted_value_std=0.113, train/target_value_mean=-0.255, train/target_value_std=0.198, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5804/8000 [51:41<2:06:22, 3.45s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.08, train/loss=3.16, train/lr=5e-5, train/mae=0.0631, train/predicted_value_mean=-0.289, train/predicted_value_std=0.182, train/target_value_mean=-0.223, train/target_value_std=0.147, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5805/8000 [51:45<2:05:54, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.49, train/loss=3.45, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.25, train/predicted_value_std=0.156, train/target_value_mean=-0.215, train/target_value_std=0.14, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5806/8000 [51:48<2:05:26, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.02, train/loss=3.78, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.315, train/predicted_value_std=0.122, train/target_value_mean=-0.281, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5807/8000 [51:51<2:05:04, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.71, train/loss=3.47, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.278, train/predicted_value_std=0.129, train/target_value_mean=-0.262, train/target_value_std=0.2, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5808/8000 [51:55<2:04:58, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.82, train/loss=3.37, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.292, train/predicted_value_std=0.0761, train/target_value_mean=-0.25, train/target_value_std=0.143, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5809/8000 [51:58<2:05:32, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.54, train/loss=3.89, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.33, train/predicted_value_std=0.186, train/target_value_mean=-0.337, train/target_value_std=0.299, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5810/8000 [52:02<2:05:22, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=6.91, train/loss=3.1, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.217, train/predicted_value_std=0.113, train/target_value_mean=-0.186, train/target_value_std=0.18, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5811/8000 [52:05<2:05:02, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.62, train/loss=3.56, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.356, train/predicted_value_std=0.143, train/target_value_mean=-0.265, train/target_value_std=0.138, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5812/8000 [52:09<2:04:56, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.3, train/loss=3.52, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.324, train/predicted_value_std=0.0989, train/target_value_mean=-0.32, train/target_value_std=0.119, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5813/8000 [52:12<2:07:57, 3.51s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=9.38, train/loss=2.73, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.209, train/predicted_value_std=0.121, train/target_value_mean=-0.212, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5814/8000 [52:16<2:07:05, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.47, train/loss=3.53, train/lr=5e-5, train/mae=0.0644, train/predicted_value_mean=-0.256, train/predicted_value_std=0.158, train/target_value_mean=-0.252, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5815/8000 [52:19<2:06:35, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.07, train/loss=2.84, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.253, train/predicted_value_std=0.132, train/target_value_mean=-0.236, train/target_value_std=0.133, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5816/8000 [52:23<2:06:23, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.18, train/loss=4.33, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.369, train/predicted_value_std=0.0778, train/target_value_mean=-0.32, train/target_value_std=0.201, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5817/8000 [52:26<2:06:09, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=5.61, train/loss=2.97, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.274, train/predicted_value_std=0.116, train/target_value_mean=-0.223, train/target_value_std=0.166, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5818/8000 [52:30<2:05:45, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=11.8, train/loss=3.17, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.252, train/predicted_value_std=0.0823, train/target_value_mean=-0.13, train/target_value_std=0.0808, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5819/8000 [52:33<2:05:58, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.44, train/loss=3.14, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.228, train/predicted_value_std=0.0984, train/target_value_mean=-0.17, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5820/8000 [52:37<2:05:55, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10, train/loss=3.49, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.326, train/predicted_value_std=0.162, train/target_value_mean=-0.342, train/target_value_std=0.224, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5821/8000 [52:40<2:05:53, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.24, train/loss=3.44, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.28, train/predicted_value_std=0.162, train/target_value_mean=-0.264, train/target_value_std=0.215, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5822/8000 [52:43<2:05:22, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.9, train/loss=3.96, train/lr=5e-5, train/mae=0.193, train/predicted_value_mean=-0.317, train/predicted_value_std=0.172, train/target_value_mean=-0.353, train/target_value_std=0.288, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5823/8000 [52:47<2:04:42, 3.44s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.68, train/loss=3.79, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.286, train/predicted_value_std=0.142, train/target_value_mean=-0.297, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5824/8000 [52:50<2:04:32, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.2, train/loss=3.56, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.263, train/predicted_value_std=0.136, train/target_value_mean=-0.25, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5825/8000 [52:54<2:07:19, 3.51s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.06, train/loss=2.6, train/lr=5e-5, train/mae=0.0369, train/predicted_value_mean=-0.186, train/predicted_value_std=0.103, train/target_value_mean=-0.154, train/target_value_std=0.111, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5826/8000 [52:57<2:06:09, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.7, train/loss=4.11, train/lr=5e-5, train/mae=0.191, train/predicted_value_mean=-0.312, train/predicted_value_std=0.131, train/target_value_mean=-0.294, train/target_value_std=0.182, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5827/8000 [53:01<2:05:15, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.92, train/loss=3.32, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.32, train/predicted_value_std=0.195, train/target_value_mean=-0.298, train/target_value_std=0.195, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5828/8000 [53:04<2:05:02, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=9.56, train/loss=4.81, train/lr=5e-5, train/mae=0.281, train/predicted_value_mean=-0.345, train/predicted_value_std=0.0915, train/target_value_mean=-0.431, train/target_value_std=0.179, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5829/8000 [53:08<2:05:03, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.15, train/loss=3.7, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.33, train/predicted_value_std=0.129, train/target_value_mean=-0.339, train/target_value_std=0.221, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5830/8000 [53:11<2:05:00, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.81, train/loss=3.46, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.28, train/predicted_value_std=0.13, train/target_value_mean=-0.302, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5831/8000 [53:15<2:05:01, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.01, train/loss=3.38, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.276, train/predicted_value_std=0.131, train/target_value_mean=-0.254, train/target_value_std=0.163, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5832/8000 [53:18<2:04:29, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=7.44, train/loss=3.75, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.394, train/predicted_value_std=0.146, train/target_value_mean=-0.416, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5833/8000 [53:21<2:03:31, 3.42s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=11.3, train/loss=3.16, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.266, train/predicted_value_std=0.132, train/target_value_mean=-0.244, train/target_value_std=0.14, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5834/8000 [53:25<2:03:05, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.37, train/loss=3.41, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.203, train/predicted_value_std=0.098, train/target_value_mean=-0.156, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5835/8000 [53:28<2:02:50, 3.40s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.42, train/loss=4.07, train/lr=5e-5, train/mae=0.216, train/predicted_value_mean=-0.269, train/predicted_value_std=0.0719, train/target_value_mean=-0.245, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5836/8000 [53:32<2:06:25, 3.51s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.73, train/loss=3.79, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.288, train/predicted_value_std=0.117, train/target_value_mean=-0.254, train/target_value_std=0.179, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5837/8000 [53:35<2:05:10, 3.47s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.85, train/loss=3.44, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.311, train/predicted_value_std=0.156, train/target_value_mean=-0.325, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5838/8000 [53:39<2:04:12, 3.45s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.78, train/loss=3.26, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.221, train/predicted_value_std=0.163, train/target_value_mean=-0.259, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5839/8000 [53:42<2:03:42, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.68, train/loss=3.98, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.373, train/predicted_value_std=0.174, train/target_value_mean=-0.37, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5840/8000 [53:45<2:03:23, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.84, train/loss=3.44, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.27, train/predicted_value_std=0.176, train/target_value_mean=-0.271, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5841/8000 [53:49<2:02:58, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.33, train/loss=3.53, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.268, train/predicted_value_std=0.185, train/target_value_mean=-0.31, train/target_value_std=0.255, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5842/8000 [53:52<2:02:45, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.37, train/loss=2.82, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.199, train/predicted_value_std=0.0979, train/target_value_mean=-0.173, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5843/8000 [53:56<2:02:45, 3.41s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.17, train/loss=3.93, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.244, train/predicted_value_std=0.157, train/target_value_mean=-0.267, train/target_value_std=0.184, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5844/8000 [53:59<2:02:43, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.05, train/loss=3.59, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.303, train/predicted_value_std=0.138, train/target_value_mean=-0.396, train/target_value_std=0.227, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5845/8000 [54:03<2:02:54, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.44, train/loss=3.41, train/lr=5e-5, train/mae=0.0947, train/predicted_value_mean=-0.276, train/predicted_value_std=0.192, train/target_value_mean=-0.24, train/target_value_std=0.202, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5846/8000 [54:06<2:03:04, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.83, train/loss=3.48, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.332, train/predicted_value_std=0.185, train/target_value_mean=-0.305, train/target_value_std=0.191, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5847/8000 [54:09<2:02:55, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=14.2, train/loss=4.11, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.367, train/predicted_value_std=0.142, train/target_value_mean=-0.323, train/target_value_std=0.258, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5848/8000 [54:13<2:06:00, 3.51s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.27, train/loss=4.14, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.316, train/predicted_value_std=0.103, train/target_value_mean=-0.271, train/target_value_std=0.195, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5849/8000 [54:17<2:05:22, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.07, train/loss=3.49, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.322, train/predicted_value_std=0.22, train/target_value_mean=-0.337, train/target_value_std=0.267, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5850/8000 [54:20<2:04:47, 3.48s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.3, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.302, train/predicted_value_std=0.124, train/target_value_mean=-0.248, train/target_value_std=0.192, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5851/8000 [54:23<2:04:16, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.6, train/loss=3.56, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.261, train/predicted_value_std=0.12, train/target_value_mean=-0.197, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5852/8000 [54:27<2:03:52, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.16, train/loss=3.51, train/lr=5e-5, train/mae=0.0506, train/predicted_value_mean=-0.243, train/predicted_value_std=0.0584, train/target_value_mean=-0.202, train/target_value_std=0.143, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5853/8000 [54:30<2:03:39, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=5.95, train/loss=3.81, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.291, train/predicted_value_std=0.131, train/target_value_mean=-0.315, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5854/8000 [54:34<2:03:26, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=10.3, train/loss=3, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.235, train/predicted_value_std=0.163, train/target_value_mean=-0.266, train/target_value_std=0.237, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5855/8000 [54:37<2:02:51, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.7, train/loss=3.3, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.271, train/predicted_value_std=0.134, train/target_value_mean=-0.228, train/target_value_std=0.137, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5856/8000 [54:41<2:02:36, 3.43s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.02, train/loss=2.65, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.205, train/predicted_value_std=0.109, train/target_value_mean=-0.246, train/target_value_std=0.184, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5857/8000 [54:44<2:02:24, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=13.3, train/loss=3.8, train/lr=5e-5, train/mae=0.216, train/predicted_value_mean=-0.372, train/predicted_value_std=0.158, train/target_value_mean=-0.356, train/target_value_std=0.289, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5858/8000 [54:47<2:01:33, 3.41s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.11, train/loss=3.63, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.278, train/predicted_value_std=0.163, train/target_value_mean=-0.259, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5859/8000 [54:51<2:03:51, 3.47s/it, time/step=3.62, time/training=3.62, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.16, train/loss=3.98, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.273, train/predicted_value_std=0.182, train/target_value_mean=-0.237, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5860/8000 [54:54<2:03:22, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.688, train/grad_norm=7.95, train/loss=2.55, train/lr=5e-5, train/mae=0.0681, train/predicted_value_mean=-0.21, train/predicted_value_std=0.206, train/target_value_mean=-0.214, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5861/8000 [54:58<2:03:11, 3.46s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.49, train/loss=3.63, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.347, train/predicted_value_std=0.161, train/target_value_mean=-0.32, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5862/8000 [55:01<2:03:01, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.81, train/loss=2.79, train/lr=5e-5, train/mae=0.0297, train/predicted_value_mean=-0.252, train/predicted_value_std=0.112, train/target_value_mean=-0.212, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5863/8000 [55:05<2:02:49, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=12.1, train/loss=3.55, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.289, train/predicted_value_std=0.137, train/target_value_mean=-0.234, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5864/8000 [55:08<2:02:09, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.28, train/loss=3.89, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.362, train/predicted_value_std=0.209, train/target_value_mean=-0.329, train/target_value_std=0.31, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5865/8000 [55:12<2:01:26, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.99, train/loss=3.76, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.373, train/predicted_value_std=0.165, train/target_value_mean=-0.353, train/target_value_std=0.287, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5866/8000 [55:15<2:01:07, 3.41s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=8.74, train/loss=2.98, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.268, train/predicted_value_std=0.154, train/target_value_mean=-0.268, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5867/8000 [55:18<2:00:57, 3.40s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.61, train/loss=3.93, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.305, train/predicted_value_std=0.119, train/target_value_mean=-0.237, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5868/8000 [55:22<2:00:59, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=6.39, train/loss=3.2, train/lr=5e-5, train/mae=0.0969, train/predicted_value_mean=-0.228, train/predicted_value_std=0.193, train/target_value_mean=-0.219, train/target_value_std=0.22, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5869/8000 [55:25<2:01:08, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.72, train/loss=3.86, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.328, train/predicted_value_std=0.115, train/target_value_mean=-0.337, train/target_value_std=0.181, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5870/8000 [55:29<2:01:03, 3.41s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=6.99, train/loss=3.1, train/lr=5e-5, train/mae=0.0822, train/predicted_value_mean=-0.229, train/predicted_value_std=0.142, train/target_value_mean=-0.206, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5871/8000 [55:32<2:04:25, 3.51s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0, train/cat_acc_neighbor=0.312, train/grad_norm=7.84, train/loss=3.68, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.29, train/predicted_value_std=0.0787, train/target_value_mean=-0.291, train/target_value_std=0.0991, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5872/8000 [55:36<2:03:30, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.48, train/loss=3.48, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.275, train/predicted_value_std=0.135, train/target_value_mean=-0.239, train/target_value_std=0.172, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5873/8000 [55:39<2:03:28, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.09, train/loss=3.24, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.315, train/predicted_value_std=0.203, train/target_value_mean=-0.314, train/target_value_std=0.273, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5874/8000 [55:43<2:02:21, 3.45s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.66, train/loss=3, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.197, train/predicted_value_std=0.132, train/target_value_mean=-0.193, train/target_value_std=0.167, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5875/8000 [55:46<2:01:27, 3.43s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.06, train/loss=3.45, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.344, train/predicted_value_std=0.119, train/target_value_mean=-0.334, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5876/8000 [55:49<2:01:16, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.11, train/loss=3.72, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.272, train/predicted_value_std=0.106, train/target_value_mean=-0.298, train/target_value_std=0.211, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5877/8000 [55:53<2:01:07, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.92, train/loss=3.85, train/lr=5e-5, train/mae=0.0559, train/predicted_value_mean=-0.338, train/predicted_value_std=0.148, train/target_value_mean=-0.295, train/target_value_std=0.166, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5878/8000 [55:56<2:00:49, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=5.76, train/loss=3.33, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.266, train/predicted_value_std=0.177, train/target_value_mean=-0.214, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 73%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5879/8000 [56:00<2:00:16, 3.40s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.8, train/loss=4.35, train/lr=5e-5, train/mae=0.204, train/predicted_value_mean=-0.332, train/predicted_value_std=0.0998, train/target_value_mean=-0.345, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5880/8000 [56:03<1:59:45, 3.39s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.11, train/loss=3.72, train/lr=5e-5, train/mae=0.0822, train/predicted_value_mean=-0.308, train/predicted_value_std=0.0924, train/target_value_mean=-0.26, train/target_value_std=0.0945, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5881/8000 [56:06<1:59:33, 3.39s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.83, train/loss=3.52, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.306, train/predicted_value_std=0.132, train/target_value_mean=-0.319, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5882/8000 [56:10<2:02:28, 3.47s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.27, train/loss=3.22, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.254, train/predicted_value_std=0.147, train/target_value_mean=-0.204, train/target_value_std=0.158, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5883/8000 [56:13<2:02:17, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.55, train/loss=4.08, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.32, train/predicted_value_std=0.125, train/target_value_mean=-0.273, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5884/8000 [56:17<2:01:09, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.67, train/loss=3.23, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.26, train/predicted_value_std=0.143, train/target_value_mean=-0.247, train/target_value_std=0.148, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5885/8000 [56:20<2:00:32, 3.42s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.61, train/loss=3.09, train/lr=5e-5, train/mae=0.0837, train/predicted_value_mean=-0.245, train/predicted_value_std=0.135, train/target_value_mean=-0.212, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5886/8000 [56:24<2:00:10, 3.41s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.91, train/loss=4.19, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.328, train/predicted_value_std=0.157, train/target_value_mean=-0.322, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5887/8000 [56:27<2:00:14, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=11.3, train/loss=3.5, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.288, train/predicted_value_std=0.209, train/target_value_mean=-0.222, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5888/8000 [56:30<2:00:14, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=5.84, train/loss=4.1, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.327, train/predicted_value_std=0.111, train/target_value_mean=-0.319, train/target_value_std=0.135, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5889/8000 [56:34<2:00:48, 3.43s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.73, train/loss=3.85, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.246, train/predicted_value_std=0.0911, train/target_value_mean=-0.219, train/target_value_std=0.171, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5890/8000 [56:37<2:00:58, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.79, train/loss=3.22, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.232, train/predicted_value_std=0.159, train/target_value_mean=-0.279, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5891/8000 [56:41<2:01:00, 3.44s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.76, train/loss=3.51, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.359, train/predicted_value_std=0.174, train/target_value_mean=-0.376, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5892/8000 [56:44<2:01:08, 3.45s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.85, train/loss=3.25, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.297, train/predicted_value_std=0.18, train/target_value_mean=-0.3, train/target_value_std=0.233, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5893/8000 [56:48<2:01:01, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.53, train/loss=3.74, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.278, train/predicted_value_std=0.11, train/target_value_mean=-0.241, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5894/8000 [56:51<2:03:46, 3.53s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.28, train/loss=3.43, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.327, train/predicted_value_std=0.124, train/target_value_mean=-0.33, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5895/8000 [56:55<2:02:46, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.14, train/loss=3.26, train/lr=5e-5, train/mae=0.0822, train/predicted_value_mean=-0.248, train/predicted_value_std=0.15, train/target_value_mean=-0.229, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5896/8000 [56:58<2:02:13, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.94, train/loss=3.8, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.327, train/predicted_value_std=0.117, train/target_value_mean=-0.333, train/target_value_std=0.195, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5897/8000 [57:02<2:01:51, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.84, train/loss=3.51, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.298, train/predicted_value_std=0.116, train/target_value_mean=-0.299, train/target_value_std=0.14, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5898/8000 [57:05<2:01:35, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=12.2, train/loss=3.77, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.26, train/predicted_value_std=0.146, train/target_value_mean=-0.227, train/target_value_std=0.219, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5899/8000 [57:09<2:01:23, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.21, train/loss=3.19, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.294, train/predicted_value_std=0.215, train/target_value_mean=-0.306, train/target_value_std=0.313, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5900/8000 [57:12<2:00:15, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.59, train/loss=3.64, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.341, train/predicted_value_std=0.113, train/target_value_mean=-0.368, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5901/8000 [57:15<2:00:14, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=12.6, train/loss=3.94, train/lr=5e-5, train/mae=0.178, train/predicted_value_mean=-0.337, train/predicted_value_std=0.152, train/target_value_mean=-0.39, train/target_value_std=0.273, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5902/8000 [57:19<2:01:24, 3.47s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.23, train/loss=4.37, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.307, train/predicted_value_std=0.158, train/target_value_mean=-0.302, train/target_value_std=0.192, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5903/8000 [57:22<2:01:06, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=18.8, train/loss=3.53, train/lr=5e-5, train/mae=0.0712, train/predicted_value_mean=-0.241, train/predicted_value_std=0.148, train/target_value_mean=-0.234, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5904/8000 [57:26<2:00:41, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.09, train/loss=3.69, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.284, train/predicted_value_std=0.161, train/target_value_mean=-0.254, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5905/8000 [57:30<2:03:25, 3.53s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.09, train/loss=4.09, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.349, train/predicted_value_std=0.103, train/target_value_mean=-0.383, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5906/8000 [57:33<2:02:15, 3.50s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.92, train/loss=3.8, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.328, train/predicted_value_std=0.121, train/target_value_mean=-0.321, train/target_value_std=0.227, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5907/8000 [57:36<2:01:10, 3.47s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.4, train/loss=3.43, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.241, train/predicted_value_std=0.131, train/target_value_mean=-0.263, train/target_value_std=0.182, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5908/8000 [57:40<2:00:39, 3.46s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.46, train/loss=3.57, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.375, train/predicted_value_std=0.138, train/target_value_mean=-0.37, train/target_value_std=0.144, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5909/8000 [57:43<2:00:15, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.12, train/loss=3.91, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.296, train/predicted_value_std=0.118, train/target_value_mean=-0.291, train/target_value_std=0.259, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5910/8000 [57:47<1:59:54, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.4, train/loss=3.83, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.346, train/predicted_value_std=0.137, train/target_value_mean=-0.365, train/target_value_std=0.13, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5911/8000 [57:50<1:59:59, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.96, train/loss=3.67, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.223, train/predicted_value_std=0.111, train/target_value_mean=-0.121, train/target_value_std=0.0729, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5912/8000 [57:54<1:59:58, 3.45s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10, train/loss=3.65, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.262, train/predicted_value_std=0.0918, train/target_value_mean=-0.264, train/target_value_std=0.135, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5913/8000 [57:57<1:59:07, 3.42s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.17, train/loss=3.43, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.265, train/predicted_value_std=0.0895, train/target_value_mean=-0.275, train/target_value_std=0.136, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5914/8000 [58:00<1:58:53, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.79, train/loss=3.57, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.235, train/predicted_value_std=0.09, train/target_value_mean=-0.256, train/target_value_std=0.17, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5915/8000 [58:04<1:58:22, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.54, train/loss=3.6, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.255, train/predicted_value_std=0.121, train/target_value_mean=-0.242, train/target_value_std=0.118, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5916/8000 [58:07<1:58:06, 3.40s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.26, train/loss=4.19, train/lr=5e-5, train/mae=0.23, train/predicted_value_mean=-0.373, train/predicted_value_std=0.111, train/target_value_mean=-0.401, train/target_value_std=0.256, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5917/8000 [58:11<2:01:02, 3.49s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.59, train/loss=3.35, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.277, train/predicted_value_std=0.133, train/target_value_mean=-0.296, train/target_value_std=0.181, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5918/8000 [58:14<1:59:31, 3.44s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=12.9, train/loss=2.89, train/lr=5e-5, train/mae=0.0234, train/predicted_value_mean=-0.268, train/predicted_value_std=0.111, train/target_value_mean=-0.256, train/target_value_std=0.152, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5919/8000 [58:18<1:58:51, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.18, train/loss=4.31, train/lr=5e-5, train/mae=0.208, train/predicted_value_mean=-0.381, train/predicted_value_std=0.0614, train/target_value_mean=-0.42, train/target_value_std=0.109, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5920/8000 [58:21<1:58:08, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.28, train/loss=3.96, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.356, train/predicted_value_std=0.14, train/target_value_mean=-0.292, train/target_value_std=0.145, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5921/8000 [58:24<1:58:33, 3.42s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.52, train/loss=3.83, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.264, train/predicted_value_std=0.111, train/target_value_mean=-0.263, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5922/8000 [58:28<1:59:55, 3.46s/it, time/step=3.56, time/training=3.55, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.02, train/loss=3.65, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.325, train/predicted_value_std=0.107, train/target_value_mean=-0.339, train/target_value_std=0.11, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5923/8000 [58:31<2:00:09, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.16, train/loss=3.47, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.331, train/predicted_value_std=0.169, train/target_value_mean=-0.297, train/target_value_std=0.279, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5924/8000 [58:35<1:59:57, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.94, train/loss=3.42, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.333, train/predicted_value_std=0.206, train/target_value_mean=-0.317, train/target_value_std=0.32, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5925/8000 [58:38<1:59:38, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.34, train/loss=3.15, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.237, train/predicted_value_std=0.142, train/target_value_mean=-0.214, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5926/8000 [58:42<1:59:34, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=11.7, train/loss=3.67, train/lr=5e-5, train/mae=0.0759, train/predicted_value_mean=-0.265, train/predicted_value_std=0.144, train/target_value_mean=-0.212, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5927/8000 [58:45<1:59:16, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.29, train/loss=3.45, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.323, train/predicted_value_std=0.164, train/target_value_mean=-0.271, train/target_value_std=0.173, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5928/8000 [58:49<2:01:52, 3.53s/it, time/step=3.71, time/training=3.7, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.95, train/loss=3.76, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.289, train/predicted_value_std=0.144, train/target_value_mean=-0.228, train/target_value_std=0.0917, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5929/8000 [58:52<2:00:32, 3.49s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.41, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.358, train/predicted_value_std=0.168, train/target_value_mean=-0.418, train/target_value_std=0.248, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5930/8000 [58:56<1:59:14, 3.46s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=6.79, train/loss=4.24, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.374, train/predicted_value_std=0.209, train/target_value_mean=-0.348, train/target_value_std=0.307, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5931/8000 [58:59<1:58:42, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.94, train/loss=3.83, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.301, train/predicted_value_std=0.122, train/target_value_mean=-0.274, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5932/8000 [59:03<1:58:10, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.87, train/loss=3.5, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.298, train/predicted_value_std=0.11, train/target_value_mean=-0.293, train/target_value_std=0.18, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5933/8000 [59:06<1:57:44, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.81, train/loss=3.13, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.277, train/predicted_value_std=0.219, train/target_value_mean=-0.271, train/target_value_std=0.233, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5934/8000 [59:09<1:57:34, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.46, train/loss=3.73, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.295, train/predicted_value_std=0.118, train/target_value_mean=-0.275, train/target_value_std=0.156, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5935/8000 [59:13<1:57:59, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.06, train/loss=3.41, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.283, train/predicted_value_std=0.16, train/target_value_mean=-0.267, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5936/8000 [59:16<1:58:06, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.61, train/loss=3.98, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.339, train/predicted_value_std=0.134, train/target_value_mean=-0.335, train/target_value_std=0.243, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5937/8000 [59:20<1:57:29, 3.42s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.66, train/loss=3.94, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.292, train/predicted_value_std=0.145, train/target_value_mean=-0.323, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5938/8000 [59:23<1:57:34, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.75, train/loss=3.12, train/lr=5e-5, train/mae=0.0506, train/predicted_value_mean=-0.311, train/predicted_value_std=0.14, train/target_value_mean=-0.319, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5939/8000 [59:27<1:57:51, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.62, train/loss=3.8, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.347, train/predicted_value_std=0.137, train/target_value_mean=-0.283, train/target_value_std=0.215, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5940/8000 [59:30<2:00:55, 3.52s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=13.2, train/loss=3.55, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.254, train/predicted_value_std=0.152, train/target_value_mean=-0.255, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5941/8000 [59:34<1:59:49, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.66, train/loss=3.6, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.292, train/predicted_value_std=0.174, train/target_value_mean=-0.247, train/target_value_std=0.133, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5942/8000 [59:37<1:58:35, 3.46s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.06, train/loss=3.4, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.338, train/predicted_value_std=0.208, train/target_value_mean=-0.361, train/target_value_std=0.276, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5943/8000 [59:40<1:57:59, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.7, train/loss=3.25, train/lr=5e-5, train/mae=0.0716, train/predicted_value_mean=-0.214, train/predicted_value_std=0.0884, train/target_value_mean=-0.2, train/target_value_std=0.127, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5944/8000 [59:44<1:57:56, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.53, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.339, train/predicted_value_std=0.195, train/target_value_mean=-0.328, train/target_value_std=0.246, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5945/8000 [59:47<1:57:51, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.91, train/loss=2.92, train/lr=5e-5, train/mae=0.0372, train/predicted_value_mean=-0.315, train/predicted_value_std=0.147, train/target_value_mean=-0.29, train/target_value_std=0.147, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5946/8000 [59:51<1:58:05, 3.45s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.69, train/loss=3.59, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.334, train/predicted_value_std=0.201, train/target_value_mean=-0.316, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5947/8000 [59:54<1:58:01, 3.45s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.18, train/loss=3.61, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.323, train/predicted_value_std=0.133, train/target_value_mean=-0.305, train/target_value_std=0.22, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5948/8000 [59:58<1:58:06, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.92, train/loss=4.07, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.361, train/predicted_value_std=0.148, train/target_value_mean=-0.395, train/target_value_std=0.283, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5949/8000 [1:00:01<1:57:54, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.14, train/loss=3.42, train/lr=5e-5, train/mae=0.0575, train/predicted_value_mean=-0.299, train/predicted_value_std=0.12, train/target_value_mean=-0.265, train/target_value_std=0.207, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5950/8000 [1:00:05<1:57:57, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.02, train/loss=3.41, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.292, train/predicted_value_std=0.224, train/target_value_mean=-0.194, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5951/8000 [1:00:08<2:00:21, 3.52s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.55, train/loss=3.61, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.302, train/predicted_value_std=0.144, train/target_value_mean=-0.271, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5952/8000 [1:00:12<1:59:13, 3.49s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=7.89, train/loss=3.37, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.299, train/predicted_value_std=0.145, train/target_value_mean=-0.315, train/target_value_std=0.236, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5953/8000 [1:00:15<1:58:45, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.58, train/loss=3.14, train/lr=5e-5, train/mae=0.0459, train/predicted_value_mean=-0.271, train/predicted_value_std=0.189, train/target_value_mean=-0.248, train/target_value_std=0.224, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5954/8000 [1:00:19<1:58:13, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.74, train/loss=3.17, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.23, train/predicted_value_std=0.189, train/target_value_mean=-0.223, train/target_value_std=0.225, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5955/8000 [1:00:22<1:57:45, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=7.86, train/loss=2.36, train/lr=5e-5, train/mae=0.0125, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0927, train/target_value_mean=-0.194, train/target_value_std=0.127, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5956/8000 [1:00:26<1:57:53, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.79, train/loss=3.26, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.262, train/predicted_value_std=0.17, train/target_value_mean=-0.227, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5957/8000 [1:00:29<1:57:33, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.6, train/loss=3.88, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.301, train/predicted_value_std=0.188, train/target_value_mean=-0.273, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5958/8000 [1:00:32<1:57:20, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.96, train/loss=3.55, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.222, train/predicted_value_std=0.103, train/target_value_mean=-0.218, train/target_value_std=0.136, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5959/8000 [1:00:36<1:57:01, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.77, train/loss=3.52, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0764, train/target_value_mean=-0.29, train/target_value_std=0.161, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 74%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5960/8000 [1:00:39<1:57:10, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.82, train/loss=3.19, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.253, train/predicted_value_std=0.0862, train/target_value_mean=-0.233, train/target_value_std=0.125, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5961/8000 [1:00:43<1:56:55, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.43, train/loss=3.32, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.234, train/predicted_value_std=0.187, train/target_value_mean=-0.269, train/target_value_std=0.277, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5962/8000 [1:00:46<1:56:50, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.4, train/loss=3.35, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.281, train/predicted_value_std=0.188, train/target_value_mean=-0.275, train/target_value_std=0.218, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5963/8000 [1:00:50<1:59:45, 3.53s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.34, train/loss=3.93, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.316, train/predicted_value_std=0.108, train/target_value_mean=-0.309, train/target_value_std=0.188, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5964/8000 [1:00:53<1:58:49, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=9.87, train/loss=4.13, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.297, train/predicted_value_std=0.175, train/target_value_mean=-0.316, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5965/8000 [1:00:57<1:58:23, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.17, train/loss=3.95, train/lr=5e-5, train/mae=0.0656, train/predicted_value_mean=-0.327, train/predicted_value_std=0.17, train/target_value_mean=-0.344, train/target_value_std=0.254, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5966/8000 [1:01:00<1:57:36, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.09, train/loss=3.73, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.296, train/predicted_value_std=0.109, train/target_value_mean=-0.332, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5967/8000 [1:01:04<1:56:52, 3.45s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.69, train/loss=3.29, train/lr=5e-5, train/mae=0.0628, train/predicted_value_mean=-0.269, train/predicted_value_std=0.122, train/target_value_mean=-0.24, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5968/8000 [1:01:07<1:57:02, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.26, train/loss=3.55, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.387, train/predicted_value_std=0.189, train/target_value_mean=-0.392, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5969/8000 [1:01:11<1:57:08, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.67, train/loss=4.29, train/lr=5e-5, train/mae=0.198, train/predicted_value_mean=-0.36, train/predicted_value_std=0.0968, train/target_value_mean=-0.344, train/target_value_std=0.241, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5970/8000 [1:01:14<1:57:22, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.95, train/loss=3.8, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.379, train/predicted_value_std=0.143, train/target_value_mean=-0.359, train/target_value_std=0.109, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5971/8000 [1:01:17<1:57:21, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.06, train/loss=3.2, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.339, train/predicted_value_std=0.177, train/target_value_mean=-0.333, train/target_value_std=0.213, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5972/8000 [1:01:21<1:57:25, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.53, train/loss=3.86, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.299, train/predicted_value_std=0.126, train/target_value_mean=-0.317, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5973/8000 [1:01:25<1:57:53, 3.49s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.43, train/loss=3.19, train/lr=5e-5, train/mae=0.0312, train/predicted_value_mean=-0.328, train/predicted_value_std=0.172, train/target_value_mean=-0.341, train/target_value_std=0.239, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5974/8000 [1:01:28<2:00:42, 3.57s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.86, train/loss=3.2, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.272, train/predicted_value_std=0.104, train/target_value_mean=-0.295, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5975/8000 [1:01:32<1:59:42, 3.55s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.9, train/loss=3.56, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.335, train/predicted_value_std=0.119, train/target_value_mean=-0.264, train/target_value_std=0.149, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5976/8000 [1:01:35<1:58:33, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.89, train/loss=3.86, train/lr=5e-5, train/mae=0.0872, train/predicted_value_mean=-0.288, train/predicted_value_std=0.0907, train/target_value_mean=-0.241, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5977/8000 [1:01:39<1:57:30, 3.49s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.81, train/loss=3.79, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.35, train/predicted_value_std=0.142, train/target_value_mean=-0.356, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5978/8000 [1:01:42<1:57:02, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.62, train/loss=3.82, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.257, train/predicted_value_std=0.126, train/target_value_mean=-0.281, train/target_value_std=0.203, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5979/8000 [1:01:46<1:56:41, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.22, train/loss=3.99, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.408, train/predicted_value_std=0.157, train/target_value_mean=-0.381, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5980/8000 [1:01:49<1:56:15, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.29, train/loss=3.9, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.307, train/predicted_value_std=0.168, train/target_value_mean=-0.294, train/target_value_std=0.224, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5981/8000 [1:01:52<1:56:26, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.66, train/loss=3.22, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.267, train/predicted_value_std=0.227, train/target_value_mean=-0.24, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5982/8000 [1:01:56<1:56:05, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.33, train/loss=3.49, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.262, train/predicted_value_std=0.0985, train/target_value_mean=-0.31, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5983/8000 [1:01:59<1:55:38, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.22, train/loss=4.13, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.303, train/predicted_value_std=0.0974, train/target_value_mean=-0.269, train/target_value_std=0.145, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5984/8000 [1:02:03<1:55:28, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.44, train/loss=4.11, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.361, train/predicted_value_std=0.117, train/target_value_mean=-0.337, train/target_value_std=0.128, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5985/8000 [1:02:06<1:55:28, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.46, train/loss=3.23, train/lr=5e-5, train/mae=0.0978, train/predicted_value_mean=-0.279, train/predicted_value_std=0.161, train/target_value_mean=-0.283, train/target_value_std=0.244, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5986/8000 [1:02:10<1:58:10, 3.52s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.5, train/cat_acc_neighbor=0.5, train/grad_norm=7.99, train/loss=2.83, train/lr=5e-5, train/mae=0.0825, train/predicted_value_mean=-0.255, train/predicted_value_std=0.129, train/target_value_mean=-0.251, train/target_value_std=0.194, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5987/8000 [1:02:13<1:57:08, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=14.5, train/loss=3.07, train/lr=5e-5, train/mae=0.0837, train/predicted_value_mean=-0.266, train/predicted_value_std=0.136, train/target_value_mean=-0.219, train/target_value_std=0.122, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5988/8000 [1:02:17<1:56:21, 3.47s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.83, train/loss=2.95, train/lr=5e-5, train/mae=0.0459, train/predicted_value_mean=-0.33, train/predicted_value_std=0.123, train/target_value_mean=-0.326, train/target_value_std=0.167, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 5989/8000 [1:02:20<1:55:37, 3.45s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.29, train/loss=3.62, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.313, train/predicted_value_std=0.111, train/target_value_mean=-0.24, train/target_value_std=0.167, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5990/8000 [1:02:24<1:55:18, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.13, train/loss=3.57, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.303, train/predicted_value_std=0.135, train/target_value_mean=-0.247, train/target_value_std=0.199, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 5991/8000 [1:02:27<1:55:06, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.67, train/loss=4, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.382, train/predicted_value_std=0.118, train/target_value_mean=-0.389, train/target_value_std=0.178, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 5992/8000 [1:02:30<1:54:58, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.58, train/loss=3.65, train/lr=5e-5, train/mae=0.0688, train/predicted_value_mean=-0.277, train/predicted_value_std=0.102, train/target_value_mean=-0.255, train/target_value_std=0.168, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5993/8000 [1:02:34<1:55:13, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=11.6, train/loss=3.26, train/lr=5e-5, train/mae=0.0709, train/predicted_value_mean=-0.315, train/predicted_value_std=0.145, train/target_value_mean=-0.295, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 5994/8000 [1:02:37<1:55:15, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.84, train/loss=3.15, train/lr=5e-5, train/mae=0.0569, train/predicted_value_mean=-0.27, train/predicted_value_std=0.228, train/target_value_mean=-0.283, train/target_value_std=0.309, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5995/8000 [1:02:41<1:55:22, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8, train/loss=3.68, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.303, train/predicted_value_std=0.138, train/target_value_mean=-0.344, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 5996/8000 [1:02:44<1:55:40, 3.46s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.87, train/loss=3.77, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.313, train/predicted_value_std=0.121, train/target_value_mean=-0.295, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 5997/8000 [1:02:48<1:58:24, 3.55s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=8.36, train/loss=4.12, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.396, train/predicted_value_std=0.143, train/target_value_mean=-0.36, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 5998/8000 [1:02:51<1:57:14, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.17, train/loss=3.67, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.36, train/predicted_value_std=0.184, train/target_value_mean=-0.301, train/target_value_std=0.207, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 5999/8000 [1:02:55<1:56:06, 3.48s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.4, train/loss=3.21, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.225, train/predicted_value_std=0.126, train/target_value_mean=-0.139, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:859: UserWarning: `_get_pg_default_device` will be deprecated, it only stays for backward-compatiblity reason. If you need to find a device for object collectives, please use `_get_object_coll_device`. If you need to query the device types supported by group, please use `_device_capability(group)`. +(ActorGroup(rank=0) pid=3732960) warnings.warn( +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:4631: UserWarning: No device id is provided via `init_process_group` or `barrier `. Using the current device set by the user. +(ActorGroup(rank=0) pid=3732960) warnings.warn( # warn only once +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:4631: UserWarning: No device id is provided via `init_process_group` or `barrier `. Using the current device set by the user. +(ActorGroup(rank=0) pid=3732960) warnings.warn( # warn only once +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #1] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 75%|▊| 6000/8000 [1:08:53<61:03:34, 109.91s/it, time/step=358, time/training=3.41, time/evaluate=317, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.89, train/loss=3.15, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.27, train/predicted_value_std=0.0912, train/target_value_mean=-0.269, train/target_value_std=0.0845, train/value_spearman=0.5, eval/cat_acc_best=0.266, eval/cat_acc_neighbor=0.429, eval/loss=2.3, eval/mae=0.0167, eval/predicted_value_mean=-0.107, eval/predicted_value_std=0.00133, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.266, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.429, eval/stack_bowls_recap_rollout_rc/loss=2.3, eval/stack_bowls_recap_rollout_rc/mae=0.0167, eval/stack_bowls_recap_rollout_rc/predicted_(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6001/8000 [1:08:57<43:17:41, 77.97s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.02, train/loss=3.32, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.289, train/predicted_value_std=0.118, train/target_value_mean=-0.24, train/target_value_std=0.108, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6002/8000 [1:09:00<30:51:17, 55.59s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.45, train/loss=4.17, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.339, train/predicted_value_std=0.175, train/target_value_mean=-0.311, train/target_value_std=0.23, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6003/8000 [1:09:03<22:09:45, 39.95s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.65, train/loss=3.86, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.356, train/predicted_value_std=0.164, train/target_value_mean=-0.364, train/target_value_std=0.269, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6004/8000 [1:09:07<16:04:40, 29.00s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.11, train/loss=3.71, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.266, train/predicted_value_std=0.113, train/target_value_mean=-0.275, train/target_value_std=0.134, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6005/8000 [1:09:10<11:49:28, 21.34s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.29, train/loss=3.4, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.297, train/predicted_value_std=0.13, train/target_value_mean=-0.283, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6006/8000 [1:09:14<8:51:07, 15.98s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.64, train/loss=3.75, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.261, train/predicted_value_std=0.148, train/target_value_mean=-0.269, train/target_value_std=0.222, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6007/8000 [1:09:17<6:46:08, 12.23s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.97, train/loss=3.46, train/lr=5e-5, train/mae=0.0903, train/predicted_value_mean=-0.288, train/predicted_value_std=0.12, train/target_value_mean=-0.201, train/target_value_std=0.183, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6008/8000 [1:09:21<5:18:56, 9.61s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.49, train/loss=3.43, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.324, train/predicted_value_std=0.106, train/target_value_mean=-0.275, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6009/8000 [1:09:24<4:18:22, 7.79s/it, time/step=3.54, time/training=3.53, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.25, train/loss=3.55, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.313, train/predicted_value_std=0.155, train/target_value_mean=-0.285, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6010/8000 [1:09:28<3:35:40, 6.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.85, train/loss=3.93, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.279, train/predicted_value_std=0.181, train/target_value_mean=-0.248, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6011/8000 [1:09:31<3:05:44, 5.60s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.68, train/loss=3.37, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.283, train/predicted_value_std=0.127, train/target_value_mean=-0.264, train/target_value_std=0.216, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6012/8000 [1:09:35<2:44:49, 4.97s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.96, train/loss=3.12, train/lr=5e-5, train/mae=0.0678, train/predicted_value_mean=-0.211, train/predicted_value_std=0.145, train/target_value_mean=-0.169, train/target_value_std=0.114, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6013/8000 [1:09:38<2:30:08, 4.53s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.48, train/loss=3.73, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.308, train/predicted_value_std=0.141, train/target_value_mean=-0.346, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6014/8000 [1:09:42<2:19:40, 4.22s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.32, train/loss=3.31, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0891, train/target_value_mean=-0.231, train/target_value_std=0.117, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6015/8000 [1:09:45<2:14:18, 4.06s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=13.1, train/loss=2.93, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.31, train/predicted_value_std=0.215, train/target_value_mean=-0.314, train/target_value_std=0.23, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6016/8000 [1:09:49<2:07:56, 3.87s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.41, train/loss=3.44, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.251, train/predicted_value_std=0.102, train/target_value_mean=-0.245, train/target_value_std=0.111, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6017/8000 [1:09:52<2:04:08, 3.76s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.35, train/loss=3.41, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.246, train/predicted_value_std=0.139, train/target_value_mean=-0.259, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6018/8000 [1:09:56<2:01:40, 3.68s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.71, train/loss=3.88, train/lr=5e-5, train/mae=0.204, train/predicted_value_mean=-0.267, train/predicted_value_std=0.081, train/target_value_mean=-0.253, train/target_value_std=0.155, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6019/8000 [1:09:59<1:59:56, 3.63s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.94, train/loss=3.11, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.313, train/predicted_value_std=0.189, train/target_value_mean=-0.284, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6020/8000 [1:10:03<1:58:41, 3.60s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.53, train/loss=3.44, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.276, train/predicted_value_std=0.143, train/target_value_mean=-0.198, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6021/8000 [1:10:06<1:57:48, 3.57s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.01, train/loss=3.55, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.342, train/predicted_value_std=0.149, train/target_value_mean=-0.314, train/target_value_std=0.236, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6022/8000 [1:10:10<1:57:04, 3.55s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.16, train/loss=4.09, train/lr=5e-5, train/mae=0.23, train/predicted_value_mean=-0.322, train/predicted_value_std=0.157, train/target_value_mean=-0.404, train/target_value_std=0.27, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6023/8000 [1:10:13<1:56:34, 3.54s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=6.47, train/loss=4.29, train/lr=5e-5, train/mae=0.243, train/predicted_value_mean=-0.3, train/predicted_value_std=0.187, train/target_value_mean=-0.295, train/target_value_std=0.257, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6024/8000 [1:10:17<1:55:37, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.57, train/loss=3.39, train/lr=5e-5, train/mae=0.0816, train/predicted_value_mean=-0.328, train/predicted_value_std=0.117, train/target_value_mean=-0.293, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6025/8000 [1:10:20<1:54:39, 3.48s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.27, train/loss=3.48, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0752, train/target_value_mean=-0.224, train/target_value_std=0.109, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6026/8000 [1:10:24<1:54:03, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.62, train/loss=3.98, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.281, train/predicted_value_std=0.122, train/target_value_mean=-0.258, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6027/8000 [1:10:27<1:53:52, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.52, train/loss=3.14, train/lr=5e-5, train/mae=0.0716, train/predicted_value_mean=-0.295, train/predicted_value_std=0.151, train/target_value_mean=-0.292, train/target_value_std=0.173, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6028/8000 [1:10:31<1:53:26, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.53, train/loss=3.32, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.253, train/predicted_value_std=0.123, train/target_value_mean=-0.284, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6029/8000 [1:10:34<1:53:22, 3.45s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.65, train/loss=4.02, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.33, train/predicted_value_std=0.0951, train/target_value_mean=-0.302, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6030/8000 [1:10:38<1:56:55, 3.56s/it, time/step=3.82, time/training=3.81, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.56, train/loss=3.05, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.285, train/predicted_value_std=0.147, train/target_value_mean=-0.28, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6031/8000 [1:10:41<1:56:10, 3.54s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.69, train/loss=3.41, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.272, train/predicted_value_std=0.158, train/target_value_mean=-0.289, train/target_value_std=0.155, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6032/8000 [1:10:45<1:56:13, 3.54s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.17, train/loss=3.71, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.317, train/predicted_value_std=0.17, train/target_value_mean=-0.34, train/target_value_std=0.218, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6033/8000 [1:10:48<1:55:28, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.44, train/loss=4.13, train/lr=5e-5, train/mae=0.218, train/predicted_value_mean=-0.423, train/predicted_value_std=0.16, train/target_value_mean=-0.326, train/target_value_std=0.209, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6034/8000 [1:10:52<1:54:25, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.09, train/loss=3.29, train/lr=5e-5, train/mae=0.0728, train/predicted_value_mean=-0.261, train/predicted_value_std=0.13, train/target_value_mean=-0.224, train/target_value_std=0.134, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6035/8000 [1:10:55<1:53:43, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.93, train/loss=3.68, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.373, train/predicted_value_std=0.214, train/target_value_mean=-0.438, train/target_value_std=0.33, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6036/8000 [1:10:59<1:53:48, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.75, train/loss=3.31, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.341, train/predicted_value_std=0.14, train/target_value_mean=-0.331, train/target_value_std=0.233, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6037/8000 [1:11:02<1:53:34, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.06, train/loss=3.43, train/lr=5e-5, train/mae=0.0575, train/predicted_value_mean=-0.261, train/predicted_value_std=0.0928, train/target_value_mean=-0.23, train/target_value_std=0.114, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6038/8000 [1:11:06<1:54:10, 3.49s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.85, train/loss=3.36, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.254, train/predicted_value_std=0.138, train/target_value_mean=-0.267, train/target_value_std=0.218, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 75%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6039/8000 [1:11:09<1:55:28, 3.53s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8.08, train/loss=4.03, train/lr=5e-5, train/mae=0.204, train/predicted_value_mean=-0.322, train/predicted_value_std=0.103, train/target_value_mean=-0.311, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6040/8000 [1:11:13<1:55:44, 3.54s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.65, train/loss=3.28, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.291, train/predicted_value_std=0.122, train/target_value_mean=-0.298, train/target_value_std=0.154, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6041/8000 [1:11:16<1:56:07, 3.56s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.19, train/loss=3.91, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.353, train/predicted_value_std=0.118, train/target_value_mean=-0.424, train/target_value_std=0.259, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6042/8000 [1:11:20<1:55:10, 3.53s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.85, train/loss=3.56, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.279, train/predicted_value_std=0.121, train/target_value_mean=-0.232, train/target_value_std=0.168, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6043/8000 [1:11:24<1:56:45, 3.58s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.88, train/loss=3.25, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.246, train/predicted_value_std=0.13, train/target_value_mean=-0.264, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6044/8000 [1:11:27<1:55:55, 3.56s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.32, train/loss=4.05, train/lr=5e-5, train/mae=0.242, train/predicted_value_mean=-0.34, train/predicted_value_std=0.176, train/target_value_mean=-0.417, train/target_value_std=0.301, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6045/8000 [1:11:31<1:55:04, 3.53s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.6, train/loss=3.31, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.276, train/predicted_value_std=0.126, train/target_value_mean=-0.3, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6046/8000 [1:11:34<1:53:47, 3.49s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=11.6, train/loss=3.32, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.246, train/predicted_value_std=0.129, train/target_value_mean=-0.247, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6047/8000 [1:11:37<1:52:44, 3.46s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10, train/loss=3.75, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.266, train/predicted_value_std=0.138, train/target_value_mean=-0.262, train/target_value_std=0.199, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6048/8000 [1:11:41<1:52:08, 3.45s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.34, train/loss=3.12, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.317, train/predicted_value_std=0.112, train/target_value_mean=-0.329, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6049/8000 [1:11:44<1:51:49, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.7, train/loss=3.84, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.249, train/predicted_value_std=0.0946, train/target_value_mean=-0.215, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6050/8000 [1:11:48<1:51:29, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.54, train/loss=3.23, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.291, train/predicted_value_std=0.146, train/target_value_mean=-0.268, train/target_value_std=0.119, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6051/8000 [1:11:51<1:51:21, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.74, train/loss=2.96, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.284, train/predicted_value_std=0.108, train/target_value_mean=-0.228, train/target_value_std=0.101, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6052/8000 [1:11:55<1:51:43, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.04, train/loss=4.27, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.437, train/predicted_value_std=0.15, train/target_value_mean=-0.428, train/target_value_std=0.215, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6053/8000 [1:11:58<1:51:56, 3.45s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.69, train/loss=4.13, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.361, train/predicted_value_std=0.141, train/target_value_mean=-0.357, train/target_value_std=0.135, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6054/8000 [1:12:02<1:52:10, 3.46s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=11.2, train/loss=4.12, train/lr=5e-5, train/mae=0.228, train/predicted_value_mean=-0.366, train/predicted_value_std=0.131, train/target_value_mean=-0.321, train/target_value_std=0.249, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6055/8000 [1:12:05<1:55:02, 3.55s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.33, train/loss=3.67, train/lr=5e-5, train/mae=0.0656, train/predicted_value_mean=-0.369, train/predicted_value_std=0.172, train/target_value_mean=-0.332, train/target_value_std=0.188, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6056/8000 [1:12:09<1:54:01, 3.52s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.74, train/loss=3.52, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.285, train/predicted_value_std=0.173, train/target_value_mean=-0.266, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6057/8000 [1:12:12<1:53:35, 3.51s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.43, train/loss=3.74, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.245, train/predicted_value_std=0.147, train/target_value_mean=-0.22, train/target_value_std=0.249, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6058/8000 [1:12:16<1:52:49, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.9, train/loss=3.22, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.268, train/predicted_value_std=0.125, train/target_value_mean=-0.255, train/target_value_std=0.116, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6059/8000 [1:12:19<1:52:02, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.74, train/loss=3.33, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.38, train/predicted_value_std=0.13, train/target_value_mean=-0.384, train/target_value_std=0.21, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6060/8000 [1:12:22<1:51:15, 3.44s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.24, train/loss=3.2, train/lr=5e-5, train/mae=0.0306, train/predicted_value_mean=-0.236, train/predicted_value_std=0.075, train/target_value_mean=-0.198, train/target_value_std=0.124, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6061/8000 [1:12:26<1:50:08, 3.41s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.31, train/loss=3.51, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.404, train/predicted_value_std=0.114, train/target_value_mean=-0.432, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6062/8000 [1:12:29<1:49:38, 3.39s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.75, train/loss=3.11, train/lr=5e-5, train/mae=0.0534, train/predicted_value_mean=-0.269, train/predicted_value_std=0.182, train/target_value_mean=-0.299, train/target_value_std=0.273, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6063/8000 [1:12:32<1:49:17, 3.39s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.38, train/loss=2.74, train/lr=5e-5, train/mae=0.0441, train/predicted_value_mean=-0.326, train/predicted_value_std=0.202, train/target_value_mean=-0.331, train/target_value_std=0.273, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6064/8000 [1:12:36<1:48:54, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.69, train/loss=3.37, train/lr=5e-5, train/mae=0.0378, train/predicted_value_mean=-0.307, train/predicted_value_std=0.224, train/target_value_mean=-0.306, train/target_value_std=0.28, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6065/8000 [1:12:39<1:49:25, 3.39s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.09, train/loss=3.2, train/lr=5e-5, train/mae=0.0634, train/predicted_value_mean=-0.315, train/predicted_value_std=0.215, train/target_value_mean=-0.343, train/target_value_std=0.273, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6066/8000 [1:12:43<1:49:48, 3.41s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.71, train/loss=3.68, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.332, train/predicted_value_std=0.173, train/target_value_mean=-0.349, train/target_value_std=0.237, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6067/8000 [1:12:46<1:52:36, 3.50s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.35, train/loss=3.77, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.384, train/predicted_value_std=0.317, train/target_value_mean=-0.332, train/target_value_std=0.328, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6068/8000 [1:12:50<1:51:07, 3.45s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.44, train/loss=3.67, train/lr=5e-5, train/mae=0.0969, train/predicted_value_mean=-0.304, train/predicted_value_std=0.15, train/target_value_mean=-0.255, train/target_value_std=0.179, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6069/8000 [1:12:53<1:50:15, 3.43s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.03, train/loss=3.55, train/lr=5e-5, train/mae=0.0756, train/predicted_value_mean=-0.326, train/predicted_value_std=0.166, train/target_value_mean=-0.244, train/target_value_std=0.096, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6070/8000 [1:12:56<1:49:34, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10, train/loss=4.1, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.346, train/predicted_value_std=0.219, train/target_value_mean=-0.295, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6071/8000 [1:13:00<1:49:13, 3.40s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.78, train/loss=3.75, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.288, train/predicted_value_std=0.158, train/target_value_mean=-0.279, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6072/8000 [1:13:03<1:48:57, 3.39s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.61, train/loss=4, train/lr=5e-5, train/mae=0.235, train/predicted_value_mean=-0.388, train/predicted_value_std=0.186, train/target_value_mean=-0.31, train/target_value_std=0.273, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6073/8000 [1:13:07<1:48:39, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.8, train/loss=3.79, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.38, train/predicted_value_std=0.162, train/target_value_mean=-0.34, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6074/8000 [1:13:10<1:48:04, 3.37s/it, time/step=3.33, time/training=3.32, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.78, train/loss=3.48, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.302, train/predicted_value_std=0.0949, train/target_value_mean=-0.27, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6075/8000 [1:13:13<1:47:52, 3.36s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8.87, train/loss=3.99, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.312, train/predicted_value_std=0.166, train/target_value_mean=-0.163, train/target_value_std=0.1, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6076/8000 [1:13:17<1:47:50, 3.36s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.29, train/loss=2.56, train/lr=5e-5, train/mae=0.0194, train/predicted_value_mean=-0.243, train/predicted_value_std=0.114, train/target_value_mean=-0.237, train/target_value_std=0.136, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6077/8000 [1:13:20<1:47:46, 3.36s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.09, train/loss=3.39, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.231, train/predicted_value_std=0.0727, train/target_value_mean=-0.271, train/target_value_std=0.106, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6078/8000 [1:13:23<1:47:27, 3.35s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.7, train/loss=3.83, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.339, train/predicted_value_std=0.138, train/target_value_mean=-0.318, train/target_value_std=0.194, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6079/8000 [1:13:27<1:49:43, 3.43s/it, time/step=3.59, time/training=3.59, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.47, train/loss=3.8, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.266, train/predicted_value_std=0.0887, train/target_value_mean=-0.307, train/target_value_std=0.13, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6080/8000 [1:13:30<1:49:03, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.51, train/loss=4.02, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.317, train/predicted_value_std=0.143, train/target_value_mean=-0.342, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6081/8000 [1:13:34<1:48:43, 3.40s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=6.86, train/loss=4.27, train/lr=5e-5, train/mae=0.198, train/predicted_value_mean=-0.358, train/predicted_value_std=0.132, train/target_value_mean=-0.287, train/target_value_std=0.199, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6082/8000 [1:13:37<1:48:11, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.89, train/loss=2.88, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.252, train/predicted_value_std=0.148, train/target_value_mean=-0.208, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6083/8000 [1:13:40<1:47:58, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.93, train/loss=3.94, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.307, train/predicted_value_std=0.0588, train/target_value_mean=-0.207, train/target_value_std=0.105, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6084/8000 [1:13:44<1:47:37, 3.37s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.19, train/loss=3.5, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.324, train/predicted_value_std=0.175, train/target_value_mean=-0.303, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6085/8000 [1:13:47<1:47:49, 3.38s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.48, train/loss=3.77, train/lr=5e-5, train/mae=0.221, train/predicted_value_mean=-0.316, train/predicted_value_std=0.146, train/target_value_mean=-0.342, train/target_value_std=0.253, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6086/8000 [1:13:51<1:48:18, 3.40s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=6.71, train/loss=3.5, train/lr=5e-5, train/mae=0.06, train/predicted_value_mean=-0.208, train/predicted_value_std=0.0999, train/target_value_mean=-0.173, train/target_value_std=0.0814, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6087/8000 [1:13:54<1:48:40, 3.41s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.29, train/loss=3.44, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.268, train/predicted_value_std=0.088, train/target_value_mean=-0.218, train/target_value_std=0.113, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6088/8000 [1:13:57<1:48:42, 3.41s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.4, train/loss=3.75, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.334, train/predicted_value_std=0.084, train/target_value_mean=-0.366, train/target_value_std=0.131, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6089/8000 [1:14:01<1:49:07, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.81, train/loss=3.67, train/lr=5e-5, train/mae=0.0666, train/predicted_value_mean=-0.379, train/predicted_value_std=0.176, train/target_value_mean=-0.364, train/target_value_std=0.179, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6090/8000 [1:14:04<1:50:04, 3.46s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.4, train/loss=3.78, train/lr=5e-5, train/mae=0.0928, train/predicted_value_mean=-0.292, train/predicted_value_std=0.135, train/target_value_mean=-0.328, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6091/8000 [1:14:08<1:53:05, 3.55s/it, time/step=3.78, time/training=3.77, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.15, train/loss=3.22, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.288, train/predicted_value_std=0.133, train/target_value_mean=-0.262, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6092/8000 [1:14:12<1:52:05, 3.52s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.38, train/loss=3.87, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.289, train/predicted_value_std=0.137, train/target_value_mean=-0.318, train/target_value_std=0.168, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6093/8000 [1:14:15<1:51:24, 3.51s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.68, train/loss=3.66, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.321, train/predicted_value_std=0.115, train/target_value_mean=-0.327, train/target_value_std=0.222, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6094/8000 [1:14:19<1:50:36, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.25, train/loss=3.86, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.321, train/predicted_value_std=0.125, train/target_value_mean=-0.36, train/target_value_std=0.145, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6095/8000 [1:14:22<1:50:16, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.27, train/loss=3.78, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.302, train/predicted_value_std=0.135, train/target_value_mean=-0.316, train/target_value_std=0.145, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6096/8000 [1:14:25<1:50:06, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.91, train/loss=3.36, train/lr=5e-5, train/mae=0.0431, train/predicted_value_mean=-0.282, train/predicted_value_std=0.104, train/target_value_mean=-0.229, train/target_value_std=0.0996, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6097/8000 [1:14:29<1:50:02, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.21, train/loss=3.42, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.31, train/predicted_value_std=0.143, train/target_value_mean=-0.275, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6098/8000 [1:14:32<1:49:55, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10, train/loss=3.64, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.295, train/predicted_value_std=0.0825, train/target_value_mean=-0.279, train/target_value_std=0.127, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6099/8000 [1:14:36<1:49:49, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.92, train/loss=3.55, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.254, train/predicted_value_std=0.0879, train/target_value_mean=-0.202, train/target_value_std=0.111, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6100/8000 [1:14:39<1:49:44, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.09, train/loss=3.34, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.253, train/predicted_value_std=0.135, train/target_value_mean=-0.266, train/target_value_std=0.126, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6101/8000 [1:14:43<1:49:15, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.48, train/lr=5e-5, train/mae=0.166, train/predicted_value_mean=-0.258, train/predicted_value_std=0.149, train/target_value_mean=-0.343, train/target_value_std=0.322, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6102/8000 [1:14:46<1:48:51, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.47, train/loss=3.32, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.264, train/predicted_value_std=0.119, train/target_value_mean=-0.205, train/target_value_std=0.166, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6103/8000 [1:14:50<1:51:26, 3.52s/it, time/step=3.72, time/training=3.71, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.24, train/loss=3.63, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.299, train/predicted_value_std=0.117, train/target_value_mean=-0.262, train/target_value_std=0.155, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6104/8000 [1:14:53<1:50:33, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.62, train/loss=4.01, train/lr=5e-5, train/mae=0.197, train/predicted_value_mean=-0.295, train/predicted_value_std=0.122, train/target_value_mean=-0.296, train/target_value_std=0.148, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6105/8000 [1:14:57<1:49:42, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.76, train/loss=3.71, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.311, train/predicted_value_std=0.167, train/target_value_mean=-0.311, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6106/8000 [1:15:00<1:49:09, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.6, train/loss=3.71, train/lr=5e-5, train/mae=0.0878, train/predicted_value_mean=-0.274, train/predicted_value_std=0.125, train/target_value_mean=-0.196, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6107/8000 [1:15:03<1:47:50, 3.42s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.6, train/loss=3.07, train/lr=5e-5, train/mae=0.0688, train/predicted_value_mean=-0.281, train/predicted_value_std=0.14, train/target_value_mean=-0.261, train/target_value_std=0.199, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6108/8000 [1:15:07<1:47:10, 3.40s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.72, train/loss=4.1, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.318, train/predicted_value_std=0.158, train/target_value_mean=-0.32, train/target_value_std=0.242, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6109/8000 [1:15:10<1:46:39, 3.38s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.33, train/loss=3.58, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.365, train/predicted_value_std=0.147, train/target_value_mean=-0.388, train/target_value_std=0.195, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6110/8000 [1:15:14<1:46:33, 3.38s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.21, train/loss=3.58, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.27, train/predicted_value_std=0.112, train/target_value_mean=-0.242, train/target_value_std=0.185, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6111/8000 [1:15:17<1:46:25, 3.38s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.65, train/loss=2.96, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.257, train/predicted_value_std=0.184, train/target_value_mean=-0.286, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6112/8000 [1:15:20<1:46:19, 3.38s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.79, train/loss=3.15, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.217, train/predicted_value_std=0.113, train/target_value_mean=-0.223, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6113/8000 [1:15:24<1:46:15, 3.38s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.43, train/loss=4.06, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.392, train/predicted_value_std=0.166, train/target_value_mean=-0.426, train/target_value_std=0.269, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6114/8000 [1:15:27<1:46:27, 3.39s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.28, train/loss=3.78, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.301, train/predicted_value_std=0.144, train/target_value_mean=-0.291, train/target_value_std=0.203, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6115/8000 [1:15:31<1:48:33, 3.46s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.46, train/loss=4.03, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.336, train/predicted_value_std=0.0751, train/target_value_mean=-0.372, train/target_value_std=0.0742, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6116/8000 [1:15:34<1:47:54, 3.44s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.76, train/loss=3.62, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.278, train/predicted_value_std=0.129, train/target_value_mean=-0.242, train/target_value_std=0.214, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6117/8000 [1:15:37<1:47:08, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.3, train/loss=3.19, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.276, train/predicted_value_std=0.105, train/target_value_mean=-0.288, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6118/8000 [1:15:41<1:46:43, 3.40s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.78, train/loss=3.63, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.288, train/predicted_value_std=0.114, train/target_value_mean=-0.263, train/target_value_std=0.112, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6119/8000 [1:15:44<1:46:33, 3.40s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.8, train/loss=3.51, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.294, train/predicted_value_std=0.115, train/target_value_mean=-0.237, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 76%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6120/8000 [1:15:48<1:46:20, 3.39s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.21, train/loss=3.27, train/lr=5e-5, train/mae=0.0497, train/predicted_value_mean=-0.235, train/predicted_value_std=0.104, train/target_value_mean=-0.194, train/target_value_std=0.0888, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6121/8000 [1:15:51<1:45:57, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.68, train/loss=3.6, train/lr=5e-5, train/mae=0.0481, train/predicted_value_mean=-0.208, train/predicted_value_std=0.0501, train/target_value_mean=-0.158, train/target_value_std=0.0469, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6122/8000 [1:15:54<1:45:45, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.09, train/loss=3.97, train/lr=5e-5, train/mae=0.187, train/predicted_value_mean=-0.244, train/predicted_value_std=0.1, train/target_value_mean=-0.302, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6123/8000 [1:15:58<1:45:41, 3.38s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.71, train/loss=3.97, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.343, train/predicted_value_std=0.101, train/target_value_mean=-0.249, train/target_value_std=0.163, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6124/8000 [1:16:01<1:46:06, 3.39s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.48, train/loss=3.25, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.317, train/predicted_value_std=0.186, train/target_value_mean=-0.357, train/target_value_std=0.291, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6125/8000 [1:16:05<1:46:20, 3.40s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.94, train/loss=3.39, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.298, train/predicted_value_std=0.141, train/target_value_mean=-0.286, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6126/8000 [1:16:08<1:46:29, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.68, train/loss=3.32, train/lr=5e-5, train/mae=0.0778, train/predicted_value_mean=-0.231, train/predicted_value_std=0.22, train/target_value_mean=-0.266, train/target_value_std=0.29, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6127/8000 [1:16:12<1:49:12, 3.50s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.12, train/loss=3.22, train/lr=5e-5, train/mae=0.0591, train/predicted_value_mean=-0.186, train/predicted_value_std=0.0822, train/target_value_mean=-0.155, train/target_value_std=0.114, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6128/8000 [1:16:15<1:48:13, 3.47s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.39, train/loss=3.85, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.321, train/predicted_value_std=0.126, train/target_value_mean=-0.223, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6129/8000 [1:16:19<1:47:29, 3.45s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.7, train/loss=3.01, train/lr=5e-5, train/mae=0.0531, train/predicted_value_mean=-0.279, train/predicted_value_std=0.133, train/target_value_mean=-0.237, train/target_value_std=0.119, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6130/8000 [1:16:22<1:47:16, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.59, train/loss=3.24, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.279, train/predicted_value_std=0.179, train/target_value_mean=-0.261, train/target_value_std=0.177, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6131/8000 [1:16:25<1:47:08, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.39, train/loss=3.57, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.378, train/predicted_value_std=0.184, train/target_value_mean=-0.411, train/target_value_std=0.276, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6132/8000 [1:16:29<1:47:01, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.56, train/loss=3.89, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.324, train/predicted_value_std=0.0987, train/target_value_mean=-0.323, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6133/8000 [1:16:32<1:47:06, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.73, train/loss=3.31, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.312, train/predicted_value_std=0.198, train/target_value_mean=-0.283, train/target_value_std=0.244, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6134/8000 [1:16:36<1:47:05, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.48, train/loss=3.58, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.374, train/predicted_value_std=0.131, train/target_value_mean=-0.399, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6135/8000 [1:16:39<1:46:55, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.64, train/loss=3.64, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.33, train/predicted_value_std=0.176, train/target_value_mean=-0.368, train/target_value_std=0.242, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6136/8000 [1:16:43<1:46:53, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.97, train/loss=3.53, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.245, train/predicted_value_std=0.136, train/target_value_mean=-0.213, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6137/8000 [1:16:46<1:46:51, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.78, train/loss=3.71, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.319, train/predicted_value_std=0.125, train/target_value_mean=-0.299, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6138/8000 [1:16:50<1:47:11, 3.45s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.8, train/loss=3.45, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.297, train/predicted_value_std=0.132, train/target_value_mean=-0.284, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6139/8000 [1:16:53<1:50:07, 3.55s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.56, train/loss=3.49, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.275, train/predicted_value_std=0.129, train/target_value_mean=-0.278, train/target_value_std=0.169, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6140/8000 [1:16:57<1:49:41, 3.54s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.5, train/loss=3.47, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.269, train/predicted_value_std=0.116, train/target_value_mean=-0.201, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6141/8000 [1:17:00<1:48:47, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.25, train/loss=3.82, train/lr=5e-5, train/mae=0.225, train/predicted_value_mean=-0.366, train/predicted_value_std=0.0958, train/target_value_mean=-0.428, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6142/8000 [1:17:04<1:48:18, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.84, train/loss=4.1, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.291, train/predicted_value_std=0.111, train/target_value_mean=-0.249, train/target_value_std=0.179, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6143/8000 [1:17:07<1:47:47, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.59, train/loss=4, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.354, train/predicted_value_std=0.135, train/target_value_mean=-0.333, train/target_value_std=0.159, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6144/8000 [1:17:11<1:47:11, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.91, train/loss=3.08, train/lr=5e-5, train/mae=0.0409, train/predicted_value_mean=-0.308, train/predicted_value_std=0.201, train/target_value_mean=-0.293, train/target_value_std=0.247, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6145/8000 [1:17:14<1:46:53, 3.46s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7, train/loss=3.11, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.234, train/predicted_value_std=0.146, train/target_value_mean=-0.209, train/target_value_std=0.157, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6146/8000 [1:17:17<1:46:46, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.8, train/loss=3.41, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.245, train/predicted_value_std=0.144, train/target_value_mean=-0.227, train/target_value_std=0.171, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6147/8000 [1:17:21<1:46:31, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.32, train/loss=3.55, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.272, train/predicted_value_std=0.16, train/target_value_mean=-0.276, train/target_value_std=0.192, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6148/8000 [1:17:24<1:46:29, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.2, train/loss=3.17, train/lr=5e-5, train/mae=0.0269, train/predicted_value_mean=-0.286, train/predicted_value_std=0.217, train/target_value_mean=-0.247, train/target_value_std=0.24, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6149/8000 [1:17:28<1:46:29, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.19, train/loss=3.18, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.312, train/predicted_value_std=0.195, train/target_value_mean=-0.366, train/target_value_std=0.268, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6150/8000 [1:17:31<1:46:15, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.34, train/loss=3.22, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.281, train/predicted_value_std=0.0958, train/target_value_mean=-0.268, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6151/8000 [1:17:35<1:48:34, 3.52s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.44, train/loss=3.62, train/lr=5e-5, train/mae=0.206, train/predicted_value_mean=-0.34, train/predicted_value_std=0.197, train/target_value_mean=-0.392, train/target_value_std=0.291, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6152/8000 [1:17:38<1:47:38, 3.50s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.12, train/loss=3.54, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.277, train/predicted_value_std=0.195, train/target_value_mean=-0.286, train/target_value_std=0.256, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6153/8000 [1:17:42<1:47:04, 3.48s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.52, train/loss=4.3, train/lr=5e-5, train/mae=0.174, train/predicted_value_mean=-0.424, train/predicted_value_std=0.155, train/target_value_mean=-0.428, train/target_value_std=0.261, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6154/8000 [1:17:45<1:46:52, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.58, train/loss=3.18, train/lr=5e-5, train/mae=0.0631, train/predicted_value_mean=-0.26, train/predicted_value_std=0.126, train/target_value_mean=-0.188, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6155/8000 [1:17:49<1:46:42, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.58, train/loss=3.72, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.272, train/predicted_value_std=0.116, train/target_value_mean=-0.208, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6156/8000 [1:17:52<1:46:30, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.96, train/loss=3.76, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.282, train/predicted_value_std=0.162, train/target_value_mean=-0.3, train/target_value_std=0.26, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6157/8000 [1:17:56<1:46:20, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.63, train/loss=3.5, train/lr=5e-5, train/mae=0.0566, train/predicted_value_mean=-0.365, train/predicted_value_std=0.168, train/target_value_mean=-0.338, train/target_value_std=0.232, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6158/8000 [1:17:59<1:46:21, 3.46s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.2, train/loss=4.21, train/lr=5e-5, train/mae=0.219, train/predicted_value_mean=-0.384, train/predicted_value_std=0.189, train/target_value_mean=-0.369, train/target_value_std=0.17, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6159/8000 [1:18:03<1:46:30, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.98, train/loss=3.22, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.283, train/predicted_value_std=0.103, train/target_value_mean=-0.254, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6160/8000 [1:18:06<1:46:20, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=10.9, train/loss=3.34, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.298, train/predicted_value_std=0.173, train/target_value_mean=-0.284, train/target_value_std=0.18, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6161/8000 [1:18:10<1:46:17, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=6.14, train/loss=3.29, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.241, train/predicted_value_std=0.144, train/target_value_mean=-0.253, train/target_value_std=0.2, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6162/8000 [1:18:13<1:46:14, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.35, train/loss=3.67, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.282, train/predicted_value_std=0.157, train/target_value_mean=-0.289, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6163/8000 [1:18:17<1:48:52, 3.56s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.02, train/loss=3.61, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.363, train/predicted_value_std=0.215, train/target_value_mean=-0.35, train/target_value_std=0.254, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6164/8000 [1:18:20<1:47:48, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.99, train/loss=3.32, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.345, train/predicted_value_std=0.189, train/target_value_mean=-0.369, train/target_value_std=0.262, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6165/8000 [1:18:24<1:47:02, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.06, train/loss=3.73, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.285, train/predicted_value_std=0.143, train/target_value_mean=-0.246, train/target_value_std=0.162, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6166/8000 [1:18:27<1:46:26, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.59, train/loss=3.71, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.304, train/predicted_value_std=0.169, train/target_value_mean=-0.239, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6167/8000 [1:18:31<1:46:07, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.9, train/loss=3.95, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.31, train/predicted_value_std=0.143, train/target_value_mean=-0.305, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6168/8000 [1:18:34<1:45:49, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.32, train/loss=3.76, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.312, train/predicted_value_std=0.132, train/target_value_mean=-0.322, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6169/8000 [1:18:37<1:45:34, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.44, train/loss=4, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.36, train/predicted_value_std=0.229, train/target_value_mean=-0.404, train/target_value_std=0.333, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6170/8000 [1:18:41<1:45:29, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=3.42, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.268, train/predicted_value_std=0.123, train/target_value_mean=-0.259, train/target_value_std=0.179, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6171/8000 [1:18:44<1:45:33, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.84, train/loss=2.9, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.206, train/predicted_value_std=0.124, train/target_value_mean=-0.222, train/target_value_std=0.162, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6172/8000 [1:18:48<1:45:28, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.92, train/loss=2.67, train/lr=5e-5, train/mae=0.0297, train/predicted_value_mean=-0.194, train/predicted_value_std=0.129, train/target_value_mean=-0.154, train/target_value_std=0.113, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6173/8000 [1:18:51<1:45:53, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11.3, train/loss=3.32, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.345, train/predicted_value_std=0.0829, train/target_value_mean=-0.348, train/target_value_std=0.165, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6174/8000 [1:18:55<1:45:40, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.9, train/loss=4.02, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.303, train/predicted_value_std=0.124, train/target_value_mean=-0.311, train/target_value_std=0.157, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6175/8000 [1:18:59<1:48:05, 3.55s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.57, train/loss=3.95, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.307, train/predicted_value_std=0.118, train/target_value_mean=-0.266, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6176/8000 [1:19:02<1:47:07, 3.52s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.09, train/loss=3.17, train/lr=5e-5, train/mae=0.0463, train/predicted_value_mean=-0.22, train/predicted_value_std=0.14, train/target_value_mean=-0.208, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6177/8000 [1:19:05<1:46:27, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=7.97, train/loss=2.93, train/lr=5e-5, train/mae=0.0391, train/predicted_value_mean=-0.28, train/predicted_value_std=0.138, train/target_value_mean=-0.228, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6178/8000 [1:19:09<1:45:55, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.2, train/loss=3.4, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.249, train/predicted_value_std=0.0767, train/target_value_mean=-0.246, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6179/8000 [1:19:12<1:45:37, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.47, train/loss=3.14, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.26, train/predicted_value_std=0.206, train/target_value_mean=-0.241, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6180/8000 [1:19:16<1:45:30, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.42, train/loss=2.69, train/lr=5e-5, train/mae=0.035, train/predicted_value_mean=-0.19, train/predicted_value_std=0.139, train/target_value_mean=-0.15, train/target_value_std=0.107, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6181/8000 [1:19:19<1:45:08, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.89, train/loss=3.38, train/lr=5e-5, train/mae=0.0625, train/predicted_value_mean=-0.36, train/predicted_value_std=0.213, train/target_value_mean=-0.307, train/target_value_std=0.277, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6182/8000 [1:19:23<1:44:45, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.35, train/loss=3.53, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.373, train/predicted_value_std=0.176, train/target_value_mean=-0.335, train/target_value_std=0.201, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6183/8000 [1:19:26<1:44:32, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.64, train/loss=3.73, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.281, train/predicted_value_std=0.0924, train/target_value_mean=-0.236, train/target_value_std=0.0934, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6184/8000 [1:19:30<1:44:20, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.45, train/loss=3.94, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.253, train/predicted_value_std=0.0886, train/target_value_mean=-0.176, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6185/8000 [1:19:33<1:44:05, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.96, train/loss=3.53, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.256, train/predicted_value_std=0.112, train/target_value_mean=-0.2, train/target_value_std=0.123, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6186/8000 [1:19:36<1:43:48, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.98, train/loss=3.91, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.358, train/predicted_value_std=0.113, train/target_value_mean=-0.307, train/target_value_std=0.0965, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6187/8000 [1:19:40<1:46:29, 3.52s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.42, train/loss=3.65, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.406, train/predicted_value_std=0.0943, train/target_value_mean=-0.404, train/target_value_std=0.175, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6188/8000 [1:19:44<1:45:47, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.87, train/loss=3.46, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.338, train/predicted_value_std=0.186, train/target_value_mean=-0.331, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6189/8000 [1:19:47<1:44:59, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.41, train/loss=3.8, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.326, train/predicted_value_std=0.0785, train/target_value_mean=-0.276, train/target_value_std=0.159, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6190/8000 [1:19:50<1:44:14, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.67, train/loss=3.39, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.278, train/predicted_value_std=0.11, train/target_value_mean=-0.238, train/target_value_std=0.108, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6191/8000 [1:19:54<1:43:22, 3.43s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=6.31, train/loss=2.81, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.226, train/predicted_value_std=0.162, train/target_value_mean=-0.216, train/target_value_std=0.2, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6192/8000 [1:19:57<1:43:54, 3.45s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.34, train/loss=3.57, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.246, train/predicted_value_std=0.126, train/target_value_mean=-0.211, train/target_value_std=0.173, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6193/8000 [1:20:01<1:43:56, 3.45s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.02, train/loss=3.43, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.272, train/predicted_value_std=0.128, train/target_value_mean=-0.246, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6194/8000 [1:20:04<1:43:36, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.3, train/loss=3.27, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.311, train/predicted_value_std=0.13, train/target_value_mean=-0.344, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6195/8000 [1:20:08<1:42:59, 3.42s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.8, train/loss=3.86, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.32, train/predicted_value_std=0.115, train/target_value_mean=-0.348, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6196/8000 [1:20:11<1:42:36, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=13.9, train/loss=3.29, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.208, train/predicted_value_std=0.127, train/target_value_mean=-0.239, train/target_value_std=0.178, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6197/8000 [1:20:14<1:42:53, 3.42s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.5, train/loss=3.51, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.255, train/predicted_value_std=0.0982, train/target_value_mean=-0.268, train/target_value_std=0.157, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6198/8000 [1:20:18<1:43:06, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.31, train/loss=3.48, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.308, train/predicted_value_std=0.13, train/target_value_mean=-0.296, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 77%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6199/8000 [1:20:22<1:45:26, 3.51s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.71, train/loss=3.97, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.285, train/predicted_value_std=0.0973, train/target_value_mean=-0.325, train/target_value_std=0.203, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6200/8000 [1:20:25<1:44:31, 3.48s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=8.05, train/loss=3.32, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.346, train/predicted_value_std=0.177, train/target_value_mean=-0.341, train/target_value_std=0.21, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6201/8000 [1:20:28<1:44:05, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.4, train/loss=3.31, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.336, train/predicted_value_std=0.128, train/target_value_mean=-0.332, train/target_value_std=0.275, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6202/8000 [1:20:32<1:43:33, 3.46s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.74, train/loss=2.85, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.217, train/predicted_value_std=0.11, train/target_value_mean=-0.237, train/target_value_std=0.164, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6203/8000 [1:20:35<1:43:14, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.27, train/loss=3.69, train/lr=5e-5, train/mae=0.211, train/predicted_value_mean=-0.299, train/predicted_value_std=0.171, train/target_value_mean=-0.277, train/target_value_std=0.287, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6204/8000 [1:20:39<1:43:04, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.7, train/loss=3.29, train/lr=5e-5, train/mae=0.035, train/predicted_value_mean=-0.293, train/predicted_value_std=0.173, train/target_value_mean=-0.242, train/target_value_std=0.208, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6205/8000 [1:20:42<1:43:00, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.98, train/loss=2.98, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.239, train/predicted_value_std=0.122, train/target_value_mean=-0.26, train/target_value_std=0.127, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6206/8000 [1:20:46<1:43:04, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=14.9, train/loss=3.4, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.262, train/predicted_value_std=0.0961, train/target_value_mean=-0.23, train/target_value_std=0.108, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6207/8000 [1:20:49<1:43:04, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.91, train/loss=3.92, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.362, train/predicted_value_std=0.125, train/target_value_mean=-0.357, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6208/8000 [1:20:53<1:43:04, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.24, train/loss=3.31, train/lr=5e-5, train/mae=0.0587, train/predicted_value_mean=-0.347, train/predicted_value_std=0.158, train/target_value_mean=-0.322, train/target_value_std=0.208, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6209/8000 [1:20:56<1:42:37, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.36, train/loss=3.93, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.33, train/predicted_value_std=0.128, train/target_value_mean=-0.361, train/target_value_std=0.22, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6210/8000 [1:20:59<1:42:30, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.61, train/loss=3.64, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.356, train/predicted_value_std=0.127, train/target_value_mean=-0.317, train/target_value_std=0.144, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6211/8000 [1:21:03<1:45:26, 3.54s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=13.2, train/loss=3.99, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.334, train/predicted_value_std=0.0567, train/target_value_mean=-0.265, train/target_value_std=0.146, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6212/8000 [1:21:07<1:44:18, 3.50s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.37, train/loss=3.68, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.23, train/predicted_value_std=0.105, train/target_value_mean=-0.154, train/target_value_std=0.131, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6213/8000 [1:21:10<1:43:56, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.63, train/loss=3.15, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.254, train/predicted_value_std=0.121, train/target_value_mean=-0.247, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6214/8000 [1:21:14<1:44:03, 3.50s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.27, train/loss=3.33, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.337, train/predicted_value_std=0.23, train/target_value_mean=-0.286, train/target_value_std=0.25, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6215/8000 [1:21:17<1:43:24, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.95, train/loss=3.56, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.366, train/predicted_value_std=0.125, train/target_value_mean=-0.462, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6216/8000 [1:21:20<1:43:07, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.33, train/loss=3.65, train/lr=5e-5, train/mae=0.257, train/predicted_value_mean=-0.314, train/predicted_value_std=0.216, train/target_value_mean=-0.385, train/target_value_std=0.322, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6217/8000 [1:21:24<1:42:38, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.08, train/loss=3.61, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.287, train/predicted_value_std=0.166, train/target_value_mean=-0.23, train/target_value_std=0.164, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6218/8000 [1:21:27<1:42:19, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.23, train/loss=3.91, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.371, train/predicted_value_std=0.152, train/target_value_mean=-0.385, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6219/8000 [1:21:31<1:41:25, 3.42s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.84, train/loss=2.84, train/lr=5e-5, train/mae=0.0619, train/predicted_value_mean=-0.295, train/predicted_value_std=0.094, train/target_value_mean=-0.254, train/target_value_std=0.163, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6220/8000 [1:21:34<1:41:22, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.26, train/loss=3.19, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.309, train/predicted_value_std=0.19, train/target_value_mean=-0.318, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6221/8000 [1:21:37<1:41:28, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.2, train/loss=3.57, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.356, train/predicted_value_std=0.162, train/target_value_mean=-0.329, train/target_value_std=0.129, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6222/8000 [1:21:41<1:41:32, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=5.5, train/loss=3.19, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.214, train/predicted_value_std=0.111, train/target_value_mean=-0.241, train/target_value_std=0.18, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6223/8000 [1:21:45<1:43:34, 3.50s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=6.36, train/loss=3.39, train/lr=5e-5, train/mae=0.0809, train/predicted_value_mean=-0.304, train/predicted_value_std=0.157, train/target_value_mean=-0.278, train/target_value_std=0.143, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6224/8000 [1:21:48<1:42:38, 3.47s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=7.12, train/loss=2.55, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.215, train/predicted_value_std=0.139, train/target_value_mean=-0.176, train/target_value_std=0.137, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6225/8000 [1:21:51<1:41:28, 3.43s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.98, train/loss=3.21, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.299, train/predicted_value_std=0.181, train/target_value_mean=-0.331, train/target_value_std=0.229, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6226/8000 [1:21:55<1:41:20, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.48, train/loss=3.49, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.326, train/predicted_value_std=0.111, train/target_value_mean=-0.284, train/target_value_std=0.0941, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6227/8000 [1:21:58<1:41:16, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.86, train/loss=3.17, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.323, train/predicted_value_std=0.232, train/target_value_mean=-0.286, train/target_value_std=0.25, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6228/8000 [1:22:02<1:41:14, 3.43s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.69, train/loss=3.63, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.325, train/predicted_value_std=0.198, train/target_value_mean=-0.385, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6229/8000 [1:22:05<1:41:06, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.14, train/loss=3.61, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.291, train/predicted_value_std=0.107, train/target_value_mean=-0.211, train/target_value_std=0.104, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6230/8000 [1:22:08<1:40:48, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.67, train/loss=3.04, train/lr=5e-5, train/mae=0.0897, train/predicted_value_mean=-0.199, train/predicted_value_std=0.0373, train/target_value_mean=-0.161, train/target_value_std=0.142, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6231/8000 [1:22:12<1:41:02, 3.43s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.81, train/loss=4.07, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.308, train/predicted_value_std=0.117, train/target_value_mean=-0.292, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6232/8000 [1:22:15<1:41:25, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=6.58, train/loss=2.82, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.251, train/predicted_value_std=0.156, train/target_value_mean=-0.279, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6233/8000 [1:22:19<1:41:30, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.25, train/loss=3.69, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.348, train/predicted_value_std=0.148, train/target_value_mean=-0.4, train/target_value_std=0.21, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6234/8000 [1:22:22<1:41:28, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=11, train/loss=2.76, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.277, train/predicted_value_std=0.144, train/target_value_mean=-0.284, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6235/8000 [1:22:26<1:43:02, 3.50s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.45, train/loss=3.26, train/lr=5e-5, train/mae=0.0969, train/predicted_value_mean=-0.297, train/predicted_value_std=0.169, train/target_value_mean=-0.282, train/target_value_std=0.211, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6236/8000 [1:22:29<1:41:44, 3.46s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.04, train/loss=3.32, train/lr=5e-5, train/mae=0.199, train/predicted_value_mean=-0.303, train/predicted_value_std=0.156, train/target_value_mean=-0.344, train/target_value_std=0.293, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6237/8000 [1:22:33<1:40:50, 3.43s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.5, train/cat_acc_neighbor=0.5, train/grad_norm=11.2, train/loss=2.52, train/lr=5e-5, train/mae=0.0534, train/predicted_value_mean=-0.224, train/predicted_value_std=0.0983, train/target_value_mean=-0.168, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6238/8000 [1:22:36<1:40:07, 3.41s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.42, train/loss=3.74, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.34, train/predicted_value_std=0.126, train/target_value_mean=-0.367, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6239/8000 [1:22:39<1:39:43, 3.40s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.89, train/loss=3.12, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.251, train/predicted_value_std=0.0919, train/target_value_mean=-0.211, train/target_value_std=0.148, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6240/8000 [1:22:43<1:39:35, 3.40s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.28, train/loss=3.59, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.313, train/predicted_value_std=0.123, train/target_value_mean=-0.295, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6241/8000 [1:22:46<1:40:11, 3.42s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.44, train/loss=3, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.367, train/predicted_value_std=0.196, train/target_value_mean=-0.373, train/target_value_std=0.304, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6242/8000 [1:22:50<1:40:21, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.99, train/loss=3.36, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.258, train/predicted_value_std=0.0903, train/target_value_mean=-0.229, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6243/8000 [1:22:53<1:40:26, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.63, train/loss=2.42, train/lr=5e-5, train/mae=0.0516, train/predicted_value_mean=-0.18, train/predicted_value_std=0.111, train/target_value_mean=-0.12, train/target_value_std=0.124, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6244/8000 [1:22:57<1:40:56, 3.45s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.24, train/loss=3.99, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.305, train/predicted_value_std=0.127, train/target_value_mean=-0.279, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6245/8000 [1:23:00<1:41:04, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.77, train/loss=3.74, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.418, train/predicted_value_std=0.182, train/target_value_mean=-0.467, train/target_value_std=0.266, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6246/8000 [1:23:04<1:41:22, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.5, train/loss=3.36, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.283, train/predicted_value_std=0.181, train/target_value_mean=-0.269, train/target_value_std=0.2, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6247/8000 [1:23:07<1:44:13, 3.57s/it, time/step=3.8, time/training=3.79, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.54, train/loss=4.35, train/lr=5e-5, train/mae=0.188, train/predicted_value_mean=-0.322, train/predicted_value_std=0.0723, train/target_value_mean=-0.345, train/target_value_std=0.121, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6248/8000 [1:23:11<1:43:12, 3.53s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8, train/loss=3.41, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.268, train/predicted_value_std=0.115, train/target_value_mean=-0.206, train/target_value_std=0.14, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6249/8000 [1:23:14<1:42:17, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.08, train/loss=3.64, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.319, train/predicted_value_std=0.13, train/target_value_mean=-0.333, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6250/8000 [1:23:18<1:41:31, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.16, train/loss=3.28, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.272, train/predicted_value_std=0.159, train/target_value_mean=-0.224, train/target_value_std=0.103, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6251/8000 [1:23:21<1:40:57, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.06, train/loss=4.21, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.283, train/predicted_value_std=0.129, train/target_value_mean=-0.289, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6252/8000 [1:23:25<1:41:01, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.15, train/loss=3.54, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.362, train/predicted_value_std=0.134, train/target_value_mean=-0.372, train/target_value_std=0.269, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6253/8000 [1:23:28<1:41:09, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.1, train/loss=2.95, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.245, train/predicted_value_std=0.083, train/target_value_mean=-0.241, train/target_value_std=0.135, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6254/8000 [1:23:32<1:41:17, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.34, train/loss=3.14, train/lr=5e-5, train/mae=0.0762, train/predicted_value_mean=-0.288, train/predicted_value_std=0.144, train/target_value_mean=-0.3, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6255/8000 [1:23:35<1:41:01, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.25, train/loss=2.92, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.286, train/predicted_value_std=0.274, train/target_value_mean=-0.249, train/target_value_std=0.288, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6256/8000 [1:23:38<1:40:36, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.6, train/loss=3.69, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.371, train/predicted_value_std=0.146, train/target_value_mean=-0.416, train/target_value_std=0.25, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6257/8000 [1:23:42<1:39:48, 3.44s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.54, train/loss=3.98, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.439, train/predicted_value_std=0.135, train/target_value_mean=-0.477, train/target_value_std=0.299, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6258/8000 [1:23:45<1:39:09, 3.42s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.13, train/loss=3.74, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.291, train/predicted_value_std=0.138, train/target_value_mean=-0.275, train/target_value_std=0.215, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6259/8000 [1:23:49<1:42:05, 3.52s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.31, train/loss=3.43, train/lr=5e-5, train/mae=0.0988, train/predicted_value_mean=-0.297, train/predicted_value_std=0.132, train/target_value_mean=-0.301, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6260/8000 [1:23:52<1:41:32, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.17, train/loss=3.01, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.271, train/predicted_value_std=0.102, train/target_value_mean=-0.228, train/target_value_std=0.128, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6261/8000 [1:23:56<1:40:27, 3.47s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.8, train/loss=4.23, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.342, train/predicted_value_std=0.133, train/target_value_mean=-0.39, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6262/8000 [1:23:59<1:39:29, 3.43s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.35, train/loss=3.42, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.275, train/predicted_value_std=0.132, train/target_value_mean=-0.203, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6263/8000 [1:24:02<1:38:55, 3.42s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.33, train/loss=3.71, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.352, train/predicted_value_std=0.18, train/target_value_mean=-0.322, train/target_value_std=0.267, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6264/8000 [1:24:06<1:38:45, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=13.8, train/loss=3.33, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.308, train/predicted_value_std=0.0952, train/target_value_mean=-0.289, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6265/8000 [1:24:09<1:38:39, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.67, train/loss=3.62, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.343, train/predicted_value_std=0.123, train/target_value_mean=-0.31, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6266/8000 [1:24:13<1:38:22, 3.40s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.41, train/loss=3.07, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.286, train/predicted_value_std=0.167, train/target_value_mean=-0.237, train/target_value_std=0.175, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6267/8000 [1:24:16<1:38:10, 3.40s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.95, train/loss=3.58, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.362, train/predicted_value_std=0.202, train/target_value_mean=-0.347, train/target_value_std=0.24, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6268/8000 [1:24:19<1:37:57, 3.39s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.72, train/loss=2.89, train/lr=5e-5, train/mae=0.0688, train/predicted_value_mean=-0.286, train/predicted_value_std=0.21, train/target_value_mean=-0.253, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6269/8000 [1:24:23<1:37:41, 3.39s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.72, train/loss=3.97, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.344, train/predicted_value_std=0.149, train/target_value_mean=-0.347, train/target_value_std=0.178, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6270/8000 [1:24:26<1:37:28, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.67, train/loss=3.97, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.358, train/predicted_value_std=0.118, train/target_value_mean=-0.324, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6271/8000 [1:24:30<1:39:54, 3.47s/it, time/step=3.67, time/training=3.66, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=6.55, train/loss=2.94, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.274, train/predicted_value_std=0.127, train/target_value_mean=-0.212, train/target_value_std=0.0986, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6272/8000 [1:24:33<1:39:34, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.53, train/loss=3.25, train/lr=5e-5, train/mae=0.0316, train/predicted_value_mean=-0.242, train/predicted_value_std=0.157, train/target_value_mean=-0.235, train/target_value_std=0.186, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6273/8000 [1:24:37<1:39:06, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.74, train/loss=3.47, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.202, train/predicted_value_std=0.0997, train/target_value_mean=-0.151, train/target_value_std=0.0794, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6274/8000 [1:24:40<1:38:33, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.5, train/grad_norm=6.56, train/loss=3.3, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.23, train/predicted_value_std=0.125, train/target_value_mean=-0.23, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6275/8000 [1:24:43<1:38:17, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.05, train/loss=3.77, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.304, train/predicted_value_std=0.17, train/target_value_mean=-0.29, train/target_value_std=0.238, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6276/8000 [1:24:47<1:38:20, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.99, train/loss=3.34, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.262, train/predicted_value_std=0.0751, train/target_value_mean=-0.235, train/target_value_std=0.109, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6277/8000 [1:24:50<1:37:45, 3.40s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.7, train/loss=3.14, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.246, train/predicted_value_std=0.113, train/target_value_mean=-0.2, train/target_value_std=0.106, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6278/8000 [1:24:54<1:38:18, 3.43s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=11, train/loss=2.83, train/lr=5e-5, train/mae=0.0381, train/predicted_value_mean=-0.255, train/predicted_value_std=0.104, train/target_value_mean=-0.234, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6279/8000 [1:24:57<1:38:32, 3.44s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.45, train/loss=3.27, train/lr=5e-5, train/mae=0.0925, train/predicted_value_mean=-0.356, train/predicted_value_std=0.11, train/target_value_mean=-0.375, train/target_value_std=0.204, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 78%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6280/8000 [1:25:01<1:38:24, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.17, train/loss=3.28, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.202, train/predicted_value_std=0.0868, train/target_value_mean=-0.179, train/target_value_std=0.114, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6281/8000 [1:25:04<1:38:20, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.32, train/loss=3.99, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.333, train/predicted_value_std=0.141, train/target_value_mean=-0.283, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6282/8000 [1:25:08<1:38:17, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.32, train/loss=3.33, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.256, train/predicted_value_std=0.149, train/target_value_mean=-0.246, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6283/8000 [1:25:11<1:40:51, 3.52s/it, time/step=3.74, time/training=3.73, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.81, train/loss=3.69, train/lr=5e-5, train/mae=0.0666, train/predicted_value_mean=-0.318, train/predicted_value_std=0.146, train/target_value_mean=-0.276, train/target_value_std=0.172, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6284/8000 [1:25:15<1:40:08, 3.50s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.21, train/loss=3.46, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.291, train/predicted_value_std=0.156, train/target_value_mean=-0.288, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6285/8000 [1:25:18<1:39:27, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9, train/loss=3.28, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.246, train/predicted_value_std=0.073, train/target_value_mean=-0.22, train/target_value_std=0.108, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6286/8000 [1:25:22<1:39:11, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10.8, train/loss=3.35, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.323, train/predicted_value_std=0.214, train/target_value_mean=-0.273, train/target_value_std=0.191, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6287/8000 [1:25:25<1:38:55, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=8.7, train/loss=2.35, train/lr=5e-5, train/mae=0.0134, train/predicted_value_mean=-0.243, train/predicted_value_std=0.17, train/target_value_mean=-0.219, train/target_value_std=0.179, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6288/8000 [1:25:28<1:38:46, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.18, train/lr=5e-5, train/mae=0.0403, train/predicted_value_mean=-0.264, train/predicted_value_std=0.145, train/target_value_mean=-0.242, train/target_value_std=0.233, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6289/8000 [1:25:32<1:38:40, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.3, train/loss=3.64, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.233, train/predicted_value_std=0.117, train/target_value_mean=-0.211, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6290/8000 [1:25:35<1:38:22, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.36, train/loss=3.87, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.327, train/predicted_value_std=0.145, train/target_value_mean=-0.336, train/target_value_std=0.148, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6291/8000 [1:25:39<1:38:04, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.48, train/loss=3.87, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.302, train/predicted_value_std=0.142, train/target_value_mean=-0.278, train/target_value_std=0.144, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6292/8000 [1:25:42<1:38:02, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.55, train/loss=2.73, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.23, train/predicted_value_std=0.12, train/target_value_mean=-0.162, train/target_value_std=0.122, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6293/8000 [1:25:46<1:37:50, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.7, train/loss=3.56, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.331, train/predicted_value_std=0.107, train/target_value_mean=-0.33, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6294/8000 [1:25:49<1:37:51, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.99, train/loss=4.03, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.329, train/predicted_value_std=0.144, train/target_value_mean=-0.295, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6295/8000 [1:25:53<1:39:54, 3.52s/it, time/step=3.69, time/training=3.68, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=13, train/loss=3.83, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.298, train/predicted_value_std=0.14, train/target_value_mean=-0.34, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6296/8000 [1:25:56<1:39:21, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.67, train/loss=3.4, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.302, train/predicted_value_std=0.21, train/target_value_mean=-0.333, train/target_value_std=0.309, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6297/8000 [1:26:00<1:39:21, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.07, train/loss=3.73, train/lr=5e-5, train/mae=0.176, train/predicted_value_mean=-0.292, train/predicted_value_std=0.168, train/target_value_mean=-0.295, train/target_value_std=0.146, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6298/8000 [1:26:03<1:39:26, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.59, train/loss=3.43, train/lr=5e-5, train/mae=0.0631, train/predicted_value_mean=-0.288, train/predicted_value_std=0.172, train/target_value_mean=-0.223, train/target_value_std=0.203, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6299/8000 [1:26:07<1:39:12, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.01, train/loss=2.97, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.218, train/predicted_value_std=0.0921, train/target_value_mean=-0.185, train/target_value_std=0.0951, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6300/8000 [1:26:10<1:38:37, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.43, train/loss=3.42, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.298, train/predicted_value_std=0.181, train/target_value_mean=-0.289, train/target_value_std=0.253, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6301/8000 [1:26:14<1:38:56, 3.49s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.84, train/loss=3.74, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.385, train/predicted_value_std=0.12, train/target_value_mean=-0.351, train/target_value_std=0.24, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6302/8000 [1:26:17<1:39:02, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.18, train/loss=3.4, train/lr=5e-5, train/mae=0.0947, train/predicted_value_mean=-0.203, train/predicted_value_std=0.152, train/target_value_mean=-0.171, train/target_value_std=0.172, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6303/8000 [1:26:21<1:39:12, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.94, train/loss=3.18, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.294, train/predicted_value_std=0.148, train/target_value_mean=-0.298, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6304/8000 [1:26:24<1:39:10, 3.51s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=11.1, train/loss=4.21, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.338, train/predicted_value_std=0.155, train/target_value_mean=-0.349, train/target_value_std=0.295, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6305/8000 [1:26:28<1:39:07, 3.51s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.39, train/loss=3.6, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.259, train/predicted_value_std=0.131, train/target_value_mean=-0.221, train/target_value_std=0.173, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6306/8000 [1:26:31<1:38:57, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.97, train/loss=3.63, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.292, train/predicted_value_std=0.165, train/target_value_mean=-0.28, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6307/8000 [1:26:35<1:41:24, 3.59s/it, time/step=3.8, time/training=3.8, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.89, train/loss=3.53, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.299, train/predicted_value_std=0.112, train/target_value_mean=-0.32, train/target_value_std=0.142, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6308/8000 [1:26:39<1:40:28, 3.56s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.66, train/loss=3.22, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.273, train/predicted_value_std=0.126, train/target_value_mean=-0.295, train/target_value_std=0.171, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6309/8000 [1:26:42<1:39:52, 3.54s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.89, train/loss=3.64, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.363, train/predicted_value_std=0.203, train/target_value_mean=-0.368, train/target_value_std=0.256, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6310/8000 [1:26:45<1:38:44, 3.51s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.96, train/loss=3.14, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.32, train/predicted_value_std=0.16, train/target_value_mean=-0.293, train/target_value_std=0.225, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6311/8000 [1:26:49<1:39:14, 3.53s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.7, train/loss=3.64, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.328, train/predicted_value_std=0.124, train/target_value_mean=-0.304, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6312/8000 [1:26:53<1:39:04, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.52, train/loss=3.48, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.311, train/predicted_value_std=0.13, train/target_value_mean=-0.312, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6313/8000 [1:26:56<1:38:56, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.85, train/loss=3.65, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.358, train/predicted_value_std=0.177, train/target_value_mean=-0.326, train/target_value_std=0.267, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6314/8000 [1:27:00<1:38:51, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.81, train/loss=3.93, train/lr=5e-5, train/mae=0.257, train/predicted_value_mean=-0.339, train/predicted_value_std=0.209, train/target_value_mean=-0.346, train/target_value_std=0.319, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6315/8000 [1:27:03<1:38:11, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.63, train/loss=3.48, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.247, train/predicted_value_std=0.131, train/target_value_mean=-0.173, train/target_value_std=0.126, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6316/8000 [1:27:06<1:37:24, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.5, train/loss=3.67, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.247, train/predicted_value_std=0.124, train/target_value_mean=-0.287, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6317/8000 [1:27:10<1:37:03, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.62, train/loss=3.44, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.328, train/predicted_value_std=0.158, train/target_value_mean=-0.316, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6318/8000 [1:27:13<1:37:27, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=6.67, train/loss=2.88, train/lr=5e-5, train/mae=0.0559, train/predicted_value_mean=-0.262, train/predicted_value_std=0.154, train/target_value_mean=-0.236, train/target_value_std=0.162, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6319/8000 [1:27:17<1:40:11, 3.58s/it, time/step=3.81, time/training=3.8, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.3, train/loss=3.73, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.279, train/predicted_value_std=0.159, train/target_value_mean=-0.314, train/target_value_std=0.258, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6320/8000 [1:27:21<1:39:23, 3.55s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.61, train/loss=3.13, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.291, train/predicted_value_std=0.156, train/target_value_mean=-0.233, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6321/8000 [1:27:24<1:38:31, 3.52s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.14, train/loss=3.23, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.361, train/predicted_value_std=0.226, train/target_value_mean=-0.291, train/target_value_std=0.261, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6322/8000 [1:27:28<1:37:44, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.4, train/loss=2.96, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.297, train/predicted_value_std=0.204, train/target_value_mean=-0.304, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6323/8000 [1:27:31<1:37:02, 3.47s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.92, train/loss=4.12, train/lr=5e-5, train/mae=0.208, train/predicted_value_mean=-0.323, train/predicted_value_std=0.137, train/target_value_mean=-0.38, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6324/8000 [1:27:35<1:37:17, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.6, train/loss=3.34, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.272, train/predicted_value_std=0.193, train/target_value_mean=-0.257, train/target_value_std=0.227, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6325/8000 [1:27:38<1:37:24, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.71, train/loss=3.17, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.254, train/predicted_value_std=0.147, train/target_value_mean=-0.226, train/target_value_std=0.218, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6326/8000 [1:27:42<1:37:21, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.96, train/loss=3.26, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.259, train/predicted_value_std=0.113, train/target_value_mean=-0.208, train/target_value_std=0.0902, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6327/8000 [1:27:45<1:37:03, 3.48s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.11, train/loss=3.55, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.289, train/predicted_value_std=0.12, train/target_value_mean=-0.325, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6328/8000 [1:27:48<1:36:31, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=12.6, train/loss=3.29, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.342, train/predicted_value_std=0.194, train/target_value_mean=-0.378, train/target_value_std=0.331, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6329/8000 [1:27:52<1:36:17, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.94, train/loss=2.94, train/lr=5e-5, train/mae=0.0584, train/predicted_value_mean=-0.227, train/predicted_value_std=0.193, train/target_value_mean=-0.189, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6330/8000 [1:27:55<1:35:52, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.68, train/loss=2.74, train/lr=5e-5, train/mae=0.0562, train/predicted_value_mean=-0.409, train/predicted_value_std=0.199, train/target_value_mean=-0.408, train/target_value_std=0.262, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6331/8000 [1:27:59<1:37:51, 3.52s/it, time/step=3.69, time/training=3.68, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.89, train/loss=3.33, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.251, train/predicted_value_std=0.113, train/target_value_mean=-0.167, train/target_value_std=0.0961, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6332/8000 [1:28:02<1:37:13, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.01, train/loss=2.71, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.211, train/predicted_value_std=0.115, train/target_value_mean=-0.187, train/target_value_std=0.126, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6333/8000 [1:28:06<1:36:29, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.41, train/loss=2.99, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.295, train/predicted_value_std=0.167, train/target_value_mean=-0.271, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6334/8000 [1:28:09<1:36:26, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.28, train/loss=3.12, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.25, train/predicted_value_std=0.151, train/target_value_mean=-0.224, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6335/8000 [1:28:13<1:36:26, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.53, train/loss=3.16, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.25, train/predicted_value_std=0.162, train/target_value_mean=-0.19, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6336/8000 [1:28:16<1:36:24, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.76, train/loss=4.05, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.275, train/predicted_value_std=0.126, train/target_value_mean=-0.224, train/target_value_std=0.196, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6337/8000 [1:28:20<1:36:26, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.13, train/loss=3.39, train/lr=5e-5, train/mae=0.193, train/predicted_value_mean=-0.344, train/predicted_value_std=0.156, train/target_value_mean=-0.331, train/target_value_std=0.307, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6338/8000 [1:28:23<1:36:26, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.05, train/loss=3.47, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.28, train/predicted_value_std=0.147, train/target_value_mean=-0.329, train/target_value_std=0.24, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6339/8000 [1:28:27<1:36:24, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.42, train/loss=3.42, train/lr=5e-5, train/mae=0.189, train/predicted_value_mean=-0.379, train/predicted_value_std=0.179, train/target_value_mean=-0.412, train/target_value_std=0.324, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6340/8000 [1:28:30<1:36:16, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.65, train/loss=3.84, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.355, train/predicted_value_std=0.0997, train/target_value_mean=-0.36, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6341/8000 [1:28:34<1:35:57, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.56, train/loss=3.76, train/lr=5e-5, train/mae=0.0447, train/predicted_value_mean=-0.309, train/predicted_value_std=0.114, train/target_value_mean=-0.291, train/target_value_std=0.167, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6342/8000 [1:28:37<1:35:42, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.46, train/loss=3.7, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.327, train/predicted_value_std=0.129, train/target_value_mean=-0.29, train/target_value_std=0.215, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6343/8000 [1:28:41<1:38:25, 3.56s/it, time/step=3.8, time/training=3.79, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.57, train/loss=3.24, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.217, train/predicted_value_std=0.123, train/target_value_mean=-0.161, train/target_value_std=0.141, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6344/8000 [1:28:44<1:37:45, 3.54s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.81, train/loss=3.49, train/lr=5e-5, train/mae=0.0666, train/predicted_value_mean=-0.301, train/predicted_value_std=0.121, train/target_value_mean=-0.327, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6345/8000 [1:28:48<1:37:09, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.78, train/loss=4.04, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.29, train/predicted_value_std=0.073, train/target_value_mean=-0.284, train/target_value_std=0.19, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6346/8000 [1:28:51<1:36:47, 3.51s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.86, train/loss=3.7, train/lr=5e-5, train/mae=0.221, train/predicted_value_mean=-0.284, train/predicted_value_std=0.112, train/target_value_mean=-0.324, train/target_value_std=0.22, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6347/8000 [1:28:55<1:36:31, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.22, train/loss=2.84, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.288, train/predicted_value_std=0.181, train/target_value_mean=-0.312, train/target_value_std=0.214, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6348/8000 [1:28:58<1:36:10, 3.49s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=10.3, train/loss=4.24, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.294, train/predicted_value_std=0.126, train/target_value_mean=-0.27, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6349/8000 [1:29:02<1:36:07, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=13.3, train/loss=3.08, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.279, train/predicted_value_std=0.0781, train/target_value_mean=-0.279, train/target_value_std=0.162, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6350/8000 [1:29:05<1:35:38, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.86, train/loss=3.65, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.3, train/predicted_value_std=0.123, train/target_value_mean=-0.258, train/target_value_std=0.0986, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6351/8000 [1:29:09<1:34:58, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.68, train/loss=3.48, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.259, train/predicted_value_std=0.129, train/target_value_mean=-0.243, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6352/8000 [1:29:12<1:37:36, 3.55s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=6.93, train/loss=3.84, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.309, train/predicted_value_std=0.0535, train/target_value_mean=-0.287, train/target_value_std=0.149, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6353/8000 [1:29:16<1:36:28, 3.51s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.19, train/loss=3.59, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.282, train/predicted_value_std=0.11, train/target_value_mean=-0.222, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6354/8000 [1:29:19<1:35:48, 3.49s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.13, train/loss=3.54, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.327, train/predicted_value_std=0.194, train/target_value_mean=-0.305, train/target_value_std=0.225, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6355/8000 [1:29:23<1:35:36, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=13.4, train/loss=3.37, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.296, train/predicted_value_std=0.141, train/target_value_mean=-0.338, train/target_value_std=0.258, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6356/8000 [1:29:26<1:35:23, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.16, train/loss=2.97, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.219, train/predicted_value_std=0.162, train/target_value_mean=-0.184, train/target_value_std=0.177, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6357/8000 [1:29:30<1:35:08, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.99, train/loss=3.29, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.281, train/predicted_value_std=0.134, train/target_value_mean=-0.283, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6358/8000 [1:29:33<1:35:06, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.55, train/loss=2.8, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.253, train/predicted_value_std=0.154, train/target_value_mean=-0.246, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 79%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6359/8000 [1:29:37<1:34:42, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.4, train/loss=3.59, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.345, train/predicted_value_std=0.129, train/target_value_mean=-0.369, train/target_value_std=0.232, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6360/8000 [1:29:40<1:34:30, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.27, train/loss=3.57, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.321, train/predicted_value_std=0.142, train/target_value_mean=-0.332, train/target_value_std=0.165, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6361/8000 [1:29:43<1:34:14, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.5, train/loss=3.26, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.303, train/predicted_value_std=0.179, train/target_value_mean=-0.283, train/target_value_std=0.23, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6362/8000 [1:29:47<1:34:14, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.11, train/loss=3.7, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.316, train/predicted_value_std=0.171, train/target_value_mean=-0.337, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6363/8000 [1:29:50<1:34:18, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.95, train/loss=3.44, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.384, train/predicted_value_std=0.209, train/target_value_mean=-0.386, train/target_value_std=0.263, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6364/8000 [1:29:54<1:36:46, 3.55s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.38, train/loss=3.95, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.255, train/predicted_value_std=0.109, train/target_value_mean=-0.192, train/target_value_std=0.156, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6365/8000 [1:29:58<1:35:52, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.81, train/loss=3.81, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.317, train/predicted_value_std=0.147, train/target_value_mean=-0.333, train/target_value_std=0.322, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6366/8000 [1:30:01<1:34:54, 3.49s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.2, train/loss=3.82, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.336, train/predicted_value_std=0.117, train/target_value_mean=-0.312, train/target_value_std=0.166, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6367/8000 [1:30:04<1:33:52, 3.45s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.3, train/loss=3.15, train/lr=5e-5, train/mae=0.0537, train/predicted_value_mean=-0.281, train/predicted_value_std=0.132, train/target_value_mean=-0.256, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6368/8000 [1:30:08<1:33:14, 3.43s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=8.4, train/loss=2.8, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.183, train/predicted_value_std=0.135, train/target_value_mean=-0.207, train/target_value_std=0.204, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6369/8000 [1:30:11<1:33:16, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.61, train/loss=3.35, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.314, train/predicted_value_std=0.184, train/target_value_mean=-0.254, train/target_value_std=0.267, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6370/8000 [1:30:15<1:32:33, 3.41s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.39, train/loss=3.32, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.261, train/predicted_value_std=0.205, train/target_value_mean=-0.285, train/target_value_std=0.271, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6371/8000 [1:30:18<1:31:58, 3.39s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.79, train/loss=3.31, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.345, train/predicted_value_std=0.184, train/target_value_mean=-0.326, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6372/8000 [1:30:21<1:31:48, 3.38s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.72, train/loss=4.13, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.365, train/predicted_value_std=0.152, train/target_value_mean=-0.408, train/target_value_std=0.202, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6373/8000 [1:30:25<1:32:24, 3.41s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.21, train/loss=3.3, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.339, train/predicted_value_std=0.186, train/target_value_mean=-0.355, train/target_value_std=0.243, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6374/8000 [1:30:28<1:33:08, 3.44s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.87, train/loss=4.16, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.286, train/predicted_value_std=0.173, train/target_value_mean=-0.357, train/target_value_std=0.262, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6375/8000 [1:30:32<1:33:40, 3.46s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.81, train/loss=3.69, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.254, train/predicted_value_std=0.103, train/target_value_mean=-0.282, train/target_value_std=0.0998, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6376/8000 [1:30:35<1:35:18, 3.52s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.62, train/loss=3.47, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.231, train/predicted_value_std=0.128, train/target_value_mean=-0.251, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6377/8000 [1:30:39<1:34:13, 3.48s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=8.73, train/loss=2.83, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.302, train/predicted_value_std=0.131, train/target_value_mean=-0.312, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6378/8000 [1:30:42<1:33:40, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.5, train/loss=3.37, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.283, train/predicted_value_std=0.108, train/target_value_mean=-0.195, train/target_value_std=0.159, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6379/8000 [1:30:46<1:33:31, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.89, train/loss=2.98, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.298, train/predicted_value_std=0.215, train/target_value_mean=-0.277, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6380/8000 [1:30:49<1:33:11, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10, train/loss=3.84, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.341, train/predicted_value_std=0.221, train/target_value_mean=-0.362, train/target_value_std=0.357, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6381/8000 [1:30:53<1:33:34, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.66, train/loss=3.81, train/lr=5e-5, train/mae=0.0944, train/predicted_value_mean=-0.346, train/predicted_value_std=0.0896, train/target_value_mean=-0.338, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6382/8000 [1:30:56<1:33:00, 3.45s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.31, train/loss=3.37, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.284, train/predicted_value_std=0.139, train/target_value_mean=-0.243, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6383/8000 [1:30:59<1:32:45, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.69, train/loss=3.83, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.33, train/predicted_value_std=0.122, train/target_value_mean=-0.335, train/target_value_std=0.155, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6384/8000 [1:31:03<1:32:49, 3.45s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.26, train/loss=3.71, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.272, train/predicted_value_std=0.186, train/target_value_mean=-0.227, train/target_value_std=0.207, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6385/8000 [1:31:06<1:32:50, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.15, train/loss=3.68, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.321, train/predicted_value_std=0.163, train/target_value_mean=-0.317, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6386/8000 [1:31:10<1:33:05, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=5.64, train/loss=3.27, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.292, train/predicted_value_std=0.13, train/target_value_mean=-0.26, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6387/8000 [1:31:13<1:33:12, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.63, train/loss=3.04, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.32, train/predicted_value_std=0.132, train/target_value_mean=-0.323, train/target_value_std=0.226, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6388/8000 [1:31:17<1:35:32, 3.56s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.6, train/loss=3.09, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.213, train/predicted_value_std=0.143, train/target_value_mean=-0.196, train/target_value_std=0.18, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6389/8000 [1:31:21<1:34:49, 3.53s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.16, train/loss=3.05, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.286, train/predicted_value_std=0.149, train/target_value_mean=-0.295, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6390/8000 [1:31:24<1:34:12, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=6.97, train/loss=3.26, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.283, train/predicted_value_std=0.0746, train/target_value_mean=-0.279, train/target_value_std=0.118, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6391/8000 [1:31:28<1:34:58, 3.54s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.1, train/loss=3.53, train/lr=5e-5, train/mae=0.19, train/predicted_value_mean=-0.32, train/predicted_value_std=0.144, train/target_value_mean=-0.287, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6392/8000 [1:31:31<1:34:14, 3.52s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.49, train/loss=3.56, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.335, train/predicted_value_std=0.218, train/target_value_mean=-0.351, train/target_value_std=0.252, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6393/8000 [1:31:35<1:33:52, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.4, train/loss=3.06, train/lr=5e-5, train/mae=0.0469, train/predicted_value_mean=-0.247, train/predicted_value_std=0.134, train/target_value_mean=-0.261, train/target_value_std=0.189, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6394/8000 [1:31:38<1:33:41, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.3, train/loss=3.6, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.335, train/predicted_value_std=0.195, train/target_value_mean=-0.353, train/target_value_std=0.243, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6395/8000 [1:31:42<1:33:27, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=9.2, train/loss=3.95, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.352, train/predicted_value_std=0.0849, train/target_value_mean=-0.332, train/target_value_std=0.115, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6396/8000 [1:31:45<1:33:16, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.62, train/loss=3.04, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.23, train/predicted_value_std=0.119, train/target_value_mean=-0.214, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6397/8000 [1:31:48<1:33:10, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=11.2, train/loss=3.77, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.305, train/predicted_value_std=0.151, train/target_value_mean=-0.295, train/target_value_std=0.234, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6398/8000 [1:31:52<1:33:05, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.57, train/loss=3.9, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.27, train/predicted_value_std=0.132, train/target_value_mean=-0.196, train/target_value_std=0.162, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6399/8000 [1:31:55<1:32:54, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.87, train/loss=3.47, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.246, train/predicted_value_std=0.13, train/target_value_mean=-0.307, train/target_value_std=0.221, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6400/8000 [1:31:59<1:35:08, 3.57s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.03, train/loss=3.43, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.343, train/predicted_value_std=0.186, train/target_value_mean=-0.329, train/target_value_std=0.234, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6401/8000 [1:32:03<1:34:16, 3.54s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10, train/loss=3.33, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.182, train/predicted_value_std=0.1, train/target_value_mean=-0.132, train/target_value_std=0.0876, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6402/8000 [1:32:06<1:33:57, 3.53s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.57, train/loss=3.23, train/lr=5e-5, train/mae=0.0897, train/predicted_value_mean=-0.326, train/predicted_value_std=0.245, train/target_value_mean=-0.347, train/target_value_std=0.309, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6403/8000 [1:32:10<1:33:24, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.77, train/loss=3.31, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.38, train/predicted_value_std=0.117, train/target_value_mean=-0.399, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6404/8000 [1:32:13<1:33:01, 3.50s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7, train/loss=3.43, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.308, train/predicted_value_std=0.199, train/target_value_mean=-0.252, train/target_value_std=0.157, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6405/8000 [1:32:17<1:32:38, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.7, train/loss=3.62, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.325, train/predicted_value_std=0.155, train/target_value_mean=-0.34, train/target_value_std=0.108, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6406/8000 [1:32:20<1:32:28, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.19, train/loss=3.39, train/lr=5e-5, train/mae=0.0631, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0769, train/target_value_mean=-0.305, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6407/8000 [1:32:24<1:32:20, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.39, train/loss=3.62, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.328, train/predicted_value_std=0.15, train/target_value_mean=-0.251, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6408/8000 [1:32:27<1:32:24, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=9.1, train/loss=3.22, train/lr=5e-5, train/mae=0.0444, train/predicted_value_mean=-0.212, train/predicted_value_std=0.0986, train/target_value_mean=-0.145, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6409/8000 [1:32:31<1:32:23, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.86, train/loss=3.31, train/lr=5e-5, train/mae=0.0391, train/predicted_value_mean=-0.261, train/predicted_value_std=0.119, train/target_value_mean=-0.236, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6410/8000 [1:32:34<1:32:20, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.5, train/loss=3.44, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.253, train/predicted_value_std=0.0881, train/target_value_mean=-0.254, train/target_value_std=0.0842, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6411/8000 [1:32:37<1:32:25, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.27, train/loss=3.62, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.316, train/predicted_value_std=0.165, train/target_value_mean=-0.303, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6412/8000 [1:32:41<1:34:33, 3.57s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=11.5, train/loss=3.02, train/lr=5e-5, train/mae=0.0559, train/predicted_value_mean=-0.342, train/predicted_value_std=0.228, train/target_value_mean=-0.301, train/target_value_std=0.218, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6413/8000 [1:32:45<1:33:39, 3.54s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.83, train/loss=4.15, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.365, train/predicted_value_std=0.0807, train/target_value_mean=-0.345, train/target_value_std=0.0913, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6414/8000 [1:32:48<1:33:09, 3.52s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.03, train/loss=3.07, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.295, train/predicted_value_std=0.226, train/target_value_mean=-0.253, train/target_value_std=0.222, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6415/8000 [1:32:52<1:32:51, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.22, train/loss=3.34, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.292, train/predicted_value_std=0.156, train/target_value_mean=-0.286, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6416/8000 [1:32:55<1:32:29, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=6.74, train/loss=4.3, train/lr=5e-5, train/mae=0.223, train/predicted_value_mean=-0.323, train/predicted_value_std=0.0966, train/target_value_mean=-0.248, train/target_value_std=0.13, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6417/8000 [1:32:59<1:32:04, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.64, train/loss=3.65, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0673, train/target_value_mean=-0.309, train/target_value_std=0.108, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6418/8000 [1:33:02<1:31:37, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=9.73, train/loss=2.93, train/lr=5e-5, train/mae=0.0322, train/predicted_value_mean=-0.27, train/predicted_value_std=0.106, train/target_value_mean=-0.241, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6419/8000 [1:33:06<1:31:07, 3.46s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.6, train/loss=3.6, train/lr=5e-5, train/mae=0.0716, train/predicted_value_mean=-0.296, train/predicted_value_std=0.186, train/target_value_mean=-0.303, train/target_value_std=0.242, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6420/8000 [1:33:09<1:30:54, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.89, train/loss=3.09, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.308, train/predicted_value_std=0.132, train/target_value_mean=-0.279, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6421/8000 [1:33:12<1:30:52, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.9, train/loss=3.66, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.289, train/predicted_value_std=0.183, train/target_value_mean=-0.319, train/target_value_std=0.184, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6422/8000 [1:33:16<1:31:10, 3.47s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.84, train/loss=3.51, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.311, train/predicted_value_std=0.16, train/target_value_mean=-0.254, train/target_value_std=0.173, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6423/8000 [1:33:19<1:30:52, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.64, train/loss=3.43, train/lr=5e-5, train/mae=0.0644, train/predicted_value_mean=-0.238, train/predicted_value_std=0.168, train/target_value_mean=-0.252, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6424/8000 [1:33:23<1:32:58, 3.54s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.68, train/loss=3.56, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.348, train/predicted_value_std=0.142, train/target_value_mean=-0.323, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6425/8000 [1:33:27<1:32:07, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.26, train/loss=3.27, train/lr=5e-5, train/mae=0.05, train/predicted_value_mean=-0.31, train/predicted_value_std=0.148, train/target_value_mean=-0.308, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6426/8000 [1:33:30<1:31:33, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.1, train/loss=4.08, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.332, train/predicted_value_std=0.103, train/target_value_mean=-0.391, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6427/8000 [1:33:33<1:31:14, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.62, train/loss=3.78, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.316, train/predicted_value_std=0.123, train/target_value_mean=-0.284, train/target_value_std=0.179, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6428/8000 [1:33:37<1:31:20, 3.49s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.64, train/loss=3.4, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.238, train/predicted_value_std=0.148, train/target_value_mean=-0.211, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6429/8000 [1:33:40<1:31:06, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=5.78, train/loss=3.2, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.216, train/predicted_value_std=0.127, train/target_value_mean=-0.197, train/target_value_std=0.167, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6430/8000 [1:33:44<1:31:07, 3.48s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.23, train/loss=4.17, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.365, train/predicted_value_std=0.212, train/target_value_mean=-0.335, train/target_value_std=0.285, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6431/8000 [1:33:47<1:30:42, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.61, train/loss=3.52, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.303, train/predicted_value_std=0.147, train/target_value_mean=-0.24, train/target_value_std=0.124, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6432/8000 [1:33:51<1:30:25, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.8, train/loss=3.58, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.292, train/predicted_value_std=0.0865, train/target_value_mean=-0.273, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6433/8000 [1:33:54<1:30:43, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.49, train/loss=3.43, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.292, train/predicted_value_std=0.152, train/target_value_mean=-0.317, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6434/8000 [1:33:58<1:31:00, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.99, train/loss=2.94, train/lr=5e-5, train/mae=0.0628, train/predicted_value_mean=-0.222, train/predicted_value_std=0.132, train/target_value_mean=-0.169, train/target_value_std=0.129, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6435/8000 [1:34:01<1:30:44, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.31, train/loss=3.62, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.271, train/predicted_value_std=0.116, train/target_value_mean=-0.222, train/target_value_std=0.158, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6436/8000 [1:34:05<1:32:54, 3.56s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=12.3, train/loss=3.15, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.237, train/predicted_value_std=0.0814, train/target_value_mean=-0.248, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6437/8000 [1:34:08<1:31:29, 3.51s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.84, train/loss=4.22, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.373, train/predicted_value_std=0.145, train/target_value_mean=-0.312, train/target_value_std=0.241, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6438/8000 [1:34:12<1:30:23, 3.47s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.78, train/loss=3.61, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.325, train/predicted_value_std=0.112, train/target_value_mean=-0.284, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6439/8000 [1:34:15<1:29:19, 3.43s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.51, train/loss=3.06, train/lr=5e-5, train/mae=0.05, train/predicted_value_mean=-0.219, train/predicted_value_std=0.124, train/target_value_mean=-0.161, train/target_value_std=0.0884, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 80%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6440/8000 [1:34:19<1:29:04, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.23, train/loss=3.41, train/lr=5e-5, train/mae=0.0947, train/predicted_value_mean=-0.349, train/predicted_value_std=0.0801, train/target_value_mean=-0.263, train/target_value_std=0.172, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6441/8000 [1:34:22<1:29:15, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.78, train/loss=3.56, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.243, train/predicted_value_std=0.131, train/target_value_mean=-0.206, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6442/8000 [1:34:25<1:29:19, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=13.7, train/loss=2.95, train/lr=5e-5, train/mae=0.0537, train/predicted_value_mean=-0.246, train/predicted_value_std=0.173, train/target_value_mean=-0.268, train/target_value_std=0.254, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6443/8000 [1:34:29<1:29:32, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.81, train/loss=3.87, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.326, train/predicted_value_std=0.0774, train/target_value_mean=-0.334, train/target_value_std=0.154, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6444/8000 [1:34:32<1:29:27, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.1, train/loss=3.56, train/lr=5e-5, train/mae=0.0734, train/predicted_value_mean=-0.322, train/predicted_value_std=0.151, train/target_value_mean=-0.348, train/target_value_std=0.269, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6445/8000 [1:34:36<1:29:37, 3.46s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.04, train/loss=3.35, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.3, train/predicted_value_std=0.137, train/target_value_mean=-0.291, train/target_value_std=0.18, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6446/8000 [1:34:39<1:29:45, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.94, train/loss=3.25, train/lr=5e-5, train/mae=0.0441, train/predicted_value_mean=-0.256, train/predicted_value_std=0.152, train/target_value_mean=-0.259, train/target_value_std=0.154, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6447/8000 [1:34:43<1:29:47, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.47, train/loss=3.15, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.224, train/predicted_value_std=0.136, train/target_value_mean=-0.205, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6448/8000 [1:34:47<1:32:11, 3.56s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.41, train/loss=3.23, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.304, train/predicted_value_std=0.111, train/target_value_mean=-0.335, train/target_value_std=0.158, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6449/8000 [1:34:50<1:31:20, 3.53s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.57, train/loss=3.23, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.299, train/predicted_value_std=0.146, train/target_value_mean=-0.231, train/target_value_std=0.215, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6450/8000 [1:34:54<1:30:57, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.37, train/loss=3.45, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.349, train/predicted_value_std=0.0549, train/target_value_mean=-0.328, train/target_value_std=0.184, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6451/8000 [1:34:57<1:30:26, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.36, train/loss=3.64, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.327, train/predicted_value_std=0.142, train/target_value_mean=-0.378, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6452/8000 [1:35:00<1:30:10, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.3, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.276, train/predicted_value_std=0.0949, train/target_value_mean=-0.293, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6453/8000 [1:35:04<1:29:58, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.73, train/loss=3.71, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.303, train/predicted_value_std=0.108, train/target_value_mean=-0.365, train/target_value_std=0.172, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6454/8000 [1:35:07<1:29:53, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.85, train/loss=3.44, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.39, train/predicted_value_std=0.208, train/target_value_mean=-0.323, train/target_value_std=0.256, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6455/8000 [1:35:11<1:29:45, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.55, train/loss=3.44, train/lr=5e-5, train/mae=0.0631, train/predicted_value_mean=-0.222, train/predicted_value_std=0.13, train/target_value_mean=-0.181, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6456/8000 [1:35:14<1:29:51, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=7.72, train/loss=3.3, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0548, train/target_value_mean=-0.347, train/target_value_std=0.0848, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6457/8000 [1:35:18<1:29:34, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.17, train/loss=2.74, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.216, train/predicted_value_std=0.121, train/target_value_mean=-0.202, train/target_value_std=0.141, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6458/8000 [1:35:21<1:29:32, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.56, train/loss=3.71, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.369, train/predicted_value_std=0.116, train/target_value_mean=-0.325, train/target_value_std=0.189, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6459/8000 [1:35:25<1:29:26, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.64, train/loss=3.88, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.267, train/predicted_value_std=0.132, train/target_value_mean=-0.271, train/target_value_std=0.232, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6460/8000 [1:35:29<1:31:28, 3.56s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.44, train/loss=3.2, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.288, train/predicted_value_std=0.201, train/target_value_mean=-0.318, train/target_value_std=0.304, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6461/8000 [1:35:32<1:30:40, 3.53s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.68, train/loss=3.43, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.273, train/predicted_value_std=0.0873, train/target_value_mean=-0.204, train/target_value_std=0.139, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6462/8000 [1:35:36<1:30:13, 3.52s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.36, train/loss=3.31, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.344, train/predicted_value_std=0.192, train/target_value_mean=-0.315, train/target_value_std=0.188, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6463/8000 [1:35:39<1:29:37, 3.50s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10.6, train/loss=3.08, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.28, train/predicted_value_std=0.119, train/target_value_mean=-0.283, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6464/8000 [1:35:42<1:29:08, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.75, train/loss=3.37, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.362, train/predicted_value_std=0.17, train/target_value_mean=-0.37, train/target_value_std=0.254, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6465/8000 [1:35:46<1:28:58, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=6.85, train/loss=4.2, train/lr=5e-5, train/mae=0.265, train/predicted_value_mean=-0.323, train/predicted_value_std=0.0986, train/target_value_mean=-0.319, train/target_value_std=0.0933, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6466/8000 [1:35:49<1:28:21, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.69, train/loss=3.98, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.365, train/predicted_value_std=0.125, train/target_value_mean=-0.326, train/target_value_std=0.276, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6467/8000 [1:35:53<1:27:25, 3.42s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.83, train/loss=3.39, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.279, train/predicted_value_std=0.115, train/target_value_mean=-0.261, train/target_value_std=0.198, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6468/8000 [1:35:56<1:27:12, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.85, train/loss=3.85, train/lr=5e-5, train/mae=0.212, train/predicted_value_mean=-0.318, train/predicted_value_std=0.113, train/target_value_mean=-0.268, train/target_value_std=0.163, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6469/8000 [1:35:59<1:27:07, 3.41s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.71, train/loss=4.19, train/lr=5e-5, train/mae=0.163, train/predicted_value_mean=-0.359, train/predicted_value_std=0.11, train/target_value_mean=-0.402, train/target_value_std=0.23, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6470/8000 [1:36:03<1:27:27, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.63, train/loss=3.38, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.296, train/predicted_value_std=0.156, train/target_value_mean=-0.256, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6471/8000 [1:36:06<1:27:36, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.91, train/loss=3.59, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.35, train/predicted_value_std=0.114, train/target_value_mean=-0.359, train/target_value_std=0.14, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6472/8000 [1:36:10<1:29:48, 3.53s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.59, train/loss=3.4, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.314, train/predicted_value_std=0.116, train/target_value_mean=-0.296, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6473/8000 [1:36:14<1:29:17, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=8.33, train/loss=3.51, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.353, train/predicted_value_std=0.139, train/target_value_mean=-0.319, train/target_value_std=0.193, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6474/8000 [1:36:17<1:29:09, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.1, train/loss=3.12, train/lr=5e-5, train/mae=0.0988, train/predicted_value_mean=-0.276, train/predicted_value_std=0.155, train/target_value_mean=-0.215, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6475/8000 [1:36:21<1:28:43, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=6.84, train/loss=2.75, train/lr=5e-5, train/mae=0.0644, train/predicted_value_mean=-0.261, train/predicted_value_std=0.178, train/target_value_mean=-0.223, train/target_value_std=0.219, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6476/8000 [1:36:24<1:28:34, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.77, train/loss=3.74, train/lr=5e-5, train/mae=0.213, train/predicted_value_mean=-0.325, train/predicted_value_std=0.132, train/target_value_mean=-0.395, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6477/8000 [1:36:27<1:28:01, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.72, train/loss=3.4, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.25, train/predicted_value_std=0.16, train/target_value_mean=-0.23, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6478/8000 [1:36:31<1:27:57, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=11.1, train/loss=2.38, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.312, train/predicted_value_std=0.261, train/target_value_mean=-0.265, train/target_value_std=0.242, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6479/8000 [1:36:34<1:27:34, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.36, train/loss=3.55, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.305, train/predicted_value_std=0.0585, train/target_value_mean=-0.259, train/target_value_std=0.0839, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6480/8000 [1:36:38<1:27:22, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=9.06, train/loss=2.87, train/lr=5e-5, train/mae=0.0397, train/predicted_value_mean=-0.222, train/predicted_value_std=0.0989, train/target_value_mean=-0.197, train/target_value_std=0.0806, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6481/8000 [1:36:41<1:27:17, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.3, train/loss=3.61, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.277, train/predicted_value_std=0.159, train/target_value_mean=-0.294, train/target_value_std=0.232, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6482/8000 [1:36:45<1:27:02, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.87, train/loss=3.87, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.272, train/predicted_value_std=0.129, train/target_value_mean=-0.288, train/target_value_std=0.194, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6483/8000 [1:36:48<1:26:57, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.73, train/loss=3.39, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.31, train/predicted_value_std=0.127, train/target_value_mean=-0.306, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6484/8000 [1:36:52<1:29:30, 3.54s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.12, train/loss=4.15, train/lr=5e-5, train/mae=0.23, train/predicted_value_mean=-0.328, train/predicted_value_std=0.0932, train/target_value_mean=-0.398, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6485/8000 [1:36:55<1:29:08, 3.53s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.55, train/loss=3.45, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.325, train/predicted_value_std=0.146, train/target_value_mean=-0.327, train/target_value_std=0.213, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6486/8000 [1:36:59<1:28:33, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=8.6, train/loss=3.16, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.233, train/predicted_value_std=0.103, train/target_value_mean=-0.227, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6487/8000 [1:37:02<1:28:23, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=11.3, train/loss=3.4, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.288, train/predicted_value_std=0.187, train/target_value_mean=-0.32, train/target_value_std=0.259, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6488/8000 [1:37:06<1:28:15, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.69, train/loss=3.28, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.233, train/predicted_value_std=0.14, train/target_value_mean=-0.198, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6489/8000 [1:37:09<1:27:57, 3.49s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.62, train/loss=3.39, train/lr=5e-5, train/mae=0.0697, train/predicted_value_mean=-0.268, train/predicted_value_std=0.126, train/target_value_mean=-0.285, train/target_value_std=0.113, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6490/8000 [1:37:13<1:27:52, 3.49s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.45, train/loss=3.43, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.273, train/predicted_value_std=0.106, train/target_value_mean=-0.208, train/target_value_std=0.125, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6491/8000 [1:37:16<1:27:22, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.21, train/loss=3.4, train/lr=5e-5, train/mae=0.0809, train/predicted_value_mean=-0.327, train/predicted_value_std=0.181, train/target_value_mean=-0.331, train/target_value_std=0.256, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6492/8000 [1:37:20<1:27:01, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.17, train/loss=2.85, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.217, train/predicted_value_std=0.0973, train/target_value_mean=-0.166, train/target_value_std=0.0896, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6493/8000 [1:37:23<1:26:12, 3.43s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.61, train/loss=3.59, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.323, train/predicted_value_std=0.111, train/target_value_mean=-0.285, train/target_value_std=0.172, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6494/8000 [1:37:26<1:25:59, 3.43s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.27, train/loss=3.45, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.261, train/predicted_value_std=0.131, train/target_value_mean=-0.242, train/target_value_std=0.18, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6495/8000 [1:37:30<1:26:00, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.5, train/cat_acc_neighbor=0.5, train/grad_norm=7.28, train/loss=2.99, train/lr=5e-5, train/mae=0.0544, train/predicted_value_mean=-0.314, train/predicted_value_std=0.16, train/target_value_mean=-0.268, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6496/8000 [1:37:33<1:27:23, 3.49s/it, time/step=3.62, time/training=3.62, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.48, train/loss=3.76, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.36, train/predicted_value_std=0.178, train/target_value_mean=-0.341, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6497/8000 [1:37:37<1:27:00, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.63, train/loss=3.65, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.353, train/predicted_value_std=0.165, train/target_value_mean=-0.342, train/target_value_std=0.23, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6498/8000 [1:37:40<1:26:51, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.35, train/loss=3.63, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.343, train/predicted_value_std=0.181, train/target_value_mean=-0.429, train/target_value_std=0.321, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6499/8000 [1:37:44<1:26:54, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=12.8, train/loss=3.7, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.284, train/predicted_value_std=0.129, train/target_value_mean=-0.333, train/target_value_std=0.181, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #1] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 81%|▊| 6500/8000 [1:43:02<40:44:10, 97.77s/it, time/step=318, time/training=3.48, time/evaluate=314, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.46, train/loss=3.16, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.269, train/predicted_value_std=0.189, train/target_value_mean=-0.215, train/target_value_std=0.176, train/value_spearman=0.5, eval/cat_acc_best=0.317, eval/cat_acc_neighbor=0.486, eval/loss=2.32, eval/mae=0.0409, eval/predicted_value_mean=-0.147, eval/predicted_value_std=0.00511, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.317, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.486, eval/stack_bowls_recap_rollout_rc/loss=2.32, eval/stack_bowls_recap_rollout_rc/mae=0.0409, eval/stack_bowls_recap_rollout_rc/predicted_val(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6501/8000 [1:43:05<28:55:47, 69.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=12.3, train/loss=3.37, train/lr=5e-5, train/mae=0.0662, train/predicted_value_mean=-0.318, train/predicted_value_std=0.18, train/target_value_mean=-0.253, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6502/8000 [1:43:09<20:40:03, 49.67s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.5, train/loss=3.5, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.351, train/predicted_value_std=0.17, train/target_value_mean=-0.327, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6503/8000 [1:43:12<14:53:15, 35.80s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.7, train/loss=2.73, train/lr=5e-5, train/mae=0.0444, train/predicted_value_mean=-0.273, train/predicted_value_std=0.197, train/target_value_mean=-0.245, train/target_value_std=0.188, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6504/8000 [1:43:15<10:50:35, 26.09s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.6, train/loss=4.07, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.408, train/predicted_value_std=0.1, train/target_value_mean=-0.456, train/target_value_std=0.156, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6505/8000 [1:43:19<8:00:48, 19.30s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.52, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.286, train/predicted_value_std=0.118, train/target_value_mean=-0.276, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6506/8000 [1:43:23<6:04:10, 14.63s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=11.4, train/loss=3.62, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.281, train/predicted_value_std=0.114, train/target_value_mean=-0.248, train/target_value_std=0.121, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6507/8000 [1:43:26<4:40:25, 11.27s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.98, train/loss=3.99, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.285, train/predicted_value_std=0.11, train/target_value_mean=-0.322, train/target_value_std=0.229, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6508/8000 [1:43:29<3:41:39, 8.91s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.01, train/loss=3.72, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.344, train/predicted_value_std=0.124, train/target_value_mean=-0.329, train/target_value_std=0.0624, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6509/8000 [1:43:33<3:00:29, 7.26s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.92, train/loss=3.35, train/lr=5e-5, train/mae=0.0534, train/predicted_value_mean=-0.238, train/predicted_value_std=0.13, train/target_value_mean=-0.24, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6510/8000 [1:43:36<2:31:51, 6.12s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.85, train/loss=2.87, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.24, train/predicted_value_std=0.189, train/target_value_mean=-0.272, train/target_value_std=0.265, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6511/8000 [1:43:40<2:11:50, 5.31s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.64, train/loss=3.45, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.294, train/predicted_value_std=0.157, train/target_value_mean=-0.3, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6512/8000 [1:43:43<1:57:54, 4.75s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.26, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.27, train/predicted_value_std=0.162, train/target_value_mean=-0.231, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6513/8000 [1:43:47<1:47:46, 4.35s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.66, train/loss=2.89, train/lr=5e-5, train/mae=0.0662, train/predicted_value_mean=-0.269, train/predicted_value_std=0.104, train/target_value_mean=-0.274, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6514/8000 [1:43:50<1:40:31, 4.06s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.06, train/loss=3.59, train/lr=5e-5, train/mae=0.0681, train/predicted_value_mean=-0.344, train/predicted_value_std=0.193, train/target_value_mean=-0.401, train/target_value_std=0.281, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6515/8000 [1:43:53<1:35:31, 3.86s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.83, train/loss=3.6, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.249, train/predicted_value_std=0.0899, train/target_value_mean=-0.226, train/target_value_std=0.0876, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6516/8000 [1:43:57<1:32:05, 3.72s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.37, train/loss=4.08, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.383, train/predicted_value_std=0.172, train/target_value_mean=-0.347, train/target_value_std=0.191, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6517/8000 [1:44:00<1:29:44, 3.63s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.32, train/loss=3.66, train/lr=5e-5, train/mae=0.0884, train/predicted_value_mean=-0.425, train/predicted_value_std=0.156, train/target_value_mean=-0.53, train/target_value_std=0.194, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6518/8000 [1:44:04<1:29:55, 3.64s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.96, train/loss=3.85, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.326, train/predicted_value_std=0.18, train/target_value_mean=-0.326, train/target_value_std=0.266, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 81%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6519/8000 [1:44:07<1:28:54, 3.60s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.32, train/loss=3.59, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.303, train/predicted_value_std=0.224, train/target_value_mean=-0.342, train/target_value_std=0.328, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6520/8000 [1:44:11<1:27:50, 3.56s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.57, train/loss=2.97, train/lr=5e-5, train/mae=0.0897, train/predicted_value_mean=-0.222, train/predicted_value_std=0.0962, train/target_value_mean=-0.212, train/target_value_std=0.154, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6521/8000 [1:44:14<1:27:08, 3.54s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.36, train/loss=3.39, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.29, train/predicted_value_std=0.188, train/target_value_mean=-0.302, train/target_value_std=0.25, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6522/8000 [1:44:18<1:26:31, 3.51s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.04, train/loss=3.62, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.279, train/predicted_value_std=0.0743, train/target_value_mean=-0.287, train/target_value_std=0.143, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6523/8000 [1:44:21<1:25:51, 3.49s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.1, train/loss=3.44, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.31, train/predicted_value_std=0.0915, train/target_value_mean=-0.335, train/target_value_std=0.094, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6524/8000 [1:44:25<1:25:29, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.05, train/loss=3.54, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.295, train/predicted_value_std=0.192, train/target_value_mean=-0.328, train/target_value_std=0.234, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6525/8000 [1:44:28<1:25:04, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.84, train/loss=3.2, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.281, train/predicted_value_std=0.179, train/target_value_mean=-0.236, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6526/8000 [1:44:31<1:24:46, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.34, train/loss=3.75, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.324, train/predicted_value_std=0.158, train/target_value_mean=-0.229, train/target_value_std=0.134, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6527/8000 [1:44:35<1:24:49, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.38, train/loss=3.31, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.367, train/predicted_value_std=0.116, train/target_value_mean=-0.377, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6528/8000 [1:44:38<1:24:49, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.27, train/loss=3.51, train/lr=5e-5, train/mae=0.0512, train/predicted_value_mean=-0.313, train/predicted_value_std=0.156, train/target_value_mean=-0.267, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6529/8000 [1:44:42<1:24:49, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.34, train/loss=3.62, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.296, train/predicted_value_std=0.241, train/target_value_mean=-0.306, train/target_value_std=0.271, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6530/8000 [1:44:46<1:27:01, 3.55s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.04, train/loss=3.57, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0903, train/target_value_mean=-0.281, train/target_value_std=0.0904, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6531/8000 [1:44:49<1:26:11, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.62, train/loss=4.22, train/lr=5e-5, train/mae=0.211, train/predicted_value_mean=-0.329, train/predicted_value_std=0.141, train/target_value_mean=-0.374, train/target_value_std=0.259, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6532/8000 [1:44:53<1:25:30, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.93, train/loss=3.54, train/lr=5e-5, train/mae=0.0612, train/predicted_value_mean=-0.278, train/predicted_value_std=0.172, train/target_value_mean=-0.283, train/target_value_std=0.218, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6533/8000 [1:44:56<1:25:08, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.62, train/loss=3.31, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.353, train/predicted_value_std=0.19, train/target_value_mean=-0.352, train/target_value_std=0.254, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6534/8000 [1:44:59<1:24:50, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.53, train/loss=4.11, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.368, train/predicted_value_std=0.177, train/target_value_mean=-0.346, train/target_value_std=0.227, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6535/8000 [1:45:03<1:24:49, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=20.8, train/loss=3.64, train/lr=5e-5, train/mae=0.0978, train/predicted_value_mean=-0.254, train/predicted_value_std=0.165, train/target_value_mean=-0.193, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6536/8000 [1:45:06<1:24:44, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.59, train/loss=3.68, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.319, train/predicted_value_std=0.161, train/target_value_mean=-0.335, train/target_value_std=0.243, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6537/8000 [1:45:10<1:24:42, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.26, train/loss=3.62, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.297, train/predicted_value_std=0.136, train/target_value_mean=-0.302, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6538/8000 [1:45:13<1:24:32, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.25, train/loss=3.03, train/lr=5e-5, train/mae=0.0825, train/predicted_value_mean=-0.261, train/predicted_value_std=0.167, train/target_value_mean=-0.199, train/target_value_std=0.144, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6539/8000 [1:45:17<1:24:22, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.62, train/loss=3.34, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.303, train/predicted_value_std=0.232, train/target_value_mean=-0.321, train/target_value_std=0.281, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6540/8000 [1:45:20<1:24:10, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.57, train/loss=3.4, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.272, train/predicted_value_std=0.0881, train/target_value_mean=-0.24, train/target_value_std=0.121, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6541/8000 [1:45:24<1:24:12, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.99, train/loss=3.36, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.307, train/predicted_value_std=0.139, train/target_value_mean=-0.262, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6542/8000 [1:45:27<1:26:07, 3.54s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.16, train/loss=3.89, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.332, train/predicted_value_std=0.0843, train/target_value_mean=-0.295, train/target_value_std=0.116, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6543/8000 [1:45:31<1:25:15, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.6, train/loss=3.48, train/lr=5e-5, train/mae=0.0584, train/predicted_value_mean=-0.346, train/predicted_value_std=0.173, train/target_value_mean=-0.33, train/target_value_std=0.179, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6544/8000 [1:45:34<1:24:42, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.1, train/loss=2.97, train/lr=5e-5, train/mae=0.0553, train/predicted_value_mean=-0.222, train/predicted_value_std=0.13, train/target_value_mean=-0.17, train/target_value_std=0.162, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6545/8000 [1:45:38<1:24:05, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.29, train/loss=3.55, train/lr=5e-5, train/mae=0.0709, train/predicted_value_mean=-0.298, train/predicted_value_std=0.0681, train/target_value_mean=-0.305, train/target_value_std=0.147, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6546/8000 [1:45:41<1:23:39, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.08, train/loss=3.67, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.281, train/predicted_value_std=0.116, train/target_value_mean=-0.241, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6547/8000 [1:45:45<1:23:22, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.25, train/loss=4.14, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.381, train/predicted_value_std=0.104, train/target_value_mean=-0.459, train/target_value_std=0.189, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6548/8000 [1:45:48<1:23:11, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=6.43, train/loss=2.77, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.343, train/predicted_value_std=0.213, train/target_value_mean=-0.351, train/target_value_std=0.271, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6549/8000 [1:45:51<1:22:54, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.26, train/loss=3.52, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.289, train/predicted_value_std=0.157, train/target_value_mean=-0.22, train/target_value_std=0.133, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6550/8000 [1:45:55<1:22:48, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.04, train/loss=4.01, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.302, train/predicted_value_std=0.129, train/target_value_mean=-0.245, train/target_value_std=0.229, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6551/8000 [1:45:58<1:22:38, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=11.3, train/loss=2.93, train/lr=5e-5, train/mae=0.0266, train/predicted_value_mean=-0.316, train/predicted_value_std=0.0931, train/target_value_mean=-0.295, train/target_value_std=0.0845, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6552/8000 [1:46:02<1:22:31, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.88, train/loss=3.34, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0927, train/target_value_mean=-0.171, train/target_value_std=0.106, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6553/8000 [1:46:05<1:22:23, 3.42s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.29, train/loss=3.67, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.352, train/predicted_value_std=0.153, train/target_value_mean=-0.315, train/target_value_std=0.115, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6554/8000 [1:46:09<1:25:01, 3.53s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.75, train/loss=3.74, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.275, train/predicted_value_std=0.144, train/target_value_mean=-0.311, train/target_value_std=0.261, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6555/8000 [1:46:12<1:24:16, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.73, train/loss=3.91, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.299, train/predicted_value_std=0.192, train/target_value_mean=-0.303, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6556/8000 [1:46:16<1:23:34, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=9.18, train/loss=3.1, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.315, train/predicted_value_std=0.174, train/target_value_mean=-0.243, train/target_value_std=0.231, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6557/8000 [1:46:19<1:23:02, 3.45s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.02, train/loss=3.6, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.297, train/predicted_value_std=0.102, train/target_value_mean=-0.219, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6558/8000 [1:46:22<1:22:26, 3.43s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=7.66, train/loss=2.67, train/lr=5e-5, train/mae=0.0191, train/predicted_value_mean=-0.252, train/predicted_value_std=0.136, train/target_value_mean=-0.217, train/target_value_std=0.174, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6559/8000 [1:46:26<1:21:56, 3.41s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.45, train/loss=3.96, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.464, train/predicted_value_std=0.136, train/target_value_mean=-0.47, train/target_value_std=0.263, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6560/8000 [1:46:29<1:21:42, 3.40s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.97, train/loss=3.22, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.269, train/predicted_value_std=0.139, train/target_value_mean=-0.226, train/target_value_std=0.147, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6561/8000 [1:46:33<1:22:49, 3.45s/it, time/step=3.57, time/training=3.56, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.23, train/loss=3.89, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.377, train/predicted_value_std=0.166, train/target_value_mean=-0.364, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6562/8000 [1:46:36<1:22:32, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=8.44, train/loss=3.35, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.321, train/predicted_value_std=0.159, train/target_value_mean=-0.318, train/target_value_std=0.225, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6563/8000 [1:46:40<1:22:30, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.73, train/loss=2.97, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.281, train/predicted_value_std=0.113, train/target_value_mean=-0.215, train/target_value_std=0.139, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6564/8000 [1:46:43<1:22:34, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.81, train/loss=4.03, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0805, train/target_value_mean=-0.221, train/target_value_std=0.0989, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6565/8000 [1:46:47<1:22:22, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.82, train/loss=3.51, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.299, train/predicted_value_std=0.106, train/target_value_mean=-0.286, train/target_value_std=0.0981, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6566/8000 [1:46:50<1:23:56, 3.51s/it, time/step=3.67, time/training=3.67, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.68, train/loss=2.97, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.235, train/predicted_value_std=0.118, train/target_value_mean=-0.244, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6567/8000 [1:46:54<1:23:17, 3.49s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.89, train/loss=3.48, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.242, train/predicted_value_std=0.126, train/target_value_mean=-0.226, train/target_value_std=0.136, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6568/8000 [1:46:57<1:22:50, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.25, train/loss=3.06, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.295, train/predicted_value_std=0.0627, train/target_value_mean=-0.316, train/target_value_std=0.0823, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6569/8000 [1:47:01<1:22:30, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=14, train/loss=2.83, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.211, train/predicted_value_std=0.081, train/target_value_mean=-0.128, train/target_value_std=0.079, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6570/8000 [1:47:04<1:22:22, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.7, train/loss=3.48, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.327, train/predicted_value_std=0.117, train/target_value_mean=-0.316, train/target_value_std=0.162, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6571/8000 [1:47:07<1:22:36, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.24, train/loss=3.58, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.375, train/predicted_value_std=0.176, train/target_value_mean=-0.341, train/target_value_std=0.157, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6572/8000 [1:47:11<1:22:20, 3.46s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7, train/loss=4.02, train/lr=5e-5, train/mae=0.232, train/predicted_value_mean=-0.284, train/predicted_value_std=0.159, train/target_value_mean=-0.35, train/target_value_std=0.324, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6573/8000 [1:47:14<1:22:17, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.07, train/loss=3.79, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.302, train/predicted_value_std=0.144, train/target_value_mean=-0.317, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6574/8000 [1:47:18<1:22:12, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.71, train/loss=3.64, train/lr=5e-5, train/mae=0.0616, train/predicted_value_mean=-0.278, train/predicted_value_std=0.0904, train/target_value_mean=-0.21, train/target_value_std=0.126, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6575/8000 [1:47:21<1:22:08, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.76, train/loss=3.35, train/lr=5e-5, train/mae=0.0822, train/predicted_value_mean=-0.321, train/predicted_value_std=0.201, train/target_value_mean=-0.352, train/target_value_std=0.329, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6576/8000 [1:47:25<1:22:42, 3.49s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.43, train/loss=3.82, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.277, train/predicted_value_std=0.166, train/target_value_mean=-0.252, train/target_value_std=0.249, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6577/8000 [1:47:28<1:23:10, 3.51s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.36, train/loss=3.06, train/lr=5e-5, train/mae=0.0825, train/predicted_value_mean=-0.339, train/predicted_value_std=0.128, train/target_value_mean=-0.423, train/target_value_std=0.19, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6578/8000 [1:47:32<1:24:32, 3.57s/it, time/step=3.71, time/training=3.7, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.13, train/loss=3.2, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.282, train/predicted_value_std=0.169, train/target_value_mean=-0.322, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6579/8000 [1:47:36<1:23:39, 3.53s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.54, train/loss=3.51, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.334, train/predicted_value_std=0.193, train/target_value_mean=-0.362, train/target_value_std=0.255, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6580/8000 [1:47:39<1:22:54, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.61, train/loss=3.07, train/lr=5e-5, train/mae=0.0403, train/predicted_value_mean=-0.28, train/predicted_value_std=0.126, train/target_value_mean=-0.237, train/target_value_std=0.0997, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6581/8000 [1:47:42<1:22:13, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.72, train/loss=3.11, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.266, train/predicted_value_std=0.172, train/target_value_mean=-0.245, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6582/8000 [1:47:46<1:21:10, 3.43s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.33, train/loss=4.01, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.385, train/predicted_value_std=0.182, train/target_value_mean=-0.372, train/target_value_std=0.277, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6583/8000 [1:47:49<1:20:35, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.38, train/loss=3.48, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.33, train/predicted_value_std=0.171, train/target_value_mean=-0.292, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6584/8000 [1:47:52<1:20:20, 3.40s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.9, train/loss=3.63, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.283, train/predicted_value_std=0.101, train/target_value_mean=-0.276, train/target_value_std=0.135, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6585/8000 [1:47:56<1:20:33, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.41, train/loss=3.46, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.341, train/predicted_value_std=0.142, train/target_value_mean=-0.333, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6586/8000 [1:47:59<1:20:32, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.42, train/loss=4.04, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.368, train/predicted_value_std=0.127, train/target_value_mean=-0.44, train/target_value_std=0.149, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6587/8000 [1:48:03<1:20:38, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=9.85, train/loss=3.63, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.316, train/predicted_value_std=0.065, train/target_value_mean=-0.279, train/target_value_std=0.128, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6588/8000 [1:48:06<1:20:48, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.85, train/loss=2.83, train/lr=5e-5, train/mae=0.0878, train/predicted_value_mean=-0.274, train/predicted_value_std=0.137, train/target_value_mean=-0.258, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6589/8000 [1:48:10<1:21:00, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.36, train/loss=3.39, train/lr=5e-5, train/mae=0.0603, train/predicted_value_mean=-0.305, train/predicted_value_std=0.125, train/target_value_mean=-0.294, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6590/8000 [1:48:13<1:23:11, 3.54s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=12, train/loss=3.5, train/lr=5e-5, train/mae=0.0553, train/predicted_value_mean=-0.252, train/predicted_value_std=0.149, train/target_value_mean=-0.251, train/target_value_std=0.223, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6591/8000 [1:48:17<1:22:35, 3.52s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.15, train/loss=3.73, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.276, train/predicted_value_std=0.149, train/target_value_mean=-0.216, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6592/8000 [1:48:20<1:22:04, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.4, train/loss=3.95, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.338, train/predicted_value_std=0.127, train/target_value_mean=-0.303, train/target_value_std=0.203, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6593/8000 [1:48:24<1:21:44, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.4, train/loss=2.93, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.246, train/predicted_value_std=0.168, train/target_value_mean=-0.228, train/target_value_std=0.257, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6594/8000 [1:48:27<1:21:24, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.9, train/loss=3.39, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.277, train/predicted_value_std=0.0947, train/target_value_mean=-0.256, train/target_value_std=0.153, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6595/8000 [1:48:31<1:21:09, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.66, train/loss=3.52, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.286, train/predicted_value_std=0.144, train/target_value_mean=-0.296, train/target_value_std=0.206, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6596/8000 [1:48:34<1:21:01, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.71, train/loss=3.34, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.318, train/predicted_value_std=0.128, train/target_value_mean=-0.284, train/target_value_std=0.157, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6597/8000 [1:48:38<1:21:47, 3.50s/it, time/step=3.58, time/training=3.57, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.43, train/loss=3.76, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.287, train/predicted_value_std=0.118, train/target_value_mean=-0.319, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6598/8000 [1:48:41<1:21:44, 3.50s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.82, train/loss=3.76, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.273, train/predicted_value_std=0.109, train/target_value_mean=-0.265, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6599/8000 [1:48:45<1:21:21, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.562, train/grad_norm=8, train/loss=2.92, train/lr=5e-5, train/mae=0.0522, train/predicted_value_mean=-0.232, train/predicted_value_std=0.226, train/target_value_mean=-0.227, train/target_value_std=0.261, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 82%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6600/8000 [1:48:48<1:21:08, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.79, train/loss=3.51, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.287, train/predicted_value_std=0.21, train/target_value_mean=-0.344, train/target_value_std=0.284, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6601/8000 [1:48:52<1:20:57, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.94, train/loss=3.44, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.272, train/predicted_value_std=0.113, train/target_value_mean=-0.233, train/target_value_std=0.177, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6602/8000 [1:48:55<1:22:58, 3.56s/it, time/step=3.77, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.28, train/loss=3.76, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.258, train/predicted_value_std=0.124, train/target_value_mean=-0.283, train/target_value_std=0.133, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6603/8000 [1:48:59<1:22:12, 3.53s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.29, train/loss=3.61, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.318, train/predicted_value_std=0.148, train/target_value_mean=-0.285, train/target_value_std=0.127, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6604/8000 [1:49:02<1:21:43, 3.51s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.31, train/loss=3.43, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.283, train/predicted_value_std=0.103, train/target_value_mean=-0.267, train/target_value_std=0.0979, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6605/8000 [1:49:06<1:21:17, 3.50s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.05, train/loss=3.2, train/lr=5e-5, train/mae=0.0344, train/predicted_value_mean=-0.258, train/predicted_value_std=0.129, train/target_value_mean=-0.23, train/target_value_std=0.125, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6606/8000 [1:49:09<1:20:56, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.74, train/loss=3.88, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.312, train/predicted_value_std=0.0802, train/target_value_mean=-0.285, train/target_value_std=0.116, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6607/8000 [1:49:13<1:20:38, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.65, train/loss=3.24, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.253, train/predicted_value_std=0.154, train/target_value_mean=-0.237, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6608/8000 [1:49:16<1:21:20, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=7.62, train/loss=3.23, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.325, train/predicted_value_std=0.182, train/target_value_mean=-0.254, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6609/8000 [1:49:20<1:23:05, 3.58s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.36, train/loss=3.67, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.343, train/predicted_value_std=0.151, train/target_value_mean=-0.376, train/target_value_std=0.235, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6610/8000 [1:49:24<1:22:25, 3.56s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.97, train/loss=3.09, train/lr=5e-5, train/mae=0.0431, train/predicted_value_mean=-0.321, train/predicted_value_std=0.169, train/target_value_mean=-0.288, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6611/8000 [1:49:27<1:21:38, 3.53s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.76, train/loss=3.61, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.318, train/predicted_value_std=0.173, train/target_value_mean=-0.348, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6612/8000 [1:49:30<1:21:00, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=5.88, train/loss=3.54, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.27, train/predicted_value_std=0.17, train/target_value_mean=-0.25, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6613/8000 [1:49:34<1:20:41, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.98, train/loss=3.71, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.299, train/predicted_value_std=0.094, train/target_value_mean=-0.249, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6614/8000 [1:49:38<1:22:32, 3.57s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=6.08, train/loss=3.8, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.338, train/predicted_value_std=0.084, train/target_value_mean=-0.323, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6615/8000 [1:49:41<1:21:47, 3.54s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.47, train/loss=3.41, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.338, train/predicted_value_std=0.134, train/target_value_mean=-0.309, train/target_value_std=0.148, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6616/8000 [1:49:45<1:21:17, 3.52s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.79, train/loss=3.68, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.425, train/predicted_value_std=0.113, train/target_value_mean=-0.422, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6617/8000 [1:49:48<1:20:51, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.94, train/loss=3.23, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.293, train/predicted_value_std=0.142, train/target_value_mean=-0.287, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6618/8000 [1:49:52<1:20:15, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.89, train/loss=3.87, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.262, train/predicted_value_std=0.0986, train/target_value_mean=-0.265, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6619/8000 [1:49:55<1:19:46, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.63, train/loss=2.94, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.268, train/predicted_value_std=0.165, train/target_value_mean=-0.255, train/target_value_std=0.249, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6620/8000 [1:49:58<1:19:34, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.7, train/loss=3.83, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.255, train/predicted_value_std=0.081, train/target_value_mean=-0.311, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6621/8000 [1:50:02<1:19:36, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.73, train/loss=2.98, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.267, train/predicted_value_std=0.241, train/target_value_mean=-0.208, train/target_value_std=0.24, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6622/8000 [1:50:05<1:19:34, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.71, train/loss=3.58, train/lr=5e-5, train/mae=0.0778, train/predicted_value_mean=-0.289, train/predicted_value_std=0.166, train/target_value_mean=-0.257, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6623/8000 [1:50:09<1:19:37, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=10.5, train/loss=3.6, train/lr=5e-5, train/mae=0.185, train/predicted_value_mean=-0.344, train/predicted_value_std=0.216, train/target_value_mean=-0.347, train/target_value_std=0.33, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6624/8000 [1:50:12<1:19:31, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.86, train/loss=3.36, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.295, train/predicted_value_std=0.173, train/target_value_mean=-0.278, train/target_value_std=0.185, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6625/8000 [1:50:16<1:19:13, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.29, train/lr=5e-5, train/mae=0.0534, train/predicted_value_mean=-0.298, train/predicted_value_std=0.124, train/target_value_mean=-0.263, train/target_value_std=0.137, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6626/8000 [1:50:19<1:20:45, 3.53s/it, time/step=3.69, time/training=3.68, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.73, train/loss=4.21, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.341, train/predicted_value_std=0.123, train/target_value_mean=-0.222, train/target_value_std=0.165, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6627/8000 [1:50:23<1:19:57, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=9.81, train/loss=3.12, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.322, train/predicted_value_std=0.193, train/target_value_mean=-0.323, train/target_value_std=0.284, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6628/8000 [1:50:26<1:19:25, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.11, train/loss=3.65, train/lr=5e-5, train/mae=0.218, train/predicted_value_mean=-0.364, train/predicted_value_std=0.187, train/target_value_mean=-0.34, train/target_value_std=0.26, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6629/8000 [1:50:30<1:18:59, 3.46s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=9.35, train/loss=3.14, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.273, train/predicted_value_std=0.128, train/target_value_mean=-0.276, train/target_value_std=0.2, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6630/8000 [1:50:33<1:18:46, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.4, train/loss=3.4, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.298, train/predicted_value_std=0.171, train/target_value_mean=-0.257, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6631/8000 [1:50:37<1:18:36, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.5, train/loss=4.02, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.3, train/predicted_value_std=0.0736, train/target_value_mean=-0.262, train/target_value_std=0.104, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6632/8000 [1:50:40<1:18:31, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.79, train/loss=3.52, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.268, train/predicted_value_std=0.153, train/target_value_mean=-0.232, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6633/8000 [1:50:43<1:18:40, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.11, train/loss=2.6, train/lr=5e-5, train/mae=0.0397, train/predicted_value_mean=-0.258, train/predicted_value_std=0.177, train/target_value_mean=-0.242, train/target_value_std=0.225, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6634/8000 [1:50:47<1:18:45, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.83, train/loss=3.58, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.284, train/predicted_value_std=0.146, train/target_value_mean=-0.265, train/target_value_std=0.249, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6635/8000 [1:50:50<1:18:43, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=10.1, train/loss=2.81, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.244, train/predicted_value_std=0.204, train/target_value_mean=-0.241, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6636/8000 [1:50:54<1:18:46, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.96, train/loss=3.68, train/lr=5e-5, train/mae=0.21, train/predicted_value_mean=-0.301, train/predicted_value_std=0.147, train/target_value_mean=-0.33, train/target_value_std=0.18, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6637/8000 [1:50:57<1:18:37, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.87, train/loss=3.23, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.336, train/predicted_value_std=0.101, train/target_value_mean=-0.335, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6638/8000 [1:51:01<1:20:34, 3.55s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.4, train/loss=3.87, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.249, train/predicted_value_std=0.12, train/target_value_mean=-0.244, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6639/8000 [1:51:05<1:20:04, 3.53s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.45, train/loss=3.62, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.296, train/predicted_value_std=0.165, train/target_value_mean=-0.333, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6640/8000 [1:51:08<1:19:46, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.66, train/loss=3.87, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.265, train/predicted_value_std=0.0974, train/target_value_mean=-0.283, train/target_value_std=0.123, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6641/8000 [1:51:12<1:19:35, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.09, train/loss=3.33, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.355, train/predicted_value_std=0.149, train/target_value_mean=-0.315, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6642/8000 [1:51:15<1:18:53, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.18, train/loss=3.68, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.271, train/predicted_value_std=0.1, train/target_value_mean=-0.268, train/target_value_std=0.128, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6643/8000 [1:51:19<1:19:11, 3.50s/it, time/step=3.54, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.6, train/loss=2.87, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.325, train/predicted_value_std=0.131, train/target_value_mean=-0.289, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6644/8000 [1:51:22<1:18:34, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.11, train/loss=3.82, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.284, train/predicted_value_std=0.164, train/target_value_mean=-0.306, train/target_value_std=0.291, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6645/8000 [1:51:25<1:18:10, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.98, train/loss=3.38, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.39, train/predicted_value_std=0.166, train/target_value_mean=-0.398, train/target_value_std=0.302, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6646/8000 [1:51:29<1:17:54, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.14, train/loss=2.9, train/lr=5e-5, train/mae=0.0763, train/predicted_value_mean=-0.26, train/predicted_value_std=0.09, train/target_value_mean=-0.224, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6647/8000 [1:51:32<1:17:34, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.89, train/loss=3.24, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.313, train/predicted_value_std=0.131, train/target_value_mean=-0.287, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6648/8000 [1:51:36<1:17:26, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.18, train/loss=3.46, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.457, train/predicted_value_std=0.1, train/target_value_mean=-0.439, train/target_value_std=0.121, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6649/8000 [1:51:39<1:17:30, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.11, train/loss=3.17, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.252, train/predicted_value_std=0.138, train/target_value_mean=-0.303, train/target_value_std=0.165, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6650/8000 [1:51:43<1:19:25, 3.53s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.3, train/loss=3.44, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.284, train/predicted_value_std=0.0783, train/target_value_mean=-0.328, train/target_value_std=0.14, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6651/8000 [1:51:46<1:18:43, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11, train/loss=3.28, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.227, train/predicted_value_std=0.153, train/target_value_mean=-0.177, train/target_value_std=0.119, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6652/8000 [1:51:50<1:18:15, 3.48s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.15, train/loss=3.55, train/lr=5e-5, train/mae=0.0497, train/predicted_value_mean=-0.274, train/predicted_value_std=0.144, train/target_value_mean=-0.32, train/target_value_std=0.236, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6653/8000 [1:51:53<1:17:54, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.95, train/loss=4.11, train/lr=5e-5, train/mae=0.227, train/predicted_value_mean=-0.341, train/predicted_value_std=0.0744, train/target_value_mean=-0.357, train/target_value_std=0.245, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6654/8000 [1:51:57<1:17:37, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=6.74, train/loss=4.13, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.351, train/predicted_value_std=0.13, train/target_value_mean=-0.36, train/target_value_std=0.134, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6655/8000 [1:52:00<1:17:28, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.4, train/loss=3.67, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.331, train/predicted_value_std=0.132, train/target_value_mean=-0.37, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6656/8000 [1:52:03<1:17:24, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.88, train/loss=3.48, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.357, train/predicted_value_std=0.11, train/target_value_mean=-0.356, train/target_value_std=0.201, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6657/8000 [1:52:07<1:17:21, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.29, train/loss=3.61, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.254, train/predicted_value_std=0.0933, train/target_value_mean=-0.2, train/target_value_std=0.115, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6658/8000 [1:52:10<1:17:21, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.89, train/loss=3.32, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.281, train/predicted_value_std=0.109, train/target_value_mean=-0.289, train/target_value_std=0.175, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6659/8000 [1:52:14<1:17:19, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.64, train/loss=3.13, train/lr=5e-5, train/mae=0.0634, train/predicted_value_mean=-0.273, train/predicted_value_std=0.17, train/target_value_mean=-0.294, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6660/8000 [1:52:17<1:17:15, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.3, train/loss=3.65, train/lr=5e-5, train/mae=0.0666, train/predicted_value_mean=-0.273, train/predicted_value_std=0.119, train/target_value_mean=-0.245, train/target_value_std=0.135, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6661/8000 [1:52:21<1:17:02, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.1, train/loss=3.83, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.316, train/predicted_value_std=0.135, train/target_value_mean=-0.253, train/target_value_std=0.168, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6662/8000 [1:52:24<1:18:58, 3.54s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10, train/loss=4.16, train/lr=5e-5, train/mae=0.182, train/predicted_value_mean=-0.332, train/predicted_value_std=0.132, train/target_value_mean=-0.277, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6663/8000 [1:52:28<1:18:17, 3.51s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.24, train/loss=2.78, train/lr=5e-5, train/mae=0.0391, train/predicted_value_mean=-0.189, train/predicted_value_std=0.12, train/target_value_mean=-0.153, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6664/8000 [1:52:31<1:17:53, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.92, train/loss=3.06, train/lr=5e-5, train/mae=0.0562, train/predicted_value_mean=-0.258, train/predicted_value_std=0.157, train/target_value_mean=-0.231, train/target_value_std=0.18, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6665/8000 [1:52:35<1:17:33, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.3, train/loss=3.43, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.242, train/predicted_value_std=0.213, train/target_value_mean=-0.22, train/target_value_std=0.238, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO +(ActorGroup(rank=0) pid=3732960) :rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6666/8000 [1:52:38<1:17:30, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.11, train/loss=3.28, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.268, train/predicted_value_std=0.233, train/target_value_mean=-0.267, train/target_value_std=0.25, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6667/8000 [1:52:42<1:17:13, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.37, train/loss=3.58, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.364, train/predicted_value_std=0.121, train/target_value_mean=-0.387, train/target_value_std=0.194, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6668/8000 [1:52:45<1:17:03, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.54, train/loss=4.1, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.299, train/predicted_value_std=0.0478, train/target_value_mean=-0.276, train/target_value_std=0.105, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6669/8000 [1:52:49<1:16:59, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.07, train/loss=3.48, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.26, train/predicted_value_std=0.196, train/target_value_mean=-0.232, train/target_value_std=0.241, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6670/8000 [1:52:52<1:16:59, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.47, train/loss=3.69, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.286, train/predicted_value_std=0.119, train/target_value_mean=-0.273, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6671/8000 [1:52:56<1:16:51, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.27, train/loss=3.34, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.307, train/predicted_value_std=0.105, train/target_value_mean=-0.274, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6672/8000 [1:52:59<1:16:46, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.22, train/loss=3.12, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.218, train/predicted_value_std=0.0853, train/target_value_mean=-0.219, train/target_value_std=0.109, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6673/8000 [1:53:03<1:16:39, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.1, train/loss=3.87, train/lr=5e-5, train/mae=0.217, train/predicted_value_mean=-0.357, train/predicted_value_std=0.098, train/target_value_mean=-0.377, train/target_value_std=0.195, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6674/8000 [1:53:06<1:18:28, 3.55s/it, time/step=3.75, time/training=3.74, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.01, train/loss=3.38, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.253, train/predicted_value_std=0.089, train/target_value_mean=-0.275, train/target_value_std=0.0805, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6675/8000 [1:53:10<1:18:04, 3.54s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.75, train/loss=3.83, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.29, train/predicted_value_std=0.15, train/target_value_mean=-0.22, train/target_value_std=0.161, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6676/8000 [1:53:13<1:17:33, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=9.34, train/loss=2.74, train/lr=5e-5, train/mae=0.0444, train/predicted_value_mean=-0.223, train/predicted_value_std=0.137, train/target_value_mean=-0.196, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6677/8000 [1:53:17<1:17:05, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.31, train/loss=3.31, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.333, train/predicted_value_std=0.199, train/target_value_mean=-0.338, train/target_value_std=0.239, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6678/8000 [1:53:20<1:16:39, 3.48s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.35, train/loss=3.4, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.268, train/predicted_value_std=0.18, train/target_value_mean=-0.254, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 83%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6679/8000 [1:53:24<1:16:16, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.76, train/loss=3.06, train/lr=5e-5, train/mae=0.0869, train/predicted_value_mean=-0.265, train/predicted_value_std=0.11, train/target_value_mean=-0.231, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6680/8000 [1:53:27<1:15:59, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.83, train/loss=3.54, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.312, train/predicted_value_std=0.185, train/target_value_mean=-0.314, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6681/8000 [1:53:30<1:15:44, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.42, train/loss=3.39, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.287, train/predicted_value_std=0.144, train/target_value_mean=-0.213, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6682/8000 [1:53:34<1:15:34, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.12, train/loss=3.21, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.335, train/predicted_value_std=0.195, train/target_value_mean=-0.365, train/target_value_std=0.265, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6683/8000 [1:53:37<1:15:35, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.85, train/loss=4.06, train/lr=5e-5, train/mae=0.26, train/predicted_value_mean=-0.327, train/predicted_value_std=0.13, train/target_value_mean=-0.417, train/target_value_std=0.23, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6684/8000 [1:53:41<1:15:21, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=11.3, train/loss=3.09, train/lr=5e-5, train/mae=0.0537, train/predicted_value_mean=-0.22, train/predicted_value_std=0.0737, train/target_value_mean=-0.212, train/target_value_std=0.122, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6685/8000 [1:53:44<1:15:18, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.2, train/loss=3.69, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.311, train/predicted_value_std=0.182, train/target_value_mean=-0.326, train/target_value_std=0.18, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6686/8000 [1:53:48<1:17:20, 3.53s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.9, train/loss=3.16, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.311, train/predicted_value_std=0.127, train/target_value_mean=-0.284, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6687/8000 [1:53:51<1:16:46, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.26, train/loss=3.46, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.332, train/predicted_value_std=0.14, train/target_value_mean=-0.328, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6688/8000 [1:53:55<1:16:20, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=9.65, train/loss=2.94, train/lr=5e-5, train/mae=0.0475, train/predicted_value_mean=-0.24, train/predicted_value_std=0.0767, train/target_value_mean=-0.178, train/target_value_std=0.052, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6689/8000 [1:53:58<1:15:55, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=9.02, train/loss=3.73, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.29, train/predicted_value_std=0.12, train/target_value_mean=-0.318, train/target_value_std=0.236, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6690/8000 [1:54:02<1:15:43, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.66, train/loss=3.43, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.266, train/predicted_value_std=0.209, train/target_value_mean=-0.275, train/target_value_std=0.239, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6691/8000 [1:54:05<1:15:31, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.09, train/loss=3.05, train/lr=5e-5, train/mae=0.0787, train/predicted_value_mean=-0.283, train/predicted_value_std=0.173, train/target_value_mean=-0.255, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6692/8000 [1:54:09<1:15:26, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.72, train/loss=2.74, train/lr=5e-5, train/mae=0.0444, train/predicted_value_mean=-0.281, train/predicted_value_std=0.172, train/target_value_mean=-0.257, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6693/8000 [1:54:12<1:15:24, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.375, train/grad_norm=7.44, train/loss=3.47, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.23, train/predicted_value_std=0.076, train/target_value_mean=-0.197, train/target_value_std=0.17, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6694/8000 [1:54:16<1:15:17, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.17, train/loss=2.6, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.207, train/predicted_value_std=0.11, train/target_value_mean=-0.191, train/target_value_std=0.134, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6695/8000 [1:54:19<1:15:12, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.2, train/loss=3.7, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.329, train/predicted_value_std=0.135, train/target_value_mean=-0.275, train/target_value_std=0.174, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6696/8000 [1:54:22<1:15:03, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.13, train/loss=2.88, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.295, train/predicted_value_std=0.182, train/target_value_mean=-0.263, train/target_value_std=0.225, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6697/8000 [1:54:26<1:14:50, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.08, train/loss=2.96, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.261, train/predicted_value_std=0.0996, train/target_value_mean=-0.221, train/target_value_std=0.171, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6698/8000 [1:54:30<1:16:28, 3.52s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.5, train/loss=3.9, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.342, train/predicted_value_std=0.163, train/target_value_mean=-0.369, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6699/8000 [1:54:33<1:15:45, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.24, train/loss=3.96, train/lr=5e-5, train/mae=0.191, train/predicted_value_mean=-0.314, train/predicted_value_std=0.113, train/target_value_mean=-0.301, train/target_value_std=0.166, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6700/8000 [1:54:37<1:15:24, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.18, train/loss=3.33, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.269, train/predicted_value_std=0.158, train/target_value_mean=-0.274, train/target_value_std=0.197, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6701/8000 [1:54:40<1:15:03, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.37, train/loss=3.73, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.319, train/predicted_value_std=0.121, train/target_value_mean=-0.335, train/target_value_std=0.192, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6702/8000 [1:54:43<1:14:48, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.74, train/loss=3.41, train/lr=5e-5, train/mae=0.193, train/predicted_value_mean=-0.36, train/predicted_value_std=0.132, train/target_value_mean=-0.354, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6703/8000 [1:54:47<1:14:46, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.59, train/loss=3.26, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.26, train/predicted_value_std=0.194, train/target_value_mean=-0.251, train/target_value_std=0.221, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6704/8000 [1:54:50<1:14:40, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.79, train/loss=3.61, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.342, train/predicted_value_std=0.192, train/target_value_mean=-0.369, train/target_value_std=0.271, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6705/8000 [1:54:54<1:14:32, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.71, train/loss=3.79, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.321, train/predicted_value_std=0.177, train/target_value_mean=-0.256, train/target_value_std=0.221, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6706/8000 [1:54:57<1:14:20, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.28, train/loss=3.94, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.35, train/predicted_value_std=0.131, train/target_value_mean=-0.319, train/target_value_std=0.145, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6707/8000 [1:55:01<1:14:29, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.88, train/loss=3.71, train/lr=5e-5, train/mae=0.189, train/predicted_value_mean=-0.281, train/predicted_value_std=0.12, train/target_value_mean=-0.325, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6708/8000 [1:55:04<1:14:24, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.95, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.333, train/predicted_value_std=0.129, train/target_value_mean=-0.294, train/target_value_std=0.0915, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6709/8000 [1:55:08<1:14:03, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.55, train/loss=3.71, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.315, train/predicted_value_std=0.195, train/target_value_mean=-0.334, train/target_value_std=0.324, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6710/8000 [1:55:11<1:15:32, 3.51s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.02, train/loss=3.57, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.302, train/predicted_value_std=0.135, train/target_value_mean=-0.291, train/target_value_std=0.182, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6711/8000 [1:55:15<1:15:09, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.06, train/loss=3.57, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.359, train/predicted_value_std=0.178, train/target_value_mean=-0.345, train/target_value_std=0.173, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6712/8000 [1:55:18<1:15:07, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.37, train/loss=3.19, train/lr=5e-5, train/mae=0.0562, train/predicted_value_mean=-0.241, train/predicted_value_std=0.152, train/target_value_mean=-0.202, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6713/8000 [1:55:22<1:14:54, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.87, train/loss=3.07, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.229, train/predicted_value_std=0.12, train/target_value_mean=-0.184, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6714/8000 [1:55:25<1:14:44, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.28, train/loss=3.33, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.321, train/predicted_value_std=0.126, train/target_value_mean=-0.336, train/target_value_std=0.207, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6715/8000 [1:55:29<1:14:24, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.65, train/loss=4.06, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.329, train/predicted_value_std=0.0865, train/target_value_mean=-0.289, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6716/8000 [1:55:32<1:14:13, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.7, train/loss=3.49, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.265, train/predicted_value_std=0.148, train/target_value_mean=-0.142, train/target_value_std=0.103, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6717/8000 [1:55:35<1:14:06, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.3, train/loss=4.21, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.318, train/predicted_value_std=0.147, train/target_value_mean=-0.292, train/target_value_std=0.24, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6718/8000 [1:55:39<1:13:53, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.09, train/loss=3.42, train/lr=5e-5, train/mae=0.0375, train/predicted_value_mean=-0.243, train/predicted_value_std=0.103, train/target_value_mean=-0.236, train/target_value_std=0.13, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6719/8000 [1:55:42<1:13:50, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.95, train/loss=4.02, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.308, train/predicted_value_std=0.122, train/target_value_mean=-0.277, train/target_value_std=0.106, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6720/8000 [1:55:46<1:13:41, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.66, train/loss=4.03, train/lr=5e-5, train/mae=0.302, train/predicted_value_mean=-0.313, train/predicted_value_std=0.106, train/target_value_mean=-0.31, train/target_value_std=0.26, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6721/8000 [1:55:49<1:13:38, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=9.25, train/loss=2.99, train/lr=5e-5, train/mae=0.0512, train/predicted_value_mean=-0.306, train/predicted_value_std=0.149, train/target_value_mean=-0.297, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6722/8000 [1:55:53<1:15:28, 3.54s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.05, train/loss=4, train/lr=5e-5, train/mae=0.202, train/predicted_value_mean=-0.316, train/predicted_value_std=0.141, train/target_value_mean=-0.306, train/target_value_std=0.247, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6723/8000 [1:55:56<1:14:45, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.77, train/loss=3.04, train/lr=5e-5, train/mae=0.0512, train/predicted_value_mean=-0.234, train/predicted_value_std=0.144, train/target_value_mean=-0.218, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6724/8000 [1:56:00<1:14:16, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.71, train/loss=3.73, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.279, train/predicted_value_std=0.126, train/target_value_mean=-0.268, train/target_value_std=0.189, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6725/8000 [1:56:03<1:13:52, 3.48s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.99, train/loss=3.41, train/lr=5e-5, train/mae=0.175, train/predicted_value_mean=-0.375, train/predicted_value_std=0.199, train/target_value_mean=-0.365, train/target_value_std=0.211, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6726/8000 [1:56:07<1:13:36, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=6.36, train/loss=2.97, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.334, train/predicted_value_std=0.21, train/target_value_mean=-0.335, train/target_value_std=0.313, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6727/8000 [1:56:10<1:13:20, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=13.1, train/loss=3.8, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.259, train/predicted_value_std=0.116, train/target_value_mean=-0.164, train/target_value_std=0.0978, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6728/8000 [1:56:14<1:13:05, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=6.44, train/loss=3.06, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.345, train/predicted_value_std=0.199, train/target_value_mean=-0.401, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6729/8000 [1:56:17<1:12:56, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.31, train/loss=3.34, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.232, train/predicted_value_std=0.116, train/target_value_mean=-0.2, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6730/8000 [1:56:21<1:12:52, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=9.44, train/loss=2.93, train/lr=5e-5, train/mae=0.0447, train/predicted_value_mean=-0.321, train/predicted_value_std=0.13, train/target_value_mean=-0.314, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6731/8000 [1:56:24<1:12:52, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=3.35, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0978, train/target_value_mean=-0.334, train/target_value_std=0.139, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6732/8000 [1:56:27<1:12:50, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=12, train/loss=3.68, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.33, train/predicted_value_std=0.139, train/target_value_mean=-0.329, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6733/8000 [1:56:31<1:12:51, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.23, train/loss=3.36, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.304, train/predicted_value_std=0.117, train/target_value_mean=-0.265, train/target_value_std=0.133, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6734/8000 [1:56:35<1:14:32, 3.53s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.06, train/loss=3.31, train/lr=5e-5, train/mae=0.0381, train/predicted_value_mean=-0.277, train/predicted_value_std=0.154, train/target_value_mean=-0.231, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6735/8000 [1:56:38<1:14:29, 3.53s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.71, train/loss=3.44, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.399, train/predicted_value_std=0.182, train/target_value_mean=-0.442, train/target_value_std=0.33, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6736/8000 [1:56:42<1:13:45, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.81, train/loss=3, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.295, train/predicted_value_std=0.131, train/target_value_mean=-0.265, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6737/8000 [1:56:45<1:13:15, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=8.46, train/loss=2.91, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.251, train/predicted_value_std=0.147, train/target_value_mean=-0.245, train/target_value_std=0.215, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6738/8000 [1:56:48<1:12:47, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.53, train/loss=4.12, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.32, train/predicted_value_std=0.0664, train/target_value_mean=-0.262, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6739/8000 [1:56:52<1:12:30, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.7, train/loss=3.55, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.26, train/predicted_value_std=0.0807, train/target_value_mean=-0.222, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6740/8000 [1:56:55<1:12:16, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.07, train/loss=3.44, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.357, train/predicted_value_std=0.146, train/target_value_mean=-0.418, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6741/8000 [1:56:59<1:12:05, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.56, train/loss=3.59, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.278, train/predicted_value_std=0.125, train/target_value_mean=-0.293, train/target_value_std=0.125, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6742/8000 [1:57:02<1:12:12, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=9.91, train/loss=2.99, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.317, train/predicted_value_std=0.114, train/target_value_mean=-0.272, train/target_value_std=0.129, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6743/8000 [1:57:06<1:12:11, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.6, train/loss=3.05, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.308, train/predicted_value_std=0.161, train/target_value_mean=-0.256, train/target_value_std=0.149, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6744/8000 [1:57:09<1:12:09, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=7.38, train/loss=3.14, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.297, train/predicted_value_std=0.121, train/target_value_mean=-0.305, train/target_value_std=0.221, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6745/8000 [1:57:12<1:12:02, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.64, train/loss=3.39, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.288, train/predicted_value_std=0.157, train/target_value_mean=-0.182, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6746/8000 [1:57:16<1:13:38, 3.52s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.1, train/loss=3.88, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.387, train/predicted_value_std=0.145, train/target_value_mean=-0.444, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6747/8000 [1:57:20<1:13:01, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.68, train/loss=4.24, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.292, train/predicted_value_std=0.118, train/target_value_mean=-0.264, train/target_value_std=0.187, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6748/8000 [1:57:23<1:12:38, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.63, train/loss=3.48, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.298, train/predicted_value_std=0.208, train/target_value_mean=-0.256, train/target_value_std=0.264, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6749/8000 [1:57:27<1:12:25, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=9.1, train/loss=3.36, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.325, train/predicted_value_std=0.129, train/target_value_mean=-0.314, train/target_value_std=0.248, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6750/8000 [1:57:30<1:12:01, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.57, train/loss=3.45, train/lr=5e-5, train/mae=0.0506, train/predicted_value_mean=-0.334, train/predicted_value_std=0.137, train/target_value_mean=-0.329, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6751/8000 [1:57:33<1:11:49, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=12.2, train/loss=3.86, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.321, train/predicted_value_std=0.124, train/target_value_mean=-0.264, train/target_value_std=0.122, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6752/8000 [1:57:37<1:11:38, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.1, train/loss=3.91, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.23, train/predicted_value_std=0.121, train/target_value_mean=-0.199, train/target_value_std=0.102, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6753/8000 [1:57:40<1:11:24, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10, train/loss=3.25, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.387, train/predicted_value_std=0.137, train/target_value_mean=-0.34, train/target_value_std=0.236, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6754/8000 [1:57:44<1:11:25, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.43, train/loss=3.56, train/lr=5e-5, train/mae=0.196, train/predicted_value_mean=-0.286, train/predicted_value_std=0.207, train/target_value_mean=-0.225, train/target_value_std=0.171, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6755/8000 [1:57:47<1:11:28, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.28, train/loss=3.19, train/lr=5e-5, train/mae=0.0403, train/predicted_value_mean=-0.312, train/predicted_value_std=0.148, train/target_value_mean=-0.277, train/target_value_std=0.197, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6756/8000 [1:57:51<1:11:17, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8, train/loss=4.16, train/lr=5e-5, train/mae=0.274, train/predicted_value_mean=-0.324, train/predicted_value_std=0.111, train/target_value_mean=-0.4, train/target_value_std=0.243, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6757/8000 [1:57:54<1:11:18, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.66, train/loss=3.26, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.237, train/predicted_value_std=0.117, train/target_value_mean=-0.234, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6758/8000 [1:57:58<1:13:05, 3.53s/it, time/step=3.74, time/training=3.74, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.84, train/loss=3.61, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.302, train/predicted_value_std=0.0978, train/target_value_mean=-0.324, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6759/8000 [1:58:01<1:12:33, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.8, train/loss=3.5, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.249, train/predicted_value_std=0.121, train/target_value_mean=-0.261, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 84%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6760/8000 [1:58:05<1:12:05, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.99, train/loss=3.07, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.269, train/predicted_value_std=0.0731, train/target_value_mean=-0.262, train/target_value_std=0.0905, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6761/8000 [1:58:08<1:11:39, 3.47s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.96, train/loss=3.47, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.275, train/predicted_value_std=0.123, train/target_value_mean=-0.23, train/target_value_std=0.138, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6762/8000 [1:58:12<1:11:29, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.21, train/loss=3.55, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.266, train/predicted_value_std=0.112, train/target_value_mean=-0.316, train/target_value_std=0.18, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6763/8000 [1:58:15<1:11:13, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.96, train/loss=3.57, train/lr=5e-5, train/mae=0.146, train/predicted_value_mean=-0.218, train/predicted_value_std=0.12, train/target_value_mean=-0.264, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6764/8000 [1:58:18<1:11:04, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=10.7, train/loss=3.31, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.32, train/predicted_value_std=0.103, train/target_value_mean=-0.296, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6765/8000 [1:58:22<1:11:03, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=12.3, train/loss=3.66, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.279, train/predicted_value_std=0.147, train/target_value_mean=-0.292, train/target_value_std=0.216, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6766/8000 [1:58:25<1:10:59, 3.45s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.33, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.297, train/predicted_value_std=0.19, train/target_value_mean=-0.289, train/target_value_std=0.244, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6767/8000 [1:58:29<1:10:48, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.18, train/loss=3.21, train/lr=5e-5, train/mae=0.035, train/predicted_value_mean=-0.216, train/predicted_value_std=0.158, train/target_value_mean=-0.167, train/target_value_std=0.142, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6768/8000 [1:58:32<1:10:52, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.07, train/loss=3.69, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.304, train/predicted_value_std=0.15, train/target_value_mean=-0.334, train/target_value_std=0.252, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6769/8000 [1:58:36<1:10:40, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.14, train/loss=4.19, train/lr=5e-5, train/mae=0.202, train/predicted_value_mean=-0.321, train/predicted_value_std=0.116, train/target_value_mean=-0.286, train/target_value_std=0.238, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6770/8000 [1:58:39<1:12:20, 3.53s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.91, train/loss=3.66, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.282, train/predicted_value_std=0.132, train/target_value_mean=-0.281, train/target_value_std=0.204, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6771/8000 [1:58:43<1:11:50, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=13.2, train/loss=3.87, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.312, train/predicted_value_std=0.152, train/target_value_mean=-0.369, train/target_value_std=0.268, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6772/8000 [1:58:46<1:11:28, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.7, train/loss=2.99, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.231, train/predicted_value_std=0.122, train/target_value_mean=-0.254, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6773/8000 [1:58:50<1:11:26, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.18, train/loss=3.12, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.251, train/predicted_value_std=0.0966, train/target_value_mean=-0.239, train/target_value_std=0.115, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6774/8000 [1:58:53<1:11:28, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.46, train/loss=4.17, train/lr=5e-5, train/mae=0.189, train/predicted_value_mean=-0.32, train/predicted_value_std=0.133, train/target_value_mean=-0.291, train/target_value_std=0.2, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6775/8000 [1:58:57<1:11:34, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.89, train/loss=3.58, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.276, train/predicted_value_std=0.129, train/target_value_mean=-0.275, train/target_value_std=0.161, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6776/8000 [1:59:00<1:11:18, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=10.4, train/loss=3.09, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.28, train/predicted_value_std=0.124, train/target_value_mean=-0.255, train/target_value_std=0.141, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6777/8000 [1:59:04<1:11:19, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.33, train/loss=3, train/lr=5e-5, train/mae=0.0778, train/predicted_value_mean=-0.225, train/predicted_value_std=0.105, train/target_value_mean=-0.187, train/target_value_std=0.145, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6778/8000 [1:59:07<1:11:15, 3.50s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.8, train/loss=3.35, train/lr=5e-5, train/mae=0.0722, train/predicted_value_mean=-0.235, train/predicted_value_std=0.113, train/target_value_mean=-0.162, train/target_value_std=0.0922, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6779/8000 [1:59:11<1:11:19, 3.51s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.7, train/loss=2.61, train/lr=5e-5, train/mae=0.0569, train/predicted_value_mean=-0.205, train/predicted_value_std=0.133, train/target_value_mean=-0.181, train/target_value_std=0.117, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6780/8000 [1:59:14<1:11:32, 3.52s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.21, train/loss=3.94, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.3, train/predicted_value_std=0.113, train/target_value_mean=-0.271, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6781/8000 [1:59:18<1:11:01, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=11, train/loss=3.45, train/lr=5e-5, train/mae=0.0634, train/predicted_value_mean=-0.352, train/predicted_value_std=0.154, train/target_value_mean=-0.331, train/target_value_std=0.196, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6782/8000 [1:59:22<1:12:59, 3.60s/it, time/step=3.83, time/training=3.82, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.64, train/loss=3.55, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.358, train/predicted_value_std=0.255, train/target_value_mean=-0.36, train/target_value_std=0.254, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6783/8000 [1:59:25<1:12:09, 3.56s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.48, train/loss=3.88, train/lr=5e-5, train/mae=0.188, train/predicted_value_mean=-0.334, train/predicted_value_std=0.166, train/target_value_mean=-0.366, train/target_value_std=0.227, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6784/8000 [1:59:29<1:11:25, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.39, train/loss=3.52, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.242, train/predicted_value_std=0.164, train/target_value_mean=-0.25, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6785/8000 [1:59:32<1:11:09, 3.51s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=11.6, train/loss=3.18, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.256, train/predicted_value_std=0.183, train/target_value_mean=-0.225, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6786/8000 [1:59:35<1:10:49, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.3, train/loss=3.69, train/lr=5e-5, train/mae=0.213, train/predicted_value_mean=-0.329, train/predicted_value_std=0.224, train/target_value_mean=-0.359, train/target_value_std=0.303, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6787/8000 [1:59:39<1:10:22, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.85, train/loss=3.54, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.291, train/predicted_value_std=0.146, train/target_value_mean=-0.307, train/target_value_std=0.168, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6788/8000 [1:59:42<1:10:20, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.88, train/loss=3.8, train/lr=5e-5, train/mae=0.209, train/predicted_value_mean=-0.336, train/predicted_value_std=0.156, train/target_value_mean=-0.378, train/target_value_std=0.198, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6789/8000 [1:59:46<1:10:12, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.81, train/loss=3.07, train/lr=5e-5, train/mae=0.0763, train/predicted_value_mean=-0.307, train/predicted_value_std=0.183, train/target_value_mean=-0.331, train/target_value_std=0.178, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6790/8000 [1:59:49<1:10:14, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.36, train/loss=3.68, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.317, train/predicted_value_std=0.0968, train/target_value_mean=-0.352, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6791/8000 [1:59:53<1:10:29, 3.50s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=6.67, train/loss=2.34, train/lr=5e-5, train/mae=0.0497, train/predicted_value_mean=-0.207, train/predicted_value_std=0.104, train/target_value_mean=-0.214, train/target_value_std=0.145, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6792/8000 [1:59:56<1:10:43, 3.51s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.46, train/loss=3.82, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.393, train/predicted_value_std=0.16, train/target_value_mean=-0.445, train/target_value_std=0.272, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6793/8000 [2:00:00<1:10:29, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.27, train/loss=3.82, train/lr=5e-5, train/mae=0.178, train/predicted_value_mean=-0.277, train/predicted_value_std=0.097, train/target_value_mean=-0.301, train/target_value_std=0.133, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6794/8000 [2:00:04<1:12:01, 3.58s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.63, train/loss=3.47, train/lr=5e-5, train/mae=0.0384, train/predicted_value_mean=-0.29, train/predicted_value_std=0.164, train/target_value_mean=-0.316, train/target_value_std=0.24, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6795/8000 [2:00:07<1:11:15, 3.55s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.83, train/loss=3.39, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.265, train/predicted_value_std=0.12, train/target_value_mean=-0.263, train/target_value_std=0.167, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6796/8000 [2:00:11<1:10:41, 3.52s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.5, train/loss=3.54, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.331, train/predicted_value_std=0.166, train/target_value_mean=-0.301, train/target_value_std=0.21, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6797/8000 [2:00:14<1:10:23, 3.51s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.61, train/loss=3.76, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0998, train/target_value_mean=-0.291, train/target_value_std=0.193, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6798/8000 [2:00:18<1:09:55, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=12.6, train/loss=3.47, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.285, train/predicted_value_std=0.186, train/target_value_mean=-0.277, train/target_value_std=0.309, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6799/8000 [2:00:21<1:09:51, 3.49s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.32, train/loss=3.73, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.284, train/predicted_value_std=0.0821, train/target_value_mean=-0.26, train/target_value_std=0.218, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6800/8000 [2:00:25<1:10:00, 3.50s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.4, train/loss=3.62, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.446, train/predicted_value_std=0.215, train/target_value_mean=-0.444, train/target_value_std=0.275, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6801/8000 [2:00:28<1:09:45, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.32, train/loss=3.42, train/lr=5e-5, train/mae=0.0688, train/predicted_value_mean=-0.254, train/predicted_value_std=0.174, train/target_value_mean=-0.226, train/target_value_std=0.194, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6802/8000 [2:00:31<1:09:23, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.31, train/loss=3.63, train/lr=5e-5, train/mae=0.22, train/predicted_value_mean=-0.306, train/predicted_value_std=0.134, train/target_value_mean=-0.357, train/target_value_std=0.265, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6803/8000 [2:00:35<1:09:19, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.27, train/loss=4, train/lr=5e-5, train/mae=0.209, train/predicted_value_mean=-0.331, train/predicted_value_std=0.168, train/target_value_mean=-0.247, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6804/8000 [2:00:38<1:08:56, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.89, train/loss=3.1, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.249, train/predicted_value_std=0.133, train/target_value_mean=-0.2, train/target_value_std=0.124, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6805/8000 [2:00:42<1:08:47, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.94, train/loss=3.58, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.286, train/predicted_value_std=0.0901, train/target_value_mean=-0.215, train/target_value_std=0.106, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6806/8000 [2:00:46<1:10:31, 3.54s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=8.18, train/loss=2.58, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.281, train/predicted_value_std=0.157, train/target_value_mean=-0.237, train/target_value_std=0.125, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6807/8000 [2:00:49<1:09:50, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.71, train/loss=3.51, train/lr=5e-5, train/mae=0.0619, train/predicted_value_mean=-0.385, train/predicted_value_std=0.138, train/target_value_mean=-0.437, train/target_value_std=0.147, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6808/8000 [2:00:52<1:09:19, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.1, train/loss=3.47, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.267, train/predicted_value_std=0.217, train/target_value_mean=-0.217, train/target_value_std=0.213, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6809/8000 [2:00:56<1:09:03, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.98, train/loss=4, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.226, train/predicted_value_std=0.109, train/target_value_mean=-0.253, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6810/8000 [2:00:59<1:09:00, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.5, train/cat_acc_neighbor=0.5, train/grad_norm=7.2, train/loss=2.5, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.277, train/predicted_value_std=0.157, train/target_value_mean=-0.238, train/target_value_std=0.134, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6811/8000 [2:01:03<1:08:50, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.91, train/loss=2.94, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.282, train/predicted_value_std=0.18, train/target_value_mean=-0.32, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6812/8000 [2:01:06<1:08:48, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.23, train/loss=2.95, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.256, train/predicted_value_std=0.182, train/target_value_mean=-0.234, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6813/8000 [2:01:10<1:08:44, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.27, train/loss=3.55, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.256, train/predicted_value_std=0.101, train/target_value_mean=-0.239, train/target_value_std=0.111, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6814/8000 [2:01:13<1:08:12, 3.45s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.4, train/loss=3.61, train/lr=5e-5, train/mae=0.0484, train/predicted_value_mean=-0.293, train/predicted_value_std=0.0935, train/target_value_mean=-0.199, train/target_value_std=0.119, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6815/8000 [2:01:17<1:07:37, 3.42s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.64, train/loss=3.55, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.259, train/predicted_value_std=0.157, train/target_value_mean=-0.27, train/target_value_std=0.164, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6816/8000 [2:01:20<1:07:25, 3.42s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.84, train/loss=3.68, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.269, train/predicted_value_std=0.141, train/target_value_mean=-0.293, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6817/8000 [2:01:23<1:07:30, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.01, train/loss=3.83, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.305, train/predicted_value_std=0.145, train/target_value_mean=-0.267, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6818/8000 [2:01:27<1:09:17, 3.52s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=5.92, train/loss=3.08, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.289, train/predicted_value_std=0.194, train/target_value_mean=-0.299, train/target_value_std=0.243, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6819/8000 [2:01:31<1:08:49, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=12.4, train/loss=3.23, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.339, train/predicted_value_std=0.174, train/target_value_mean=-0.346, train/target_value_std=0.279, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6820/8000 [2:01:34<1:08:41, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.77, train/loss=3.02, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.262, train/predicted_value_std=0.149, train/target_value_mean=-0.329, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6821/8000 [2:01:38<1:08:38, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=11.7, train/loss=2.84, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.322, train/predicted_value_std=0.182, train/target_value_mean=-0.294, train/target_value_std=0.148, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6822/8000 [2:01:41<1:08:23, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.78, train/loss=3.25, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.303, train/predicted_value_std=0.102, train/target_value_mean=-0.272, train/target_value_std=0.149, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6823/8000 [2:01:44<1:08:13, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.02, train/loss=3.16, train/lr=5e-5, train/mae=0.0331, train/predicted_value_mean=-0.184, train/predicted_value_std=0.0985, train/target_value_mean=-0.149, train/target_value_std=0.0677, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6824/8000 [2:01:48<1:07:51, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.562, train/cat_acc_neighbor=0.562, train/grad_norm=6.84, train/loss=2.66, train/lr=5e-5, train/mae=0.0838, train/predicted_value_mean=-0.255, train/predicted_value_std=0.128, train/target_value_mean=-0.212, train/target_value_std=0.172, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6825/8000 [2:01:51<1:07:36, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.39, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.302, train/predicted_value_std=0.218, train/target_value_mean=-0.318, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6826/8000 [2:01:55<1:07:32, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.08, train/loss=3.59, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.289, train/predicted_value_std=0.141, train/target_value_mean=-0.329, train/target_value_std=0.208, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6827/8000 [2:01:58<1:07:37, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.55, train/loss=3.03, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.246, train/predicted_value_std=0.145, train/target_value_mean=-0.213, train/target_value_std=0.186, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6828/8000 [2:02:02<1:07:34, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.63, train/loss=3.66, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.305, train/predicted_value_std=0.135, train/target_value_mean=-0.305, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6829/8000 [2:02:05<1:07:25, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.34, train/loss=3.33, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.275, train/predicted_value_std=0.0863, train/target_value_mean=-0.253, train/target_value_std=0.103, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6830/8000 [2:02:09<1:08:53, 3.53s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.83, train/loss=3.49, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.342, train/predicted_value_std=0.21, train/target_value_mean=-0.363, train/target_value_std=0.231, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6831/8000 [2:02:12<1:08:00, 3.49s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.26, train/loss=3.85, train/lr=5e-5, train/mae=0.182, train/predicted_value_mean=-0.427, train/predicted_value_std=0.0929, train/target_value_mean=-0.446, train/target_value_std=0.171, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6832/8000 [2:02:16<1:07:42, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.37, train/loss=3.38, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.357, train/predicted_value_std=0.138, train/target_value_mean=-0.34, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6833/8000 [2:02:19<1:07:36, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.71, train/loss=3.26, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.344, train/predicted_value_std=0.199, train/target_value_mean=-0.328, train/target_value_std=0.244, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6834/8000 [2:02:23<1:07:13, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.57, train/loss=3.69, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.268, train/predicted_value_std=0.0901, train/target_value_mean=-0.183, train/target_value_std=0.0526, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6835/8000 [2:02:26<1:07:31, 3.48s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=7.52, train/loss=3.31, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.277, train/predicted_value_std=0.135, train/target_value_mean=-0.29, train/target_value_std=0.198, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6836/8000 [2:02:30<1:07:25, 3.48s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=8.4, train/loss=3.1, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.266, train/predicted_value_std=0.159, train/target_value_mean=-0.243, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6837/8000 [2:02:33<1:07:28, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.28, train/loss=3.99, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.347, train/predicted_value_std=0.144, train/target_value_mean=-0.407, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6838/8000 [2:02:37<1:07:03, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.21, train/loss=3.71, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.31, train/predicted_value_std=0.144, train/target_value_mean=-0.319, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 85%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6839/8000 [2:02:40<1:07:04, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.13, train/loss=3.64, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.35, train/predicted_value_std=0.102, train/target_value_mean=-0.327, train/target_value_std=0.13, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6840/8000 [2:02:43<1:07:07, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.38, train/loss=3.31, train/lr=5e-5, train/mae=0.0587, train/predicted_value_mean=-0.283, train/predicted_value_std=0.113, train/target_value_mean=-0.23, train/target_value_std=0.147, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6841/8000 [2:02:47<1:07:06, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.8, train/loss=3.27, train/lr=5e-5, train/mae=0.0787, train/predicted_value_mean=-0.242, train/predicted_value_std=0.136, train/target_value_mean=-0.245, train/target_value_std=0.226, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6842/8000 [2:02:51<1:08:26, 3.55s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.85, train/loss=3.69, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.246, train/predicted_value_std=0.0833, train/target_value_mean=-0.181, train/target_value_std=0.148, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6843/8000 [2:02:54<1:07:53, 3.52s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.6, train/loss=3.67, train/lr=5e-5, train/mae=0.0412, train/predicted_value_mean=-0.273, train/predicted_value_std=0.138, train/target_value_mean=-0.253, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6844/8000 [2:02:58<1:07:17, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=8.89, train/loss=2.8, train/lr=5e-5, train/mae=0.0447, train/predicted_value_mean=-0.253, train/predicted_value_std=0.13, train/target_value_mean=-0.256, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6845/8000 [2:03:01<1:06:57, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=7.81, train/loss=3.05, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.24, train/predicted_value_std=0.191, train/target_value_mean=-0.256, train/target_value_std=0.244, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6846/8000 [2:03:04<1:06:38, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.98, train/loss=3.61, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.373, train/predicted_value_std=0.15, train/target_value_mean=-0.357, train/target_value_std=0.222, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6847/8000 [2:03:08<1:06:20, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.77, train/loss=3.65, train/lr=5e-5, train/mae=0.198, train/predicted_value_mean=-0.352, train/predicted_value_std=0.164, train/target_value_mean=-0.295, train/target_value_std=0.218, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6848/8000 [2:03:11<1:06:06, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.72, train/loss=3.59, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.379, train/predicted_value_std=0.0772, train/target_value_mean=-0.38, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6849/8000 [2:03:15<1:06:05, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11.1, train/loss=3.54, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.239, train/predicted_value_std=0.105, train/target_value_mean=-0.201, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6850/8000 [2:03:18<1:05:56, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.48, train/loss=3.9, train/lr=5e-5, train/mae=0.174, train/predicted_value_mean=-0.347, train/predicted_value_std=0.167, train/target_value_mean=-0.408, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6851/8000 [2:03:22<1:06:04, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.79, train/loss=3.3, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.305, train/predicted_value_std=0.136, train/target_value_mean=-0.296, train/target_value_std=0.16, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6852/8000 [2:03:25<1:06:32, 3.48s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.25, train/loss=3.32, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.317, train/predicted_value_std=0.117, train/target_value_mean=-0.309, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6853/8000 [2:03:29<1:06:14, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.27, train/loss=3.53, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.304, train/predicted_value_std=0.128, train/target_value_mean=-0.308, train/target_value_std=0.218, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6854/8000 [2:03:32<1:07:16, 3.52s/it, time/step=3.65, time/training=3.65, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.56, train/loss=3.34, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.248, train/predicted_value_std=0.13, train/target_value_mean=-0.284, train/target_value_std=0.188, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6855/8000 [2:03:36<1:06:48, 3.50s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.67, train/loss=3.11, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.271, train/predicted_value_std=0.147, train/target_value_mean=-0.299, train/target_value_std=0.154, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6856/8000 [2:03:39<1:06:29, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.89, train/loss=3.83, train/lr=5e-5, train/mae=0.0872, train/predicted_value_mean=-0.306, train/predicted_value_std=0.114, train/target_value_mean=-0.294, train/target_value_std=0.139, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6857/8000 [2:03:43<1:05:55, 3.46s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=9.32, train/loss=3.93, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.335, train/predicted_value_std=0.204, train/target_value_mean=-0.326, train/target_value_std=0.298, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6858/8000 [2:03:46<1:05:47, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.63, train/loss=3.43, train/lr=5e-5, train/mae=0.0716, train/predicted_value_mean=-0.258, train/predicted_value_std=0.0919, train/target_value_mean=-0.228, train/target_value_std=0.122, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6859/8000 [2:03:49<1:05:39, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.4, train/loss=3.71, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.299, train/predicted_value_std=0.196, train/target_value_mean=-0.302, train/target_value_std=0.276, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6860/8000 [2:03:53<1:05:27, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.19, train/loss=3.73, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.371, train/predicted_value_std=0.0487, train/target_value_mean=-0.31, train/target_value_std=0.0921, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6861/8000 [2:03:56<1:05:48, 3.47s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.18, train/loss=3.55, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.285, train/predicted_value_std=0.0917, train/target_value_mean=-0.316, train/target_value_std=0.107, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6862/8000 [2:04:00<1:05:21, 3.45s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.3, train/loss=3.66, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.337, train/predicted_value_std=0.168, train/target_value_mean=-0.299, train/target_value_std=0.209, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6863/8000 [2:04:03<1:04:53, 3.42s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.33, train/loss=3.45, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.306, train/predicted_value_std=0.131, train/target_value_mean=-0.33, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6864/8000 [2:04:07<1:04:46, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.49, train/loss=3.65, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.343, train/predicted_value_std=0.159, train/target_value_mean=-0.297, train/target_value_std=0.183, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6865/8000 [2:04:10<1:04:32, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=6.91, train/loss=4.02, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.277, train/predicted_value_std=0.0921, train/target_value_mean=-0.238, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6866/8000 [2:04:14<1:05:40, 3.47s/it, time/step=3.62, time/training=3.62, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.48, train/loss=3.11, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.249, train/predicted_value_std=0.043, train/target_value_mean=-0.225, train/target_value_std=0.0738, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6867/8000 [2:04:17<1:05:11, 3.45s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.54, train/loss=3.59, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.333, train/predicted_value_std=0.143, train/target_value_mean=-0.277, train/target_value_std=0.193, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6868/8000 [2:04:20<1:04:53, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.64, train/loss=3.58, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.332, train/predicted_value_std=0.136, train/target_value_mean=-0.333, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6869/8000 [2:04:24<1:04:44, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.34, train/loss=3.27, train/lr=5e-5, train/mae=0.07, train/predicted_value_mean=-0.333, train/predicted_value_std=0.141, train/target_value_mean=-0.312, train/target_value_std=0.203, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6870/8000 [2:04:27<1:04:37, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.05, train/loss=3.29, train/lr=5e-5, train/mae=0.0944, train/predicted_value_mean=-0.273, train/predicted_value_std=0.129, train/target_value_mean=-0.212, train/target_value_std=0.141, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6871/8000 [2:04:31<1:04:21, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.96, train/loss=2.87, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.255, train/predicted_value_std=0.18, train/target_value_mean=-0.287, train/target_value_std=0.251, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6872/8000 [2:04:34<1:04:25, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.19, train/loss=3.27, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.308, train/predicted_value_std=0.157, train/target_value_mean=-0.283, train/target_value_std=0.191, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6873/8000 [2:04:38<1:04:36, 3.44s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.12, train/loss=3.71, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.33, train/predicted_value_std=0.148, train/target_value_mean=-0.301, train/target_value_std=0.223, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6874/8000 [2:04:41<1:04:24, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.93, train/loss=3.91, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.308, train/predicted_value_std=0.13, train/target_value_mean=-0.237, train/target_value_std=0.222, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6875/8000 [2:04:44<1:04:20, 3.43s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=14.7, train/loss=3.2, train/lr=5e-5, train/mae=0.0425, train/predicted_value_mean=-0.297, train/predicted_value_std=0.138, train/target_value_mean=-0.257, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6876/8000 [2:04:48<1:04:03, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.34, train/loss=3.39, train/lr=5e-5, train/mae=0.0756, train/predicted_value_mean=-0.347, train/predicted_value_std=0.102, train/target_value_mean=-0.329, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6877/8000 [2:04:51<1:03:51, 3.41s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.31, train/loss=2.91, train/lr=5e-5, train/mae=0.0269, train/predicted_value_mean=-0.202, train/predicted_value_std=0.127, train/target_value_mean=-0.16, train/target_value_std=0.117, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6878/8000 [2:04:55<1:05:33, 3.51s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.19, train/loss=3.71, train/lr=5e-5, train/mae=0.227, train/predicted_value_mean=-0.326, train/predicted_value_std=0.114, train/target_value_mean=-0.328, train/target_value_std=0.192, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6879/8000 [2:04:58<1:05:15, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.562, train/grad_norm=6.6, train/loss=3.26, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.336, train/predicted_value_std=0.142, train/target_value_mean=-0.369, train/target_value_std=0.142, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6880/8000 [2:05:02<1:04:54, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.89, train/loss=3.6, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.223, train/predicted_value_std=0.0763, train/target_value_mean=-0.187, train/target_value_std=0.0817, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6881/8000 [2:05:05<1:05:04, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.2, train/loss=3.45, train/lr=5e-5, train/mae=0.197, train/predicted_value_mean=-0.237, train/predicted_value_std=0.131, train/target_value_mean=-0.268, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6882/8000 [2:05:09<1:04:51, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.02, train/loss=3.16, train/lr=5e-5, train/mae=0.0516, train/predicted_value_mean=-0.313, train/predicted_value_std=0.188, train/target_value_mean=-0.311, train/target_value_std=0.339, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6883/8000 [2:05:12<1:04:57, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.58, train/loss=3.28, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.251, train/predicted_value_std=0.15, train/target_value_mean=-0.26, train/target_value_std=0.197, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6884/8000 [2:05:16<1:04:56, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.92, train/loss=4.02, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.365, train/predicted_value_std=0.162, train/target_value_mean=-0.419, train/target_value_std=0.247, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6885/8000 [2:05:19<1:04:40, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.72, train/loss=3.36, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.364, train/predicted_value_std=0.191, train/target_value_mean=-0.326, train/target_value_std=0.199, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6886/8000 [2:05:23<1:04:29, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.45, train/loss=3.21, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.331, train/predicted_value_std=0.235, train/target_value_mean=-0.303, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6887/8000 [2:05:26<1:04:30, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.05, train/loss=3.35, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.258, train/predicted_value_std=0.117, train/target_value_mean=-0.244, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6888/8000 [2:05:30<1:04:20, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.91, train/loss=4.05, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.33, train/predicted_value_std=0.206, train/target_value_mean=-0.334, train/target_value_std=0.275, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6889/8000 [2:05:33<1:04:08, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.45, train/loss=3.9, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.34, train/predicted_value_std=0.157, train/target_value_mean=-0.354, train/target_value_std=0.258, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6890/8000 [2:05:37<1:05:35, 3.55s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.39, train/loss=3.33, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.276, train/predicted_value_std=0.0958, train/target_value_mean=-0.322, train/target_value_std=0.116, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6891/8000 [2:05:40<1:05:01, 3.52s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.19, train/loss=3.68, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.302, train/predicted_value_std=0.105, train/target_value_mean=-0.258, train/target_value_std=0.16, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6892/8000 [2:05:44<1:04:38, 3.50s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.88, train/loss=2.95, train/lr=5e-5, train/mae=0.0422, train/predicted_value_mean=-0.194, train/predicted_value_std=0.0975, train/target_value_mean=-0.168, train/target_value_std=0.103, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6893/8000 [2:05:47<1:04:30, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.7, train/loss=3.71, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.356, train/predicted_value_std=0.145, train/target_value_mean=-0.309, train/target_value_std=0.2, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6894/8000 [2:05:51<1:04:15, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.57, train/loss=2.68, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.317, train/predicted_value_std=0.196, train/target_value_mean=-0.32, train/target_value_std=0.251, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6895/8000 [2:05:54<1:04:09, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.36, train/loss=3.35, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.29, train/predicted_value_std=0.169, train/target_value_mean=-0.336, train/target_value_std=0.28, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6896/8000 [2:05:58<1:04:40, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.27, train/loss=2.82, train/lr=5e-5, train/mae=0.0634, train/predicted_value_mean=-0.24, train/predicted_value_std=0.182, train/target_value_mean=-0.214, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6897/8000 [2:06:01<1:04:36, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=7.64, train/loss=2.53, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.248, train/predicted_value_std=0.177, train/target_value_mean=-0.208, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6898/8000 [2:06:05<1:04:38, 3.52s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.96, train/loss=3.68, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.368, train/predicted_value_std=0.0624, train/target_value_mean=-0.387, train/target_value_std=0.0796, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6899/8000 [2:06:08<1:04:28, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.23, train/loss=3.61, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.358, train/predicted_value_std=0.23, train/target_value_mean=-0.315, train/target_value_std=0.279, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6900/8000 [2:06:12<1:04:28, 3.52s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.86, train/loss=3.88, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.33, train/predicted_value_std=0.131, train/target_value_mean=-0.368, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6901/8000 [2:06:15<1:04:00, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=12.4, train/loss=2.89, train/lr=5e-5, train/mae=0.0603, train/predicted_value_mean=-0.272, train/predicted_value_std=0.211, train/target_value_mean=-0.267, train/target_value_std=0.262, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6902/8000 [2:06:19<1:05:30, 3.58s/it, time/step=3.78, time/training=3.77, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.41, train/loss=3.43, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.265, train/predicted_value_std=0.112, train/target_value_mean=-0.231, train/target_value_std=0.184, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6903/8000 [2:06:23<1:04:44, 3.54s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.62, train/loss=3.53, train/lr=5e-5, train/mae=0.163, train/predicted_value_mean=-0.337, train/predicted_value_std=0.119, train/target_value_mean=-0.324, train/target_value_std=0.105, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6904/8000 [2:06:26<1:03:58, 3.50s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.33, train/loss=3.39, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.263, train/predicted_value_std=0.11, train/target_value_mean=-0.211, train/target_value_std=0.153, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6905/8000 [2:06:29<1:03:31, 3.48s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.87, train/loss=3.43, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.324, train/predicted_value_std=0.155, train/target_value_mean=-0.322, train/target_value_std=0.183, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6906/8000 [2:06:33<1:03:10, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.69, train/loss=3.21, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.326, train/predicted_value_std=0.238, train/target_value_mean=-0.338, train/target_value_std=0.341, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6907/8000 [2:06:36<1:02:54, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=7.41, train/loss=2.45, train/lr=5e-5, train/mae=0.0213, train/predicted_value_mean=-0.219, train/predicted_value_std=0.12, train/target_value_mean=-0.218, train/target_value_std=0.178, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6908/8000 [2:06:40<1:02:50, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.4, train/loss=3.65, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.299, train/predicted_value_std=0.188, train/target_value_mean=-0.31, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6909/8000 [2:06:43<1:02:43, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.34, train/loss=4.06, train/lr=5e-5, train/mae=0.166, train/predicted_value_mean=-0.349, train/predicted_value_std=0.179, train/target_value_mean=-0.345, train/target_value_std=0.189, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6910/8000 [2:06:47<1:02:40, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=11.7, train/loss=2.93, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.269, train/predicted_value_std=0.125, train/target_value_mean=-0.251, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6911/8000 [2:06:50<1:02:14, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.92, train/loss=3.28, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.307, train/predicted_value_std=0.21, train/target_value_mean=-0.329, train/target_value_std=0.276, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6912/8000 [2:06:53<1:02:05, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.02, train/loss=3.78, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.311, train/predicted_value_std=0.158, train/target_value_mean=-0.241, train/target_value_std=0.221, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6913/8000 [2:06:57<1:02:06, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.07, train/loss=3.62, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.314, train/predicted_value_std=0.17, train/target_value_mean=-0.296, train/target_value_std=0.242, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6914/8000 [2:07:01<1:03:47, 3.52s/it, time/step=3.75, time/training=3.74, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.6, train/loss=3.93, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.262, train/predicted_value_std=0.124, train/target_value_mean=-0.279, train/target_value_std=0.231, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6915/8000 [2:07:04<1:03:27, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.81, train/loss=3.45, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.287, train/predicted_value_std=0.144, train/target_value_mean=-0.223, train/target_value_std=0.186, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6916/8000 [2:07:08<1:03:17, 3.50s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.54, train/loss=3.3, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.229, train/predicted_value_std=0.172, train/target_value_mean=-0.212, train/target_value_std=0.192, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6917/8000 [2:07:11<1:03:02, 3.49s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.84, train/loss=3.34, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.196, train/predicted_value_std=0.109, train/target_value_mean=-0.184, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6918/8000 [2:07:14<1:02:47, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=11.4, train/loss=3.1, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.261, train/predicted_value_std=0.186, train/target_value_mean=-0.254, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6919/8000 [2:07:18<1:02:45, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.14, train/loss=3.48, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.255, train/predicted_value_std=0.108, train/target_value_mean=-0.225, train/target_value_std=0.126, train/value_spearman=-2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 86%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6920/8000 [2:07:21<1:02:35, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=12.2, train/loss=3.2, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.306, train/predicted_value_std=0.132, train/target_value_mean=-0.282, train/target_value_std=0.122, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6921/8000 [2:07:25<1:02:27, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=13, train/loss=3.25, train/lr=5e-5, train/mae=0.0775, train/predicted_value_mean=-0.333, train/predicted_value_std=0.12, train/target_value_mean=-0.291, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6922/8000 [2:07:28<1:02:12, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.3, train/loss=3.27, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.233, train/predicted_value_std=0.0706, train/target_value_mean=-0.271, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6923/8000 [2:07:32<1:01:53, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.69, train/loss=3.26, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.268, train/predicted_value_std=0.166, train/target_value_mean=-0.261, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6924/8000 [2:07:35<1:02:01, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=5.81, train/loss=3.22, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.298, train/predicted_value_std=0.183, train/target_value_mean=-0.307, train/target_value_std=0.206, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6925/8000 [2:07:39<1:02:10, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8, train/loss=2.57, train/lr=5e-5, train/mae=0.02, train/predicted_value_mean=-0.346, train/predicted_value_std=0.17, train/target_value_mean=-0.358, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6926/8000 [2:07:43<1:04:07, 3.58s/it, time/step=3.84, time/training=3.84, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.7, train/loss=3.57, train/lr=5e-5, train/mae=0.0722, train/predicted_value_mean=-0.271, train/predicted_value_std=0.163, train/target_value_mean=-0.18, train/target_value_std=0.104, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6927/8000 [2:07:46<1:03:02, 3.53s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.48, train/loss=3.65, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.346, train/predicted_value_std=0.158, train/target_value_mean=-0.278, train/target_value_std=0.148, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6928/8000 [2:07:49<1:02:28, 3.50s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.7, train/loss=3.02, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.257, train/predicted_value_std=0.122, train/target_value_mean=-0.282, train/target_value_std=0.15, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6929/8000 [2:07:53<1:02:26, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=12.2, train/loss=3.18, train/lr=5e-5, train/mae=0.0616, train/predicted_value_mean=-0.276, train/predicted_value_std=0.11, train/target_value_mean=-0.308, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6930/8000 [2:07:56<1:02:10, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.14, train/loss=3.86, train/lr=5e-5, train/mae=0.19, train/predicted_value_mean=-0.277, train/predicted_value_std=0.158, train/target_value_mean=-0.258, train/target_value_std=0.21, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6931/8000 [2:08:00<1:02:09, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.94, train/loss=3.39, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.382, train/predicted_value_std=0.181, train/target_value_mean=-0.407, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6932/8000 [2:08:03<1:02:14, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.3, train/loss=3.44, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.268, train/predicted_value_std=0.177, train/target_value_mean=-0.193, train/target_value_std=0.137, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6933/8000 [2:08:07<1:02:04, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.04, train/loss=3.33, train/lr=5e-5, train/mae=0.0391, train/predicted_value_mean=-0.333, train/predicted_value_std=0.189, train/target_value_mean=-0.327, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6934/8000 [2:08:10<1:01:46, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.87, train/loss=3.02, train/lr=5e-5, train/mae=0.0712, train/predicted_value_mean=-0.313, train/predicted_value_std=0.224, train/target_value_mean=-0.296, train/target_value_std=0.258, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6935/8000 [2:08:14<1:01:39, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.14, train/loss=3.47, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.302, train/predicted_value_std=0.127, train/target_value_mean=-0.344, train/target_value_std=0.236, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6936/8000 [2:08:17<1:01:22, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.8, train/loss=3.46, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.278, train/predicted_value_std=0.143, train/target_value_mean=-0.223, train/target_value_std=0.22, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6937/8000 [2:08:21<1:01:06, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.64, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.313, train/predicted_value_std=0.173, train/target_value_mean=-0.222, train/target_value_std=0.122, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6938/8000 [2:08:24<1:02:23, 3.52s/it, time/step=3.7, time/training=3.69, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.31, train/loss=4.45, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.428, train/predicted_value_std=0.06, train/target_value_mean=-0.457, train/target_value_std=0.206, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6939/8000 [2:08:28<1:01:48, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.59, train/loss=3.63, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.318, train/predicted_value_std=0.184, train/target_value_mean=-0.309, train/target_value_std=0.24, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6940/8000 [2:08:31<1:01:21, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.86, train/loss=3.76, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.313, train/predicted_value_std=0.163, train/target_value_mean=-0.335, train/target_value_std=0.287, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6941/8000 [2:08:35<1:01:18, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.73, train/loss=3.3, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.274, train/predicted_value_std=0.0744, train/target_value_mean=-0.209, train/target_value_std=0.0626, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6942/8000 [2:08:38<1:00:51, 3.45s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.47, train/loss=3.69, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.314, train/predicted_value_std=0.171, train/target_value_mean=-0.336, train/target_value_std=0.207, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6943/8000 [2:08:41<1:00:35, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.94, train/loss=3.96, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.34, train/predicted_value_std=0.115, train/target_value_mean=-0.371, train/target_value_std=0.259, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6944/8000 [2:08:45<1:00:15, 3.42s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.11, train/loss=3.23, train/lr=5e-5, train/mae=0.0425, train/predicted_value_mean=-0.343, train/predicted_value_std=0.206, train/target_value_mean=-0.327, train/target_value_std=0.245, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6945/8000 [2:08:48<1:00:02, 3.41s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=9.94, train/loss=3.03, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.262, train/predicted_value_std=0.21, train/target_value_mean=-0.237, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6946/8000 [2:08:52<59:43, 3.40s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.38, train/loss=2.9, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.243, train/predicted_value_std=0.15, train/target_value_mean=-0.232, train/target_value_std=0.145, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6947/8000 [2:08:55<59:32, 3.39s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.45, train/loss=3.47, train/lr=5e-5, train/mae=0.0566, train/predicted_value_mean=-0.277, train/predicted_value_std=0.0824, train/target_value_mean=-0.206, train/target_value_std=0.11, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6948/8000 [2:08:58<59:20, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.42, train/loss=4.01, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.341, train/predicted_value_std=0.113, train/target_value_mean=-0.313, train/target_value_std=0.165, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6949/8000 [2:09:02<59:07, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=10.4, train/loss=3.2, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.267, train/predicted_value_std=0.13, train/target_value_mean=-0.253, train/target_value_std=0.194, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6950/8000 [2:09:05<1:00:23, 3.45s/it, time/step=3.63, time/training=3.62, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.53, train/loss=3.82, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.297, train/predicted_value_std=0.121, train/target_value_mean=-0.324, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6951/8000 [2:09:09<1:00:01, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.04, train/loss=3.4, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.22, train/predicted_value_std=0.0836, train/target_value_mean=-0.161, train/target_value_std=0.0887, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6952/8000 [2:09:12<59:54, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.69, train/loss=3.57, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.431, train/predicted_value_std=0.14, train/target_value_mean=-0.424, train/target_value_std=0.233, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6953/8000 [2:09:15<59:49, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.69, train/loss=3.3, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.232, train/predicted_value_std=0.121, train/target_value_mean=-0.195, train/target_value_std=0.141, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6954/8000 [2:09:19<59:29, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.16, train/loss=3.66, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.288, train/predicted_value_std=0.164, train/target_value_mean=-0.275, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6955/8000 [2:09:22<59:29, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.91, train/loss=3.23, train/lr=5e-5, train/mae=0.0809, train/predicted_value_mean=-0.321, train/predicted_value_std=0.161, train/target_value_mean=-0.278, train/target_value_std=0.172, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6956/8000 [2:09:26<59:34, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=8.97, train/loss=2.8, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.297, train/predicted_value_std=0.176, train/target_value_mean=-0.252, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6957/8000 [2:09:29<59:35, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.33, train/loss=3.68, train/lr=5e-5, train/mae=0.0537, train/predicted_value_mean=-0.371, train/predicted_value_std=0.121, train/target_value_mean=-0.325, train/target_value_std=0.171, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6958/8000 [2:09:33<59:38, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.5, train/loss=4.01, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.31, train/predicted_value_std=0.161, train/target_value_mean=-0.3, train/target_value_std=0.184, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6959/8000 [2:09:36<1:00:07, 3.47s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=6.6, train/loss=3.1, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.282, train/predicted_value_std=0.113, train/target_value_mean=-0.272, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6960/8000 [2:09:40<1:00:14, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.74, train/loss=3.39, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.316, train/predicted_value_std=0.164, train/target_value_mean=-0.294, train/target_value_std=0.251, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6961/8000 [2:09:43<1:00:14, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.17, train/loss=3.54, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.289, train/predicted_value_std=0.14, train/target_value_mean=-0.205, train/target_value_std=0.14, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6962/8000 [2:09:47<1:01:00, 3.53s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.76, train/loss=3.24, train/lr=5e-5, train/mae=0.0512, train/predicted_value_mean=-0.295, train/predicted_value_std=0.165, train/target_value_mean=-0.236, train/target_value_std=0.2, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6963/8000 [2:09:50<1:00:01, 3.47s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.61, train/loss=3.37, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.368, train/predicted_value_std=0.16, train/target_value_mean=-0.34, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6964/8000 [2:09:53<59:24, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=10.1, train/loss=4.1, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.296, train/predicted_value_std=0.129, train/target_value_mean=-0.282, train/target_value_std=0.199, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6965/8000 [2:09:57<59:42, 3.46s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.2, train/loss=3.77, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.257, train/predicted_value_std=0.0973, train/target_value_mean=-0.305, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6966/8000 [2:10:00<59:39, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.36, train/loss=3.81, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.283, train/predicted_value_std=0.16, train/target_value_mean=-0.305, train/target_value_std=0.176, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6967/8000 [2:10:04<59:49, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=12.1, train/loss=3.21, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.257, train/predicted_value_std=0.174, train/target_value_mean=-0.26, train/target_value_std=0.241, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6968/8000 [2:10:08<1:00:11, 3.50s/it, time/step=3.56, time/training=3.55, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=9, train/loss=3.85, train/lr=5e-5, train/mae=0.0603, train/predicted_value_mean=-0.252, train/predicted_value_std=0.0824, train/target_value_mean=-0.259, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6969/8000 [2:10:11<1:00:02, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.81, train/loss=3.31, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.228, train/predicted_value_std=0.152, train/target_value_mean=-0.198, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6970/8000 [2:10:14<59:53, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.98, train/loss=3.94, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.27, train/predicted_value_std=0.116, train/target_value_mean=-0.293, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6971/8000 [2:10:18<59:57, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=19, train/loss=3.86, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.297, train/predicted_value_std=0.141, train/target_value_mean=-0.324, train/target_value_std=0.181, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6972/8000 [2:10:21<59:40, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.53, train/loss=3.86, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.312, train/predicted_value_std=0.105, train/target_value_mean=-0.29, train/target_value_std=0.125, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6973/8000 [2:10:25<59:22, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.79, train/loss=3.61, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.364, train/predicted_value_std=0.125, train/target_value_mean=-0.394, train/target_value_std=0.181, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6974/8000 [2:10:29<1:01:09, 3.58s/it, time/step=3.83, time/training=3.82, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=6.63, train/loss=3.09, train/lr=5e-5, train/mae=0.0437, train/predicted_value_mean=-0.328, train/predicted_value_std=0.207, train/target_value_mean=-0.263, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6975/8000 [2:10:32<1:00:43, 3.55s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.84, train/loss=3.5, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.238, train/predicted_value_std=0.109, train/target_value_mean=-0.222, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6976/8000 [2:10:36<1:00:19, 3.53s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.03, train/loss=2.97, train/lr=5e-5, train/mae=0.0434, train/predicted_value_mean=-0.247, train/predicted_value_std=0.146, train/target_value_mean=-0.181, train/target_value_std=0.103, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6977/8000 [2:10:39<1:00:03, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.45, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.232, train/predicted_value_std=0.134, train/target_value_mean=-0.209, train/target_value_std=0.131, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6978/8000 [2:10:43<59:54, 3.52s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.63, train/loss=3.03, train/lr=5e-5, train/mae=0.0628, train/predicted_value_mean=-0.251, train/predicted_value_std=0.139, train/target_value_mean=-0.192, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6979/8000 [2:10:46<59:48, 3.51s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.75, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.309, train/predicted_value_std=0.121, train/target_value_mean=-0.299, train/target_value_std=0.217, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6980/8000 [2:10:50<59:40, 3.51s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.55, train/loss=3.25, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.238, train/predicted_value_std=0.13, train/target_value_mean=-0.269, train/target_value_std=0.179, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6981/8000 [2:10:53<59:43, 3.52s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.31, train/loss=3.39, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.364, train/predicted_value_std=0.166, train/target_value_mean=-0.397, train/target_value_std=0.253, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6982/8000 [2:10:57<58:54, 3.47s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.17, train/loss=3.01, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.19, train/predicted_value_std=0.14, train/target_value_mean=-0.238, train/target_value_std=0.232, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6983/8000 [2:11:00<58:05, 3.43s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.86, train/loss=3.17, train/lr=5e-5, train/mae=0.09, train/predicted_value_mean=-0.202, train/predicted_value_std=0.115, train/target_value_mean=-0.215, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 6984/8000 [2:11:03<57:36, 3.40s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.24, train/loss=3.02, train/lr=5e-5, train/mae=0.0309, train/predicted_value_mean=-0.233, train/predicted_value_std=0.114, train/target_value_mean=-0.205, train/target_value_std=0.109, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6985/8000 [2:11:07<57:15, 3.38s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.54, train/loss=4.03, train/lr=5e-5, train/mae=0.213, train/predicted_value_mean=-0.33, train/predicted_value_std=0.11, train/target_value_mean=-0.444, train/target_value_std=0.252, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6986/8000 [2:11:10<58:28, 3.46s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.82, train/loss=3.32, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.212, train/predicted_value_std=0.0981, train/target_value_mean=-0.224, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6987/8000 [2:11:14<58:18, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.35, train/loss=2.88, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.272, train/predicted_value_std=0.149, train/target_value_mean=-0.277, train/target_value_std=0.175, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 6988/8000 [2:11:17<58:15, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.55, train/loss=3.59, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.286, train/predicted_value_std=0.141, train/target_value_mean=-0.274, train/target_value_std=0.172, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 6989/8000 [2:11:21<58:13, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.58, train/loss=3.45, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.284, train/predicted_value_std=0.12, train/target_value_mean=-0.282, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 6990/8000 [2:11:24<58:04, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.24, train/loss=3.57, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.288, train/predicted_value_std=0.165, train/target_value_mean=-0.278, train/target_value_std=0.156, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6991/8000 [2:11:28<58:07, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.24, train/loss=3.42, train/lr=5e-5, train/mae=0.0825, train/predicted_value_mean=-0.271, train/predicted_value_std=0.173, train/target_value_mean=-0.252, train/target_value_std=0.211, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6992/8000 [2:11:31<58:15, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.43, train/loss=3.06, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0918, train/target_value_mean=-0.22, train/target_value_std=0.118, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6993/8000 [2:11:35<58:20, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.05, train/loss=4.06, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.303, train/predicted_value_std=0.102, train/target_value_mean=-0.253, train/target_value_std=0.123, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6994/8000 [2:11:38<58:12, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.89, train/loss=4.12, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.385, train/predicted_value_std=0.0559, train/target_value_mean=-0.356, train/target_value_std=0.106, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 6995/8000 [2:11:41<58:11, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.95, train/loss=3.59, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.311, train/predicted_value_std=0.166, train/target_value_mean=-0.282, train/target_value_std=0.255, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 6996/8000 [2:11:45<58:18, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.04, train/loss=3.21, train/lr=5e-5, train/mae=0.0587, train/predicted_value_mean=-0.33, train/predicted_value_std=0.174, train/target_value_mean=-0.307, train/target_value_std=0.19, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6997/8000 [2:11:48<58:29, 3.50s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.82, train/loss=3.32, train/lr=5e-5, train/mae=0.0687, train/predicted_value_mean=-0.278, train/predicted_value_std=0.113, train/target_value_mean=-0.198, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 6998/8000 [2:11:52<1:00:03, 3.60s/it, time/step=3.82, time/training=3.82, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.11, train/loss=3.87, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.441, train/predicted_value_std=0.205, train/target_value_mean=-0.534, train/target_value_std=0.248, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 87%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 6999/8000 [2:11:56<59:32, 3.57s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.47, train/loss=3.46, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.243, train/predicted_value_std=0.103, train/target_value_mean=-0.213, train/target_value_std=0.0919, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:859: UserWarning: `_get_pg_default_device` will be deprecated, it only stays for backward-compatiblity reason. If you need to find a device for object collectives, please use `_get_object_coll_device`. If you need to query the device types supported by group, please use `_device_capability(group)`. +(ActorGroup(rank=0) pid=3732960) warnings.warn( +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:4631: UserWarning: No device id is provided via `init_process_group` or `barrier `. Using the current device set by the user. +(ActorGroup(rank=0) pid=3732960) warnings.warn( # warn only once +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:4631: UserWarning: No device id is provided via `init_process_group` or `barrier `. Using the current device set by the user. +(ActorGroup(rank=0) pid=3732960) warnings.warn( # warn only once +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #1] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 88%|▉| 7000/8000 [2:17:53<30:27:00, 109.62s/it, time/step=357, time/training=3.55, time/evaluate=317, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=11.5, train/loss=3.1, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.311, train/predicted_value_std=0.148, train/target_value_mean=-0.287, train/target_value_std=0.17, train/value_spearman=1, eval/cat_acc_best=0.305, eval/cat_acc_neighbor=0.43, eval/loss=2.38, eval/mae=0.0181, eval/predicted_value_mean=-0.0997, eval/predicted_value_std=0.00116, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.305, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.43, eval/stack_bowls_recap_rollout_rc/loss=2.38, eval/stack_bowls_recap_rollout_rc/mae=0.0181, eval/stack_bowls_recap_rollout_rc/predicted_value(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7001/8000 [2:17:56<21:35:01, 77.78s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.17, train/loss=2.96, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.363, train/predicted_value_std=0.267, train/target_value_mean=-0.377, train/target_value_std=0.297, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7002/8000 [2:18:00<15:22:43, 55.47s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.7, train/loss=4.26, train/lr=5e-5, train/mae=0.0944, train/predicted_value_mean=-0.356, train/predicted_value_std=0.17, train/target_value_mean=-0.282, train/target_value_std=0.198, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7003/8000 [2:18:03<11:02:42, 39.88s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.87, train/loss=3.64, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.292, train/predicted_value_std=0.106, train/target_value_mean=-0.261, train/target_value_std=0.172, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7004/8000 [2:18:07<8:00:27, 28.94s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.65, train/loss=3.2, train/lr=5e-5, train/mae=0.0559, train/predicted_value_mean=-0.321, train/predicted_value_std=0.0837, train/target_value_mean=-0.276, train/target_value_std=0.117, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7005/8000 [2:18:10<5:52:37, 21.26s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.75, train/loss=3.26, train/lr=5e-5, train/mae=0.0728, train/predicted_value_mean=-0.257, train/predicted_value_std=0.177, train/target_value_mean=-0.268, train/target_value_std=0.261, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7006/8000 [2:18:13<4:23:10, 15.89s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.75, train/loss=3.77, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.313, train/predicted_value_std=0.152, train/target_value_mean=-0.249, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7007/8000 [2:18:17<3:20:33, 12.12s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=13.6, train/loss=3.37, train/lr=5e-5, train/mae=0.0816, train/predicted_value_mean=-0.336, train/predicted_value_std=0.109, train/target_value_mean=-0.357, train/target_value_std=0.14, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7008/8000 [2:18:20<2:36:46, 9.48s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.46, train/loss=3.33, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.338, train/predicted_value_std=0.155, train/target_value_mean=-0.296, train/target_value_std=0.145, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7009/8000 [2:18:23<2:06:19, 7.65s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.7, train/loss=3.59, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.296, train/predicted_value_std=0.165, train/target_value_mean=-0.269, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7010/8000 [2:18:27<1:45:05, 6.37s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=8.28, train/loss=2.22, train/lr=5e-5, train/mae=0.0191, train/predicted_value_mean=-0.146, train/predicted_value_std=0.105, train/target_value_mean=-0.129, train/target_value_std=0.119, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7011/8000 [2:18:30<1:29:57, 5.46s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.34, train/loss=3.45, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.28, train/predicted_value_std=0.187, train/target_value_mean=-0.234, train/target_value_std=0.204, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7012/8000 [2:18:34<1:19:28, 4.83s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.9, train/loss=2.99, train/lr=5e-5, train/mae=0.0428, train/predicted_value_mean=-0.303, train/predicted_value_std=0.132, train/target_value_mean=-0.266, train/target_value_std=0.154, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7013/8000 [2:18:37<1:13:40, 4.48s/it, time/step=3.67, time/training=3.66, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.01, train/loss=2.89, train/lr=5e-5, train/mae=0.0838, train/predicted_value_mean=-0.259, train/predicted_value_std=0.111, train/target_value_mean=-0.265, train/target_value_std=0.148, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7014/8000 [2:18:41<1:08:15, 4.15s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=9.99, train/loss=3.11, train/lr=5e-5, train/mae=0.0578, train/predicted_value_mean=-0.258, train/predicted_value_std=0.107, train/target_value_mean=-0.29, train/target_value_std=0.184, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7015/8000 [2:18:44<1:04:37, 3.94s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.98, train/loss=4, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.275, train/predicted_value_std=0.0858, train/target_value_mean=-0.242, train/target_value_std=0.122, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7016/8000 [2:18:47<1:02:01, 3.78s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.38, train/loss=3.43, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.356, train/predicted_value_std=0.243, train/target_value_mean=-0.324, train/target_value_std=0.303, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7017/8000 [2:18:51<1:00:14, 3.68s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=10.3, train/loss=3.31, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.272, train/predicted_value_std=0.0823, train/target_value_mean=-0.285, train/target_value_std=0.185, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7018/8000 [2:18:54<58:54, 3.60s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.49, train/loss=3.49, train/lr=5e-5, train/mae=0.0928, train/predicted_value_mean=-0.29, train/predicted_value_std=0.119, train/target_value_mean=-0.281, train/target_value_std=0.197, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7019/8000 [2:18:58<57:53, 3.54s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=9.27, train/loss=2.86, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.306, train/predicted_value_std=0.171, train/target_value_mean=-0.339, train/target_value_std=0.221, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7020/8000 [2:19:01<57:10, 3.50s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.43, train/loss=2.98, train/lr=5e-5, train/mae=0.0484, train/predicted_value_mean=-0.243, train/predicted_value_std=0.159, train/target_value_mean=-0.198, train/target_value_std=0.144, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7021/8000 [2:19:05<56:50, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.97, train/loss=3.65, train/lr=5e-5, train/mae=0.0697, train/predicted_value_mean=-0.285, train/predicted_value_std=0.146, train/target_value_mean=-0.287, train/target_value_std=0.245, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7022/8000 [2:19:08<56:29, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.88, train/loss=3.5, train/lr=5e-5, train/mae=0.0522, train/predicted_value_mean=-0.275, train/predicted_value_std=0.173, train/target_value_mean=-0.227, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7023/8000 [2:19:11<56:17, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=8.71, train/loss=2.87, train/lr=5e-5, train/mae=0.0463, train/predicted_value_mean=-0.231, train/predicted_value_std=0.137, train/target_value_mean=-0.216, train/target_value_std=0.134, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7024/8000 [2:19:15<55:57, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.2, train/loss=3.15, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.223, train/predicted_value_std=0.12, train/target_value_mean=-0.255, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7025/8000 [2:19:18<55:47, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=9.41, train/loss=2.81, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.167, train/predicted_value_std=0.0807, train/target_value_mean=-0.195, train/target_value_std=0.215, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7026/8000 [2:19:22<56:54, 3.51s/it, time/step=3.67, time/training=3.67, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.79, train/loss=3.73, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.282, train/predicted_value_std=0.0932, train/target_value_mean=-0.326, train/target_value_std=0.0988, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7027/8000 [2:19:25<56:20, 3.47s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.36, train/loss=3.85, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.282, train/predicted_value_std=0.106, train/target_value_mean=-0.271, train/target_value_std=0.148, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7028/8000 [2:19:29<56:04, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.49, train/loss=4.11, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.326, train/predicted_value_std=0.135, train/target_value_mean=-0.328, train/target_value_std=0.206, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7029/8000 [2:19:32<55:36, 3.44s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.93, train/loss=2.52, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.259, train/predicted_value_std=0.16, train/target_value_mean=-0.235, train/target_value_std=0.203, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7030/8000 [2:19:36<55:26, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=12.2, train/loss=4.15, train/lr=5e-5, train/mae=0.185, train/predicted_value_mean=-0.303, train/predicted_value_std=0.105, train/target_value_mean=-0.302, train/target_value_std=0.161, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7031/8000 [2:19:39<56:07, 3.47s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.69, train/loss=3.82, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.392, train/predicted_value_std=0.125, train/target_value_mean=-0.338, train/target_value_std=0.244, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7032/8000 [2:19:43<56:35, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=12, train/loss=3.97, train/lr=5e-5, train/mae=0.237, train/predicted_value_mean=-0.31, train/predicted_value_std=0.132, train/target_value_mean=-0.365, train/target_value_std=0.27, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7033/8000 [2:19:46<55:57, 3.47s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=9.5, train/loss=3.84, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.281, train/predicted_value_std=0.157, train/target_value_mean=-0.303, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7034/8000 [2:19:50<55:53, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.7, train/loss=3.06, train/lr=5e-5, train/mae=0.0809, train/predicted_value_mean=-0.335, train/predicted_value_std=0.145, train/target_value_mean=-0.321, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7035/8000 [2:19:53<55:33, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=6.1, train/loss=2.53, train/lr=5e-5, train/mae=0.0453, train/predicted_value_mean=-0.177, train/predicted_value_std=0.114, train/target_value_mean=-0.164, train/target_value_std=0.111, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7036/8000 [2:19:56<55:23, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.05, train/loss=3.35, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.253, train/predicted_value_std=0.0933, train/target_value_mean=-0.202, train/target_value_std=0.112, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7037/8000 [2:20:00<55:31, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.51, train/loss=3.3, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.306, train/predicted_value_std=0.21, train/target_value_mean=-0.263, train/target_value_std=0.266, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7038/8000 [2:20:04<57:07, 3.56s/it, time/step=3.8, time/training=3.8, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.26, train/loss=3.32, train/lr=5e-5, train/mae=0.0869, train/predicted_value_mean=-0.26, train/predicted_value_std=0.177, train/target_value_mean=-0.219, train/target_value_std=0.158, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7039/8000 [2:20:07<56:02, 3.50s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.14, train/loss=3.69, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.303, train/predicted_value_std=0.163, train/target_value_mean=-0.27, train/target_value_std=0.22, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7040/8000 [2:20:10<55:06, 3.44s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.22, train/loss=3.49, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.238, train/predicted_value_std=0.118, train/target_value_mean=-0.277, train/target_value_std=0.262, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7041/8000 [2:20:14<55:05, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.93, train/loss=3.71, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.336, train/predicted_value_std=0.137, train/target_value_mean=-0.37, train/target_value_std=0.32, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7042/8000 [2:20:17<55:04, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.14, train/loss=3.07, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.311, train/predicted_value_std=0.175, train/target_value_mean=-0.271, train/target_value_std=0.284, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7043/8000 [2:20:21<55:06, 3.46s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.59, train/loss=3.15, train/lr=5e-5, train/mae=0.0447, train/predicted_value_mean=-0.203, train/predicted_value_std=0.08, train/target_value_mean=-0.182, train/target_value_std=0.127, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7044/8000 [2:20:24<55:28, 3.48s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.37, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.286, train/predicted_value_std=0.172, train/target_value_mean=-0.27, train/target_value_std=0.189, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7045/8000 [2:20:28<55:32, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.57, train/loss=3.06, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.289, train/predicted_value_std=0.157, train/target_value_mean=-0.287, train/target_value_std=0.255, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7046/8000 [2:20:31<55:42, 3.50s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.5, train/loss=3.27, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.239, train/predicted_value_std=0.113, train/target_value_mean=-0.19, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7047/8000 [2:20:35<55:31, 3.50s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.82, train/loss=3.58, train/lr=5e-5, train/mae=0.0775, train/predicted_value_mean=-0.391, train/predicted_value_std=0.176, train/target_value_mean=-0.417, train/target_value_std=0.236, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7048/8000 [2:20:38<54:47, 3.45s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=12.4, train/loss=3.35, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.385, train/predicted_value_std=0.187, train/target_value_mean=-0.324, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7049/8000 [2:20:41<54:11, 3.42s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.31, train/loss=3.08, train/lr=5e-5, train/mae=0.0469, train/predicted_value_mean=-0.243, train/predicted_value_std=0.162, train/target_value_mean=-0.253, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7050/8000 [2:20:45<55:42, 3.52s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.58, train/loss=3.36, train/lr=5e-5, train/mae=0.0416, train/predicted_value_mean=-0.216, train/predicted_value_std=0.134, train/target_value_mean=-0.149, train/target_value_std=0.075, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7051/8000 [2:20:49<55:23, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=9.13, train/loss=2.85, train/lr=5e-5, train/mae=0.0594, train/predicted_value_mean=-0.25, train/predicted_value_std=0.211, train/target_value_mean=-0.231, train/target_value_std=0.203, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7052/8000 [2:20:52<55:12, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.8, train/loss=3.08, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.312, train/predicted_value_std=0.136, train/target_value_mean=-0.31, train/target_value_std=0.21, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7053/8000 [2:20:56<54:58, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.01, train/loss=2.98, train/lr=5e-5, train/mae=0.0756, train/predicted_value_mean=-0.221, train/predicted_value_std=0.12, train/target_value_mean=-0.186, train/target_value_std=0.139, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7054/8000 [2:20:59<54:20, 3.45s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.66, train/loss=3.16, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.299, train/predicted_value_std=0.138, train/target_value_mean=-0.229, train/target_value_std=0.155, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7055/8000 [2:21:02<54:05, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.41, train/loss=3.48, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.239, train/predicted_value_std=0.165, train/target_value_mean=-0.242, train/target_value_std=0.157, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7056/8000 [2:21:06<53:51, 3.42s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.87, train/loss=3.74, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.291, train/predicted_value_std=0.121, train/target_value_mean=-0.257, train/target_value_std=0.0761, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7057/8000 [2:21:09<53:28, 3.40s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.58, train/loss=3.31, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.307, train/predicted_value_std=0.167, train/target_value_mean=-0.271, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7058/8000 [2:21:13<53:18, 3.39s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.96, train/loss=3.59, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.277, train/predicted_value_std=0.113, train/target_value_mean=-0.292, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7059/8000 [2:21:16<53:02, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=14.7, train/loss=3.71, train/lr=5e-5, train/mae=0.175, train/predicted_value_mean=-0.281, train/predicted_value_std=0.128, train/target_value_mean=-0.205, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7060/8000 [2:21:19<52:51, 3.37s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=11.4, train/loss=3.39, train/lr=5e-5, train/mae=0.0541, train/predicted_value_mean=-0.327, train/predicted_value_std=0.152, train/target_value_mean=-0.339, train/target_value_std=0.184, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7061/8000 [2:21:23<52:51, 3.38s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.18, train/loss=4.02, train/lr=5e-5, train/mae=0.216, train/predicted_value_mean=-0.29, train/predicted_value_std=0.168, train/target_value_mean=-0.245, train/target_value_std=0.213, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7062/8000 [2:21:26<53:59, 3.45s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.66, train/loss=3.6, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.341, train/predicted_value_std=0.178, train/target_value_mean=-0.38, train/target_value_std=0.318, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7063/8000 [2:21:30<53:31, 3.43s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.1, train/loss=2.84, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.298, train/predicted_value_std=0.269, train/target_value_mean=-0.33, train/target_value_std=0.33, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7064/8000 [2:21:33<53:13, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.14, train/loss=3.64, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.321, train/predicted_value_std=0.115, train/target_value_mean=-0.316, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7065/8000 [2:21:36<53:15, 3.42s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.55, train/loss=3.58, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.295, train/predicted_value_std=0.132, train/target_value_mean=-0.296, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7066/8000 [2:21:40<53:19, 3.43s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.43, train/loss=3.54, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.351, train/predicted_value_std=0.145, train/target_value_mean=-0.338, train/target_value_std=0.279, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7067/8000 [2:21:43<53:19, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.5, train/loss=3.89, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.258, train/predicted_value_std=0.146, train/target_value_mean=-0.261, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7068/8000 [2:21:47<53:34, 3.45s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=6.86, train/loss=3.22, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.312, train/predicted_value_std=0.0967, train/target_value_mean=-0.313, train/target_value_std=0.178, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7069/8000 [2:21:50<54:00, 3.48s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=5.89, train/loss=2.96, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.279, train/predicted_value_std=0.162, train/target_value_mean=-0.297, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7070/8000 [2:21:54<53:52, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.38, train/loss=3.33, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.304, train/predicted_value_std=0.0659, train/target_value_mean=-0.286, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7071/8000 [2:21:57<53:14, 3.44s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.04, train/loss=3.36, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.338, train/predicted_value_std=0.0981, train/target_value_mean=-0.339, train/target_value_std=0.104, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7072/8000 [2:22:01<53:12, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.71, train/loss=3.65, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.328, train/predicted_value_std=0.123, train/target_value_mean=-0.291, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7073/8000 [2:22:04<53:16, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.6, train/loss=3.99, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.322, train/predicted_value_std=0.112, train/target_value_mean=-0.356, train/target_value_std=0.187, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7074/8000 [2:22:08<54:39, 3.54s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.95, train/loss=3.35, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.238, train/predicted_value_std=0.177, train/target_value_mean=-0.218, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7075/8000 [2:22:11<54:21, 3.53s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.97, train/loss=3.68, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.287, train/predicted_value_std=0.143, train/target_value_mean=-0.237, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7076/8000 [2:22:15<54:00, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.06, train/loss=3.03, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.26, train/predicted_value_std=0.189, train/target_value_mean=-0.244, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7077/8000 [2:22:18<53:33, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.19, train/loss=2.9, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.248, train/predicted_value_std=0.174, train/target_value_mean=-0.271, train/target_value_std=0.234, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7078/8000 [2:22:22<53:28, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.48, train/loss=3.25, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.253, train/predicted_value_std=0.0831, train/target_value_mean=-0.254, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7079/8000 [2:22:25<53:22, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.03, train/loss=3.13, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.3, train/predicted_value_std=0.173, train/target_value_mean=-0.294, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 88%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7080/8000 [2:22:29<53:19, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.98, train/loss=3.96, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.342, train/predicted_value_std=0.142, train/target_value_mean=-0.249, train/target_value_std=0.167, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7081/8000 [2:22:32<53:16, 3.48s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.47, train/loss=3.6, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.345, train/predicted_value_std=0.126, train/target_value_mean=-0.377, train/target_value_std=0.188, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7082/8000 [2:22:36<53:11, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.27, train/loss=3.34, train/lr=5e-5, train/mae=0.0616, train/predicted_value_mean=-0.291, train/predicted_value_std=0.141, train/target_value_mean=-0.268, train/target_value_std=0.147, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7083/8000 [2:22:39<53:04, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.1, train/loss=3.37, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.38, train/predicted_value_std=0.178, train/target_value_mean=-0.389, train/target_value_std=0.233, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7084/8000 [2:22:43<53:11, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.01, train/loss=3.32, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.319, train/predicted_value_std=0.135, train/target_value_mean=-0.287, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7085/8000 [2:22:46<53:04, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.57, train/loss=3.81, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.375, train/predicted_value_std=0.149, train/target_value_mean=-0.329, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7086/8000 [2:22:50<54:19, 3.57s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.02, train/loss=3.17, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.231, train/predicted_value_std=0.138, train/target_value_mean=-0.228, train/target_value_std=0.152, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7087/8000 [2:22:53<53:48, 3.54s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.19, train/loss=4.22, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.287, train/predicted_value_std=0.107, train/target_value_mean=-0.287, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7088/8000 [2:22:57<53:17, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.11, train/loss=3.77, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.285, train/predicted_value_std=0.124, train/target_value_mean=-0.288, train/target_value_std=0.206, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7089/8000 [2:23:00<52:21, 3.45s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=9.27, train/loss=3.01, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.209, train/predicted_value_std=0.118, train/target_value_mean=-0.183, train/target_value_std=0.154, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7090/8000 [2:23:03<52:02, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=3.87, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.269, train/predicted_value_std=0.149, train/target_value_mean=-0.185, train/target_value_std=0.175, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7091/8000 [2:23:07<52:00, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.63, train/loss=3.42, train/lr=5e-5, train/mae=0.0984, train/predicted_value_mean=-0.283, train/predicted_value_std=0.217, train/target_value_mean=-0.341, train/target_value_std=0.281, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7092/8000 [2:23:10<52:00, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.9, train/loss=3.83, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.339, train/predicted_value_std=0.132, train/target_value_mean=-0.325, train/target_value_std=0.208, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7093/8000 [2:23:14<52:05, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.48, train/loss=3.6, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.262, train/predicted_value_std=0.116, train/target_value_mean=-0.242, train/target_value_std=0.136, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7094/8000 [2:23:17<52:20, 3.47s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.21, train/loss=2.89, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.253, train/predicted_value_std=0.127, train/target_value_mean=-0.253, train/target_value_std=0.16, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7095/8000 [2:23:21<52:13, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.23, train/loss=3.9, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.295, train/predicted_value_std=0.167, train/target_value_mean=-0.336, train/target_value_std=0.251, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7096/8000 [2:23:24<52:11, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.5, train/loss=4.18, train/lr=5e-5, train/mae=0.242, train/predicted_value_mean=-0.303, train/predicted_value_std=0.155, train/target_value_mean=-0.33, train/target_value_std=0.251, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7097/8000 [2:23:28<51:58, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.56, train/loss=3.64, train/lr=5e-5, train/mae=0.0734, train/predicted_value_mean=-0.261, train/predicted_value_std=0.109, train/target_value_mean=-0.217, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7098/8000 [2:23:31<53:01, 3.53s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.49, train/loss=3.7, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.255, train/predicted_value_std=0.148, train/target_value_mean=-0.248, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7099/8000 [2:23:35<52:35, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.24, train/loss=4.23, train/lr=5e-5, train/mae=0.215, train/predicted_value_mean=-0.281, train/predicted_value_std=0.0636, train/target_value_mean=-0.304, train/target_value_std=0.104, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7100/8000 [2:23:38<52:31, 3.50s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.83, train/loss=3.63, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.251, train/predicted_value_std=0.166, train/target_value_mean=-0.258, train/target_value_std=0.188, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7101/8000 [2:23:42<52:09, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.37, train/loss=2.99, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.272, train/predicted_value_std=0.193, train/target_value_mean=-0.288, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7102/8000 [2:23:45<51:29, 3.44s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=7.13, train/loss=2.89, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.247, train/predicted_value_std=0.167, train/target_value_mean=-0.232, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7103/8000 [2:23:48<51:03, 3.42s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.21, train/loss=3.86, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.422, train/predicted_value_std=0.16, train/target_value_mean=-0.387, train/target_value_std=0.131, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7104/8000 [2:23:52<51:09, 3.43s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.17, train/loss=3.84, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.41, train/predicted_value_std=0.241, train/target_value_mean=-0.438, train/target_value_std=0.334, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7105/8000 [2:23:55<51:32, 3.46s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.93, train/loss=3.18, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.267, train/predicted_value_std=0.183, train/target_value_mean=-0.257, train/target_value_std=0.229, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7106/8000 [2:23:59<51:58, 3.49s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.21, train/loss=3, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.249, train/predicted_value_std=0.115, train/target_value_mean=-0.261, train/target_value_std=0.13, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7107/8000 [2:24:03<52:19, 3.52s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.71, train/loss=3.55, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.249, train/predicted_value_std=0.126, train/target_value_mean=-0.191, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7108/8000 [2:24:06<52:03, 3.50s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.375, train/grad_norm=7.95, train/loss=3.61, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.377, train/predicted_value_std=0.225, train/target_value_mean=-0.406, train/target_value_std=0.371, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7109/8000 [2:24:09<51:44, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.56, train/loss=3.55, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.31, train/predicted_value_std=0.148, train/target_value_mean=-0.262, train/target_value_std=0.245, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7110/8000 [2:24:13<52:55, 3.57s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.93, train/loss=3.49, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.326, train/predicted_value_std=0.12, train/target_value_mean=-0.35, train/target_value_std=0.142, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7111/8000 [2:24:17<52:22, 3.53s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.7, train/loss=3.04, train/lr=5e-5, train/mae=0.221, train/predicted_value_mean=-0.311, train/predicted_value_std=0.257, train/target_value_mean=-0.227, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7112/8000 [2:24:20<51:53, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.98, train/loss=3.42, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.239, train/predicted_value_std=0.08, train/target_value_mean=-0.168, train/target_value_std=0.113, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7113/8000 [2:24:24<51:39, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.08, train/loss=3.65, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.336, train/predicted_value_std=0.145, train/target_value_mean=-0.277, train/target_value_std=0.0888, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7114/8000 [2:24:27<51:25, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=7.8, train/loss=3.53, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.328, train/predicted_value_std=0.105, train/target_value_mean=-0.404, train/target_value_std=0.135, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7115/8000 [2:24:30<51:11, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.58, train/loss=3.3, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.288, train/predicted_value_std=0.14, train/target_value_mean=-0.221, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7116/8000 [2:24:34<51:04, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.51, train/loss=3.59, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.29, train/predicted_value_std=0.146, train/target_value_mean=-0.294, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7117/8000 [2:24:37<50:36, 3.44s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.23, train/loss=3.59, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.286, train/predicted_value_std=0.109, train/target_value_mean=-0.287, train/target_value_std=0.173, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7118/8000 [2:24:41<50:16, 3.42s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.56, train/loss=3.49, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.263, train/predicted_value_std=0.133, train/target_value_mean=-0.239, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7119/8000 [2:24:44<50:01, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.85, train/loss=3.39, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.292, train/predicted_value_std=0.0694, train/target_value_mean=-0.283, train/target_value_std=0.112, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7120/8000 [2:24:47<49:46, 3.39s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=6.8, train/loss=4.02, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.286, train/predicted_value_std=0.0888, train/target_value_mean=-0.285, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7121/8000 [2:24:51<49:57, 3.41s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.63, train/loss=3.5, train/lr=5e-5, train/mae=0.217, train/predicted_value_mean=-0.243, train/predicted_value_std=0.0963, train/target_value_mean=-0.321, train/target_value_std=0.156, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7122/8000 [2:24:55<51:26, 3.52s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.53, train/loss=3.65, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.354, train/predicted_value_std=0.111, train/target_value_mean=-0.389, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7123/8000 [2:24:58<51:11, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.76, train/loss=3.83, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.277, train/predicted_value_std=0.0605, train/target_value_mean=-0.233, train/target_value_std=0.0909, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7124/8000 [2:25:02<50:57, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.12, train/loss=3.74, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.304, train/predicted_value_std=0.0774, train/target_value_mean=-0.299, train/target_value_std=0.115, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7125/8000 [2:25:05<50:25, 3.46s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.05, train/loss=3.41, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.266, train/predicted_value_std=0.116, train/target_value_mean=-0.26, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7126/8000 [2:25:08<50:20, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.25, train/loss=3.3, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.302, train/predicted_value_std=0.158, train/target_value_mean=-0.312, train/target_value_std=0.213, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7127/8000 [2:25:12<50:18, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=11.4, train/loss=3.91, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.358, train/predicted_value_std=0.162, train/target_value_mean=-0.306, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7128/8000 [2:25:15<50:35, 3.48s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.9, train/loss=3.54, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.286, train/predicted_value_std=0.134, train/target_value_mean=-0.259, train/target_value_std=0.206, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7129/8000 [2:25:19<50:12, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.84, train/loss=3.62, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.283, train/predicted_value_std=0.155, train/target_value_mean=-0.287, train/target_value_std=0.226, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7130/8000 [2:25:22<49:37, 3.42s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=13.4, train/loss=3.33, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.309, train/predicted_value_std=0.165, train/target_value_mean=-0.335, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7131/8000 [2:25:26<49:38, 3.43s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.55, train/loss=3.22, train/lr=5e-5, train/mae=0.0591, train/predicted_value_mean=-0.281, train/predicted_value_std=0.145, train/target_value_mean=-0.304, train/target_value_std=0.128, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7132/8000 [2:25:29<49:26, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.48, train/loss=3.87, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.244, train/predicted_value_std=0.113, train/target_value_mean=-0.24, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7133/8000 [2:25:32<48:59, 3.39s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.5, train/loss=3.02, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.275, train/predicted_value_std=0.0913, train/target_value_mean=-0.202, train/target_value_std=0.102, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7134/8000 [2:25:36<50:10, 3.48s/it, time/step=3.67, time/training=3.67, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.97, train/loss=3.53, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.319, train/predicted_value_std=0.18, train/target_value_mean=-0.283, train/target_value_std=0.15, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7135/8000 [2:25:39<49:49, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.75, train/loss=3.39, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.321, train/predicted_value_std=0.204, train/target_value_mean=-0.349, train/target_value_std=0.263, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7136/8000 [2:25:43<49:40, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.21, train/loss=3.99, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.322, train/predicted_value_std=0.147, train/target_value_mean=-0.413, train/target_value_std=0.241, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7137/8000 [2:25:46<49:32, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.72, train/loss=3.65, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.303, train/predicted_value_std=0.139, train/target_value_mean=-0.29, train/target_value_std=0.228, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7138/8000 [2:25:50<50:02, 3.48s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.96, train/loss=3.36, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0809, train/target_value_mean=-0.226, train/target_value_std=0.123, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7139/8000 [2:25:53<50:17, 3.50s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.19, train/loss=3.33, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.329, train/predicted_value_std=0.143, train/target_value_mean=-0.32, train/target_value_std=0.168, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7140/8000 [2:25:57<50:46, 3.54s/it, time/step=3.63, time/training=3.63, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.95, train/loss=3.64, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.294, train/predicted_value_std=0.0902, train/target_value_mean=-0.252, train/target_value_std=0.157, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7141/8000 [2:26:01<50:54, 3.56s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.42, train/loss=3.73, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.312, train/predicted_value_std=0.17, train/target_value_mean=-0.302, train/target_value_std=0.199, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7142/8000 [2:26:04<50:36, 3.54s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.21, train/loss=3.58, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.338, train/predicted_value_std=0.139, train/target_value_mean=-0.417, train/target_value_std=0.294, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7143/8000 [2:26:08<50:25, 3.53s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.79, train/loss=3.22, train/lr=5e-5, train/mae=0.0394, train/predicted_value_mean=-0.295, train/predicted_value_std=0.197, train/target_value_mean=-0.286, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7144/8000 [2:26:11<50:16, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.56, train/loss=2.95, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.358, train/predicted_value_std=0.229, train/target_value_mean=-0.328, train/target_value_std=0.256, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7145/8000 [2:26:15<50:36, 3.55s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.9, train/loss=3.25, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.228, train/predicted_value_std=0.178, train/target_value_mean=-0.177, train/target_value_std=0.166, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7146/8000 [2:26:19<52:12, 3.67s/it, time/step=3.94, time/training=3.93, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10, train/loss=3.43, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.293, train/predicted_value_std=0.162, train/target_value_mean=-0.311, train/target_value_std=0.231, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7147/8000 [2:26:22<51:14, 3.60s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=12.5, train/loss=2.75, train/lr=5e-5, train/mae=0.0222, train/predicted_value_mean=-0.256, train/predicted_value_std=0.111, train/target_value_mean=-0.185, train/target_value_std=0.0569, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7148/8000 [2:26:26<50:43, 3.57s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.27, train/loss=3.37, train/lr=5e-5, train/mae=0.0816, train/predicted_value_mean=-0.262, train/predicted_value_std=0.153, train/target_value_mean=-0.209, train/target_value_std=0.109, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7149/8000 [2:26:29<50:09, 3.54s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.73, train/loss=3.61, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.359, train/predicted_value_std=0.137, train/target_value_mean=-0.33, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7150/8000 [2:26:32<49:44, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.1, train/loss=3.44, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.333, train/predicted_value_std=0.164, train/target_value_mean=-0.336, train/target_value_std=0.264, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7151/8000 [2:26:36<49:33, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.01, train/loss=3.43, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.287, train/predicted_value_std=0.103, train/target_value_mean=-0.223, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7152/8000 [2:26:39<49:09, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.8, train/loss=3.05, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.26, train/predicted_value_std=0.18, train/target_value_mean=-0.176, train/target_value_std=0.102, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7153/8000 [2:26:43<49:01, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.42, train/loss=2.66, train/lr=5e-5, train/mae=0.0647, train/predicted_value_mean=-0.272, train/predicted_value_std=0.154, train/target_value_mean=-0.225, train/target_value_std=0.201, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7154/8000 [2:26:46<48:52, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.46, train/loss=2.74, train/lr=5e-5, train/mae=0.0591, train/predicted_value_mean=-0.283, train/predicted_value_std=0.152, train/target_value_mean=-0.234, train/target_value_std=0.202, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7155/8000 [2:26:50<48:44, 3.46s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.46, train/loss=3.66, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.297, train/predicted_value_std=0.129, train/target_value_mean=-0.291, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7156/8000 [2:26:53<48:14, 3.43s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.21, train/loss=3.11, train/lr=5e-5, train/mae=0.0628, train/predicted_value_mean=-0.248, train/predicted_value_std=0.158, train/target_value_mean=-0.223, train/target_value_std=0.191, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7157/8000 [2:26:57<48:01, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=10.2, train/loss=3.2, train/lr=5e-5, train/mae=0.0872, train/predicted_value_mean=-0.29, train/predicted_value_std=0.0999, train/target_value_mean=-0.242, train/target_value_std=0.0912, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7158/8000 [2:27:00<49:05, 3.50s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.8, train/loss=3.43, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.31, train/predicted_value_std=0.134, train/target_value_mean=-0.299, train/target_value_std=0.187, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 89%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7159/8000 [2:27:04<48:44, 3.48s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.44, train/loss=3.4, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.327, train/predicted_value_std=0.133, train/target_value_mean=-0.253, train/target_value_std=0.113, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7160/8000 [2:27:07<48:14, 3.45s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.19, train/loss=4.05, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.359, train/predicted_value_std=0.13, train/target_value_mean=-0.418, train/target_value_std=0.156, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7161/8000 [2:27:10<47:55, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.25, train/loss=3.47, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.323, train/predicted_value_std=0.18, train/target_value_mean=-0.367, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7162/8000 [2:27:14<47:37, 3.41s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.42, train/loss=3.5, train/lr=5e-5, train/mae=0.0541, train/predicted_value_mean=-0.24, train/predicted_value_std=0.135, train/target_value_mean=-0.19, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7163/8000 [2:27:17<47:48, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.81, train/loss=3.47, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.372, train/predicted_value_std=0.228, train/target_value_mean=-0.394, train/target_value_std=0.321, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7164/8000 [2:27:21<47:55, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.3, train/loss=3.6, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.212, train/predicted_value_std=0.07, train/target_value_mean=-0.243, train/target_value_std=0.087, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7165/8000 [2:27:24<48:01, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.17, train/loss=3.07, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.23, train/predicted_value_std=0.102, train/target_value_mean=-0.25, train/target_value_std=0.0995, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7166/8000 [2:27:28<48:27, 3.49s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.54, train/loss=3.62, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.242, train/predicted_value_std=0.182, train/target_value_mean=-0.172, train/target_value_std=0.133, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7167/8000 [2:27:31<48:19, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.625, train/grad_norm=7.25, train/loss=2.75, train/lr=5e-5, train/mae=0.0284, train/predicted_value_mean=-0.205, train/predicted_value_std=0.154, train/target_value_mean=-0.188, train/target_value_std=0.151, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7168/8000 [2:27:35<48:08, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=10.1, train/loss=2.98, train/lr=5e-5, train/mae=0.0566, train/predicted_value_mean=-0.307, train/predicted_value_std=0.2, train/target_value_mean=-0.319, train/target_value_std=0.25, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7169/8000 [2:27:38<47:56, 3.46s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.29, train/loss=3.56, train/lr=5e-5, train/mae=0.06, train/predicted_value_mean=-0.272, train/predicted_value_std=0.16, train/target_value_mean=-0.287, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7170/8000 [2:27:42<48:48, 3.53s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.41, train/loss=3.44, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.299, train/predicted_value_std=0.103, train/target_value_mean=-0.281, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7171/8000 [2:27:45<48:21, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=9.06, train/loss=3.28, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.269, train/predicted_value_std=0.176, train/target_value_mean=-0.272, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7172/8000 [2:27:49<48:09, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=9.61, train/loss=3.32, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.303, train/predicted_value_std=0.104, train/target_value_mean=-0.306, train/target_value_std=0.126, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7173/8000 [2:27:52<48:02, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.7, train/loss=3.68, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.25, train/predicted_value_std=0.133, train/target_value_mean=-0.23, train/target_value_std=0.188, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7174/8000 [2:27:56<47:46, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.67, train/loss=3.58, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.253, train/predicted_value_std=0.133, train/target_value_mean=-0.3, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7175/8000 [2:27:59<47:36, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.75, train/loss=3.41, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.298, train/predicted_value_std=0.174, train/target_value_mean=-0.283, train/target_value_std=0.188, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7176/8000 [2:28:03<47:40, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.98, train/loss=3.5, train/lr=5e-5, train/mae=0.23, train/predicted_value_mean=-0.264, train/predicted_value_std=0.103, train/target_value_mean=-0.3, train/target_value_std=0.141, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7177/8000 [2:28:06<47:45, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.29, train/loss=3.79, train/lr=5e-5, train/mae=0.222, train/predicted_value_mean=-0.466, train/predicted_value_std=0.151, train/target_value_mean=-0.451, train/target_value_std=0.34, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7178/8000 [2:28:09<47:36, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.33, train/loss=3.7, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.331, train/predicted_value_std=0.141, train/target_value_mean=-0.34, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7179/8000 [2:28:13<47:35, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.07, train/loss=3.18, train/lr=5e-5, train/mae=0.0531, train/predicted_value_mean=-0.27, train/predicted_value_std=0.175, train/target_value_mean=-0.242, train/target_value_std=0.237, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7180/8000 [2:28:16<47:35, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.89, train/loss=3.8, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.344, train/predicted_value_std=0.169, train/target_value_mean=-0.333, train/target_value_std=0.276, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7181/8000 [2:28:20<47:23, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.67, train/loss=3.35, train/lr=5e-5, train/mae=0.0603, train/predicted_value_mean=-0.243, train/predicted_value_std=0.0971, train/target_value_mean=-0.207, train/target_value_std=0.142, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7182/8000 [2:28:24<48:28, 3.56s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.41, train/loss=3.73, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.346, train/predicted_value_std=0.179, train/target_value_mean=-0.325, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7183/8000 [2:28:27<47:58, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.86, train/loss=3.23, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.324, train/predicted_value_std=0.134, train/target_value_mean=-0.324, train/target_value_std=0.272, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7184/8000 [2:28:31<47:59, 3.53s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.63, train/loss=3.09, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.27, train/predicted_value_std=0.133, train/target_value_mean=-0.257, train/target_value_std=0.168, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7185/8000 [2:28:34<47:52, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.77, train/loss=3.69, train/lr=5e-5, train/mae=0.0628, train/predicted_value_mean=-0.384, train/predicted_value_std=0.165, train/target_value_mean=-0.376, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7186/8000 [2:28:38<47:20, 3.49s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.06, train/loss=4.01, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.324, train/predicted_value_std=0.159, train/target_value_mean=-0.311, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7187/8000 [2:28:41<46:44, 3.45s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.92, train/loss=3.02, train/lr=5e-5, train/mae=0.0634, train/predicted_value_mean=-0.259, train/predicted_value_std=0.156, train/target_value_mean=-0.238, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7188/8000 [2:28:44<46:18, 3.42s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.04, train/loss=3.94, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.334, train/predicted_value_std=0.0515, train/target_value_mean=-0.318, train/target_value_std=0.102, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7189/8000 [2:28:48<45:54, 3.40s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.28, train/loss=3.69, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.235, train/predicted_value_std=0.125, train/target_value_mean=-0.217, train/target_value_std=0.207, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7190/8000 [2:28:51<45:53, 3.40s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.1, train/loss=3.67, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.292, train/predicted_value_std=0.152, train/target_value_mean=-0.294, train/target_value_std=0.178, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7191/8000 [2:28:54<45:43, 3.39s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=11, train/loss=3.7, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.328, train/predicted_value_std=0.187, train/target_value_mean=-0.299, train/target_value_std=0.15, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7192/8000 [2:28:58<45:37, 3.39s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.53, train/loss=3.58, train/lr=5e-5, train/mae=0.0709, train/predicted_value_mean=-0.283, train/predicted_value_std=0.147, train/target_value_mean=-0.263, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7193/8000 [2:29:01<45:28, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.14, train/loss=3.64, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.262, train/predicted_value_std=0.16, train/target_value_mean=-0.258, train/target_value_std=0.217, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7194/8000 [2:29:05<47:13, 3.52s/it, time/step=3.83, time/training=3.83, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.56, train/loss=3.9, train/lr=5e-5, train/mae=0.225, train/predicted_value_mean=-0.327, train/predicted_value_std=0.14, train/target_value_mean=-0.3, train/target_value_std=0.325, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7195/8000 [2:29:08<47:09, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.67, train/loss=3.82, train/lr=5e-5, train/mae=0.231, train/predicted_value_mean=-0.25, train/predicted_value_std=0.14, train/target_value_mean=-0.288, train/target_value_std=0.213, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7196/8000 [2:29:12<46:52, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.78, train/loss=3.06, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.313, train/predicted_value_std=0.149, train/target_value_mean=-0.305, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7197/8000 [2:29:15<46:34, 3.48s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.67, train/loss=4.02, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.337, train/predicted_value_std=0.129, train/target_value_mean=-0.333, train/target_value_std=0.154, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7198/8000 [2:29:19<46:51, 3.51s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.76, train/loss=3.29, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.245, train/predicted_value_std=0.131, train/target_value_mean=-0.203, train/target_value_std=0.133, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7199/8000 [2:29:22<46:52, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.62, train/loss=4.13, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.305, train/predicted_value_std=0.124, train/target_value_mean=-0.296, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7200/8000 [2:29:26<46:47, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.55, train/loss=3.37, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.281, train/predicted_value_std=0.165, train/target_value_mean=-0.26, train/target_value_std=0.166, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7201/8000 [2:29:29<46:46, 3.51s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.91, train/loss=3.63, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.251, train/predicted_value_std=0.108, train/target_value_mean=-0.269, train/target_value_std=0.142, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7202/8000 [2:29:33<46:42, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.1, train/loss=2.8, train/lr=5e-5, train/mae=0.0597, train/predicted_value_mean=-0.195, train/predicted_value_std=0.113, train/target_value_mean=-0.173, train/target_value_std=0.112, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7203/8000 [2:29:37<46:41, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.25, train/loss=3.09, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.348, train/predicted_value_std=0.229, train/target_value_mean=-0.35, train/target_value_std=0.304, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7204/8000 [2:29:40<46:40, 3.52s/it, time/step=3.53, time/training=3.52, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.13, train/loss=3.72, train/lr=5e-5, train/mae=0.166, train/predicted_value_mean=-0.343, train/predicted_value_std=0.198, train/target_value_mean=-0.331, train/target_value_std=0.307, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7205/8000 [2:29:44<46:33, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.08, train/loss=3.56, train/lr=5e-5, train/mae=0.0794, train/predicted_value_mean=-0.301, train/predicted_value_std=0.108, train/target_value_mean=-0.256, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7206/8000 [2:29:47<47:05, 3.56s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=12.3, train/loss=3.63, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.302, train/predicted_value_std=0.173, train/target_value_mean=-0.266, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7207/8000 [2:29:51<46:18, 3.50s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.21, train/loss=2.95, train/lr=5e-5, train/mae=0.05, train/predicted_value_mean=-0.312, train/predicted_value_std=0.221, train/target_value_mean=-0.286, train/target_value_std=0.251, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7208/8000 [2:29:54<46:03, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.94, train/loss=3.46, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.227, train/predicted_value_std=0.155, train/target_value_mean=-0.282, train/target_value_std=0.257, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7209/8000 [2:29:58<45:59, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=6.47, train/loss=2.59, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.23, train/predicted_value_std=0.172, train/target_value_mean=-0.213, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7210/8000 [2:30:01<45:53, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.02, train/loss=2.98, train/lr=5e-5, train/mae=0.0178, train/predicted_value_mean=-0.305, train/predicted_value_std=0.13, train/target_value_mean=-0.276, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7211/8000 [2:30:04<45:34, 3.47s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.8, train/loss=3.71, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.284, train/predicted_value_std=0.0999, train/target_value_mean=-0.253, train/target_value_std=0.0764, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7212/8000 [2:30:08<45:30, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.68, train/loss=3.94, train/lr=5e-5, train/mae=0.204, train/predicted_value_mean=-0.294, train/predicted_value_std=0.144, train/target_value_mean=-0.317, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7213/8000 [2:30:11<45:54, 3.50s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.92, train/loss=3.01, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.309, train/predicted_value_std=0.183, train/target_value_mean=-0.283, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7214/8000 [2:30:15<45:49, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=6.6, train/loss=2.53, train/lr=5e-5, train/mae=0.0837, train/predicted_value_mean=-0.131, train/predicted_value_std=0.106, train/target_value_mean=-0.126, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7215/8000 [2:30:18<45:44, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.3, train/loss=3.77, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0946, train/target_value_mean=-0.298, train/target_value_std=0.128, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7216/8000 [2:30:22<45:44, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.54, train/loss=3.77, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.341, train/predicted_value_std=0.17, train/target_value_mean=-0.293, train/target_value_std=0.226, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7217/8000 [2:30:25<45:34, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.54, train/loss=3.63, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.368, train/predicted_value_std=0.0802, train/target_value_mean=-0.388, train/target_value_std=0.132, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7218/8000 [2:30:29<46:41, 3.58s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.81, train/loss=3.72, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.422, train/predicted_value_std=0.209, train/target_value_mean=-0.421, train/target_value_std=0.265, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7219/8000 [2:30:33<46:02, 3.54s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.04, train/loss=3.45, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.339, train/predicted_value_std=0.157, train/target_value_mean=-0.365, train/target_value_std=0.167, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7220/8000 [2:30:36<45:26, 3.50s/it, time/step=3.4, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.6, train/loss=3.28, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.369, train/predicted_value_std=0.165, train/target_value_mean=-0.37, train/target_value_std=0.23, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7221/8000 [2:30:40<45:08, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.27, train/loss=3.57, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.375, train/predicted_value_std=0.223, train/target_value_mean=-0.373, train/target_value_std=0.237, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7222/8000 [2:30:43<45:08, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.31, train/loss=3.45, train/lr=5e-5, train/mae=0.06, train/predicted_value_mean=-0.268, train/predicted_value_std=0.104, train/target_value_mean=-0.261, train/target_value_std=0.134, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7223/8000 [2:30:46<45:08, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=8.37, train/loss=3.71, train/lr=5e-5, train/mae=0.0644, train/predicted_value_mean=-0.295, train/predicted_value_std=0.15, train/target_value_mean=-0.298, train/target_value_std=0.19, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7224/8000 [2:30:50<45:14, 3.50s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.31, train/loss=3.53, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.279, train/predicted_value_std=0.121, train/target_value_mean=-0.219, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7225/8000 [2:30:54<45:27, 3.52s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.4, train/loss=3.6, train/lr=5e-5, train/mae=0.0681, train/predicted_value_mean=-0.357, train/predicted_value_std=0.148, train/target_value_mean=-0.361, train/target_value_std=0.138, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7226/8000 [2:30:57<45:20, 3.52s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.18, train/loss=3.22, train/lr=5e-5, train/mae=0.0662, train/predicted_value_mean=-0.225, train/predicted_value_std=0.142, train/target_value_mean=-0.163, train/target_value_std=0.118, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7227/8000 [2:31:01<45:14, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.26, train/loss=2.37, train/lr=5e-5, train/mae=0.0194, train/predicted_value_mean=-0.193, train/predicted_value_std=0.0687, train/target_value_mean=-0.162, train/target_value_std=0.0673, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7228/8000 [2:31:04<45:17, 3.52s/it, time/step=3.54, time/training=3.53, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.93, train/loss=3.84, train/lr=5e-5, train/mae=0.0944, train/predicted_value_mean=-0.287, train/predicted_value_std=0.118, train/target_value_mean=-0.325, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7229/8000 [2:31:08<45:12, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.25, train/loss=3.64, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.265, train/predicted_value_std=0.163, train/target_value_mean=-0.271, train/target_value_std=0.197, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7230/8000 [2:31:11<46:12, 3.60s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.99, train/loss=3.57, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.246, train/predicted_value_std=0.145, train/target_value_mean=-0.251, train/target_value_std=0.196, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7231/8000 [2:31:15<45:50, 3.58s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.88, train/loss=3.39, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.343, train/predicted_value_std=0.148, train/target_value_mean=-0.303, train/target_value_std=0.257, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7232/8000 [2:31:19<45:52, 3.58s/it, time/step=3.6, time/training=3.59, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.95, train/loss=3.78, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.283, train/predicted_value_std=0.163, train/target_value_mean=-0.258, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7233/8000 [2:31:22<45:35, 3.57s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.85, train/loss=3.24, train/lr=5e-5, train/mae=0.0763, train/predicted_value_mean=-0.191, train/predicted_value_std=0.0964, train/target_value_mean=-0.14, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7234/8000 [2:31:26<45:20, 3.55s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.7, train/loss=3.98, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.301, train/predicted_value_std=0.0692, train/target_value_mean=-0.329, train/target_value_std=0.109, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7235/8000 [2:31:29<45:14, 3.55s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.66, train/loss=3.38, train/lr=5e-5, train/mae=0.0969, train/predicted_value_mean=-0.251, train/predicted_value_std=0.117, train/target_value_mean=-0.169, train/target_value_std=0.139, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7236/8000 [2:31:33<44:43, 3.51s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.74, train/loss=3.51, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.247, train/predicted_value_std=0.147, train/target_value_mean=-0.188, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7237/8000 [2:31:36<44:17, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=6.79, train/loss=3.96, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.246, train/predicted_value_std=0.119, train/target_value_mean=-0.282, train/target_value_std=0.201, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7238/8000 [2:31:39<43:57, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.55, train/loss=3.41, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.277, train/predicted_value_std=0.135, train/target_value_mean=-0.259, train/target_value_std=0.114, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7239/8000 [2:31:43<43:44, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.46, train/loss=3.46, train/lr=5e-5, train/mae=0.0469, train/predicted_value_mean=-0.271, train/predicted_value_std=0.181, train/target_value_mean=-0.236, train/target_value_std=0.194, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 90%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7240/8000 [2:31:46<43:32, 3.44s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.61, train/loss=3.57, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0891, train/target_value_mean=-0.273, train/target_value_std=0.159, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7241/8000 [2:31:50<43:25, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.9, train/loss=3.43, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.311, train/predicted_value_std=0.127, train/target_value_mean=-0.315, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7242/8000 [2:31:53<44:19, 3.51s/it, time/step=3.68, time/training=3.68, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.75, train/loss=3.23, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.271, train/predicted_value_std=0.165, train/target_value_mean=-0.267, train/target_value_std=0.258, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7243/8000 [2:31:57<43:56, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10, train/loss=3.58, train/lr=5e-5, train/mae=0.176, train/predicted_value_mean=-0.365, train/predicted_value_std=0.125, train/target_value_mean=-0.409, train/target_value_std=0.155, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7244/8000 [2:32:00<43:35, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=13.7, train/loss=3.33, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.268, train/predicted_value_std=0.198, train/target_value_mean=-0.32, train/target_value_std=0.313, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7245/8000 [2:32:04<43:23, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.53, train/loss=3.01, train/lr=5e-5, train/mae=0.0712, train/predicted_value_mean=-0.266, train/predicted_value_std=0.163, train/target_value_mean=-0.226, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7246/8000 [2:32:07<43:16, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.45, train/loss=3.45, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.334, train/predicted_value_std=0.15, train/target_value_mean=-0.355, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7247/8000 [2:32:10<43:12, 3.44s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11.5, train/loss=3.43, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.326, train/predicted_value_std=0.116, train/target_value_mean=-0.33, train/target_value_std=0.183, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7248/8000 [2:32:14<43:23, 3.46s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.55, train/loss=3.87, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.298, train/predicted_value_std=0.114, train/target_value_mean=-0.342, train/target_value_std=0.164, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7249/8000 [2:32:18<43:35, 3.48s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.47, train/loss=3.6, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.333, train/predicted_value_std=0.193, train/target_value_mean=-0.322, train/target_value_std=0.189, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7250/8000 [2:32:21<43:40, 3.49s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.41, train/loss=3.61, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.231, train/predicted_value_std=0.111, train/target_value_mean=-0.169, train/target_value_std=0.107, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7251/8000 [2:32:25<43:42, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.52, train/loss=3.63, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.283, train/predicted_value_std=0.155, train/target_value_mean=-0.342, train/target_value_std=0.287, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7252/8000 [2:32:28<44:02, 3.53s/it, time/step=3.6, time/training=3.6, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.59, train/loss=2.98, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.297, train/predicted_value_std=0.11, train/target_value_mean=-0.233, train/target_value_std=0.122, train/value_spearman=-0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7253/8000 [2:32:32<43:56, 3.53s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=8.11, train/loss=4.23, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.337, train/predicted_value_std=0.128, train/target_value_mean=-0.296, train/target_value_std=0.138, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7254/8000 [2:32:35<44:58, 3.62s/it, time/step=3.82, time/training=3.82, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.65, train/loss=3.32, train/lr=5e-5, train/mae=0.0734, train/predicted_value_mean=-0.281, train/predicted_value_std=0.118, train/target_value_mean=-0.253, train/target_value_std=0.173, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7255/8000 [2:32:39<44:22, 3.57s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=11.1, train/loss=3.73, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.267, train/predicted_value_std=0.19, train/target_value_mean=-0.207, train/target_value_std=0.159, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7256/8000 [2:32:43<44:15, 3.57s/it, time/step=3.56, time/training=3.55, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.3, train/loss=3.93, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.402, train/predicted_value_std=0.14, train/target_value_mean=-0.343, train/target_value_std=0.194, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7257/8000 [2:32:46<43:40, 3.53s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.99, train/loss=4.12, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.288, train/predicted_value_std=0.112, train/target_value_mean=-0.229, train/target_value_std=0.184, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7258/8000 [2:32:49<43:10, 3.49s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.93, train/loss=2.74, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.223, train/predicted_value_std=0.105, train/target_value_mean=-0.204, train/target_value_std=0.11, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7259/8000 [2:32:53<43:11, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.12, train/loss=3.15, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.31, train/predicted_value_std=0.191, train/target_value_mean=-0.311, train/target_value_std=0.256, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7260/8000 [2:32:56<42:53, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.74, train/loss=3.89, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.388, train/predicted_value_std=0.228, train/target_value_mean=-0.403, train/target_value_std=0.339, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7261/8000 [2:33:00<42:55, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=8.34, train/loss=3.15, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.322, train/predicted_value_std=0.162, train/target_value_mean=-0.303, train/target_value_std=0.167, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7262/8000 [2:33:03<43:03, 3.50s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.86, train/loss=3.74, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.328, train/predicted_value_std=0.0967, train/target_value_mean=-0.164, train/target_value_std=0.112, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7263/8000 [2:33:07<43:09, 3.51s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.37, train/loss=4.27, train/lr=5e-5, train/mae=0.233, train/predicted_value_mean=-0.306, train/predicted_value_std=0.146, train/target_value_mean=-0.332, train/target_value_std=0.157, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7264/8000 [2:33:10<43:08, 3.52s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.21, train/loss=3.24, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.274, train/predicted_value_std=0.125, train/target_value_mean=-0.238, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7265/8000 [2:33:14<43:08, 3.52s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.93, train/loss=3.45, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.315, train/predicted_value_std=0.0926, train/target_value_mean=-0.292, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7266/8000 [2:33:18<43:50, 3.58s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.57, train/loss=3.07, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.362, train/predicted_value_std=0.156, train/target_value_mean=-0.38, train/target_value_std=0.242, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7267/8000 [2:33:21<43:10, 3.53s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=11.3, train/loss=2.82, train/lr=5e-5, train/mae=0.0478, train/predicted_value_mean=-0.212, train/predicted_value_std=0.156, train/target_value_mean=-0.229, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7268/8000 [2:33:24<42:36, 3.49s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10.4, train/loss=2.76, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.277, train/predicted_value_std=0.171, train/target_value_mean=-0.264, train/target_value_std=0.194, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7269/8000 [2:33:28<42:25, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.05, train/lr=5e-5, train/mae=0.0344, train/predicted_value_mean=-0.289, train/predicted_value_std=0.132, train/target_value_mean=-0.263, train/target_value_std=0.148, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7270/8000 [2:33:31<42:27, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=6.82, train/loss=2.95, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.315, train/predicted_value_std=0.151, train/target_value_mean=-0.317, train/target_value_std=0.235, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7271/8000 [2:33:35<42:07, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.16, train/loss=3.57, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.259, train/predicted_value_std=0.108, train/target_value_mean=-0.269, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7272/8000 [2:33:38<41:52, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.3, train/loss=3.6, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.345, train/predicted_value_std=0.156, train/target_value_mean=-0.357, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7273/8000 [2:33:42<41:51, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.99, train/loss=3.7, train/lr=5e-5, train/mae=0.193, train/predicted_value_mean=-0.29, train/predicted_value_std=0.106, train/target_value_mean=-0.333, train/target_value_std=0.19, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7274/8000 [2:33:45<42:12, 3.49s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.39, train/loss=4.01, train/lr=5e-5, train/mae=0.22, train/predicted_value_mean=-0.309, train/predicted_value_std=0.0501, train/target_value_mean=-0.334, train/target_value_std=0.225, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7275/8000 [2:33:49<42:09, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.62, train/loss=3.19, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.378, train/predicted_value_std=0.183, train/target_value_mean=-0.39, train/target_value_std=0.267, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7276/8000 [2:33:52<41:31, 3.44s/it, time/step=3.33, time/training=3.32, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.74, train/loss=3.89, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.315, train/predicted_value_std=0.106, train/target_value_mean=-0.313, train/target_value_std=0.23, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7277/8000 [2:33:55<41:07, 3.41s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.3, train/loss=4, train/lr=5e-5, train/mae=0.23, train/predicted_value_mean=-0.38, train/predicted_value_std=0.176, train/target_value_mean=-0.403, train/target_value_std=0.296, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7278/8000 [2:33:59<41:46, 3.47s/it, time/step=3.6, time/training=3.6, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.99, train/loss=3.72, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.308, train/predicted_value_std=0.104, train/target_value_mean=-0.345, train/target_value_std=0.147, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7279/8000 [2:34:02<41:14, 3.43s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.56, train/loss=3.1, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.303, train/predicted_value_std=0.188, train/target_value_mean=-0.278, train/target_value_std=0.236, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7280/8000 [2:34:06<41:12, 3.43s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.8, train/loss=3.31, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.24, train/predicted_value_std=0.127, train/target_value_mean=-0.237, train/target_value_std=0.172, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7281/8000 [2:34:09<41:19, 3.45s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.25, train/loss=3.42, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.342, train/predicted_value_std=0.261, train/target_value_mean=-0.363, train/target_value_std=0.303, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7282/8000 [2:34:13<41:24, 3.46s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=12, train/loss=3.21, train/lr=5e-5, train/mae=0.0953, train/predicted_value_mean=-0.246, train/predicted_value_std=0.0961, train/target_value_mean=-0.266, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7283/8000 [2:34:16<41:21, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.31, train/loss=3.21, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.241, train/predicted_value_std=0.109, train/target_value_mean=-0.231, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7284/8000 [2:34:20<41:11, 3.45s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.35, train/loss=3.65, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.344, train/predicted_value_std=0.14, train/target_value_mean=-0.34, train/target_value_std=0.215, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7285/8000 [2:34:23<41:02, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.82, train/loss=3.76, train/lr=5e-5, train/mae=0.0872, train/predicted_value_mean=-0.325, train/predicted_value_std=0.129, train/target_value_mean=-0.325, train/target_value_std=0.243, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7286/8000 [2:34:27<41:05, 3.45s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.31, train/loss=3.21, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.277, train/predicted_value_std=0.18, train/target_value_mean=-0.23, train/target_value_std=0.14, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7287/8000 [2:34:30<41:11, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.95, train/loss=2.99, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.217, train/predicted_value_std=0.137, train/target_value_mean=-0.214, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7288/8000 [2:34:34<41:13, 3.47s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.3, train/loss=3.54, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.345, train/predicted_value_std=0.149, train/target_value_mean=-0.32, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7289/8000 [2:34:37<41:09, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.81, train/loss=3.18, train/lr=5e-5, train/mae=0.0688, train/predicted_value_mean=-0.227, train/predicted_value_std=0.116, train/target_value_mean=-0.19, train/target_value_std=0.129, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7290/8000 [2:34:41<42:10, 3.56s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=10.1, train/loss=3.12, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.272, train/predicted_value_std=0.136, train/target_value_mean=-0.206, train/target_value_std=0.158, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7291/8000 [2:34:44<41:28, 3.51s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.99, train/loss=3.03, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.324, train/predicted_value_std=0.152, train/target_value_mean=-0.276, train/target_value_std=0.152, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7292/8000 [2:34:48<40:49, 3.46s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.17, train/loss=3.51, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.309, train/predicted_value_std=0.22, train/target_value_mean=-0.269, train/target_value_std=0.276, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7293/8000 [2:34:51<40:20, 3.42s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.36, train/loss=3.46, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.245, train/predicted_value_std=0.0843, train/target_value_mean=-0.188, train/target_value_std=0.06, train/value_spearman=2.78e-17](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7294/8000 [2:34:54<40:26, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.55, train/loss=3.62, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.297, train/predicted_value_std=0.119, train/target_value_mean=-0.281, train/target_value_std=0.163, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7295/8000 [2:34:58<40:38, 3.46s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=11.2, train/loss=3.3, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.314, train/predicted_value_std=0.0752, train/target_value_mean=-0.298, train/target_value_std=0.0946, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7296/8000 [2:35:01<40:41, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=16.5, train/loss=3.6, train/lr=5e-5, train/mae=0.0856, train/predicted_value_mean=-0.301, train/predicted_value_std=0.191, train/target_value_mean=-0.279, train/target_value_std=0.215, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7297/8000 [2:35:05<40:42, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.6, train/loss=3.76, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.278, train/predicted_value_std=0.113, train/target_value_mean=-0.223, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7298/8000 [2:35:08<40:35, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=10.6, train/loss=3.66, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.282, train/predicted_value_std=0.118, train/target_value_mean=-0.285, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7299/8000 [2:35:12<40:44, 3.49s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=12.1, train/loss=2.88, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.327, train/predicted_value_std=0.213, train/target_value_mean=-0.362, train/target_value_std=0.283, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7300/8000 [2:35:15<40:46, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.45, train/loss=3.11, train/lr=5e-5, train/mae=0.0978, train/predicted_value_mean=-0.271, train/predicted_value_std=0.121, train/target_value_mean=-0.216, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7301/8000 [2:35:19<40:48, 3.50s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=7.58, train/loss=4.02, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.317, train/predicted_value_std=0.173, train/target_value_mean=-0.341, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7302/8000 [2:35:23<41:47, 3.59s/it, time/step=3.8, time/training=3.8, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=11.4, train/loss=3.51, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.22, train/predicted_value_std=0.0848, train/target_value_mean=-0.184, train/target_value_std=0.109, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7303/8000 [2:35:26<41:09, 3.54s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.77, train/loss=3.89, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.391, train/predicted_value_std=0.111, train/target_value_mean=-0.434, train/target_value_std=0.225, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7304/8000 [2:35:30<40:36, 3.50s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.49, train/loss=3.64, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.338, train/predicted_value_std=0.16, train/target_value_mean=-0.324, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7305/8000 [2:35:33<40:16, 3.48s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.97, train/loss=4.18, train/lr=5e-5, train/mae=0.207, train/predicted_value_mean=-0.328, train/predicted_value_std=0.0857, train/target_value_mean=-0.381, train/target_value_std=0.21, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7306/8000 [2:35:36<39:59, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.44, train/loss=3.36, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.324, train/predicted_value_std=0.178, train/target_value_mean=-0.311, train/target_value_std=0.118, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7307/8000 [2:35:40<39:46, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.43, train/loss=3.44, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.286, train/predicted_value_std=0.162, train/target_value_mean=-0.305, train/target_value_std=0.194, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7308/8000 [2:35:43<39:39, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.07, train/loss=3.4, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.232, train/predicted_value_std=0.172, train/target_value_mean=-0.184, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7309/8000 [2:35:47<39:32, 3.43s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.11, train/loss=3.21, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.278, train/predicted_value_std=0.178, train/target_value_mean=-0.256, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7310/8000 [2:35:50<39:26, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.17, train/loss=3.93, train/lr=5e-5, train/mae=0.253, train/predicted_value_mean=-0.311, train/predicted_value_std=0.092, train/target_value_mean=-0.413, train/target_value_std=0.177, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7311/8000 [2:35:53<39:06, 3.41s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.35, train/loss=3.58, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.267, train/predicted_value_std=0.127, train/target_value_mean=-0.272, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7312/8000 [2:35:57<38:52, 3.39s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.35, train/loss=3.24, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.363, train/predicted_value_std=0.195, train/target_value_mean=-0.382, train/target_value_std=0.231, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7313/8000 [2:36:00<38:41, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11.6, train/loss=3.72, train/lr=5e-5, train/mae=0.188, train/predicted_value_mean=-0.306, train/predicted_value_std=0.185, train/target_value_mean=-0.31, train/target_value_std=0.259, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7314/8000 [2:36:04<39:17, 3.44s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.69, train/loss=3.96, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.307, train/predicted_value_std=0.101, train/target_value_mean=-0.315, train/target_value_std=0.178, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7315/8000 [2:36:07<38:51, 3.40s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10.3, train/loss=2.52, train/lr=5e-5, train/mae=0.0759, train/predicted_value_mean=-0.218, train/predicted_value_std=0.142, train/target_value_mean=-0.25, train/target_value_std=0.23, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7316/8000 [2:36:10<38:55, 3.41s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.51, train/loss=3.74, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.242, train/predicted_value_std=0.197, train/target_value_mean=-0.245, train/target_value_std=0.252, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7317/8000 [2:36:14<39:01, 3.43s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.91, train/loss=3.38, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.27, train/predicted_value_std=0.11, train/target_value_mean=-0.263, train/target_value_std=0.144, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7318/8000 [2:36:17<38:40, 3.40s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=9.17, train/loss=2.82, train/lr=5e-5, train/mae=0.0384, train/predicted_value_mean=-0.25, train/predicted_value_std=0.142, train/target_value_mean=-0.219, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 91%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7319/8000 [2:36:21<38:25, 3.39s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.04, train/loss=3.08, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.307, train/predicted_value_std=0.272, train/target_value_mean=-0.326, train/target_value_std=0.303, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7320/8000 [2:36:24<38:18, 3.38s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.49, train/loss=3.42, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.308, train/predicted_value_std=0.124, train/target_value_mean=-0.337, train/target_value_std=0.209, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7321/8000 [2:36:27<38:09, 3.37s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.22, train/loss=3.86, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.353, train/predicted_value_std=0.173, train/target_value_mean=-0.314, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7322/8000 [2:36:31<37:59, 3.36s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.66, train/loss=2.83, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.267, train/predicted_value_std=0.172, train/target_value_mean=-0.254, train/target_value_std=0.161, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7323/8000 [2:36:34<38:15, 3.39s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.69, train/loss=3.64, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.331, train/predicted_value_std=0.191, train/target_value_mean=-0.316, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7324/8000 [2:36:38<38:28, 3.41s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.57, train/loss=3.12, train/lr=5e-5, train/mae=0.0853, train/predicted_value_mean=-0.293, train/predicted_value_std=0.183, train/target_value_mean=-0.283, train/target_value_std=0.27, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7325/8000 [2:36:41<38:40, 3.44s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.58, train/loss=3.22, train/lr=5e-5, train/mae=0.0331, train/predicted_value_mean=-0.283, train/predicted_value_std=0.126, train/target_value_mean=-0.269, train/target_value_std=0.151, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7326/8000 [2:36:45<39:53, 3.55s/it, time/step=3.81, time/training=3.81, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.71, train/loss=3.37, train/lr=5e-5, train/mae=0.0569, train/predicted_value_mean=-0.27, train/predicted_value_std=0.0895, train/target_value_mean=-0.233, train/target_value_std=0.125, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7327/8000 [2:36:48<39:39, 3.54s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.29, train/loss=3.39, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.313, train/predicted_value_std=0.178, train/target_value_mean=-0.297, train/target_value_std=0.194, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7328/8000 [2:36:52<39:28, 3.52s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.72, train/loss=3.79, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0986, train/target_value_mean=-0.245, train/target_value_std=0.133, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7329/8000 [2:36:55<39:24, 3.52s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.13, train/loss=3.13, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.242, train/predicted_value_std=0.182, train/target_value_mean=-0.283, train/target_value_std=0.25, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7330/8000 [2:36:59<39:17, 3.52s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.43, train/loss=3.3, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.25, train/predicted_value_std=0.118, train/target_value_mean=-0.206, train/target_value_std=0.0924, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7331/8000 [2:37:02<39:12, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.41, train/loss=3.21, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.235, train/predicted_value_std=0.172, train/target_value_mean=-0.223, train/target_value_std=0.217, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7332/8000 [2:37:06<39:17, 3.53s/it, time/step=3.56, time/training=3.55, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=10.8, train/loss=3.01, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.304, train/predicted_value_std=0.135, train/target_value_mean=-0.252, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7333/8000 [2:37:10<39:13, 3.53s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=11.2, train/loss=3.29, train/lr=5e-5, train/mae=0.0941, train/predicted_value_mean=-0.21, train/predicted_value_std=0.088, train/target_value_mean=-0.175, train/target_value_std=0.102, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7334/8000 [2:37:13<39:08, 3.53s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10, train/loss=3.54, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.272, train/predicted_value_std=0.104, train/target_value_mean=-0.258, train/target_value_std=0.139, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7335/8000 [2:37:16<38:49, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.21, train/loss=3.72, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.261, train/predicted_value_std=0.0777, train/target_value_mean=-0.246, train/target_value_std=0.0962, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7336/8000 [2:37:20<38:29, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.23, train/loss=3.78, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.439, train/predicted_value_std=0.165, train/target_value_mean=-0.415, train/target_value_std=0.249, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7337/8000 [2:37:23<38:19, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.85, train/loss=3.56, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.343, train/predicted_value_std=0.209, train/target_value_mean=-0.295, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7338/8000 [2:37:27<38:55, 3.53s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.58, train/loss=2.68, train/lr=5e-5, train/mae=0.0709, train/predicted_value_mean=-0.273, train/predicted_value_std=0.143, train/target_value_mean=-0.276, train/target_value_std=0.193, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7339/8000 [2:37:30<38:39, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.29, train/loss=3.67, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.309, train/predicted_value_std=0.138, train/target_value_mean=-0.309, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7340/8000 [2:37:34<38:19, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.83, train/loss=3.37, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.275, train/predicted_value_std=0.125, train/target_value_mean=-0.206, train/target_value_std=0.149, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7341/8000 [2:37:37<38:01, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.67, train/loss=3.46, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.293, train/predicted_value_std=0.227, train/target_value_mean=-0.262, train/target_value_std=0.245, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7342/8000 [2:37:41<38:04, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.24, train/loss=3.51, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.307, train/predicted_value_std=0.208, train/target_value_mean=-0.311, train/target_value_std=0.287, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7343/8000 [2:37:44<38:10, 3.49s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.85, train/loss=3.84, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.305, train/predicted_value_std=0.17, train/target_value_mean=-0.354, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7344/8000 [2:37:48<38:11, 3.49s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.45, train/loss=4.01, train/lr=5e-5, train/mae=0.181, train/predicted_value_mean=-0.342, train/predicted_value_std=0.111, train/target_value_mean=-0.272, train/target_value_std=0.203, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7345/8000 [2:37:51<38:12, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.49, train/loss=3.32, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.303, train/predicted_value_std=0.144, train/target_value_mean=-0.243, train/target_value_std=0.193, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7346/8000 [2:37:55<38:10, 3.50s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=6.79, train/loss=2.83, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.252, train/predicted_value_std=0.126, train/target_value_mean=-0.261, train/target_value_std=0.156, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7347/8000 [2:37:58<38:09, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.74, train/loss=2.85, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.247, train/predicted_value_std=0.237, train/target_value_mean=-0.251, train/target_value_std=0.273, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7348/8000 [2:38:02<38:03, 3.50s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.37, train/loss=3.77, train/lr=5e-5, train/mae=0.223, train/predicted_value_mean=-0.257, train/predicted_value_std=0.131, train/target_value_mean=-0.264, train/target_value_std=0.141, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7349/8000 [2:38:05<38:00, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=14.8, train/loss=3.11, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.349, train/predicted_value_std=0.212, train/target_value_mean=-0.373, train/target_value_std=0.345, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7350/8000 [2:38:09<38:50, 3.59s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.89, train/loss=3.49, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.255, train/predicted_value_std=0.143, train/target_value_mean=-0.243, train/target_value_std=0.155, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7351/8000 [2:38:13<38:21, 3.55s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.48, train/loss=3.66, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.319, train/predicted_value_std=0.125, train/target_value_mean=-0.314, train/target_value_std=0.183, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7352/8000 [2:38:16<37:56, 3.51s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.52, train/loss=2.94, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.218, train/predicted_value_std=0.0801, train/target_value_mean=-0.158, train/target_value_std=0.0576, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7353/8000 [2:38:19<37:36, 3.49s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8.93, train/loss=3.83, train/lr=5e-5, train/mae=0.0925, train/predicted_value_mean=-0.239, train/predicted_value_std=0.0571, train/target_value_mean=-0.245, train/target_value_std=0.129, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7354/8000 [2:38:23<37:19, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.18, train/loss=3.57, train/lr=5e-5, train/mae=0.0412, train/predicted_value_mean=-0.267, train/predicted_value_std=0.157, train/target_value_mean=-0.202, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7355/8000 [2:38:26<37:09, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.23, train/loss=4, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.338, train/predicted_value_std=0.137, train/target_value_mean=-0.266, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7356/8000 [2:38:30<37:13, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.3, train/loss=3.46, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.289, train/predicted_value_std=0.11, train/target_value_mean=-0.239, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7357/8000 [2:38:33<37:02, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.74, train/loss=3.66, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.254, train/predicted_value_std=0.115, train/target_value_mean=-0.219, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7358/8000 [2:38:37<36:59, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.79, train/loss=3.43, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.268, train/predicted_value_std=0.143, train/target_value_mean=-0.301, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7359/8000 [2:38:40<37:01, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.17, train/loss=3.7, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.33, train/predicted_value_std=0.137, train/target_value_mean=-0.262, train/target_value_std=0.197, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7360/8000 [2:38:44<36:58, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=9.26, train/loss=3.22, train/lr=5e-5, train/mae=0.0894, train/predicted_value_mean=-0.223, train/predicted_value_std=0.066, train/target_value_mean=-0.2, train/target_value_std=0.101, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7361/8000 [2:38:47<36:48, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.68, train/loss=3.47, train/lr=5e-5, train/mae=0.163, train/predicted_value_mean=-0.269, train/predicted_value_std=0.0884, train/target_value_mean=-0.315, train/target_value_std=0.194, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7362/8000 [2:38:51<37:37, 3.54s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.36, train/loss=3.68, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.288, train/predicted_value_std=0.0792, train/target_value_mean=-0.282, train/target_value_std=0.0932, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7363/8000 [2:38:54<37:24, 3.52s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.02, train/loss=3.5, train/lr=5e-5, train/mae=0.0787, train/predicted_value_mean=-0.274, train/predicted_value_std=0.151, train/target_value_mean=-0.209, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7364/8000 [2:38:58<37:10, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.71, train/loss=3.66, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.385, train/predicted_value_std=0.178, train/target_value_mean=-0.357, train/target_value_std=0.257, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7365/8000 [2:39:01<37:02, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=6.91, train/loss=3.42, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.26, train/predicted_value_std=0.133, train/target_value_mean=-0.273, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7366/8000 [2:39:05<36:58, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.71, train/loss=3.19, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.267, train/predicted_value_std=0.156, train/target_value_mean=-0.262, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7367/8000 [2:39:08<36:51, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11.4, train/loss=3.99, train/lr=5e-5, train/mae=0.242, train/predicted_value_mean=-0.38, train/predicted_value_std=0.15, train/target_value_mean=-0.413, train/target_value_std=0.161, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7368/8000 [2:39:12<36:48, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.21, train/loss=3.47, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.291, train/predicted_value_std=0.157, train/target_value_mean=-0.295, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7369/8000 [2:39:15<36:42, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.65, train/loss=3.27, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.324, train/predicted_value_std=0.14, train/target_value_mean=-0.374, train/target_value_std=0.126, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7370/8000 [2:39:19<36:36, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.6, train/loss=3.61, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.278, train/predicted_value_std=0.194, train/target_value_mean=-0.25, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7371/8000 [2:39:22<36:34, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.68, train/loss=3.42, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.306, train/predicted_value_std=0.16, train/target_value_mean=-0.324, train/target_value_std=0.224, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7372/8000 [2:39:26<36:30, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.22, train/loss=3.14, train/lr=5e-5, train/mae=0.0938, train/predicted_value_mean=-0.225, train/predicted_value_std=0.108, train/target_value_mean=-0.223, train/target_value_std=0.101, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7373/8000 [2:39:29<36:18, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.26, train/loss=3.1, train/lr=5e-5, train/mae=0.0434, train/predicted_value_mean=-0.179, train/predicted_value_std=0.0919, train/target_value_mean=-0.0956, train/target_value_std=0.0301, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7374/8000 [2:39:33<36:59, 3.55s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.7, train/loss=3.94, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.293, train/predicted_value_std=0.0607, train/target_value_mean=-0.251, train/target_value_std=0.147, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7375/8000 [2:39:36<36:45, 3.53s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.32, train/loss=2.82, train/lr=5e-5, train/mae=0.0837, train/predicted_value_mean=-0.286, train/predicted_value_std=0.188, train/target_value_mean=-0.327, train/target_value_std=0.241, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7376/8000 [2:39:40<36:27, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.31, train/loss=3.01, train/lr=5e-5, train/mae=0.0794, train/predicted_value_mean=-0.28, train/predicted_value_std=0.0954, train/target_value_mean=-0.273, train/target_value_std=0.143, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7377/8000 [2:39:43<36:17, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.73, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.348, train/predicted_value_std=0.185, train/target_value_mean=-0.33, train/target_value_std=0.233, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7378/8000 [2:39:47<36:14, 3.50s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.83, train/loss=4.3, train/lr=5e-5, train/mae=0.217, train/predicted_value_mean=-0.385, train/predicted_value_std=0.156, train/target_value_mean=-0.457, train/target_value_std=0.187, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7379/8000 [2:39:50<36:09, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.27, train/loss=3.7, train/lr=5e-5, train/mae=0.175, train/predicted_value_mean=-0.35, train/predicted_value_std=0.142, train/target_value_mean=-0.279, train/target_value_std=0.229, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7380/8000 [2:39:54<36:02, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.81, train/loss=3.45, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.27, train/predicted_value_std=0.117, train/target_value_mean=-0.272, train/target_value_std=0.221, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7381/8000 [2:39:57<36:00, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.65, train/loss=3.53, train/lr=5e-5, train/mae=0.203, train/predicted_value_mean=-0.351, train/predicted_value_std=0.106, train/target_value_mean=-0.302, train/target_value_std=0.109, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7382/8000 [2:40:01<36:03, 3.50s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.61, train/loss=3.56, train/lr=5e-5, train/mae=0.121, train/predicted_value_mean=-0.301, train/predicted_value_std=0.163, train/target_value_mean=-0.305, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7383/8000 [2:40:04<36:04, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=9, train/loss=2.77, train/lr=5e-5, train/mae=0.0366, train/predicted_value_mean=-0.37, train/predicted_value_std=0.144, train/target_value_mean=-0.355, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7384/8000 [2:40:08<35:59, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.16, train/loss=3.23, train/lr=5e-5, train/mae=0.161, train/predicted_value_mean=-0.281, train/predicted_value_std=0.137, train/target_value_mean=-0.249, train/target_value_std=0.127, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7385/8000 [2:40:11<35:57, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.76, train/loss=3.2, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.3, train/predicted_value_std=0.14, train/target_value_mean=-0.265, train/target_value_std=0.175, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7386/8000 [2:40:15<36:36, 3.58s/it, time/step=3.74, time/training=3.73, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=3.32, train/lr=5e-5, train/mae=0.0597, train/predicted_value_mean=-0.193, train/predicted_value_std=0.13, train/target_value_mean=-0.21, train/target_value_std=0.145, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7387/8000 [2:40:18<36:03, 3.53s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=10.1, train/loss=2.94, train/lr=5e-5, train/mae=0.02, train/predicted_value_mean=-0.283, train/predicted_value_std=0.135, train/target_value_mean=-0.239, train/target_value_std=0.138, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7388/8000 [2:40:22<35:32, 3.48s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.39, train/loss=3.69, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.282, train/predicted_value_std=0.105, train/target_value_mean=-0.297, train/target_value_std=0.24, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7389/8000 [2:40:25<35:11, 3.46s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.36, train/loss=3.68, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.36, train/predicted_value_std=0.189, train/target_value_mean=-0.364, train/target_value_std=0.328, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7390/8000 [2:40:29<35:12, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.73, train/loss=3.24, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.271, train/predicted_value_std=0.127, train/target_value_mean=-0.264, train/target_value_std=0.205, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7391/8000 [2:40:32<34:59, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.97, train/loss=3.32, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.283, train/predicted_value_std=0.15, train/target_value_mean=-0.191, train/target_value_std=0.124, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7392/8000 [2:40:35<34:46, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=6.95, train/loss=2.98, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.241, train/predicted_value_std=0.101, train/target_value_mean=-0.225, train/target_value_std=0.115, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7393/8000 [2:40:39<34:42, 3.43s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.52, train/loss=3.65, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.307, train/predicted_value_std=0.144, train/target_value_mean=-0.271, train/target_value_std=0.224, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7394/8000 [2:40:42<34:39, 3.43s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=9.54, train/loss=3.67, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.27, train/predicted_value_std=0.116, train/target_value_mean=-0.282, train/target_value_std=0.116, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7395/8000 [2:40:46<34:35, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=11, train/loss=3.12, train/lr=5e-5, train/mae=0.0722, train/predicted_value_mean=-0.336, train/predicted_value_std=0.144, train/target_value_mean=-0.335, train/target_value_std=0.216, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7396/8000 [2:40:49<34:41, 3.45s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.35, train/loss=3.68, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0786, train/target_value_mean=-0.248, train/target_value_std=0.15, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7397/8000 [2:40:53<34:44, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.74, train/loss=3.67, train/lr=5e-5, train/mae=0.05, train/predicted_value_mean=-0.317, train/predicted_value_std=0.185, train/target_value_mean=-0.324, train/target_value_std=0.194, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7398/8000 [2:40:57<35:39, 3.55s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.7, train/loss=4.01, train/lr=5e-5, train/mae=0.2, train/predicted_value_mean=-0.325, train/predicted_value_std=0.185, train/target_value_mean=-0.321, train/target_value_std=0.257, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7399/8000 [2:41:00<35:21, 3.53s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.8, train/loss=2.91, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.27, train/predicted_value_std=0.172, train/target_value_mean=-0.251, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 92%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7400/8000 [2:41:03<35:08, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.21, train/loss=3.41, train/lr=5e-5, train/mae=0.0681, train/predicted_value_mean=-0.303, train/predicted_value_std=0.113, train/target_value_mean=-0.28, train/target_value_std=0.155, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7401/8000 [2:41:07<34:54, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.1, train/loss=4.02, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.329, train/predicted_value_std=0.116, train/target_value_mean=-0.348, train/target_value_std=0.24, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7402/8000 [2:41:10<34:23, 3.45s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=9.96, train/loss=3.17, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.289, train/predicted_value_std=0.107, train/target_value_mean=-0.316, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7403/8000 [2:41:14<34:08, 3.43s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.14, train/loss=3.01, train/lr=5e-5, train/mae=0.0397, train/predicted_value_mean=-0.273, train/predicted_value_std=0.124, train/target_value_mean=-0.204, train/target_value_std=0.156, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7404/8000 [2:41:17<33:49, 3.41s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.79, train/loss=3.42, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.291, train/predicted_value_std=0.109, train/target_value_mean=-0.258, train/target_value_std=0.161, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7405/8000 [2:41:20<33:35, 3.39s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.65, train/loss=2.9, train/lr=5e-5, train/mae=0.0469, train/predicted_value_mean=-0.271, train/predicted_value_std=0.15, train/target_value_mean=-0.232, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7406/8000 [2:41:24<33:24, 3.37s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.67, train/loss=2.82, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.253, train/predicted_value_std=0.169, train/target_value_mean=-0.25, train/target_value_std=0.186, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7407/8000 [2:41:27<33:28, 3.39s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.9, train/loss=3.99, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.306, train/predicted_value_std=0.0991, train/target_value_mean=-0.257, train/target_value_std=0.161, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7408/8000 [2:41:31<33:35, 3.41s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.36, train/loss=2.92, train/lr=5e-5, train/mae=0.0772, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0975, train/target_value_mean=-0.237, train/target_value_std=0.119, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7409/8000 [2:41:34<33:36, 3.41s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.33, train/loss=3.02, train/lr=5e-5, train/mae=0.0431, train/predicted_value_mean=-0.232, train/predicted_value_std=0.116, train/target_value_mean=-0.197, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7410/8000 [2:41:38<34:37, 3.52s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.83, train/loss=3.81, train/lr=5e-5, train/mae=0.206, train/predicted_value_mean=-0.329, train/predicted_value_std=0.115, train/target_value_mean=-0.354, train/target_value_std=0.198, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7411/8000 [2:41:41<34:25, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=10.2, train/loss=4.24, train/lr=5e-5, train/mae=0.222, train/predicted_value_mean=-0.33, train/predicted_value_std=0.133, train/target_value_mean=-0.385, train/target_value_std=0.25, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7412/8000 [2:41:45<34:12, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.21, train/loss=2.85, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.309, train/predicted_value_std=0.245, train/target_value_mean=-0.331, train/target_value_std=0.311, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7413/8000 [2:41:48<34:11, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.4, train/loss=3.56, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.287, train/predicted_value_std=0.129, train/target_value_mean=-0.286, train/target_value_std=0.198, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7414/8000 [2:41:52<34:06, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.7, train/loss=3.24, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.301, train/predicted_value_std=0.156, train/target_value_mean=-0.277, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7415/8000 [2:41:55<33:53, 3.48s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.46, train/loss=3.77, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.306, train/predicted_value_std=0.129, train/target_value_mean=-0.281, train/target_value_std=0.131, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7416/8000 [2:41:59<33:44, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=6.76, train/loss=3.58, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.263, train/predicted_value_std=0.155, train/target_value_mean=-0.257, train/target_value_std=0.218, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7417/8000 [2:42:02<33:37, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.89, train/loss=3.55, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.295, train/predicted_value_std=0.195, train/target_value_mean=-0.246, train/target_value_std=0.157, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7418/8000 [2:42:05<33:33, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.54, train/loss=3.67, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.267, train/predicted_value_std=0.164, train/target_value_mean=-0.225, train/target_value_std=0.211, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7419/8000 [2:42:09<33:29, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.32, train/loss=3.03, train/lr=5e-5, train/mae=0.0781, train/predicted_value_mean=-0.281, train/predicted_value_std=0.135, train/target_value_mean=-0.276, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7420/8000 [2:42:12<33:23, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.78, train/loss=3.94, train/lr=5e-5, train/mae=0.222, train/predicted_value_mean=-0.352, train/predicted_value_std=0.124, train/target_value_mean=-0.387, train/target_value_std=0.185, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7421/8000 [2:42:16<33:19, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.5, train/loss=3.03, train/lr=5e-5, train/mae=0.0337, train/predicted_value_mean=-0.289, train/predicted_value_std=0.131, train/target_value_mean=-0.207, train/target_value_std=0.106, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7422/8000 [2:42:20<34:03, 3.53s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11.1, train/loss=3.78, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.301, train/predicted_value_std=0.127, train/target_value_mean=-0.294, train/target_value_std=0.186, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7423/8000 [2:42:23<33:44, 3.51s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.38, train/loss=3.57, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.302, train/predicted_value_std=0.0857, train/target_value_mean=-0.358, train/target_value_std=0.198, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7424/8000 [2:42:26<33:30, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.61, train/loss=3.28, train/lr=5e-5, train/mae=0.0913, train/predicted_value_mean=-0.282, train/predicted_value_std=0.092, train/target_value_mean=-0.305, train/target_value_std=0.111, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7425/8000 [2:42:30<33:20, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.11, train/loss=3.17, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.25, train/predicted_value_std=0.167, train/target_value_mean=-0.266, train/target_value_std=0.186, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7426/8000 [2:42:33<33:18, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.42, train/loss=3.14, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.258, train/predicted_value_std=0.133, train/target_value_mean=-0.24, train/target_value_std=0.131, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7427/8000 [2:42:37<33:11, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.31, train/loss=2.96, train/lr=5e-5, train/mae=0.0791, train/predicted_value_mean=-0.283, train/predicted_value_std=0.121, train/target_value_mean=-0.222, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7428/8000 [2:42:40<33:04, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.4, train/loss=3.06, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.2, train/predicted_value_std=0.0565, train/target_value_mean=-0.179, train/target_value_std=0.0703, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7429/8000 [2:42:44<33:01, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=11.1, train/loss=3.35, train/lr=5e-5, train/mae=0.188, train/predicted_value_mean=-0.308, train/predicted_value_std=0.116, train/target_value_mean=-0.365, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7430/8000 [2:42:47<32:57, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.75, train/loss=3.66, train/lr=5e-5, train/mae=0.216, train/predicted_value_mean=-0.303, train/predicted_value_std=0.155, train/target_value_mean=-0.375, train/target_value_std=0.255, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7431/8000 [2:42:51<32:50, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.9, train/loss=3.34, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.277, train/predicted_value_std=0.14, train/target_value_mean=-0.282, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7432/8000 [2:42:54<32:49, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8.65, train/loss=3.74, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.331, train/predicted_value_std=0.136, train/target_value_mean=-0.277, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7433/8000 [2:42:58<32:52, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.19, train/loss=3.32, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.405, train/predicted_value_std=0.171, train/target_value_mean=-0.389, train/target_value_std=0.258, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7434/8000 [2:43:01<33:44, 3.58s/it, time/step=3.8, time/training=3.8, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.76, train/loss=3.17, train/lr=5e-5, train/mae=0.0612, train/predicted_value_mean=-0.179, train/predicted_value_std=0.135, train/target_value_mean=-0.152, train/target_value_std=0.13, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7435/8000 [2:43:05<33:27, 3.55s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11.4, train/loss=3.75, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.26, train/predicted_value_std=0.124, train/target_value_mean=-0.233, train/target_value_std=0.185, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7436/8000 [2:43:08<33:15, 3.54s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.6, train/loss=3.37, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.375, train/predicted_value_std=0.143, train/target_value_mean=-0.379, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7437/8000 [2:43:12<33:06, 3.53s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.39, train/loss=2.83, train/lr=5e-5, train/mae=0.0816, train/predicted_value_mean=-0.243, train/predicted_value_std=0.0911, train/target_value_mean=-0.188, train/target_value_std=0.123, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7438/8000 [2:43:15<32:59, 3.52s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.14, train/loss=3.54, train/lr=5e-5, train/mae=0.0394, train/predicted_value_mean=-0.28, train/predicted_value_std=0.0886, train/target_value_mean=-0.246, train/target_value_std=0.0653, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7439/8000 [2:43:19<32:53, 3.52s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.562, train/cat_acc_neighbor=0.625, train/grad_norm=6.48, train/loss=2.11, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.218, train/predicted_value_std=0.155, train/target_value_mean=-0.208, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7440/8000 [2:43:22<32:49, 3.52s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.46, train/loss=3.44, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.348, train/predicted_value_std=0.128, train/target_value_mean=-0.39, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7441/8000 [2:43:26<32:23, 3.48s/it, time/step=3.38, time/training=3.37, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.64, train/loss=3.15, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.297, train/predicted_value_std=0.142, train/target_value_mean=-0.248, train/target_value_std=0.104, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7442/8000 [2:43:29<31:53, 3.43s/it, time/step=3.31, time/training=3.31, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.7, train/loss=3.58, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.397, train/predicted_value_std=0.143, train/target_value_mean=-0.408, train/target_value_std=0.19, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7443/8000 [2:43:33<31:54, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.31, train/loss=3.42, train/lr=5e-5, train/mae=0.0787, train/predicted_value_mean=-0.277, train/predicted_value_std=0.174, train/target_value_mean=-0.233, train/target_value_std=0.244, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7444/8000 [2:43:36<31:58, 3.45s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.8, train/loss=3.55, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.295, train/predicted_value_std=0.171, train/target_value_mean=-0.237, train/target_value_std=0.135, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7445/8000 [2:43:40<32:00, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=7.65, train/loss=4.13, train/lr=5e-5, train/mae=0.0869, train/predicted_value_mean=-0.347, train/predicted_value_std=0.116, train/target_value_mean=-0.331, train/target_value_std=0.177, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7446/8000 [2:43:43<32:51, 3.56s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=7.35, train/loss=4.12, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.282, train/predicted_value_std=0.132, train/target_value_mean=-0.279, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7447/8000 [2:43:47<32:32, 3.53s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.3, train/loss=3.34, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.268, train/predicted_value_std=0.128, train/target_value_mean=-0.27, train/target_value_std=0.212, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7448/8000 [2:43:50<32:18, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.06, train/loss=3.24, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.307, train/predicted_value_std=0.169, train/target_value_mean=-0.284, train/target_value_std=0.208, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7449/8000 [2:43:54<32:07, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=7.93, train/loss=2.54, train/lr=5e-5, train/mae=0.0384, train/predicted_value_mean=-0.177, train/predicted_value_std=0.107, train/target_value_mean=-0.159, train/target_value_std=0.129, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7450/8000 [2:43:57<31:37, 3.45s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=15.3, train/loss=3.51, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.344, train/predicted_value_std=0.118, train/target_value_mean=-0.329, train/target_value_std=0.261, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7451/8000 [2:44:00<31:15, 3.42s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.72, train/loss=3.65, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.308, train/predicted_value_std=0.134, train/target_value_mean=-0.318, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7452/8000 [2:44:04<31:02, 3.40s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.5, train/loss=3.21, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.214, train/predicted_value_std=0.056, train/target_value_mean=-0.206, train/target_value_std=0.108, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7453/8000 [2:44:07<30:49, 3.38s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.59, train/loss=4.02, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.337, train/predicted_value_std=0.0641, train/target_value_mean=-0.404, train/target_value_std=0.113, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7454/8000 [2:44:10<30:34, 3.36s/it, time/step=3.31, time/training=3.3, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.28, train/loss=3.14, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.26, train/predicted_value_std=0.118, train/target_value_mean=-0.237, train/target_value_std=0.125, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7455/8000 [2:44:14<30:30, 3.36s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.36, train/loss=3.66, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.293, train/predicted_value_std=0.125, train/target_value_mean=-0.317, train/target_value_std=0.258, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7456/8000 [2:44:17<30:44, 3.39s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.18, train/loss=3.48, train/lr=5e-5, train/mae=0.171, train/predicted_value_mean=-0.344, train/predicted_value_std=0.16, train/target_value_mean=-0.337, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7457/8000 [2:44:21<30:53, 3.41s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.52, train/loss=3.09, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.297, train/predicted_value_std=0.221, train/target_value_mean=-0.252, train/target_value_std=0.239, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7458/8000 [2:44:25<31:54, 3.53s/it, time/step=3.81, time/training=3.81, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.09, train/loss=3.57, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.319, train/predicted_value_std=0.126, train/target_value_mean=-0.359, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7459/8000 [2:44:28<31:47, 3.53s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.57, train/loss=3.11, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.281, train/predicted_value_std=0.105, train/target_value_mean=-0.206, train/target_value_std=0.117, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7460/8000 [2:44:32<31:29, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.93, train/loss=3.7, train/lr=5e-5, train/mae=0.24, train/predicted_value_mean=-0.382, train/predicted_value_std=0.164, train/target_value_mean=-0.396, train/target_value_std=0.184, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7461/8000 [2:44:35<31:22, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.45, train/loss=2.58, train/lr=5e-5, train/mae=0.0231, train/predicted_value_mean=-0.317, train/predicted_value_std=0.157, train/target_value_mean=-0.301, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7462/8000 [2:44:39<31:19, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.94, train/loss=3.73, train/lr=5e-5, train/mae=0.19, train/predicted_value_mean=-0.331, train/predicted_value_std=0.198, train/target_value_mean=-0.333, train/target_value_std=0.259, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7463/8000 [2:44:42<31:11, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.47, train/loss=3.18, train/lr=5e-5, train/mae=0.0478, train/predicted_value_mean=-0.263, train/predicted_value_std=0.152, train/target_value_mean=-0.238, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7464/8000 [2:44:45<31:06, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.67, train/loss=2.71, train/lr=5e-5, train/mae=0.0425, train/predicted_value_mean=-0.21, train/predicted_value_std=0.148, train/target_value_mean=-0.201, train/target_value_std=0.171, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7465/8000 [2:44:49<30:52, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=11.6, train/loss=4.08, train/lr=5e-5, train/mae=0.216, train/predicted_value_mean=-0.354, train/predicted_value_std=0.175, train/target_value_mean=-0.438, train/target_value_std=0.181, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7466/8000 [2:44:52<30:47, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.69, train/loss=3.1, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.29, train/predicted_value_std=0.157, train/target_value_mean=-0.326, train/target_value_std=0.216, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7467/8000 [2:44:56<30:45, 3.46s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.79, train/loss=3.41, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.279, train/predicted_value_std=0.16, train/target_value_mean=-0.252, train/target_value_std=0.206, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7468/8000 [2:44:59<30:45, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.1, train/loss=3.69, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.334, train/predicted_value_std=0.255, train/target_value_mean=-0.302, train/target_value_std=0.25, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7469/8000 [2:45:03<30:46, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.15, train/loss=3.3, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.318, train/predicted_value_std=0.157, train/target_value_mean=-0.345, train/target_value_std=0.2, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7470/8000 [2:45:07<31:25, 3.56s/it, time/step=3.75, time/training=3.74, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.57, train/loss=3.63, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.293, train/predicted_value_std=0.218, train/target_value_mean=-0.226, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7471/8000 [2:45:10<31:10, 3.54s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=11.1, train/loss=2.68, train/lr=5e-5, train/mae=0.0528, train/predicted_value_mean=-0.347, train/predicted_value_std=0.228, train/target_value_mean=-0.38, train/target_value_std=0.29, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7472/8000 [2:45:13<30:45, 3.50s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.51, train/loss=3.56, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.232, train/predicted_value_std=0.107, train/target_value_mean=-0.194, train/target_value_std=0.128, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7473/8000 [2:45:17<30:17, 3.45s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.26, train/loss=3.2, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.212, train/predicted_value_std=0.137, train/target_value_mean=-0.203, train/target_value_std=0.17, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7474/8000 [2:45:20<29:57, 3.42s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.52, train/loss=3.36, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.266, train/predicted_value_std=0.117, train/target_value_mean=-0.224, train/target_value_std=0.076, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7475/8000 [2:45:23<29:48, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=12.1, train/loss=3.52, train/lr=5e-5, train/mae=0.0822, train/predicted_value_mean=-0.292, train/predicted_value_std=0.156, train/target_value_mean=-0.323, train/target_value_std=0.277, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7476/8000 [2:45:27<29:33, 3.38s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.3, train/loss=3.02, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.256, train/predicted_value_std=0.163, train/target_value_mean=-0.263, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7477/8000 [2:45:30<29:24, 3.37s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.17, train/loss=4.13, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.307, train/predicted_value_std=0.117, train/target_value_mean=-0.328, train/target_value_std=0.166, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7478/8000 [2:45:33<29:16, 3.36s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.97, train/loss=3.41, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.325, train/predicted_value_std=0.205, train/target_value_mean=-0.315, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 93%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7479/8000 [2:45:37<29:21, 3.38s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.13, train/loss=3.6, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.367, train/predicted_value_std=0.164, train/target_value_mean=-0.376, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7480/8000 [2:45:40<29:36, 3.42s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.91, train/loss=3.42, train/lr=5e-5, train/mae=0.0644, train/predicted_value_mean=-0.299, train/predicted_value_std=0.104, train/target_value_mean=-0.252, train/target_value_std=0.141, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7481/8000 [2:45:44<29:26, 3.40s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=11.2, train/loss=4.16, train/lr=5e-5, train/mae=0.252, train/predicted_value_mean=-0.348, train/predicted_value_std=0.148, train/target_value_mean=-0.328, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7482/8000 [2:45:47<29:55, 3.47s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=6.22, train/loss=2.91, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.36, train/predicted_value_std=0.197, train/target_value_mean=-0.329, train/target_value_std=0.179, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7483/8000 [2:45:51<29:48, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.55, train/loss=3.5, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.316, train/predicted_value_std=0.181, train/target_value_mean=-0.326, train/target_value_std=0.29, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7484/8000 [2:45:54<29:43, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.19, train/loss=3.69, train/lr=5e-5, train/mae=0.195, train/predicted_value_mean=-0.279, train/predicted_value_std=0.144, train/target_value_mean=-0.334, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7485/8000 [2:45:58<29:37, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.12, train/loss=3.37, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.323, train/predicted_value_std=0.167, train/target_value_mean=-0.272, train/target_value_std=0.162, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7486/8000 [2:46:01<29:32, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.82, train/loss=3.21, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.358, train/predicted_value_std=0.212, train/target_value_mean=-0.409, train/target_value_std=0.241, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7487/8000 [2:46:05<29:28, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=8.77, train/loss=3.05, train/lr=5e-5, train/mae=0.0353, train/predicted_value_mean=-0.274, train/predicted_value_std=0.167, train/target_value_mean=-0.221, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7488/8000 [2:46:08<29:11, 3.42s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.23, train/loss=3.22, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.255, train/predicted_value_std=0.185, train/target_value_mean=-0.254, train/target_value_std=0.22, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7489/8000 [2:46:11<28:53, 3.39s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.08, train/loss=3.56, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.293, train/predicted_value_std=0.162, train/target_value_mean=-0.326, train/target_value_std=0.22, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7490/8000 [2:46:15<28:46, 3.39s/it, time/step=3.37, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.4, train/loss=3.39, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.365, train/predicted_value_std=0.178, train/target_value_mean=-0.333, train/target_value_std=0.229, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7491/8000 [2:46:18<28:44, 3.39s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.37, train/loss=3.76, train/lr=5e-5, train/mae=0.0944, train/predicted_value_mean=-0.307, train/predicted_value_std=0.106, train/target_value_mean=-0.275, train/target_value_std=0.22, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7492/8000 [2:46:21<28:48, 3.40s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.86, train/loss=4.4, train/lr=5e-5, train/mae=0.244, train/predicted_value_mean=-0.41, train/predicted_value_std=0.0769, train/target_value_mean=-0.41, train/target_value_std=0.178, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7493/8000 [2:46:25<28:50, 3.41s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.4, train/loss=3.43, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.375, train/predicted_value_std=0.234, train/target_value_mean=-0.337, train/target_value_std=0.281, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7494/8000 [2:46:29<29:34, 3.51s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.1, train/loss=2.94, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.229, train/predicted_value_std=0.105, train/target_value_mean=-0.24, train/target_value_std=0.133, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7495/8000 [2:46:32<29:23, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.93, train/loss=3.55, train/lr=5e-5, train/mae=0.0866, train/predicted_value_mean=-0.304, train/predicted_value_std=0.211, train/target_value_mean=-0.321, train/target_value_std=0.248, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7496/8000 [2:46:36<29:11, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.02, train/loss=3.53, train/lr=5e-5, train/mae=0.142, train/predicted_value_mean=-0.334, train/predicted_value_std=0.187, train/target_value_mean=-0.337, train/target_value_std=0.296, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7497/8000 [2:46:39<29:06, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.29, train/loss=3.5, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.331, train/predicted_value_std=0.122, train/target_value_mean=-0.338, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7498/8000 [2:46:42<29:02, 3.47s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.69, train/loss=3.5, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.312, train/predicted_value_std=0.119, train/target_value_mean=-0.272, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7499/8000 [2:46:46<28:56, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.1, train/loss=2.94, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.297, train/predicted_value_std=0.176, train/target_value_mean=-0.317, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #1] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 94%|▉| 7500/8000 [2:52:05<13:38:37, 98.24s/it, time/step=319, time/training=3.45, time/evaluate=316, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.97, train/loss=3.01, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.298, train/predicted_value_std=0.198, train/target_value_mean=-0.285, train/target_value_std=0.257, train/value_spearman=1, eval/cat_acc_best=0.304, eval/cat_acc_neighbor=0.474, eval/loss=2.17, eval/mae=0.0137, eval/predicted_value_mean=-0.099, eval/predicted_value_std=0.00122, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.304, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.474, eval/stack_bowls_recap_rollout_rc/loss=2.17, eval/stack_bowls_recap_rollout_rc/mae=0.0137, eval/stack_bowls_recap_rollout_rc/predicted_v(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7501/8000 [2:52:09<9:40:28, 69.80s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.6, train/loss=3.57, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.218, train/predicted_value_std=0.167, train/target_value_mean=-0.125, train/target_value_std=0.121, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7502/8000 [2:52:12<6:54:09, 49.90s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.6, train/loss=3.17, train/lr=5e-5, train/mae=0.0584, train/predicted_value_mean=-0.315, train/predicted_value_std=0.184, train/target_value_mean=-0.224, train/target_value_std=0.133, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7503/8000 [2:52:16<4:58:42, 36.06s/it, time/step=3.78, time/training=3.77, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.04, train/loss=4.05, train/lr=5e-5, train/mae=0.149, train/predicted_value_mean=-0.364, train/predicted_value_std=0.056, train/target_value_mean=-0.326, train/target_value_std=0.191, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7504/8000 [2:52:19<3:37:10, 26.27s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.05, train/loss=3.95, train/lr=5e-5, train/mae=0.211, train/predicted_value_mean=-0.363, train/predicted_value_std=0.106, train/target_value_mean=-0.354, train/target_value_std=0.246, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7505/8000 [2:52:23<2:40:13, 19.42s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.93, train/loss=3.01, train/lr=5e-5, train/mae=0.0606, train/predicted_value_mean=-0.28, train/predicted_value_std=0.138, train/target_value_mean=-0.256, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7506/8000 [2:52:26<2:00:31, 14.64s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.11, train/loss=3.75, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.308, train/predicted_value_std=0.0947, train/target_value_mean=-0.235, train/target_value_std=0.139, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7507/8000 [2:52:30<1:32:44, 11.29s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.86, train/loss=2.93, train/lr=5e-5, train/mae=0.0381, train/predicted_value_mean=-0.227, train/predicted_value_std=0.101, train/target_value_mean=-0.202, train/target_value_std=0.149, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7508/8000 [2:52:33<1:13:18, 8.94s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.96, train/loss=2.94, train/lr=5e-5, train/mae=0.0359, train/predicted_value_mean=-0.338, train/predicted_value_std=0.196, train/target_value_mean=-0.255, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7509/8000 [2:52:37<59:43, 7.30s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=7.38, train/loss=2.96, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.344, train/predicted_value_std=0.181, train/target_value_mean=-0.382, train/target_value_std=0.31, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7510/8000 [2:52:40<50:09, 6.14s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.62, train/loss=3.56, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.292, train/predicted_value_std=0.115, train/target_value_mean=-0.342, train/target_value_std=0.24, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7511/8000 [2:52:44<43:28, 5.33s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.7, train/loss=3.65, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.323, train/predicted_value_std=0.155, train/target_value_mean=-0.312, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7512/8000 [2:52:47<38:46, 4.77s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.98, train/loss=3.27, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.287, train/predicted_value_std=0.118, train/target_value_mean=-0.231, train/target_value_std=0.166, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7513/8000 [2:52:50<35:17, 4.35s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.55, train/loss=4.15, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.312, train/predicted_value_std=0.159, train/target_value_mean=-0.275, train/target_value_std=0.196, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7514/8000 [2:52:54<32:52, 4.06s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.87, train/loss=3.49, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.326, train/predicted_value_std=0.172, train/target_value_mean=-0.289, train/target_value_std=0.245, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7515/8000 [2:52:58<32:01, 3.96s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.97, train/loss=3.06, train/lr=5e-5, train/mae=0.0763, train/predicted_value_mean=-0.264, train/predicted_value_std=0.144, train/target_value_mean=-0.283, train/target_value_std=0.246, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7516/8000 [2:53:01<30:43, 3.81s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.28, train/loss=2.75, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.241, train/predicted_value_std=0.11, train/target_value_mean=-0.245, train/target_value_std=0.17, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7517/8000 [2:53:04<29:43, 3.69s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.562, train/cat_acc_neighbor=0.688, train/grad_norm=6.45, train/loss=2.47, train/lr=5e-5, train/mae=0.0406, train/predicted_value_mean=-0.292, train/predicted_value_std=0.189, train/target_value_mean=-0.259, train/target_value_std=0.171, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7518/8000 [2:53:08<29:02, 3.61s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.87, train/loss=3.16, train/lr=5e-5, train/mae=0.0831, train/predicted_value_mean=-0.278, train/predicted_value_std=0.115, train/target_value_mean=-0.267, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7519/8000 [2:53:11<28:31, 3.56s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.01, train/loss=3.49, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.301, train/predicted_value_std=0.141, train/target_value_mean=-0.314, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7520/8000 [2:53:15<28:11, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.88, train/loss=3.66, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.269, train/predicted_value_std=0.131, train/target_value_mean=-0.219, train/target_value_std=0.237, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7521/8000 [2:53:18<27:53, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.21, train/loss=3.39, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.224, train/predicted_value_std=0.0874, train/target_value_mean=-0.248, train/target_value_std=0.145, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7522/8000 [2:53:22<27:39, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.4, train/loss=2.69, train/lr=5e-5, train/mae=0.0881, train/predicted_value_mean=-0.151, train/predicted_value_std=0.121, train/target_value_mean=-0.181, train/target_value_std=0.189, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7523/8000 [2:53:25<27:23, 3.45s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.83, train/loss=3.34, train/lr=5e-5, train/mae=0.0887, train/predicted_value_mean=-0.22, train/predicted_value_std=0.109, train/target_value_mean=-0.205, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7524/8000 [2:53:28<27:06, 3.42s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.52, train/loss=3.56, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.244, train/predicted_value_std=0.132, train/target_value_mean=-0.18, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7525/8000 [2:53:32<27:01, 3.41s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7, train/loss=3.2, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.278, train/predicted_value_std=0.113, train/target_value_mean=-0.29, train/target_value_std=0.21, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7526/8000 [2:53:35<27:01, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.54, train/loss=3.49, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.263, train/predicted_value_std=0.0808, train/target_value_mean=-0.297, train/target_value_std=0.148, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7527/8000 [2:53:39<27:36, 3.50s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=6.93, train/loss=3.85, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.317, train/predicted_value_std=0.151, train/target_value_mean=-0.287, train/target_value_std=0.169, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7528/8000 [2:53:42<27:21, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.59, train/loss=3.07, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.345, train/predicted_value_std=0.0831, train/target_value_mean=-0.3, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7529/8000 [2:53:46<27:19, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.9, train/loss=3.2, train/lr=5e-5, train/mae=0.0562, train/predicted_value_mean=-0.277, train/predicted_value_std=0.132, train/target_value_mean=-0.253, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7530/8000 [2:53:49<27:16, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.79, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.317, train/predicted_value_std=0.095, train/target_value_mean=-0.314, train/target_value_std=0.178, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7531/8000 [2:53:53<27:27, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.7, train/loss=3.74, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.305, train/predicted_value_std=0.103, train/target_value_mean=-0.368, train/target_value_std=0.13, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7532/8000 [2:53:56<27:24, 3.51s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.65, train/loss=3.99, train/lr=5e-5, train/mae=0.194, train/predicted_value_mean=-0.29, train/predicted_value_std=0.138, train/target_value_mean=-0.29, train/target_value_std=0.222, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7533/8000 [2:54:00<27:20, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.5, train/grad_norm=7.56, train/loss=2.85, train/lr=5e-5, train/mae=0.0925, train/predicted_value_mean=-0.171, train/predicted_value_std=0.132, train/target_value_mean=-0.168, train/target_value_std=0.142, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7534/8000 [2:54:03<27:15, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11.3, train/loss=3.28, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.218, train/predicted_value_std=0.141, train/target_value_mean=-0.202, train/target_value_std=0.16, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7535/8000 [2:54:07<27:11, 3.51s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.9, train/loss=3.06, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.259, train/predicted_value_std=0.17, train/target_value_mean=-0.282, train/target_value_std=0.201, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7536/8000 [2:54:10<27:07, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.68, train/loss=3.37, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.361, train/predicted_value_std=0.128, train/target_value_mean=-0.383, train/target_value_std=0.192, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7537/8000 [2:54:14<27:18, 3.54s/it, time/step=3.61, time/training=3.61, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.15, train/loss=3.98, train/lr=5e-5, train/mae=0.215, train/predicted_value_mean=-0.339, train/predicted_value_std=0.0941, train/target_value_mean=-0.311, train/target_value_std=0.146, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7538/8000 [2:54:18<27:23, 3.56s/it, time/step=3.59, time/training=3.59, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.9, train/loss=3.89, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.35, train/predicted_value_std=0.167, train/target_value_mean=-0.394, train/target_value_std=0.146, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7539/8000 [2:54:21<27:58, 3.64s/it, time/step=3.83, time/training=3.83, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.13, train/loss=3.38, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.237, train/predicted_value_std=0.11, train/target_value_mean=-0.181, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7540/8000 [2:54:25<27:35, 3.60s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.77, train/loss=3.59, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.43, train/predicted_value_std=0.202, train/target_value_mean=-0.45, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7541/8000 [2:54:28<27:16, 3.56s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.88, train/loss=3.49, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.319, train/predicted_value_std=0.164, train/target_value_mean=-0.298, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7542/8000 [2:54:32<26:59, 3.54s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.3, train/loss=3.51, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.278, train/predicted_value_std=0.169, train/target_value_mean=-0.231, train/target_value_std=0.164, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7543/8000 [2:54:35<26:44, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=12.1, train/loss=3.2, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.247, train/predicted_value_std=0.139, train/target_value_mean=-0.27, train/target_value_std=0.184, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7544/8000 [2:54:39<26:31, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=9.76, train/loss=3.28, train/lr=5e-5, train/mae=0.0809, train/predicted_value_mean=-0.306, train/predicted_value_std=0.115, train/target_value_mean=-0.343, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7545/8000 [2:54:42<26:17, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=3.73, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.265, train/predicted_value_std=0.164, train/target_value_mean=-0.229, train/target_value_std=0.204, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7546/8000 [2:54:46<26:11, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.23, train/loss=3.31, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.314, train/predicted_value_std=0.133, train/target_value_mean=-0.267, train/target_value_std=0.134, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7547/8000 [2:54:49<26:02, 3.45s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=10, train/loss=3.39, train/lr=5e-5, train/mae=0.0994, train/predicted_value_mean=-0.285, train/predicted_value_std=0.143, train/target_value_mean=-0.273, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7548/8000 [2:54:52<25:53, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=9.13, train/loss=3.12, train/lr=5e-5, train/mae=0.0312, train/predicted_value_mean=-0.287, train/predicted_value_std=0.178, train/target_value_mean=-0.235, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7549/8000 [2:54:56<26:02, 3.46s/it, time/step=3.53, time/training=3.52, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.14, train/loss=3.07, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.228, train/predicted_value_std=0.143, train/target_value_mean=-0.237, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7550/8000 [2:54:59<26:02, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8, train/loss=3.75, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.254, train/predicted_value_std=0.104, train/target_value_mean=-0.232, train/target_value_std=0.147, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7551/8000 [2:55:03<26:32, 3.55s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.5, train/loss=3.54, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.322, train/predicted_value_std=0.112, train/target_value_mean=-0.346, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7552/8000 [2:55:07<26:09, 3.50s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.8, train/loss=3.71, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.308, train/predicted_value_std=0.121, train/target_value_mean=-0.298, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7553/8000 [2:55:10<25:51, 3.47s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=7.29, train/loss=2.65, train/lr=5e-5, train/mae=0.0284, train/predicted_value_mean=-0.217, train/predicted_value_std=0.0922, train/target_value_mean=-0.193, train/target_value_std=0.0686, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7554/8000 [2:55:13<25:40, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.18, train/loss=3.81, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.303, train/predicted_value_std=0.174, train/target_value_mean=-0.298, train/target_value_std=0.267, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7555/8000 [2:55:17<25:38, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.1, train/loss=4.09, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.369, train/predicted_value_std=0.109, train/target_value_mean=-0.299, train/target_value_std=0.175, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7556/8000 [2:55:20<25:34, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.21, train/loss=3.58, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.305, train/predicted_value_std=0.158, train/target_value_mean=-0.288, train/target_value_std=0.244, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7557/8000 [2:55:24<25:34, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=11.4, train/loss=3.73, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.395, train/predicted_value_std=0.135, train/target_value_mean=-0.387, train/target_value_std=0.231, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7558/8000 [2:55:27<25:35, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.2, train/loss=3.68, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.306, train/predicted_value_std=0.195, train/target_value_mean=-0.331, train/target_value_std=0.289, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7559/8000 [2:55:31<25:30, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.34, train/loss=3.69, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.226, train/predicted_value_std=0.0808, train/target_value_mean=-0.225, train/target_value_std=0.186, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 94%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7560/8000 [2:55:34<25:22, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.55, train/loss=3.43, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.331, train/predicted_value_std=0.123, train/target_value_mean=-0.343, train/target_value_std=0.168, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7561/8000 [2:55:38<25:15, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.35, train/loss=3.44, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.306, train/predicted_value_std=0.132, train/target_value_mean=-0.359, train/target_value_std=0.22, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7562/8000 [2:55:41<25:10, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.26, train/loss=3.06, train/lr=5e-5, train/mae=0.0972, train/predicted_value_mean=-0.229, train/predicted_value_std=0.125, train/target_value_mean=-0.221, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7563/8000 [2:55:45<25:43, 3.53s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.66, train/loss=3.15, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.281, train/predicted_value_std=0.168, train/target_value_mean=-0.243, train/target_value_std=0.201, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7564/8000 [2:55:48<25:26, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=11.5, train/loss=3.37, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.299, train/predicted_value_std=0.107, train/target_value_mean=-0.302, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7565/8000 [2:55:52<25:13, 3.48s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.84, train/loss=3.72, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.364, train/predicted_value_std=0.1, train/target_value_mean=-0.365, train/target_value_std=0.17, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7566/8000 [2:55:55<25:03, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.81, train/loss=3.75, train/lr=5e-5, train/mae=0.207, train/predicted_value_mean=-0.276, train/predicted_value_std=0.166, train/target_value_mean=-0.324, train/target_value_std=0.25, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7567/8000 [2:55:59<24:56, 3.46s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.54, train/loss=3.17, train/lr=5e-5, train/mae=0.0534, train/predicted_value_mean=-0.266, train/predicted_value_std=0.142, train/target_value_mean=-0.251, train/target_value_std=0.165, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7568/8000 [2:56:02<25:03, 3.48s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=20.2, train/loss=3.38, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.32, train/predicted_value_std=0.167, train/target_value_mean=-0.304, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7569/8000 [2:56:06<25:13, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.08, train/loss=4.38, train/lr=5e-5, train/mae=0.187, train/predicted_value_mean=-0.391, train/predicted_value_std=0.143, train/target_value_mean=-0.477, train/target_value_std=0.229, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7570/8000 [2:56:09<25:04, 3.50s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.48, train/loss=3.65, train/lr=5e-5, train/mae=0.186, train/predicted_value_mean=-0.313, train/predicted_value_std=0.174, train/target_value_mean=-0.405, train/target_value_std=0.257, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7571/8000 [2:56:13<24:56, 3.49s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.77, train/loss=3.25, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.264, train/predicted_value_std=0.155, train/target_value_mean=-0.241, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7572/8000 [2:56:16<24:46, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=10.9, train/loss=3.41, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.321, train/predicted_value_std=0.12, train/target_value_mean=-0.313, train/target_value_std=0.16, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7573/8000 [2:56:20<24:46, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0, train/grad_norm=9.44, train/loss=3.83, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.322, train/predicted_value_std=0.13, train/target_value_mean=-0.301, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7574/8000 [2:56:23<24:47, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.95, train/loss=3.05, train/lr=5e-5, train/mae=0.0391, train/predicted_value_mean=-0.291, train/predicted_value_std=0.179, train/target_value_mean=-0.289, train/target_value_std=0.245, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7575/8000 [2:56:27<25:24, 3.59s/it, time/step=3.81, time/training=3.81, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.77, train/loss=3.75, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.272, train/predicted_value_std=0.149, train/target_value_mean=-0.229, train/target_value_std=0.194, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7576/8000 [2:56:30<25:08, 3.56s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.23, train/loss=3.12, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.223, train/predicted_value_std=0.126, train/target_value_mean=-0.188, train/target_value_std=0.141, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7577/8000 [2:56:34<24:49, 3.52s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.5, train/loss=3.53, train/lr=5e-5, train/mae=0.162, train/predicted_value_mean=-0.332, train/predicted_value_std=0.145, train/target_value_mean=-0.294, train/target_value_std=0.0946, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7578/8000 [2:56:37<24:31, 3.49s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.75, train/loss=3.75, train/lr=5e-5, train/mae=0.0716, train/predicted_value_mean=-0.303, train/predicted_value_std=0.172, train/target_value_mean=-0.306, train/target_value_std=0.264, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7579/8000 [2:56:41<24:19, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.32, train/loss=3.28, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.261, train/predicted_value_std=0.0854, train/target_value_mean=-0.251, train/target_value_std=0.108, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7580/8000 [2:56:44<24:09, 3.45s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=8.13, train/loss=3.3, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.267, train/predicted_value_std=0.162, train/target_value_mean=-0.262, train/target_value_std=0.267, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7581/8000 [2:56:47<24:07, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.23, train/loss=3.42, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.289, train/predicted_value_std=0.149, train/target_value_mean=-0.282, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7582/8000 [2:56:51<24:08, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.4, train/loss=4.4, train/lr=5e-5, train/mae=0.111, train/predicted_value_mean=-0.348, train/predicted_value_std=0.19, train/target_value_mean=-0.338, train/target_value_std=0.261, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7583/8000 [2:56:54<24:07, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.64, train/loss=3.16, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.292, train/predicted_value_std=0.086, train/target_value_mean=-0.302, train/target_value_std=0.211, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7584/8000 [2:56:58<24:08, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0, train/cat_acc_neighbor=0.312, train/grad_norm=8.37, train/loss=3.33, train/lr=5e-5, train/mae=0.0897, train/predicted_value_mean=-0.308, train/predicted_value_std=0.204, train/target_value_mean=-0.326, train/target_value_std=0.257, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7585/8000 [2:57:01<24:07, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=8.13, train/loss=3.31, train/lr=5e-5, train/mae=0.0587, train/predicted_value_mean=-0.326, train/predicted_value_std=0.114, train/target_value_mean=-0.316, train/target_value_std=0.131, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7586/8000 [2:57:05<23:53, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.56, train/loss=3.32, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.291, train/predicted_value_std=0.127, train/target_value_mean=-0.207, train/target_value_std=0.103, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7587/8000 [2:57:09<24:15, 3.52s/it, time/step=3.67, time/training=3.66, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.7, train/loss=3.11, train/lr=5e-5, train/mae=0.0837, train/predicted_value_mean=-0.319, train/predicted_value_std=0.182, train/target_value_mean=-0.279, train/target_value_std=0.206, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7588/8000 [2:57:12<23:49, 3.47s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.57, train/loss=3.73, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.335, train/predicted_value_std=0.19, train/target_value_mean=-0.337, train/target_value_std=0.273, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7589/8000 [2:57:15<23:31, 3.43s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.375, train/grad_norm=8.96, train/loss=3.23, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.292, train/predicted_value_std=0.194, train/target_value_mean=-0.352, train/target_value_std=0.274, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7590/8000 [2:57:19<23:17, 3.41s/it, time/step=3.34, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.46, train/loss=3.33, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.344, train/predicted_value_std=0.149, train/target_value_mean=-0.218, train/target_value_std=0.154, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7591/8000 [2:57:22<23:18, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.87, train/loss=3.66, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.319, train/predicted_value_std=0.143, train/target_value_mean=-0.299, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7592/8000 [2:57:25<23:20, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.58, train/loss=3.1, train/lr=5e-5, train/mae=0.0456, train/predicted_value_mean=-0.316, train/predicted_value_std=0.225, train/target_value_mean=-0.313, train/target_value_std=0.238, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7593/8000 [2:57:29<23:24, 3.45s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.42, train/loss=3.31, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.293, train/predicted_value_std=0.148, train/target_value_mean=-0.222, train/target_value_std=0.101, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7594/8000 [2:57:32<23:20, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.96, train/loss=3.8, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.258, train/predicted_value_std=0.0861, train/target_value_mean=-0.209, train/target_value_std=0.129, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7595/8000 [2:57:36<23:21, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=6.99, train/loss=3.41, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.286, train/predicted_value_std=0.181, train/target_value_mean=-0.34, train/target_value_std=0.237, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7596/8000 [2:57:39<23:20, 3.47s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.9, train/loss=3.11, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.267, train/predicted_value_std=0.0777, train/target_value_mean=-0.228, train/target_value_std=0.107, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7597/8000 [2:57:43<23:24, 3.49s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.32, train/loss=2.98, train/lr=5e-5, train/mae=0.035, train/predicted_value_mean=-0.248, train/predicted_value_std=0.121, train/target_value_mean=-0.228, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7598/8000 [2:57:46<23:22, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.75, train/loss=2.99, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.295, train/predicted_value_std=0.169, train/target_value_mean=-0.292, train/target_value_std=0.195, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7599/8000 [2:57:50<23:53, 3.58s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.5, train/loss=3.42, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.322, train/predicted_value_std=0.187, train/target_value_mean=-0.319, train/target_value_std=0.204, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7600/8000 [2:57:54<23:38, 3.55s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=6.99, train/loss=2.78, train/lr=5e-5, train/mae=0.0412, train/predicted_value_mean=-0.239, train/predicted_value_std=0.164, train/target_value_mean=-0.261, train/target_value_std=0.255, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7601/8000 [2:57:57<23:24, 3.52s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=6.39, train/loss=3.33, train/lr=5e-5, train/mae=0.0441, train/predicted_value_mean=-0.328, train/predicted_value_std=0.16, train/target_value_mean=-0.335, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7602/8000 [2:58:01<23:13, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.96, train/loss=3.06, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.329, train/predicted_value_std=0.227, train/target_value_mean=-0.292, train/target_value_std=0.257, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7603/8000 [2:58:04<23:01, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.27, train/loss=2.77, train/lr=5e-5, train/mae=0.0906, train/predicted_value_mean=-0.226, train/predicted_value_std=0.115, train/target_value_mean=-0.192, train/target_value_std=0.171, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7604/8000 [2:58:07<22:55, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.02, train/loss=3.1, train/lr=5e-5, train/mae=0.0997, train/predicted_value_mean=-0.388, train/predicted_value_std=0.137, train/target_value_mean=-0.353, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7605/8000 [2:58:11<22:48, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.89, train/loss=2.57, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.217, train/predicted_value_std=0.112, train/target_value_mean=-0.219, train/target_value_std=0.151, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7606/8000 [2:58:14<22:39, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.97, train/loss=3.22, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.283, train/predicted_value_std=0.214, train/target_value_mean=-0.257, train/target_value_std=0.203, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7607/8000 [2:58:18<22:39, 3.46s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.4, train/loss=2.97, train/lr=5e-5, train/mae=0.0612, train/predicted_value_mean=-0.227, train/predicted_value_std=0.152, train/target_value_mean=-0.218, train/target_value_std=0.183, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7608/8000 [2:58:21<22:31, 3.45s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.56, train/loss=3.48, train/lr=5e-5, train/mae=0.119, train/predicted_value_mean=-0.302, train/predicted_value_std=0.109, train/target_value_mean=-0.327, train/target_value_std=0.14, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7609/8000 [2:58:25<22:25, 3.44s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.76, train/loss=3.53, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.242, train/predicted_value_std=0.106, train/target_value_mean=-0.237, train/target_value_std=0.175, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7610/8000 [2:58:28<22:18, 3.43s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.09, train/loss=3.51, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.371, train/predicted_value_std=0.151, train/target_value_mean=-0.355, train/target_value_std=0.259, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7611/8000 [2:58:32<22:46, 3.51s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.67, train/loss=4.03, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.296, train/predicted_value_std=0.172, train/target_value_mean=-0.267, train/target_value_std=0.142, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7612/8000 [2:58:35<22:35, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.35, train/loss=3.36, train/lr=5e-5, train/mae=0.0494, train/predicted_value_mean=-0.316, train/predicted_value_std=0.122, train/target_value_mean=-0.345, train/target_value_std=0.162, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7613/8000 [2:58:39<22:32, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=11.4, train/loss=2.64, train/lr=5e-5, train/mae=0.00719, train/predicted_value_mean=-0.218, train/predicted_value_std=0.114, train/target_value_mean=-0.211, train/target_value_std=0.135, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7614/8000 [2:58:42<22:26, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.13, train/loss=3.57, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.247, train/predicted_value_std=0.169, train/target_value_mean=-0.24, train/target_value_std=0.234, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7615/8000 [2:58:46<22:20, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=9.48, train/loss=3.85, train/lr=5e-5, train/mae=0.106, train/predicted_value_mean=-0.283, train/predicted_value_std=0.171, train/target_value_mean=-0.268, train/target_value_std=0.268, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7616/8000 [2:58:49<22:13, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.77, train/loss=3.72, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.306, train/predicted_value_std=0.113, train/target_value_mean=-0.312, train/target_value_std=0.106, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7617/8000 [2:58:53<22:16, 3.49s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=6.83, train/loss=3.96, train/lr=5e-5, train/mae=0.196, train/predicted_value_mean=-0.329, train/predicted_value_std=0.163, train/target_value_mean=-0.358, train/target_value_std=0.232, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7618/8000 [2:58:56<22:09, 3.48s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.61, train/loss=3.06, train/lr=5e-5, train/mae=0.07, train/predicted_value_mean=-0.29, train/predicted_value_std=0.185, train/target_value_mean=-0.259, train/target_value_std=0.222, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7619/8000 [2:59:00<22:02, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.29, train/loss=3.27, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.248, train/predicted_value_std=0.205, train/target_value_mean=-0.298, train/target_value_std=0.262, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7620/8000 [2:59:03<21:57, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.5, train/loss=3.65, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.268, train/predicted_value_std=0.146, train/target_value_mean=-0.224, train/target_value_std=0.123, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7621/8000 [2:59:07<22:03, 3.49s/it, time/step=3.55, time/training=3.55, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=7.29, train/loss=3.32, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.274, train/predicted_value_std=0.14, train/target_value_mean=-0.271, train/target_value_std=0.138, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7622/8000 [2:59:10<21:51, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.625, train/grad_norm=10.1, train/loss=2.63, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.218, train/predicted_value_std=0.153, train/target_value_mean=-0.178, train/target_value_std=0.146, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7623/8000 [2:59:14<22:32, 3.59s/it, time/step=3.86, time/training=3.86, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.37, train/loss=3.49, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.34, train/predicted_value_std=0.196, train/target_value_mean=-0.285, train/target_value_std=0.154, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7624/8000 [2:59:17<22:12, 3.54s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.89, train/loss=3.93, train/lr=5e-5, train/mae=0.21, train/predicted_value_mean=-0.333, train/predicted_value_std=0.118, train/target_value_mean=-0.427, train/target_value_std=0.121, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7625/8000 [2:59:21<21:56, 3.51s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.89, train/loss=2.8, train/lr=5e-5, train/mae=0.0884, train/predicted_value_mean=-0.293, train/predicted_value_std=0.11, train/target_value_mean=-0.256, train/target_value_std=0.166, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7626/8000 [2:59:24<21:41, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.21, train/loss=3.97, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.343, train/predicted_value_std=0.108, train/target_value_mean=-0.343, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7627/8000 [2:59:28<21:34, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11, train/loss=3.52, train/lr=5e-5, train/mae=0.178, train/predicted_value_mean=-0.321, train/predicted_value_std=0.0703, train/target_value_mean=-0.264, train/target_value_std=0.107, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7628/8000 [2:59:31<21:32, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.78, train/loss=2.51, train/lr=5e-5, train/mae=0.0119, train/predicted_value_mean=-0.212, train/predicted_value_std=0.0931, train/target_value_mean=-0.168, train/target_value_std=0.0973, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7629/8000 [2:59:35<22:03, 3.57s/it, time/step=3.79, time/training=3.78, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.12, train/loss=2.95, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.277, train/predicted_value_std=0.121, train/target_value_mean=-0.241, train/target_value_std=0.175, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7630/8000 [2:59:38<21:47, 3.53s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.17, train/loss=3.83, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.362, train/predicted_value_std=0.167, train/target_value_mean=-0.378, train/target_value_std=0.24, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7631/8000 [2:59:42<21:38, 3.52s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.45, train/loss=3.21, train/lr=5e-5, train/mae=0.129, train/predicted_value_mean=-0.257, train/predicted_value_std=0.142, train/target_value_mean=-0.282, train/target_value_std=0.207, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7632/8000 [2:59:45<21:27, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=8.42, train/loss=3.91, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.25, train/predicted_value_std=0.0782, train/target_value_mean=-0.268, train/target_value_std=0.114, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7633/8000 [2:59:49<21:17, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.43, train/loss=3.16, train/lr=5e-5, train/mae=0.0422, train/predicted_value_mean=-0.256, train/predicted_value_std=0.0961, train/target_value_mean=-0.251, train/target_value_std=0.134, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7634/8000 [2:59:52<21:45, 3.57s/it, time/step=3.77, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.64, train/loss=3.48, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.327, train/predicted_value_std=0.219, train/target_value_mean=-0.27, train/target_value_std=0.199, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7635/8000 [2:59:56<21:37, 3.56s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.12, train/loss=3.27, train/lr=5e-5, train/mae=0.0603, train/predicted_value_mean=-0.271, train/predicted_value_std=0.05, train/target_value_mean=-0.205, train/target_value_std=0.103, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7636/8000 [2:59:59<21:27, 3.54s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.89, train/loss=3.47, train/lr=5e-5, train/mae=0.0472, train/predicted_value_mean=-0.298, train/predicted_value_std=0.177, train/target_value_mean=-0.249, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7637/8000 [3:00:03<21:17, 3.52s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.63, train/loss=3.1, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.28, train/predicted_value_std=0.118, train/target_value_mean=-0.257, train/target_value_std=0.166, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7638/8000 [3:00:06<21:07, 3.50s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.84, train/loss=3.66, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.282, train/predicted_value_std=0.115, train/target_value_mean=-0.236, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 95%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7639/8000 [3:00:10<20:54, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.82, train/loss=2.97, train/lr=5e-5, train/mae=0.0234, train/predicted_value_mean=-0.246, train/predicted_value_std=0.165, train/target_value_mean=-0.236, train/target_value_std=0.211, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7640/8000 [3:00:13<20:39, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.23, train/loss=3.11, train/lr=5e-5, train/mae=0.0816, train/predicted_value_mean=-0.249, train/predicted_value_std=0.144, train/target_value_mean=-0.24, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7641/8000 [3:00:17<20:24, 3.41s/it, time/step=3.33, time/training=3.33, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.11, train/loss=3.5, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.273, train/predicted_value_std=0.113, train/target_value_mean=-0.205, train/target_value_std=0.133, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7642/8000 [3:00:20<20:11, 3.39s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.93, train/loss=3.01, train/lr=5e-5, train/mae=0.0762, train/predicted_value_mean=-0.289, train/predicted_value_std=0.136, train/target_value_mean=-0.265, train/target_value_std=0.165, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7643/8000 [3:00:23<20:05, 3.38s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=9.27, train/loss=3.65, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.272, train/predicted_value_std=0.152, train/target_value_mean=-0.225, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7644/8000 [3:00:27<20:01, 3.38s/it, time/step=3.37, time/training=3.37, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.73, train/loss=3.86, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.33, train/predicted_value_std=0.106, train/target_value_mean=-0.34, train/target_value_std=0.161, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7645/8000 [3:00:30<19:59, 3.38s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=10.4, train/loss=3.95, train/lr=5e-5, train/mae=0.0912, train/predicted_value_mean=-0.324, train/predicted_value_std=0.188, train/target_value_mean=-0.316, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7646/8000 [3:00:34<20:30, 3.48s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.61, train/loss=2.9, train/lr=5e-5, train/mae=0.0413, train/predicted_value_mean=-0.299, train/predicted_value_std=0.212, train/target_value_mean=-0.272, train/target_value_std=0.255, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7647/8000 [3:00:37<20:25, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.5, train/loss=3.52, train/lr=5e-5, train/mae=0.0488, train/predicted_value_mean=-0.224, train/predicted_value_std=0.107, train/target_value_mean=-0.169, train/target_value_std=0.0972, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7648/8000 [3:00:41<20:20, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.27, train/loss=3.48, train/lr=5e-5, train/mae=0.0975, train/predicted_value_mean=-0.384, train/predicted_value_std=0.105, train/target_value_mean=-0.403, train/target_value_std=0.114, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7649/8000 [3:00:44<20:14, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=9.28, train/loss=2.88, train/lr=5e-5, train/mae=0.0694, train/predicted_value_mean=-0.329, train/predicted_value_std=0.212, train/target_value_mean=-0.314, train/target_value_std=0.263, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7650/8000 [3:00:47<20:10, 3.46s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.35, train/loss=3.61, train/lr=5e-5, train/mae=0.227, train/predicted_value_mean=-0.294, train/predicted_value_std=0.149, train/target_value_mean=-0.32, train/target_value_std=0.148, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7651/8000 [3:00:51<20:04, 3.45s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.13, train/loss=3.32, train/lr=5e-5, train/mae=0.118, train/predicted_value_mean=-0.331, train/predicted_value_std=0.228, train/target_value_mean=-0.351, train/target_value_std=0.255, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7652/8000 [3:00:54<20:02, 3.45s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.85, train/loss=3.43, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.258, train/predicted_value_std=0.121, train/target_value_mean=-0.265, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7653/8000 [3:00:58<19:58, 3.45s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.7, train/loss=3.11, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.232, train/predicted_value_std=0.188, train/target_value_mean=-0.226, train/target_value_std=0.153, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7654/8000 [3:01:01<19:57, 3.46s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=10.6, train/loss=2.57, train/lr=5e-5, train/mae=0.0325, train/predicted_value_mean=-0.194, train/predicted_value_std=0.114, train/target_value_mean=-0.171, train/target_value_std=0.128, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7655/8000 [3:01:05<19:59, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.96, train/loss=3.4, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.256, train/predicted_value_std=0.147, train/target_value_mean=-0.311, train/target_value_std=0.194, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7656/8000 [3:01:08<19:56, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.29, train/loss=3.57, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.355, train/predicted_value_std=0.227, train/target_value_mean=-0.388, train/target_value_std=0.29, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7657/8000 [3:01:12<20:17, 3.55s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.18, train/loss=3.42, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.299, train/predicted_value_std=0.121, train/target_value_mean=-0.344, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7658/8000 [3:01:15<20:00, 3.51s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.67, train/loss=3.9, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.317, train/predicted_value_std=0.147, train/target_value_mean=-0.289, train/target_value_std=0.182, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7659/8000 [3:01:19<19:48, 3.49s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.33, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.244, train/predicted_value_std=0.113, train/target_value_mean=-0.197, train/target_value_std=0.183, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7660/8000 [3:01:22<19:38, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=7.63, train/loss=3.35, train/lr=5e-5, train/mae=0.0447, train/predicted_value_mean=-0.241, train/predicted_value_std=0.0858, train/target_value_mean=-0.195, train/target_value_std=0.0641, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7661/8000 [3:01:26<19:30, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.98, train/loss=3.36, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.351, train/predicted_value_std=0.114, train/target_value_mean=-0.327, train/target_value_std=0.125, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7662/8000 [3:01:29<19:22, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.76, train/loss=4, train/lr=5e-5, train/mae=0.201, train/predicted_value_mean=-0.321, train/predicted_value_std=0.187, train/target_value_mean=-0.275, train/target_value_std=0.201, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7663/8000 [3:01:33<19:17, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.29, train/loss=3.43, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.274, train/predicted_value_std=0.126, train/target_value_mean=-0.289, train/target_value_std=0.192, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7664/8000 [3:01:36<19:13, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=11.6, train/loss=3.85, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.332, train/predicted_value_std=0.156, train/target_value_mean=-0.282, train/target_value_std=0.197, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7665/8000 [3:01:39<19:11, 3.44s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.79, train/loss=3.89, train/lr=5e-5, train/mae=0.0912, train/predicted_value_mean=-0.332, train/predicted_value_std=0.155, train/target_value_mean=-0.277, train/target_value_std=0.183, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7666/8000 [3:01:43<19:07, 3.44s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.8, train/loss=2.64, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.313, train/predicted_value_std=0.185, train/target_value_mean=-0.347, train/target_value_std=0.275, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7667/8000 [3:01:46<19:01, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.6, train/loss=3.13, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.327, train/predicted_value_std=0.186, train/target_value_mean=-0.308, train/target_value_std=0.231, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7668/8000 [3:01:50<18:59, 3.43s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.1, train/loss=3.5, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.387, train/predicted_value_std=0.214, train/target_value_mean=-0.387, train/target_value_std=0.246, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7669/8000 [3:01:53<19:28, 3.53s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.61, train/loss=3.75, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.352, train/predicted_value_std=0.16, train/target_value_mean=-0.38, train/target_value_std=0.256, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7670/8000 [3:01:57<19:05, 3.47s/it, time/step=3.34, time/training=3.33, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.01, train/loss=3.98, train/lr=5e-5, train/mae=0.226, train/predicted_value_mean=-0.32, train/predicted_value_std=0.176, train/target_value_mean=-0.401, train/target_value_std=0.294, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7671/8000 [3:02:00<18:53, 3.45s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.83, train/loss=3.35, train/lr=5e-5, train/mae=0.13, train/predicted_value_mean=-0.28, train/predicted_value_std=0.182, train/target_value_mean=-0.263, train/target_value_std=0.232, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7672/8000 [3:02:04<18:40, 3.42s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.4, train/loss=3.51, train/lr=5e-5, train/mae=0.184, train/predicted_value_mean=-0.273, train/predicted_value_std=0.072, train/target_value_mean=-0.316, train/target_value_std=0.196, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7673/8000 [3:02:07<18:32, 3.40s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=8.71, train/loss=2.58, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.252, train/predicted_value_std=0.071, train/target_value_mean=-0.253, train/target_value_std=0.0882, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7674/8000 [3:02:10<18:29, 3.40s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=6.44, train/loss=2.3, train/lr=5e-5, train/mae=0.0372, train/predicted_value_mean=-0.324, train/predicted_value_std=0.199, train/target_value_mean=-0.286, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7675/8000 [3:02:14<18:41, 3.45s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.04, train/loss=2.89, train/lr=5e-5, train/mae=0.0584, train/predicted_value_mean=-0.256, train/predicted_value_std=0.177, train/target_value_mean=-0.276, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7676/8000 [3:02:17<18:37, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.77, train/loss=3.77, train/lr=5e-5, train/mae=0.0369, train/predicted_value_mean=-0.343, train/predicted_value_std=0.146, train/target_value_mean=-0.269, train/target_value_std=0.153, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7677/8000 [3:02:21<18:33, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.68, train/loss=3.83, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.307, train/predicted_value_std=0.189, train/target_value_mean=-0.33, train/target_value_std=0.303, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7678/8000 [3:02:24<18:29, 3.44s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.12, train/loss=3.85, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.345, train/predicted_value_std=0.0985, train/target_value_mean=-0.372, train/target_value_std=0.2, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7679/8000 [3:02:28<18:21, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=11.1, train/loss=3.71, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.308, train/predicted_value_std=0.156, train/target_value_mean=-0.247, train/target_value_std=0.232, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7680/8000 [3:02:31<18:50, 3.53s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.4, train/loss=3.82, train/lr=5e-5, train/mae=0.167, train/predicted_value_mean=-0.317, train/predicted_value_std=0.0904, train/target_value_mean=-0.328, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7681/8000 [3:02:35<18:40, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.29, train/loss=3.71, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.302, train/predicted_value_std=0.139, train/target_value_mean=-0.321, train/target_value_std=0.231, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7682/8000 [3:02:38<18:27, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.2, train/loss=4.16, train/lr=5e-5, train/mae=0.217, train/predicted_value_mean=-0.3, train/predicted_value_std=0.122, train/target_value_mean=-0.343, train/target_value_std=0.214, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7683/8000 [3:02:42<18:16, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=7.59, train/loss=3.38, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.27, train/predicted_value_std=0.0987, train/target_value_mean=-0.285, train/target_value_std=0.162, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7684/8000 [3:02:45<18:09, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7.73, train/loss=3, train/lr=5e-5, train/mae=0.0875, train/predicted_value_mean=-0.295, train/predicted_value_std=0.117, train/target_value_mean=-0.311, train/target_value_std=0.152, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7685/8000 [3:02:48<18:06, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=6.82, train/loss=3.02, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.219, train/predicted_value_std=0.136, train/target_value_mean=-0.248, train/target_value_std=0.214, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7686/8000 [3:02:52<18:07, 3.46s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.49, train/loss=3.42, train/lr=5e-5, train/mae=0.0775, train/predicted_value_mean=-0.27, train/predicted_value_std=0.101, train/target_value_mean=-0.23, train/target_value_std=0.13, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7687/8000 [3:02:55<18:02, 3.46s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.55, train/loss=3.82, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.334, train/predicted_value_std=0.146, train/target_value_mean=-0.388, train/target_value_std=0.254, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7688/8000 [3:02:59<17:52, 3.44s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=12.4, train/loss=3.19, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.301, train/predicted_value_std=0.0892, train/target_value_mean=-0.274, train/target_value_std=0.118, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7689/8000 [3:03:02<17:44, 3.42s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.36, train/loss=3.39, train/lr=5e-5, train/mae=0.0644, train/predicted_value_mean=-0.228, train/predicted_value_std=0.0768, train/target_value_mean=-0.226, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7690/8000 [3:03:06<17:37, 3.41s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.1, train/loss=3.44, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.365, train/predicted_value_std=0.12, train/target_value_mean=-0.375, train/target_value_std=0.206, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7691/8000 [3:03:09<17:29, 3.40s/it, time/step=3.35, time/training=3.35, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=10.2, train/loss=3.66, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.329, train/predicted_value_std=0.179, train/target_value_mean=-0.352, train/target_value_std=0.235, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7692/8000 [3:03:13<17:50, 3.48s/it, time/step=3.66, time/training=3.66, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.34, train/loss=3.92, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.368, train/predicted_value_std=0.148, train/target_value_mean=-0.326, train/target_value_std=0.227, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7693/8000 [3:03:16<17:36, 3.44s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.58, train/loss=3.79, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.33, train/predicted_value_std=0.173, train/target_value_mean=-0.334, train/target_value_std=0.176, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7694/8000 [3:03:19<17:25, 3.42s/it, time/step=3.36, time/training=3.35, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.5, train/grad_norm=7.21, train/loss=2.62, train/lr=5e-5, train/mae=0.085, train/predicted_value_mean=-0.214, train/predicted_value_std=0.159, train/target_value_mean=-0.229, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7695/8000 [3:03:23<17:26, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.92, train/loss=3.29, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.289, train/predicted_value_std=0.182, train/target_value_mean=-0.252, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7696/8000 [3:03:26<17:29, 3.45s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.04, train/loss=3.8, train/lr=5e-5, train/mae=0.123, train/predicted_value_mean=-0.388, train/predicted_value_std=0.154, train/target_value_mean=-0.314, train/target_value_std=0.205, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7697/8000 [3:03:30<17:30, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.35, train/loss=2.86, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.286, train/predicted_value_std=0.203, train/target_value_mean=-0.243, train/target_value_std=0.185, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7698/8000 [3:03:33<17:30, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.23, train/loss=3.08, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.276, train/predicted_value_std=0.148, train/target_value_mean=-0.288, train/target_value_std=0.225, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7699/8000 [3:03:37<17:30, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.58, train/loss=3.82, train/lr=5e-5, train/mae=0.185, train/predicted_value_mean=-0.384, train/predicted_value_std=0.126, train/target_value_mean=-0.408, train/target_value_std=0.186, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7700/8000 [3:03:40<17:27, 3.49s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=6.55, train/loss=2.64, train/lr=5e-5, train/mae=0.0706, train/predicted_value_mean=-0.226, train/predicted_value_std=0.139, train/target_value_mean=-0.163, train/target_value_std=0.0701, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7701/8000 [3:03:44<17:25, 3.50s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.18, train/loss=3.25, train/lr=5e-5, train/mae=0.0497, train/predicted_value_mean=-0.245, train/predicted_value_std=0.12, train/target_value_mean=-0.206, train/target_value_std=0.115, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7702/8000 [3:03:47<17:22, 3.50s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.16, train/loss=3.99, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.388, train/predicted_value_std=0.2, train/target_value_mean=-0.328, train/target_value_std=0.164, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7703/8000 [3:03:51<17:45, 3.59s/it, time/step=3.79, time/training=3.79, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.82, train/loss=3.63, train/lr=5e-5, train/mae=0.173, train/predicted_value_mean=-0.326, train/predicted_value_std=0.105, train/target_value_mean=-0.347, train/target_value_std=0.24, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7704/8000 [3:03:55<17:32, 3.56s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.2, train/loss=3.84, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.361, train/predicted_value_std=0.144, train/target_value_mean=-0.338, train/target_value_std=0.177, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7705/8000 [3:03:58<17:14, 3.51s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=10.1, train/loss=2.94, train/lr=5e-5, train/mae=0.0478, train/predicted_value_mean=-0.19, train/predicted_value_std=0.0802, train/target_value_mean=-0.187, train/target_value_std=0.0852, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7706/8000 [3:04:01<17:02, 3.48s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=6.99, train/loss=3.31, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.233, train/predicted_value_std=0.126, train/target_value_mean=-0.201, train/target_value_std=0.105, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7707/8000 [3:04:05<16:55, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=8.35, train/loss=2.32, train/lr=5e-5, train/mae=0.0131, train/predicted_value_mean=-0.305, train/predicted_value_std=0.178, train/target_value_mean=-0.277, train/target_value_std=0.233, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7708/8000 [3:04:08<16:53, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.87, train/loss=3.34, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.307, train/predicted_value_std=0.14, train/target_value_mean=-0.291, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7709/8000 [3:04:12<16:49, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.06, train/loss=3.35, train/lr=5e-5, train/mae=0.0956, train/predicted_value_mean=-0.305, train/predicted_value_std=0.124, train/target_value_mean=-0.286, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7710/8000 [3:04:15<16:44, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=6.55, train/loss=2.41, train/lr=5e-5, train/mae=0.0434, train/predicted_value_mean=-0.32, train/predicted_value_std=0.193, train/target_value_mean=-0.327, train/target_value_std=0.228, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7711/8000 [3:04:19<16:38, 3.46s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.25, train/grad_norm=8.44, train/loss=3.18, train/lr=5e-5, train/mae=0.0587, train/predicted_value_mean=-0.233, train/predicted_value_std=0.145, train/target_value_mean=-0.206, train/target_value_std=0.2, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7712/8000 [3:04:22<16:33, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.438, train/grad_norm=7, train/loss=3.29, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.31, train/predicted_value_std=0.183, train/target_value_mean=-0.278, train/target_value_std=0.232, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7713/8000 [3:04:26<16:28, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.04, train/loss=3.56, train/lr=5e-5, train/mae=0.0806, train/predicted_value_mean=-0.357, train/predicted_value_std=0.147, train/target_value_mean=-0.331, train/target_value_std=0.189, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7714/8000 [3:04:29<16:27, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.562, train/grad_norm=8.32, train/loss=2.76, train/lr=5e-5, train/mae=0.0441, train/predicted_value_mean=-0.316, train/predicted_value_std=0.16, train/target_value_mean=-0.279, train/target_value_std=0.125, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7715/8000 [3:04:33<16:56, 3.57s/it, time/step=3.83, time/training=3.83, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.5, train/loss=3.61, train/lr=5e-5, train/mae=0.0619, train/predicted_value_mean=-0.3, train/predicted_value_std=0.179, train/target_value_mean=-0.23, train/target_value_std=0.148, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7716/8000 [3:04:36<16:47, 3.55s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.97, train/loss=4.21, train/lr=5e-5, train/mae=0.203, train/predicted_value_mean=-0.358, train/predicted_value_std=0.153, train/target_value_mean=-0.352, train/target_value_std=0.256, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7717/8000 [3:04:40<16:45, 3.55s/it, time/step=3.56, time/training=3.56, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.09, train/loss=3.48, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.283, train/predicted_value_std=0.146, train/target_value_mean=-0.267, train/target_value_std=0.207, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7718/8000 [3:04:43<16:36, 3.53s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=6.46, train/loss=3, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.267, train/predicted_value_std=0.205, train/target_value_mean=-0.212, train/target_value_std=0.191, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7719/8000 [3:04:47<16:28, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.11, train/loss=3.51, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.332, train/predicted_value_std=0.169, train/target_value_mean=-0.393, train/target_value_std=0.237, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 96%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7720/8000 [3:04:50<16:16, 3.49s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=9.78, train/loss=3.97, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.304, train/predicted_value_std=0.0768, train/target_value_mean=-0.318, train/target_value_std=0.139, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7721/8000 [3:04:54<16:05, 3.46s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.9, train/loss=3.8, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.305, train/predicted_value_std=0.171, train/target_value_mean=-0.41, train/target_value_std=0.296, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7722/8000 [3:04:57<16:00, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.63, train/loss=3.41, train/lr=5e-5, train/mae=0.117, train/predicted_value_mean=-0.28, train/predicted_value_std=0.161, train/target_value_mean=-0.25, train/target_value_std=0.219, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7723/8000 [3:05:01<16:00, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.05, train/loss=3.19, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.283, train/predicted_value_std=0.208, train/target_value_mean=-0.257, train/target_value_std=0.242, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7724/8000 [3:05:04<16:01, 3.48s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=10.7, train/loss=3.68, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.396, train/predicted_value_std=0.146, train/target_value_mean=-0.372, train/target_value_std=0.257, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7725/8000 [3:05:08<16:00, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=6.07, train/loss=2.87, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.234, train/predicted_value_std=0.101, train/target_value_mean=-0.24, train/target_value_std=0.155, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7726/8000 [3:05:11<16:12, 3.55s/it, time/step=3.67, time/training=3.67, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.51, train/loss=2.87, train/lr=5e-5, train/mae=0.0884, train/predicted_value_mean=-0.202, train/predicted_value_std=0.111, train/target_value_mean=-0.18, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7727/8000 [3:05:15<15:58, 3.51s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=7.29, train/loss=3.12, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.313, train/predicted_value_std=0.168, train/target_value_mean=-0.302, train/target_value_std=0.221, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7728/8000 [3:05:18<15:46, 3.48s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=12.1, train/loss=3.18, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.301, train/predicted_value_std=0.116, train/target_value_mean=-0.256, train/target_value_std=0.152, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7729/8000 [3:05:22<15:41, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=8.82, train/loss=3.06, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.339, train/predicted_value_std=0.186, train/target_value_mean=-0.384, train/target_value_std=0.233, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7730/8000 [3:05:25<15:41, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.15, train/loss=3.55, train/lr=5e-5, train/mae=0.0862, train/predicted_value_mean=-0.327, train/predicted_value_std=0.185, train/target_value_mean=-0.281, train/target_value_std=0.143, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7731/8000 [3:05:29<15:40, 3.49s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.26, train/loss=3.06, train/lr=5e-5, train/mae=0.0497, train/predicted_value_mean=-0.295, train/predicted_value_std=0.174, train/target_value_mean=-0.276, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7732/8000 [3:05:32<15:35, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.76, train/loss=2.75, train/lr=5e-5, train/mae=0.0684, train/predicted_value_mean=-0.258, train/predicted_value_std=0.211, train/target_value_mean=-0.262, train/target_value_std=0.252, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7733/8000 [3:05:36<15:31, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.26, train/loss=3.46, train/lr=5e-5, train/mae=0.148, train/predicted_value_mean=-0.326, train/predicted_value_std=0.246, train/target_value_mean=-0.273, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7734/8000 [3:05:39<15:26, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.562, train/cat_acc_neighbor=0.562, train/grad_norm=5.95, train/loss=2.47, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.25, train/predicted_value_std=0.152, train/target_value_mean=-0.211, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7735/8000 [3:05:43<15:22, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.94, train/loss=3.19, train/lr=5e-5, train/mae=0.0531, train/predicted_value_mean=-0.249, train/predicted_value_std=0.0942, train/target_value_mean=-0.276, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7736/8000 [3:05:46<15:18, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.69, train/loss=3.51, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.321, train/predicted_value_std=0.158, train/target_value_mean=-0.339, train/target_value_std=0.265, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7737/8000 [3:05:50<15:15, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.7, train/loss=2.65, train/lr=5e-5, train/mae=0.0762, train/predicted_value_mean=-0.238, train/predicted_value_std=0.0894, train/target_value_mean=-0.226, train/target_value_std=0.0664, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7738/8000 [3:05:53<15:31, 3.55s/it, time/step=3.73, time/training=3.72, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=9.6, train/loss=3.86, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.326, train/predicted_value_std=0.133, train/target_value_mean=-0.253, train/target_value_std=0.179, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7739/8000 [3:05:57<15:16, 3.51s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.438, train/cat_acc_neighbor=0.438, train/grad_norm=9.13, train/loss=2.99, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.235, train/predicted_value_std=0.151, train/target_value_mean=-0.19, train/target_value_std=0.112, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7740/8000 [3:06:00<15:06, 3.49s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.01, train/loss=3.57, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.327, train/predicted_value_std=0.189, train/target_value_mean=-0.323, train/target_value_std=0.164, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7741/8000 [3:06:04<15:01, 3.48s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.5, train/grad_norm=8.64, train/loss=2.96, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.302, train/predicted_value_std=0.19, train/target_value_mean=-0.301, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7742/8000 [3:06:07<15:00, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.1, train/loss=3.42, train/lr=5e-5, train/mae=0.145, train/predicted_value_mean=-0.319, train/predicted_value_std=0.219, train/target_value_mean=-0.339, train/target_value_std=0.244, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7743/8000 [3:06:11<14:54, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.3, train/loss=3.81, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.359, train/predicted_value_std=0.109, train/target_value_mean=-0.425, train/target_value_std=0.167, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7744/8000 [3:06:14<14:51, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.71, train/loss=2.43, train/lr=5e-5, train/mae=0.0266, train/predicted_value_mean=-0.23, train/predicted_value_std=0.177, train/target_value_mean=-0.223, train/target_value_std=0.169, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7745/8000 [3:06:18<14:49, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.3, train/loss=3.18, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.294, train/predicted_value_std=0.175, train/target_value_mean=-0.316, train/target_value_std=0.266, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7746/8000 [3:06:21<14:43, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.37, train/loss=3.41, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.278, train/predicted_value_std=0.163, train/target_value_mean=-0.186, train/target_value_std=0.181, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7747/8000 [3:06:25<14:42, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=6.66, train/loss=3.31, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.25, train/predicted_value_std=0.142, train/target_value_mean=-0.23, train/target_value_std=0.204, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7748/8000 [3:06:28<14:39, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=8.45, train/loss=3.24, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.311, train/predicted_value_std=0.0816, train/target_value_mean=-0.3, train/target_value_std=0.115, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7749/8000 [3:06:32<14:57, 3.58s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=8.25, train/loss=2.56, train/lr=5e-5, train/mae=0.0406, train/predicted_value_mean=-0.234, train/predicted_value_std=0.125, train/target_value_mean=-0.218, train/target_value_std=0.151, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7750/8000 [3:06:35<14:43, 3.53s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.43, train/loss=3.71, train/lr=5e-5, train/mae=0.0744, train/predicted_value_mean=-0.323, train/predicted_value_std=0.125, train/target_value_mean=-0.274, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7751/8000 [3:06:39<14:24, 3.47s/it, time/step=3.32, time/training=3.32, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.3, train/loss=3.96, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.353, train/predicted_value_std=0.139, train/target_value_mean=-0.311, train/target_value_std=0.251, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7752/8000 [3:06:42<14:11, 3.43s/it, time/step=3.35, time/training=3.34, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=11.1, train/loss=3.41, train/lr=5e-5, train/mae=0.0797, train/predicted_value_mean=-0.235, train/predicted_value_std=0.0955, train/target_value_mean=-0.217, train/target_value_std=0.09, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7753/8000 [3:06:45<14:06, 3.43s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=12.3, train/loss=4.08, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.3, train/predicted_value_std=0.163, train/target_value_mean=-0.28, train/target_value_std=0.202, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7754/8000 [3:06:49<14:06, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=9.33, train/loss=3.19, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.305, train/predicted_value_std=0.161, train/target_value_mean=-0.257, train/target_value_std=0.132, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7755/8000 [3:06:52<14:04, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=6.8, train/loss=3.56, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.311, train/predicted_value_std=0.157, train/target_value_mean=-0.279, train/target_value_std=0.238, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7756/8000 [3:06:56<14:04, 3.46s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10.8, train/loss=3.56, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.321, train/predicted_value_std=0.153, train/target_value_mean=-0.297, train/target_value_std=0.228, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7757/8000 [3:06:59<13:59, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=11.8, train/loss=3.39, train/lr=5e-5, train/mae=0.138, train/predicted_value_mean=-0.401, train/predicted_value_std=0.246, train/target_value_mean=-0.433, train/target_value_std=0.267, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7758/8000 [3:07:03<13:53, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.4, train/loss=2.99, train/lr=5e-5, train/mae=0.0672, train/predicted_value_mean=-0.304, train/predicted_value_std=0.176, train/target_value_mean=-0.306, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7759/8000 [3:07:06<13:48, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.77, train/loss=3.5, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.349, train/predicted_value_std=0.111, train/target_value_mean=-0.364, train/target_value_std=0.125, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7760/8000 [3:07:09<13:44, 3.43s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10, train/loss=3.22, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.278, train/predicted_value_std=0.129, train/target_value_mean=-0.276, train/target_value_std=0.161, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7761/8000 [3:07:13<13:59, 3.51s/it, time/step=3.69, time/training=3.68, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.75, train/loss=3.77, train/lr=5e-5, train/mae=0.168, train/predicted_value_mean=-0.366, train/predicted_value_std=0.0986, train/target_value_mean=-0.397, train/target_value_std=0.161, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7762/8000 [3:07:17<13:48, 3.48s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=12.8, train/loss=3.51, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.243, train/predicted_value_std=0.14, train/target_value_mean=-0.265, train/target_value_std=0.182, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7763/8000 [3:07:20<13:38, 3.45s/it, time/step=3.39, time/training=3.38, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.18, train/loss=3.5, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.3, train/predicted_value_std=0.123, train/target_value_mean=-0.329, train/target_value_std=0.149, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7764/8000 [3:07:23<13:30, 3.44s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=10, train/loss=3.5, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.318, train/predicted_value_std=0.166, train/target_value_mean=-0.34, train/target_value_std=0.157, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7765/8000 [3:07:27<13:25, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.33, train/loss=2.79, train/lr=5e-5, train/mae=0.0647, train/predicted_value_mean=-0.228, train/predicted_value_std=0.119, train/target_value_mean=-0.277, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7766/8000 [3:07:30<13:20, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.58, train/loss=3.23, train/lr=5e-5, train/mae=0.0794, train/predicted_value_mean=-0.313, train/predicted_value_std=0.192, train/target_value_mean=-0.338, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7767/8000 [3:07:34<13:22, 3.44s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.23, train/loss=2.84, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.287, train/predicted_value_std=0.15, train/target_value_mean=-0.339, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7768/8000 [3:07:37<13:20, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.26, train/loss=3.72, train/lr=5e-5, train/mae=0.233, train/predicted_value_mean=-0.293, train/predicted_value_std=0.112, train/target_value_mean=-0.314, train/target_value_std=0.0943, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7769/8000 [3:07:41<13:13, 3.44s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=9.22, train/loss=3.56, train/lr=5e-5, train/mae=0.17, train/predicted_value_mean=-0.28, train/predicted_value_std=0.199, train/target_value_mean=-0.306, train/target_value_std=0.276, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7770/8000 [3:07:44<13:09, 3.43s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.25, train/loss=3.65, train/lr=5e-5, train/mae=0.19, train/predicted_value_mean=-0.309, train/predicted_value_std=0.133, train/target_value_mean=-0.286, train/target_value_std=0.235, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7771/8000 [3:07:47<13:08, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.56, train/loss=3.97, train/lr=5e-5, train/mae=0.113, train/predicted_value_mean=-0.311, train/predicted_value_std=0.207, train/target_value_mean=-0.283, train/target_value_std=0.23, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7772/8000 [3:07:51<13:24, 3.53s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=8.15, train/loss=3.33, train/lr=5e-5, train/mae=0.0925, train/predicted_value_mean=-0.255, train/predicted_value_std=0.0998, train/target_value_mean=-0.242, train/target_value_std=0.154, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7773/8000 [3:07:55<13:19, 3.52s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=8.22, train/loss=3.23, train/lr=5e-5, train/mae=0.0678, train/predicted_value_mean=-0.384, train/predicted_value_std=0.152, train/target_value_mean=-0.387, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7774/8000 [3:07:58<13:11, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.73, train/loss=3.68, train/lr=5e-5, train/mae=0.198, train/predicted_value_mean=-0.349, train/predicted_value_std=0.226, train/target_value_mean=-0.415, train/target_value_std=0.417, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7775/8000 [3:08:02<13:09, 3.51s/it, time/step=3.52, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=11.5, train/loss=3.21, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.233, train/predicted_value_std=0.178, train/target_value_mean=-0.23, train/target_value_std=0.21, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7776/8000 [3:08:05<13:02, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.05, train/loss=3.7, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.282, train/predicted_value_std=0.158, train/target_value_mean=-0.292, train/target_value_std=0.227, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7777/8000 [3:08:08<12:54, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10, train/loss=3.22, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.241, train/predicted_value_std=0.149, train/target_value_mean=-0.15, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7778/8000 [3:08:12<12:50, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=11.4, train/loss=3.07, train/lr=5e-5, train/mae=0.192, train/predicted_value_mean=-0.322, train/predicted_value_std=0.124, train/target_value_mean=-0.244, train/target_value_std=0.209, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7779/8000 [3:08:15<12:48, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.61, train/loss=2.91, train/lr=5e-5, train/mae=0.0784, train/predicted_value_mean=-0.287, train/predicted_value_std=0.117, train/target_value_mean=-0.28, train/target_value_std=0.158, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7780/8000 [3:08:19<12:45, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.24, train/loss=3.51, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.323, train/predicted_value_std=0.293, train/target_value_mean=-0.347, train/target_value_std=0.309, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7781/8000 [3:08:22<12:42, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.562, train/grad_norm=7.33, train/loss=2.76, train/lr=5e-5, train/mae=0.0344, train/predicted_value_mean=-0.354, train/predicted_value_std=0.238, train/target_value_mean=-0.388, train/target_value_std=0.272, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7782/8000 [3:08:26<12:40, 3.49s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.42, train/loss=3.39, train/lr=5e-5, train/mae=0.14, train/predicted_value_mean=-0.319, train/predicted_value_std=0.17, train/target_value_mean=-0.271, train/target_value_std=0.136, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7783/8000 [3:08:29<12:37, 3.49s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.55, train/loss=3.21, train/lr=5e-5, train/mae=0.16, train/predicted_value_mean=-0.279, train/predicted_value_std=0.221, train/target_value_mean=-0.238, train/target_value_std=0.277, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7784/8000 [3:08:33<12:52, 3.58s/it, time/step=3.78, time/training=3.78, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=12.7, train/loss=3.04, train/lr=5e-5, train/mae=0.0409, train/predicted_value_mean=-0.382, train/predicted_value_std=0.111, train/target_value_mean=-0.364, train/target_value_std=0.14, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7785/8000 [3:08:37<12:44, 3.55s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.69, train/loss=3.71, train/lr=5e-5, train/mae=0.18, train/predicted_value_mean=-0.347, train/predicted_value_std=0.252, train/target_value_mean=-0.262, train/target_value_std=0.25, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7786/8000 [3:08:40<12:36, 3.53s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.94, train/loss=3.96, train/lr=5e-5, train/mae=0.144, train/predicted_value_mean=-0.362, train/predicted_value_std=0.153, train/target_value_mean=-0.358, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7787/8000 [3:08:44<12:29, 3.52s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=9.65, train/loss=3.64, train/lr=5e-5, train/mae=0.0897, train/predicted_value_mean=-0.29, train/predicted_value_std=0.165, train/target_value_mean=-0.286, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7788/8000 [3:08:47<12:24, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.562, train/cat_acc_neighbor=0.625, train/grad_norm=7.34, train/loss=2.93, train/lr=5e-5, train/mae=0.0569, train/predicted_value_mean=-0.326, train/predicted_value_std=0.239, train/target_value_mean=-0.372, train/target_value_std=0.323, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7789/8000 [3:08:51<12:18, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=8.61, train/loss=3.4, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.327, train/predicted_value_std=0.192, train/target_value_mean=-0.283, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7790/8000 [3:08:54<12:14, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.13, train/loss=3.35, train/lr=5e-5, train/mae=0.0491, train/predicted_value_mean=-0.395, train/predicted_value_std=0.166, train/target_value_mean=-0.47, train/target_value_std=0.207, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7791/8000 [3:08:58<12:11, 3.50s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.27, train/loss=3.88, train/lr=5e-5, train/mae=0.203, train/predicted_value_mean=-0.341, train/predicted_value_std=0.128, train/target_value_mean=-0.288, train/target_value_std=0.244, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7792/8000 [3:09:01<12:07, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.41, train/loss=3.5, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.359, train/predicted_value_std=0.175, train/target_value_mean=-0.283, train/target_value_std=0.28, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7793/8000 [3:09:05<12:02, 3.49s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=10.5, train/loss=3.65, train/lr=5e-5, train/mae=0.131, train/predicted_value_mean=-0.386, train/predicted_value_std=0.157, train/target_value_mean=-0.414, train/target_value_std=0.268, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7794/8000 [3:09:08<11:58, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=11.9, train/loss=3.22, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.307, train/predicted_value_std=0.16, train/target_value_mean=-0.244, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7795/8000 [3:09:12<12:12, 3.57s/it, time/step=3.77, time/training=3.77, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.44, train/loss=3.62, train/lr=5e-5, train/mae=0.152, train/predicted_value_mean=-0.361, train/predicted_value_std=0.161, train/target_value_mean=-0.322, train/target_value_std=0.16, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7796/8000 [3:09:15<12:06, 3.56s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.76, train/loss=4.03, train/lr=5e-5, train/mae=0.135, train/predicted_value_mean=-0.324, train/predicted_value_std=0.138, train/target_value_mean=-0.324, train/target_value_std=0.194, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7797/8000 [3:09:19<11:57, 3.54s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=9.59, train/loss=3.27, train/lr=5e-5, train/mae=0.0691, train/predicted_value_mean=-0.294, train/predicted_value_std=0.132, train/target_value_mean=-0.225, train/target_value_std=0.16, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7798/8000 [3:09:22<11:47, 3.50s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.65, train/loss=3.69, train/lr=5e-5, train/mae=0.179, train/predicted_value_mean=-0.319, train/predicted_value_std=0.154, train/target_value_mean=-0.31, train/target_value_std=0.153, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 97%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7799/8000 [3:09:26<11:38, 3.47s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=11.1, train/loss=3.46, train/lr=5e-5, train/mae=0.0962, train/predicted_value_mean=-0.267, train/predicted_value_std=0.132, train/target_value_mean=-0.263, train/target_value_std=0.196, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7800/8000 [3:09:29<11:33, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.71, train/loss=3.86, train/lr=5e-5, train/mae=0.157, train/predicted_value_mean=-0.318, train/predicted_value_std=0.207, train/target_value_mean=-0.26, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7801/8000 [3:09:33<11:26, 3.45s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.17, train/loss=3.69, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.285, train/predicted_value_std=0.163, train/target_value_mean=-0.265, train/target_value_std=0.201, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7802/8000 [3:09:36<11:20, 3.44s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.8, train/loss=2.69, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.23, train/predicted_value_std=0.198, train/target_value_mean=-0.183, train/target_value_std=0.191, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7803/8000 [3:09:39<11:15, 3.43s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.74, train/loss=3.02, train/lr=5e-5, train/mae=0.095, train/predicted_value_mean=-0.24, train/predicted_value_std=0.125, train/target_value_mean=-0.211, train/target_value_std=0.092, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7804/8000 [3:09:43<11:15, 3.44s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.01, train/loss=4.05, train/lr=5e-5, train/mae=0.193, train/predicted_value_mean=-0.395, train/predicted_value_std=0.143, train/target_value_mean=-0.464, train/target_value_std=0.22, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7805/8000 [3:09:46<11:15, 3.46s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.82, train/loss=2.56, train/lr=5e-5, train/mae=0.0991, train/predicted_value_mean=-0.232, train/predicted_value_std=0.13, train/target_value_mean=-0.248, train/target_value_std=0.215, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7806/8000 [3:09:50<11:15, 3.48s/it, time/step=3.53, time/training=3.53, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.31, train/loss=2.8, train/lr=5e-5, train/mae=0.0494, train/predicted_value_mean=-0.33, train/predicted_value_std=0.183, train/target_value_mean=-0.339, train/target_value_std=0.22, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7807/8000 [3:09:54<11:33, 3.59s/it, time/step=3.85, time/training=3.84, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=7.14, train/loss=2.77, train/lr=5e-5, train/mae=0.0844, train/predicted_value_mean=-0.284, train/predicted_value_std=0.18, train/target_value_mean=-0.328, train/target_value_std=0.181, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7808/8000 [3:09:57<11:23, 3.56s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.48, train/loss=3.01, train/lr=5e-5, train/mae=0.0809, train/predicted_value_mean=-0.298, train/predicted_value_std=0.139, train/target_value_mean=-0.296, train/target_value_std=0.139, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7809/8000 [3:10:01<11:12, 3.52s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.01, train/loss=3.95, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.301, train/predicted_value_std=0.126, train/target_value_mean=-0.317, train/target_value_std=0.136, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7810/8000 [3:10:04<11:05, 3.50s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.02, train/loss=3.73, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.284, train/predicted_value_std=0.184, train/target_value_mean=-0.348, train/target_value_std=0.218, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7811/8000 [3:10:08<11:02, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=10.5, train/loss=3.05, train/lr=5e-5, train/mae=0.03, train/predicted_value_mean=-0.286, train/predicted_value_std=0.17, train/target_value_mean=-0.263, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7812/8000 [3:10:11<10:58, 3.50s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.34, train/loss=3.4, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.269, train/predicted_value_std=0.136, train/target_value_mean=-0.277, train/target_value_std=0.168, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7813/8000 [3:10:15<10:54, 3.50s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=6.74, train/loss=3.58, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.313, train/predicted_value_std=0.155, train/target_value_mean=-0.3, train/target_value_std=0.176, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7814/8000 [3:10:18<10:51, 3.50s/it, time/step=3.51, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.32, train/loss=2.9, train/lr=5e-5, train/mae=0.0466, train/predicted_value_mean=-0.243, train/predicted_value_std=0.175, train/target_value_mean=-0.217, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7815/8000 [3:10:22<10:45, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.82, train/loss=3.76, train/lr=5e-5, train/mae=0.0834, train/predicted_value_mean=-0.275, train/predicted_value_std=0.163, train/target_value_mean=-0.264, train/target_value_std=0.142, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7816/8000 [3:10:25<10:38, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=9.57, train/loss=3.39, train/lr=5e-5, train/mae=0.0869, train/predicted_value_mean=-0.374, train/predicted_value_std=0.21, train/target_value_mean=-0.376, train/target_value_std=0.293, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7817/8000 [3:10:28<10:32, 3.45s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.5, train/grad_norm=7.38, train/loss=3.03, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.217, train/predicted_value_std=0.137, train/target_value_mean=-0.25, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7818/8000 [3:10:32<10:40, 3.52s/it, time/step=3.67, time/training=3.67, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.77, train/loss=3.81, train/lr=5e-5, train/mae=0.155, train/predicted_value_mean=-0.348, train/predicted_value_std=0.207, train/target_value_mean=-0.28, train/target_value_std=0.264, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7819/8000 [3:10:36<10:35, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.76, train/loss=3.56, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.323, train/predicted_value_std=0.14, train/target_value_mean=-0.35, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7820/8000 [3:10:39<10:31, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.05, train/loss=3.3, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.339, train/predicted_value_std=0.137, train/target_value_mean=-0.306, train/target_value_std=0.194, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7821/8000 [3:10:43<10:24, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.32, train/loss=3.21, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.354, train/predicted_value_std=0.286, train/target_value_mean=-0.332, train/target_value_std=0.332, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7822/8000 [3:10:46<10:17, 3.47s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=9.4, train/loss=2.91, train/lr=5e-5, train/mae=0.0966, train/predicted_value_mean=-0.273, train/predicted_value_std=0.168, train/target_value_mean=-0.224, train/target_value_std=0.18, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7823/8000 [3:10:49<10:12, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.91, train/loss=3.19, train/lr=5e-5, train/mae=0.0622, train/predicted_value_mean=-0.213, train/predicted_value_std=0.13, train/target_value_mean=-0.167, train/target_value_std=0.131, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7824/8000 [3:10:53<10:07, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=10.7, train/loss=2.95, train/lr=5e-5, train/mae=0.0475, train/predicted_value_mean=-0.342, train/predicted_value_std=0.136, train/target_value_mean=-0.327, train/target_value_std=0.169, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7825/8000 [3:10:56<10:06, 3.46s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=6.58, train/loss=3.6, train/lr=5e-5, train/mae=0.0981, train/predicted_value_mean=-0.29, train/predicted_value_std=0.127, train/target_value_mean=-0.289, train/target_value_std=0.158, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7826/8000 [3:11:00<10:03, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.71, train/loss=3.44, train/lr=5e-5, train/mae=0.0659, train/predicted_value_mean=-0.277, train/predicted_value_std=0.125, train/target_value_mean=-0.305, train/target_value_std=0.169, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7827/8000 [3:11:03<10:01, 3.47s/it, time/step=3.49, time/training=3.48, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.25, train/loss=3.67, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.317, train/predicted_value_std=0.139, train/target_value_mean=-0.338, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7828/8000 [3:11:07<09:57, 3.47s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.61, train/loss=3.43, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.308, train/predicted_value_std=0.164, train/target_value_mean=-0.355, train/target_value_std=0.202, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7829/8000 [3:11:10<09:51, 3.46s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.1, train/loss=3.13, train/lr=5e-5, train/mae=0.0787, train/predicted_value_mean=-0.237, train/predicted_value_std=0.0869, train/target_value_mean=-0.201, train/target_value_std=0.0885, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7830/8000 [3:11:14<10:00, 3.53s/it, time/step=3.7, time/training=3.7, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.23, train/loss=2.89, train/lr=5e-5, train/mae=0.0572, train/predicted_value_mean=-0.238, train/predicted_value_std=0.0844, train/target_value_mean=-0.22, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7831/8000 [3:11:17<09:53, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.46, train/loss=3.8, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.328, train/predicted_value_std=0.202, train/target_value_mean=-0.34, train/target_value_std=0.239, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7832/8000 [3:11:21<09:49, 3.51s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.89, train/loss=3.03, train/lr=5e-5, train/mae=0.0381, train/predicted_value_mean=-0.299, train/predicted_value_std=0.172, train/target_value_mean=-0.281, train/target_value_std=0.187, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7833/8000 [3:11:24<09:45, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=7.48, train/loss=3.92, train/lr=5e-5, train/mae=0.12, train/predicted_value_mean=-0.3, train/predicted_value_std=0.19, train/target_value_mean=-0.355, train/target_value_std=0.313, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7834/8000 [3:11:28<09:40, 3.50s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.05, train/loss=3.55, train/lr=5e-5, train/mae=0.164, train/predicted_value_mean=-0.304, train/predicted_value_std=0.122, train/target_value_mean=-0.219, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7835/8000 [3:11:31<09:34, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.99, train/loss=3.62, train/lr=5e-5, train/mae=0.0931, train/predicted_value_mean=-0.296, train/predicted_value_std=0.188, train/target_value_mean=-0.302, train/target_value_std=0.212, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7836/8000 [3:11:35<09:29, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.82, train/loss=3.77, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.324, train/predicted_value_std=0.153, train/target_value_mean=-0.244, train/target_value_std=0.14, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7837/8000 [3:11:38<09:25, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.06, train/loss=3.6, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.345, train/predicted_value_std=0.184, train/target_value_mean=-0.307, train/target_value_std=0.129, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7838/8000 [3:11:42<09:20, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.08, train/loss=3.97, train/lr=5e-5, train/mae=0.153, train/predicted_value_mean=-0.338, train/predicted_value_std=0.176, train/target_value_mean=-0.301, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7839/8000 [3:11:45<09:17, 3.46s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.65, train/loss=3.31, train/lr=5e-5, train/mae=0.0512, train/predicted_value_mean=-0.308, train/predicted_value_std=0.164, train/target_value_mean=-0.277, train/target_value_std=0.184, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7840/8000 [3:11:49<09:12, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.86, train/loss=2.76, train/lr=5e-5, train/mae=0.0612, train/predicted_value_mean=-0.221, train/predicted_value_std=0.123, train/target_value_mean=-0.169, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7841/8000 [3:11:52<09:23, 3.55s/it, time/step=3.75, time/training=3.75, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=7.13, train/loss=3.25, train/lr=5e-5, train/mae=0.055, train/predicted_value_mean=-0.318, train/predicted_value_std=0.182, train/target_value_mean=-0.276, train/target_value_std=0.185, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7842/8000 [3:11:56<09:16, 3.52s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.67, train/loss=3.2, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.266, train/predicted_value_std=0.144, train/target_value_mean=-0.275, train/target_value_std=0.196, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7843/8000 [3:11:59<09:10, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.21, train/loss=3.43, train/lr=5e-5, train/mae=0.126, train/predicted_value_mean=-0.337, train/predicted_value_std=0.139, train/target_value_mean=-0.367, train/target_value_std=0.262, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7844/8000 [3:12:03<09:04, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.97, train/loss=3.22, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.28, train/predicted_value_std=0.194, train/target_value_mean=-0.315, train/target_value_std=0.247, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7845/8000 [3:12:06<09:00, 3.49s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=6.73, train/loss=3.13, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.281, train/predicted_value_std=0.139, train/target_value_mean=-0.298, train/target_value_std=0.226, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7846/8000 [3:12:10<08:56, 3.49s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.7, train/loss=3.21, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.332, train/predicted_value_std=0.11, train/target_value_mean=-0.317, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7847/8000 [3:12:13<08:57, 3.51s/it, time/step=3.57, time/training=3.57, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=10.2, train/loss=3.33, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.273, train/predicted_value_std=0.127, train/target_value_mean=-0.257, train/target_value_std=0.168, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7848/8000 [3:12:17<08:53, 3.51s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.92, train/loss=2.73, train/lr=5e-5, train/mae=0.0916, train/predicted_value_mean=-0.271, train/predicted_value_std=0.172, train/target_value_mean=-0.273, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7849/8000 [3:12:20<08:48, 3.50s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.13, train/loss=3.23, train/lr=5e-5, train/mae=0.0678, train/predicted_value_mean=-0.325, train/predicted_value_std=0.123, train/target_value_mean=-0.311, train/target_value_std=0.128, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7850/8000 [3:12:24<08:42, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.34, train/loss=2.9, train/lr=5e-5, train/mae=0.0712, train/predicted_value_mean=-0.246, train/predicted_value_std=0.113, train/target_value_mean=-0.229, train/target_value_std=0.147, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7851/8000 [3:12:27<08:38, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.18, train/loss=3.14, train/lr=5e-5, train/mae=0.0456, train/predicted_value_mean=-0.296, train/predicted_value_std=0.159, train/target_value_mean=-0.272, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7852/8000 [3:12:31<08:40, 3.52s/it, time/step=3.6, time/training=3.6, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.47, train/loss=3.6, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.293, train/predicted_value_std=0.187, train/target_value_mean=-0.226, train/target_value_std=0.261, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7853/8000 [3:12:35<08:49, 3.60s/it, time/step=3.8, time/training=3.8, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=9.15, train/loss=3.46, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.26, train/predicted_value_std=0.163, train/target_value_mean=-0.222, train/target_value_std=0.186, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7854/8000 [3:12:38<08:40, 3.57s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.75, train/loss=4.16, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.288, train/predicted_value_std=0.158, train/target_value_mean=-0.282, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7855/8000 [3:12:41<08:33, 3.54s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.74, train/loss=3.22, train/lr=5e-5, train/mae=0.0619, train/predicted_value_mean=-0.283, train/predicted_value_std=0.146, train/target_value_mean=-0.277, train/target_value_std=0.182, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7856/8000 [3:12:45<08:27, 3.52s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.4, train/loss=3.41, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.273, train/predicted_value_std=0.159, train/target_value_mean=-0.265, train/target_value_std=0.187, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7857/8000 [3:12:48<08:21, 3.51s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.16, train/loss=3.84, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.292, train/predicted_value_std=0.0935, train/target_value_mean=-0.261, train/target_value_std=0.161, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7858/8000 [3:12:52<08:17, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.99, train/loss=3.7, train/lr=5e-5, train/mae=0.0637, train/predicted_value_mean=-0.277, train/predicted_value_std=0.143, train/target_value_mean=-0.274, train/target_value_std=0.166, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7859/8000 [3:12:55<08:14, 3.51s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.438, train/grad_norm=6.72, train/loss=2.81, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.248, train/predicted_value_std=0.165, train/target_value_mean=-0.244, train/target_value_std=0.16, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7860/8000 [3:12:59<08:07, 3.48s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.3, train/loss=3.42, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.231, train/predicted_value_std=0.144, train/target_value_mean=-0.233, train/target_value_std=0.203, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7861/8000 [3:13:02<08:02, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.5, train/loss=3.3, train/lr=5e-5, train/mae=0.0737, train/predicted_value_mean=-0.328, train/predicted_value_std=0.137, train/target_value_mean=-0.319, train/target_value_std=0.191, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7862/8000 [3:13:06<07:59, 3.48s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.76, train/loss=3.49, train/lr=5e-5, train/mae=0.1, train/predicted_value_mean=-0.326, train/predicted_value_std=0.163, train/target_value_mean=-0.34, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7863/8000 [3:13:09<07:53, 3.46s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=9.98, train/loss=3.39, train/lr=5e-5, train/mae=0.075, train/predicted_value_mean=-0.289, train/predicted_value_std=0.148, train/target_value_mean=-0.254, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7864/8000 [3:13:13<08:00, 3.54s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.06, train/loss=3.24, train/lr=5e-5, train/mae=0.0987, train/predicted_value_mean=-0.288, train/predicted_value_std=0.138, train/target_value_mean=-0.3, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7865/8000 [3:13:16<07:52, 3.50s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=8.06, train/loss=2.58, train/lr=5e-5, train/mae=0.0312, train/predicted_value_mean=-0.221, train/predicted_value_std=0.174, train/target_value_mean=-0.196, train/target_value_std=0.196, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7866/8000 [3:13:20<07:46, 3.48s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.21, train/loss=3.42, train/lr=5e-5, train/mae=0.0666, train/predicted_value_mean=-0.306, train/predicted_value_std=0.109, train/target_value_mean=-0.28, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7867/8000 [3:13:23<07:42, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.47, train/loss=3.76, train/lr=5e-5, train/mae=0.0703, train/predicted_value_mean=-0.28, train/predicted_value_std=0.118, train/target_value_mean=-0.232, train/target_value_std=0.121, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7868/8000 [3:13:27<07:39, 3.48s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.98, train/loss=3.58, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.284, train/predicted_value_std=0.152, train/target_value_mean=-0.262, train/target_value_std=0.19, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7869/8000 [3:13:30<07:33, 3.46s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.01, train/loss=3.08, train/lr=5e-5, train/mae=0.0675, train/predicted_value_mean=-0.317, train/predicted_value_std=0.174, train/target_value_mean=-0.316, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7870/8000 [3:13:34<07:29, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7, train/loss=3.2, train/lr=5e-5, train/mae=0.108, train/predicted_value_mean=-0.323, train/predicted_value_std=0.203, train/target_value_mean=-0.368, train/target_value_std=0.314, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7871/8000 [3:13:37<07:26, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.438, train/grad_norm=6.75, train/loss=2.55, train/lr=5e-5, train/mae=0.0359, train/predicted_value_mean=-0.189, train/predicted_value_std=0.131, train/target_value_mean=-0.183, train/target_value_std=0.15, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7872/8000 [3:13:41<07:22, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.25, train/loss=2.74, train/lr=5e-5, train/mae=0.0656, train/predicted_value_mean=-0.265, train/predicted_value_std=0.217, train/target_value_mean=-0.213, train/target_value_std=0.209, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7873/8000 [3:13:44<07:20, 3.47s/it, time/step=3.49, time/training=3.49, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.3, train/loss=2.71, train/lr=5e-5, train/mae=0.0397, train/predicted_value_mean=-0.22, train/predicted_value_std=0.0462, train/target_value_mean=-0.186, train/target_value_std=0.0657, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7874/8000 [3:13:47<07:16, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.625, train/grad_norm=10.6, train/loss=2.61, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.32, train/predicted_value_std=0.136, train/target_value_mean=-0.309, train/target_value_std=0.123, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7875/8000 [3:13:51<07:12, 3.46s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.57, train/loss=3.26, train/lr=5e-5, train/mae=0.103, train/predicted_value_mean=-0.298, train/predicted_value_std=0.148, train/target_value_mean=-0.288, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7876/8000 [3:13:55<07:22, 3.57s/it, time/step=3.81, time/training=3.81, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=6.74, train/loss=3.35, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.309, train/predicted_value_std=0.14, train/target_value_mean=-0.32, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7877/8000 [3:13:58<07:13, 3.53s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=8.17, train/loss=3.27, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.266, train/predicted_value_std=0.138, train/target_value_mean=-0.258, train/target_value_std=0.167, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7878/8000 [3:14:02<07:06, 3.50s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=17.1, train/loss=3.43, train/lr=5e-5, train/mae=0.0759, train/predicted_value_mean=-0.246, train/predicted_value_std=0.141, train/target_value_mean=-0.199, train/target_value_std=0.144, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7879/8000 [3:14:05<07:01, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.375, train/grad_norm=9.15, train/loss=2.53, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.25, train/predicted_value_std=0.163, train/target_value_mean=-0.256, train/target_value_std=0.204, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 98%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7880/8000 [3:14:09<06:56, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.57, train/loss=3.71, train/lr=5e-5, train/mae=0.0937, train/predicted_value_mean=-0.309, train/predicted_value_std=0.122, train/target_value_mean=-0.293, train/target_value_std=0.173, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7881/8000 [3:14:12<06:52, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.29, train/loss=3.02, train/lr=5e-5, train/mae=0.0847, train/predicted_value_mean=-0.284, train/predicted_value_std=0.125, train/target_value_mean=-0.272, train/target_value_std=0.163, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7882/8000 [3:14:15<06:47, 3.46s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=13.5, train/loss=3.63, train/lr=5e-5, train/mae=0.0944, train/predicted_value_mean=-0.358, train/predicted_value_std=0.166, train/target_value_mean=-0.313, train/target_value_std=0.229, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7883/8000 [3:14:19<06:44, 3.45s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.22, train/loss=3.27, train/lr=5e-5, train/mae=0.0725, train/predicted_value_mean=-0.296, train/predicted_value_std=0.212, train/target_value_mean=-0.275, train/target_value_std=0.237, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7884/8000 [3:14:22<06:40, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.5, train/loss=3.05, train/lr=5e-5, train/mae=0.0753, train/predicted_value_mean=-0.288, train/predicted_value_std=0.137, train/target_value_mean=-0.258, train/target_value_std=0.167, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7885/8000 [3:14:26<06:39, 3.47s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.65, train/loss=3.86, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.327, train/predicted_value_std=0.0901, train/target_value_mean=-0.279, train/target_value_std=0.0912, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7886/8000 [3:14:29<06:35, 3.47s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.89, train/loss=3.14, train/lr=5e-5, train/mae=0.0503, train/predicted_value_mean=-0.188, train/predicted_value_std=0.113, train/target_value_mean=-0.155, train/target_value_std=0.0919, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7887/8000 [3:14:33<06:42, 3.56s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.2, train/loss=3.71, train/lr=5e-5, train/mae=0.147, train/predicted_value_mean=-0.356, train/predicted_value_std=0.161, train/target_value_mean=-0.353, train/target_value_std=0.258, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7888/8000 [3:14:37<06:35, 3.53s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=9.03, train/loss=3.68, train/lr=5e-5, train/mae=0.156, train/predicted_value_mean=-0.32, train/predicted_value_std=0.168, train/target_value_mean=-0.239, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7889/8000 [3:14:40<06:29, 3.51s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=9.43, train/loss=3.99, train/lr=5e-5, train/mae=0.2, train/predicted_value_mean=-0.346, train/predicted_value_std=0.124, train/target_value_mean=-0.379, train/target_value_std=0.192, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7890/8000 [3:14:43<06:24, 3.50s/it, time/step=3.48, time/training=3.48, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=15, train/loss=3.53, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.386, train/predicted_value_std=0.172, train/target_value_mean=-0.4, train/target_value_std=0.233, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7891/8000 [3:14:47<06:20, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=7.33, train/loss=4.16, train/lr=5e-5, train/mae=0.218, train/predicted_value_mean=-0.345, train/predicted_value_std=0.131, train/target_value_mean=-0.391, train/target_value_std=0.204, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7892/8000 [3:14:50<06:15, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.312, train/grad_norm=7.57, train/loss=3.65, train/lr=5e-5, train/mae=0.115, train/predicted_value_mean=-0.291, train/predicted_value_std=0.123, train/target_value_mean=-0.297, train/target_value_std=0.152, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7893/8000 [3:14:54<06:11, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=12.3, train/loss=3.24, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.262, train/predicted_value_std=0.0912, train/target_value_mean=-0.242, train/target_value_std=0.15, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7894/8000 [3:14:57<06:07, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=13.4, train/loss=4.02, train/lr=5e-5, train/mae=0.0922, train/predicted_value_mean=-0.328, train/predicted_value_std=0.14, train/target_value_mean=-0.232, train/target_value_std=0.12, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7895/8000 [3:15:01<06:03, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.07, train/loss=3.91, train/lr=5e-5, train/mae=0.151, train/predicted_value_mean=-0.327, train/predicted_value_std=0.159, train/target_value_mean=-0.362, train/target_value_std=0.258, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7896/8000 [3:15:04<06:00, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.375, train/grad_norm=6.95, train/loss=3.07, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.255, train/predicted_value_std=0.126, train/target_value_mean=-0.301, train/target_value_std=0.137, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7897/8000 [3:15:08<05:56, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.19, train/loss=3.69, train/lr=5e-5, train/mae=0.0653, train/predicted_value_mean=-0.286, train/predicted_value_std=0.208, train/target_value_mean=-0.286, train/target_value_std=0.235, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7898/8000 [3:15:11<05:53, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=10.9, train/loss=3.09, train/lr=5e-5, train/mae=0.0719, train/predicted_value_mean=-0.243, train/predicted_value_std=0.141, train/target_value_mean=-0.249, train/target_value_std=0.223, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7899/8000 [3:15:15<05:57, 3.54s/it, time/step=3.72, time/training=3.72, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=8.07, train/loss=2.45, train/lr=5e-5, train/mae=0.0456, train/predicted_value_mean=-0.238, train/predicted_value_std=0.164, train/target_value_mean=-0.215, train/target_value_std=0.152, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7900/8000 [3:15:18<05:51, 3.51s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.02, train/loss=4.2, train/lr=5e-5, train/mae=0.207, train/predicted_value_mean=-0.304, train/predicted_value_std=0.065, train/target_value_mean=-0.315, train/target_value_std=0.158, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7901/8000 [3:15:22<05:45, 3.49s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7.6, train/loss=3.93, train/lr=5e-5, train/mae=0.0769, train/predicted_value_mean=-0.303, train/predicted_value_std=0.149, train/target_value_mean=-0.252, train/target_value_std=0.193, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7902/8000 [3:15:25<05:40, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.65, train/loss=3.06, train/lr=5e-5, train/mae=0.0741, train/predicted_value_mean=-0.282, train/predicted_value_std=0.14, train/target_value_mean=-0.254, train/target_value_std=0.152, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7903/8000 [3:15:29<05:40, 3.51s/it, time/step=3.58, time/training=3.58, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=7.44, train/loss=3.88, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.277, train/predicted_value_std=0.144, train/target_value_mean=-0.299, train/target_value_std=0.205, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7904/8000 [3:15:32<05:37, 3.51s/it, time/step=3.51, time/training=3.51, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.3, train/loss=3.22, train/lr=5e-5, train/mae=0.102, train/predicted_value_mean=-0.321, train/predicted_value_std=0.177, train/target_value_mean=-0.388, train/target_value_std=0.272, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7905/8000 [3:15:36<05:32, 3.50s/it, time/step=3.48, time/training=3.47, train/cat_acc_best=0, train/cat_acc_neighbor=0.125, train/grad_norm=10.6, train/loss=4.21, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.311, train/predicted_value_std=0.0729, train/target_value_mean=-0.346, train/target_value_std=0.121, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7906/8000 [3:15:39<05:27, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.02, train/loss=3.7, train/lr=5e-5, train/mae=0.165, train/predicted_value_mean=-0.308, train/predicted_value_std=0.121, train/target_value_mean=-0.316, train/target_value_std=0.129, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7907/8000 [3:15:43<05:22, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.93, train/loss=3.32, train/lr=5e-5, train/mae=0.112, train/predicted_value_mean=-0.319, train/predicted_value_std=0.149, train/target_value_mean=-0.314, train/target_value_std=0.157, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7908/8000 [3:15:46<05:18, 3.47s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=7, train/loss=4.22, train/lr=5e-5, train/mae=0.202, train/predicted_value_mean=-0.389, train/predicted_value_std=0.125, train/target_value_mean=-0.349, train/target_value_std=0.162, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7909/8000 [3:15:50<05:16, 3.48s/it, time/step=3.5, time/training=3.49, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=10.5, train/loss=3.09, train/lr=5e-5, train/mae=0.0803, train/predicted_value_mean=-0.317, train/predicted_value_std=0.177, train/target_value_mean=-0.312, train/target_value_std=0.223, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7910/8000 [3:15:53<05:19, 3.55s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=7.12, train/loss=2.91, train/lr=5e-5, train/mae=0.101, train/predicted_value_mean=-0.312, train/predicted_value_std=0.217, train/target_value_mean=-0.334, train/target_value_std=0.336, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7911/8000 [3:15:57<05:13, 3.52s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.77, train/loss=3.37, train/lr=5e-5, train/mae=0.0641, train/predicted_value_mean=-0.308, train/predicted_value_std=0.181, train/target_value_mean=-0.226, train/target_value_std=0.171, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7912/8000 [3:16:00<05:07, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.28, train/loss=3.23, train/lr=5e-5, train/mae=0.0609, train/predicted_value_mean=-0.293, train/predicted_value_std=0.161, train/target_value_mean=-0.262, train/target_value_std=0.144, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7913/8000 [3:16:04<05:03, 3.49s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=12.6, train/loss=3.63, train/lr=5e-5, train/mae=0.0419, train/predicted_value_mean=-0.305, train/predicted_value_std=0.128, train/target_value_mean=-0.252, train/target_value_std=0.144, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7914/8000 [3:16:07<04:59, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.11, train/loss=3.04, train/lr=5e-5, train/mae=0.0531, train/predicted_value_mean=-0.247, train/predicted_value_std=0.0858, train/target_value_mean=-0.176, train/target_value_std=0.084, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7915/8000 [3:16:11<04:55, 3.48s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.32, train/loss=3.07, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.381, train/predicted_value_std=0.199, train/target_value_mean=-0.406, train/target_value_std=0.27, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7916/8000 [3:16:14<04:51, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.2, train/loss=3.15, train/lr=5e-5, train/mae=0.0494, train/predicted_value_mean=-0.32, train/predicted_value_std=0.221, train/target_value_mean=-0.261, train/target_value_std=0.188, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7917/8000 [3:16:17<04:47, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.438, train/grad_norm=6.82, train/loss=3.02, train/lr=5e-5, train/mae=0.143, train/predicted_value_mean=-0.256, train/predicted_value_std=0.221, train/target_value_mean=-0.275, train/target_value_std=0.289, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7918/8000 [3:16:21<04:44, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.75, train/loss=3.26, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.375, train/predicted_value_std=0.205, train/target_value_mean=-0.431, train/target_value_std=0.315, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7919/8000 [3:16:24<04:40, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.46, train/loss=3.59, train/lr=5e-5, train/mae=0.166, train/predicted_value_mean=-0.287, train/predicted_value_std=0.128, train/target_value_mean=-0.291, train/target_value_std=0.214, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7920/8000 [3:16:28<04:36, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.43, train/loss=3.16, train/lr=5e-5, train/mae=0.08, train/predicted_value_mean=-0.218, train/predicted_value_std=0.158, train/target_value_mean=-0.182, train/target_value_std=0.135, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7921/8000 [3:16:31<04:33, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.7, train/loss=3.09, train/lr=5e-5, train/mae=0.0622, train/predicted_value_mean=-0.229, train/predicted_value_std=0.101, train/target_value_mean=-0.217, train/target_value_std=0.0508, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7922/8000 [3:16:35<04:37, 3.55s/it, time/step=3.77, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.37, train/loss=3.51, train/lr=5e-5, train/mae=0.0525, train/predicted_value_mean=-0.358, train/predicted_value_std=0.196, train/target_value_mean=-0.336, train/target_value_std=0.303, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7923/8000 [3:16:39<04:31, 3.53s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.89, train/loss=3.43, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.294, train/predicted_value_std=0.167, train/target_value_mean=-0.261, train/target_value_std=0.216, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7924/8000 [3:16:42<04:25, 3.49s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.48, train/loss=2.73, train/lr=5e-5, train/mae=0.0812, train/predicted_value_mean=-0.279, train/predicted_value_std=0.107, train/target_value_mean=-0.276, train/target_value_std=0.143, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7925/8000 [3:16:45<04:20, 3.48s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=12.3, train/loss=4.46, train/lr=5e-5, train/mae=0.222, train/predicted_value_mean=-0.443, train/predicted_value_std=0.112, train/target_value_mean=-0.47, train/target_value_std=0.24, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7926/8000 [3:16:49<04:17, 3.48s/it, time/step=3.47, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=6.95, train/loss=3.23, train/lr=5e-5, train/mae=0.0919, train/predicted_value_mean=-0.289, train/predicted_value_std=0.165, train/target_value_mean=-0.248, train/target_value_std=0.204, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7927/8000 [3:16:52<04:15, 3.50s/it, time/step=3.54, time/training=3.54, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.18, train/loss=3.43, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.353, train/predicted_value_std=0.116, train/target_value_mean=-0.356, train/target_value_std=0.174, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7928/8000 [3:16:56<04:10, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.562, train/grad_norm=7.11, train/loss=2.15, train/lr=5e-5, train/mae=0.0575, train/predicted_value_mean=-0.187, train/predicted_value_std=0.112, train/target_value_mean=-0.186, train/target_value_std=0.154, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7929/8000 [3:16:59<04:06, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=8.67, train/loss=2.95, train/lr=5e-5, train/mae=0.0731, train/predicted_value_mean=-0.238, train/predicted_value_std=0.124, train/target_value_mean=-0.25, train/target_value_std=0.144, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7930/8000 [3:17:03<04:03, 3.48s/it, time/step=3.5, time/training=3.5, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.07, train/loss=3.74, train/lr=5e-5, train/mae=0.0766, train/predicted_value_mean=-0.324, train/predicted_value_std=0.143, train/target_value_mean=-0.278, train/target_value_std=0.171, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7931/8000 [3:17:06<03:59, 3.47s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.375, train/grad_norm=7.76, train/loss=3.32, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.254, train/predicted_value_std=0.0779, train/target_value_mean=-0.163, train/target_value_std=0.101, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7932/8000 [3:17:10<03:54, 3.45s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=10.9, train/loss=3.29, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.325, train/predicted_value_std=0.152, train/target_value_mean=-0.277, train/target_value_std=0.211, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7933/8000 [3:17:13<03:56, 3.53s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.13, train/loss=3.64, train/lr=5e-5, train/mae=0.169, train/predicted_value_mean=-0.32, train/predicted_value_std=0.172, train/target_value_mean=-0.355, train/target_value_std=0.208, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7934/8000 [3:17:17<03:50, 3.49s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.125, train/grad_norm=8.01, train/loss=3.95, train/lr=5e-5, train/mae=0.133, train/predicted_value_mean=-0.389, train/predicted_value_std=0.19, train/target_value_mean=-0.445, train/target_value_std=0.283, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7935/8000 [3:17:20<03:45, 3.47s/it, time/step=3.41, time/training=3.4, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=10.6, train/loss=2.64, train/lr=5e-5, train/mae=0.0312, train/predicted_value_mean=-0.267, train/predicted_value_std=0.231, train/target_value_mean=-0.257, train/target_value_std=0.25, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7936/8000 [3:17:24<03:42, 3.48s/it, time/step=3.52, time/training=3.52, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.38, train/loss=3.39, train/lr=5e-5, train/mae=0.0591, train/predicted_value_mean=-0.316, train/predicted_value_std=0.151, train/target_value_mean=-0.298, train/target_value_std=0.188, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7937/8000 [3:17:27<03:38, 3.47s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.56, train/loss=3.27, train/lr=5e-5, train/mae=0.0909, train/predicted_value_mean=-0.269, train/predicted_value_std=0.142, train/target_value_mean=-0.271, train/target_value_std=0.192, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7938/8000 [3:17:31<03:33, 3.45s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=10.1, train/loss=2.85, train/lr=5e-5, train/mae=0.0447, train/predicted_value_mean=-0.251, train/predicted_value_std=0.0973, train/target_value_mean=-0.213, train/target_value_std=0.1, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7939/8000 [3:17:34<03:29, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=9.57, train/loss=3.15, train/lr=5e-5, train/mae=0.125, train/predicted_value_mean=-0.231, train/predicted_value_std=0.148, train/target_value_mean=-0.234, train/target_value_std=0.193, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7940/8000 [3:17:37<03:25, 3.43s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.74, train/loss=3.25, train/lr=5e-5, train/mae=0.159, train/predicted_value_mean=-0.266, train/predicted_value_std=0.125, train/target_value_mean=-0.275, train/target_value_std=0.148, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7941/8000 [3:17:41<03:21, 3.42s/it, time/step=3.4, time/training=3.4, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.64, train/loss=3.89, train/lr=5e-5, train/mae=0.0969, train/predicted_value_mean=-0.329, train/predicted_value_std=0.104, train/target_value_mean=-0.289, train/target_value_std=0.199, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7942/8000 [3:17:44<03:19, 3.43s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=7.08, train/loss=3.5, train/lr=5e-5, train/mae=0.0669, train/predicted_value_mean=-0.354, train/predicted_value_std=0.167, train/target_value_mean=-0.328, train/target_value_std=0.242, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7943/8000 [3:17:48<03:16, 3.44s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=9.82, train/loss=4.35, train/lr=5e-5, train/mae=0.194, train/predicted_value_mean=-0.339, train/predicted_value_std=0.163, train/target_value_mean=-0.305, train/target_value_std=0.148, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7944/8000 [3:17:51<03:13, 3.45s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.78, train/loss=3.37, train/lr=5e-5, train/mae=0.0891, train/predicted_value_mean=-0.234, train/predicted_value_std=0.0545, train/target_value_mean=-0.226, train/target_value_std=0.126, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7945/8000 [3:17:55<03:14, 3.53s/it, time/step=3.73, time/training=3.73, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.3, train/loss=3.38, train/lr=5e-5, train/mae=0.11, train/predicted_value_mean=-0.321, train/predicted_value_std=0.0973, train/target_value_mean=-0.37, train/target_value_std=0.124, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7946/8000 [3:17:58<03:09, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=7.51, train/loss=3.49, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.32, train/predicted_value_std=0.16, train/target_value_mean=-0.378, train/target_value_std=0.28, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7947/8000 [3:18:02<03:05, 3.49s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=8.63, train/loss=2.78, train/lr=5e-5, train/mae=0.0544, train/predicted_value_mean=-0.217, train/predicted_value_std=0.149, train/target_value_mean=-0.179, train/target_value_std=0.129, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7948/8000 [3:18:05<03:01, 3.48s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=7.89, train/loss=3.35, train/lr=5e-5, train/mae=0.0497, train/predicted_value_mean=-0.308, train/predicted_value_std=0.143, train/target_value_mean=-0.282, train/target_value_std=0.149, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7949/8000 [3:18:09<02:56, 3.47s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0, train/cat_acc_neighbor=0.0625, train/grad_norm=8.02, train/loss=3.61, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.301, train/predicted_value_std=0.184, train/target_value_mean=-0.313, train/target_value_std=0.205, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7950/8000 [3:18:12<02:52, 3.45s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.312, train/grad_norm=7.96, train/loss=3.09, train/lr=5e-5, train/mae=0.107, train/predicted_value_mean=-0.249, train/predicted_value_std=0.159, train/target_value_mean=-0.243, train/target_value_std=0.183, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7951/8000 [3:18:16<02:48, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.11, train/loss=3.13, train/lr=5e-5, train/mae=0.0581, train/predicted_value_mean=-0.309, train/predicted_value_std=0.203, train/target_value_mean=-0.301, train/target_value_std=0.268, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7952/8000 [3:18:19<02:45, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.375, train/cat_acc_neighbor=0.5, train/grad_norm=7.98, train/loss=3, train/lr=5e-5, train/mae=0.0859, train/predicted_value_mean=-0.285, train/predicted_value_std=0.209, train/target_value_mean=-0.283, train/target_value_std=0.212, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7953/8000 [3:18:22<02:42, 3.45s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.5, train/grad_norm=7.91, train/loss=2.97, train/lr=5e-5, train/mae=0.0469, train/predicted_value_mean=-0.263, train/predicted_value_std=0.159, train/target_value_mean=-0.217, train/target_value_std=0.208, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7954/8000 [3:18:26<02:38, 3.44s/it, time/step=3.42, time/training=3.41, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=10.4, train/loss=3.35, train/lr=5e-5, train/mae=0.0734, train/predicted_value_mean=-0.3, train/predicted_value_std=0.225, train/target_value_mean=-0.249, train/target_value_std=0.199, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7955/8000 [3:18:29<02:34, 3.42s/it, time/step=3.38, time/training=3.38, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.562, train/grad_norm=9, train/loss=3.01, train/lr=5e-5, train/mae=0.136, train/predicted_value_mean=-0.233, train/predicted_value_std=0.0859, train/target_value_mean=-0.212, train/target_value_std=0.179, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7956/8000 [3:18:33<02:34, 3.50s/it, time/step=3.69, time/training=3.69, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.16, train/loss=3.82, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.311, train/predicted_value_std=0.161, train/target_value_mean=-0.362, train/target_value_std=0.178, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7957/8000 [3:18:36<02:29, 3.48s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=6.87, train/loss=3.73, train/lr=5e-5, train/mae=0.128, train/predicted_value_mean=-0.306, train/predicted_value_std=0.185, train/target_value_mean=-0.334, train/target_value_std=0.199, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7958/8000 [3:18:40<02:25, 3.47s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=9.44, train/loss=4.03, train/lr=5e-5, train/mae=0.177, train/predicted_value_mean=-0.328, train/predicted_value_std=0.169, train/target_value_mean=-0.332, train/target_value_std=0.222, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 99%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7959/8000 [3:18:43<02:22, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.01, train/loss=3.45, train/lr=5e-5, train/mae=0.0519, train/predicted_value_mean=-0.254, train/predicted_value_std=0.158, train/target_value_mean=-0.271, train/target_value_std=0.194, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7960/8000 [3:18:47<02:18, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=8.76, train/loss=3.77, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.228, train/predicted_value_std=0.0956, train/target_value_mean=-0.273, train/target_value_std=0.13, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7961/8000 [3:18:50<02:14, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=9.54, train/loss=3.86, train/lr=5e-5, train/mae=0.189, train/predicted_value_mean=-0.323, train/predicted_value_std=0.118, train/target_value_mean=-0.314, train/target_value_std=0.228, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7962/8000 [3:18:54<02:11, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.0625, train/grad_norm=8.31, train/loss=3.98, train/lr=5e-5, train/mae=0.139, train/predicted_value_mean=-0.337, train/predicted_value_std=0.145, train/target_value_mean=-0.327, train/target_value_std=0.199, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7963/8000 [3:18:57<02:07, 3.43s/it, time/step=3.39, time/training=3.39, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.56, train/loss=2.95, train/lr=5e-5, train/mae=0.0597, train/predicted_value_mean=-0.202, train/predicted_value_std=0.137, train/target_value_mean=-0.2, train/target_value_std=0.179, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7964/8000 [3:19:00<02:02, 3.41s/it, time/step=3.36, time/training=3.36, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=10.4, train/loss=3.57, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.351, train/predicted_value_std=0.127, train/target_value_mean=-0.368, train/target_value_std=0.224, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7965/8000 [3:19:04<01:59, 3.42s/it, time/step=3.42, time/training=3.42, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.51, train/loss=3.22, train/lr=5e-5, train/mae=0.154, train/predicted_value_mean=-0.319, train/predicted_value_std=0.166, train/target_value_mean=-0.354, train/target_value_std=0.235, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏ | 7966/8000 [3:19:07<01:56, 3.42s/it, time/step=3.41, time/training=3.41, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=7.66, train/loss=3.58, train/lr=5e-5, train/mae=0.0934, train/predicted_value_mean=-0.339, train/predicted_value_std=0.177, train/target_value_mean=-0.369, train/target_value_std=0.249, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7967/8000 [3:19:11<01:52, 3.42s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.125, train/grad_norm=8.65, train/loss=3.61, train/lr=5e-5, train/mae=0.183, train/predicted_value_mean=-0.247, train/predicted_value_std=0.102, train/target_value_mean=-0.318, train/target_value_std=0.175, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7968/8000 [3:19:14<01:52, 3.52s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.25, train/grad_norm=6.83, train/loss=3.84, train/lr=5e-5, train/mae=0.0819, train/predicted_value_mean=-0.317, train/predicted_value_std=0.106, train/target_value_mean=-0.342, train/target_value_std=0.184, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎ | 7969/8000 [3:19:18<01:48, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=9.02, train/loss=3.16, train/lr=5e-5, train/mae=0.0487, train/predicted_value_mean=-0.32, train/predicted_value_std=0.143, train/target_value_mean=-0.346, train/target_value_std=0.145, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7970/8000 [3:19:21<01:44, 3.49s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.76, train/loss=3.39, train/lr=5e-5, train/mae=0.15, train/predicted_value_mean=-0.336, train/predicted_value_std=0.218, train/target_value_mean=-0.358, train/target_value_std=0.263, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍ | 7971/8000 [3:19:25<01:41, 3.49s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=7.84, train/loss=3.63, train/lr=5e-5, train/mae=0.0747, train/predicted_value_mean=-0.3, train/predicted_value_std=0.131, train/target_value_mean=-0.291, train/target_value_std=0.151, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7972/8000 [3:19:28<01:37, 3.48s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.87, train/loss=3.54, train/lr=5e-5, train/mae=0.0619, train/predicted_value_mean=-0.256, train/predicted_value_std=0.211, train/target_value_mean=-0.249, train/target_value_std=0.243, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7973/8000 [3:19:32<01:33, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.17, train/loss=3.08, train/lr=5e-5, train/mae=0.0622, train/predicted_value_mean=-0.263, train/predicted_value_std=0.143, train/target_value_mean=-0.259, train/target_value_std=0.222, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌ | 7974/8000 [3:19:35<01:30, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=13.1, train/loss=3.12, train/lr=5e-5, train/mae=0.0466, train/predicted_value_mean=-0.26, train/predicted_value_std=0.175, train/target_value_mean=-0.236, train/target_value_std=0.174, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7975/8000 [3:19:39<01:26, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=6.87, train/loss=3.15, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.262, train/predicted_value_std=0.191, train/target_value_mean=-0.261, train/target_value_std=0.22, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋ | 7976/8000 [3:19:42<01:23, 3.46s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0, train/cat_acc_neighbor=0.188, train/grad_norm=7.12, train/loss=4.04, train/lr=5e-5, train/mae=0.0959, train/predicted_value_mean=-0.37, train/predicted_value_std=0.177, train/target_value_mean=-0.434, train/target_value_std=0.296, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7977/8000 [3:19:46<01:19, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=7.38, train/loss=3.47, train/lr=5e-5, train/mae=0.0759, train/predicted_value_mean=-0.308, train/predicted_value_std=0.121, train/target_value_mean=-0.236, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊ | 7978/8000 [3:19:49<01:16, 3.46s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=8.83, train/loss=3.67, train/lr=5e-5, train/mae=0.104, train/predicted_value_mean=-0.399, train/predicted_value_std=0.15, train/target_value_mean=-0.438, train/target_value_std=0.286, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7979/8000 [3:19:53<01:14, 3.55s/it, time/step=3.76, time/training=3.76, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=9.12, train/loss=3.78, train/lr=5e-5, train/mae=0.172, train/predicted_value_mean=-0.302, train/predicted_value_std=0.165, train/target_value_mean=-0.253, train/target_value_std=0.195, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7980/8000 [3:19:56<01:10, 3.53s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=9.07, train/loss=3.88, train/lr=5e-5, train/mae=0.182, train/predicted_value_mean=-0.331, train/predicted_value_std=0.161, train/target_value_mean=-0.275, train/target_value_std=0.186, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉ | 7981/8000 [3:20:00<01:06, 3.51s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=8.86, train/loss=3.36, train/lr=5e-5, train/mae=0.0616, train/predicted_value_mean=-0.32, train/predicted_value_std=0.182, train/target_value_mean=-0.3, train/target_value_std=0.213, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7982/8000 [3:20:03<01:02, 3.49s/it, time/step=3.46, time/training=3.45, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=9.92, train/loss=2.89, train/lr=5e-5, train/mae=0.127, train/predicted_value_mean=-0.207, train/predicted_value_std=0.171, train/target_value_mean=-0.127, train/target_value_std=0.0945, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ | 7983/8000 [3:20:07<00:59, 3.48s/it, time/step=3.46, time/training=3.46, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.75, train/loss=3.83, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.354, train/predicted_value_std=0.104, train/target_value_mean=-0.339, train/target_value_std=0.231, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏| 7984/8000 [3:20:10<00:55, 3.47s/it, time/step=3.45, time/training=3.44, train/cat_acc_best=0.0625, train/cat_acc_neighbor=0.188, train/grad_norm=8.27, train/loss=3.65, train/lr=5e-5, train/mae=0.134, train/predicted_value_mean=-0.305, train/predicted_value_std=0.191, train/target_value_mean=-0.354, train/target_value_std=0.282, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▏| 7985/8000 [3:20:14<00:52, 3.47s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=8.3, train/loss=2.97, train/lr=5e-5, train/mae=0.0334, train/predicted_value_mean=-0.257, train/predicted_value_std=0.154, train/target_value_mean=-0.243, train/target_value_std=0.19, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎| 7986/8000 [3:20:17<00:48, 3.46s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.375, train/grad_norm=8.81, train/loss=3.17, train/lr=5e-5, train/mae=0.109, train/predicted_value_mean=-0.333, train/predicted_value_std=0.105, train/target_value_mean=-0.332, train/target_value_std=0.112, train/value_spearman=0.25](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎| 7987/8000 [3:20:20<00:44, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.312, train/cat_acc_neighbor=0.375, train/grad_norm=7.14, train/loss=2.84, train/lr=5e-5, train/mae=0.0828, train/predicted_value_mean=-0.273, train/predicted_value_std=0.178, train/target_value_mean=-0.281, train/target_value_std=0.181, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▎| 7988/8000 [3:20:24<00:41, 3.45s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.71, train/loss=3.45, train/lr=5e-5, train/mae=0.158, train/predicted_value_mean=-0.274, train/predicted_value_std=0.0709, train/target_value_mean=-0.267, train/target_value_std=0.0854, train/value_spearman=0](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍| 7989/8000 [3:20:27<00:37, 3.45s/it, time/step=3.43, time/training=3.43, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=7.59, train/loss=3.2, train/lr=5e-5, train/mae=0.105, train/predicted_value_mean=-0.3, train/predicted_value_std=0.184, train/target_value_mean=-0.267, train/target_value_std=0.172, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▍| 7990/8000 [3:20:31<00:34, 3.44s/it, time/step=3.43, time/training=3.42, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.188, train/grad_norm=7.5, train/loss=3.64, train/lr=5e-5, train/mae=0.137, train/predicted_value_mean=-0.37, train/predicted_value_std=0.149, train/target_value_mean=-0.35, train/target_value_std=0.141, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌| 7991/8000 [3:20:34<00:31, 3.52s/it, time/step=3.71, time/training=3.71, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.188, train/grad_norm=7.26, train/loss=3.47, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.26, train/predicted_value_std=0.213, train/target_value_mean=-0.141, train/target_value_std=0.123, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▌| 7992/8000 [3:20:38<00:27, 3.50s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.312, train/grad_norm=8.45, train/loss=3.24, train/lr=5e-5, train/mae=0.122, train/predicted_value_mean=-0.279, train/predicted_value_std=0.157, train/target_value_mean=-0.196, train/target_value_std=0.14, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋| 7993/8000 [3:20:41<00:24, 3.48s/it, time/step=3.44, time/training=3.44, train/cat_acc_best=0.5, train/cat_acc_neighbor=0.562, train/grad_norm=7.41, train/loss=2.44, train/lr=5e-5, train/mae=0.0416, train/predicted_value_mean=-0.295, train/predicted_value_std=0.237, train/target_value_mean=-0.327, train/target_value_std=0.351, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋| 7994/8000 [3:20:45<00:20, 3.47s/it, time/step=3.44, time/training=3.43, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=8.87, train/loss=3.6, train/lr=5e-5, train/mae=0.124, train/predicted_value_mean=-0.275, train/predicted_value_std=0.158, train/target_value_mean=-0.188, train/target_value_std=0.132, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▋| 7995/8000 [3:20:48<00:17, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.188, train/cat_acc_neighbor=0.25, train/grad_norm=6.69, train/loss=3.43, train/lr=5e-5, train/mae=0.114, train/predicted_value_mean=-0.359, train/predicted_value_std=0.12, train/target_value_mean=-0.358, train/target_value_std=0.223, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊| 7996/8000 [3:20:52<00:13, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.312, train/grad_norm=6.58, train/loss=3.25, train/lr=5e-5, train/mae=0.141, train/predicted_value_mean=-0.367, train/predicted_value_std=0.23, train/target_value_mean=-0.327, train/target_value_std=0.294, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▊| 7997/8000 [3:20:55<00:10, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.25, train/grad_norm=8.53, train/loss=3.34, train/lr=5e-5, train/mae=0.065, train/predicted_value_mean=-0.31, train/predicted_value_std=0.196, train/target_value_mean=-0.29, train/target_value_std=0.207, train/value_spearman=0.75](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉| 7998/8000 [3:20:59<00:06, 3.46s/it, time/step=3.45, time/training=3.45, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.438, train/grad_norm=11.6, train/loss=3.24, train/lr=5e-5, train/mae=0.132, train/predicted_value_mean=-0.411, train/predicted_value_std=0.251, train/target_value_mean=-0.397, train/target_value_std=0.374, train/value_spearman=1](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel + Global Step: 100%|█████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████▉| 7999/8000 [3:21:02<00:03, 3.46s/it, time/step=3.47, time/training=3.47, train/cat_acc_best=0.25, train/cat_acc_neighbor=0.25, train/grad_norm=11.1, train/loss=3.01, train/lr=5e-5, train/mae=0.116, train/predicted_value_mean=-0.223, train/predicted_value_std=0.0986, train/target_value_mean=-0.222, train/target_value_std=0.167, train/value_spearman=0.5](ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.modeling_critic:Disabled gradient checkpointing for ValueCriticModel +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:859: UserWarning: `_get_pg_default_device` will be deprecated, it only stays for backward-compatiblity reason. If you need to find a device for object collectives, please use `_get_object_coll_device`. If you need to query the device types supported by group, please use `_device_capability(group)`. +(ActorGroup(rank=0) pid=3732960) warnings.warn( +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:4631: UserWarning: No device id is provided via `init_process_group` or `barrier `. Using the current device set by the user. +(ActorGroup(rank=0) pid=3732960) warnings.warn( # warn only once +(ActorGroup(rank=0) pid=3732960) /data/lfwj/miniconda3/envs/lerobot/lib/python3.10/site-packages/torch/distributed/distributed_c10d.py:4631: UserWarning: No device id is provided via `init_process_group` or `barrier `. Using the current device set by the user. +(ActorGroup(rank=0) pid=3732960) warnings.warn( # warn only once +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #1] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.value_common.image_text_processing:[Tokenization Example #2] prompt='Stack the three bowls in size order: the purple bowl first, then the beige bowl.' → 'Task: stack the three bowls in size order: the purple bowl first, then the beige bowl.' (raw_len=21, pad_to=200) +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator:[Collator Verification] First batch prompts: +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [0] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. +(ActorGroup(rank=0) pid=3732960) INFO:rlinf.models.embodiment.value_model.recap.data_collator: [1] prompt: Stack the three bowls in size order: the purple bowl first, then the beige bowl. + Global Step: 100%|█| 8000/8000 [3:26:57<00:00, 109.02s/it, time/step=355, time/training=3.46, time/evaluate=315, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=12.7, train/loss=3.81, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.308, train/predicted_value_std=0.138, train/target_value_mean=-0.275, train/target_value_std=0.226, train/value_spearman=0.5, eval/cat_acc_best=0.287, eval/cat_acc_neighbor=0.44, eval/loss=2.1, eval/mae=0.0219, eval/predicted_value_mean=-0.0948, eval/predicted_value_std=0.00134, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.287, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.44, eval/stack_bowls_recap_rollout_rc/loss=2.1, eval/stack_bowls_recap_rollout_rc/mae=0.0219, eval/stack_bowls_recap_rollout_rc/predicted_valu Global Step: 100%|█| 8000/8000 [3:26:57<00:00, 4.14s/it, time/step=355, time/training=3.46, time/evaluate=315, train/cat_acc_best=0.125, train/cat_acc_neighbor=0.312, train/grad_norm=12.7, train/loss=3.81, train/lr=5e-5, train/mae=0.0841, train/predicted_value_mean=-0.308, train/predicted_value_std=0.138, train/target_value_mean=-0.275, train/target_value_std=0.226, train/value_spearman=0.5, eval/cat_acc_best=0.287, eval/cat_acc_neighbor=0.44, eval/loss=2.1, eval/mae=0.0219, eval/predicted_value_mean=-0.0948, eval/predicted_value_std=0.00134, eval/stack_bowls_recap_rollout_rc/cat_acc_best=0.287, eval/stack_bowls_recap_rollout_rc/cat_acc_neighbor=0.44, eval/stack_bowls_recap_rollout_rc/loss=2.1, eval/stack_bowls_recap_rollout_rc/mae=0.0219, eval/stack_bowls_recap_rollout_rc/predicted_value +/data/lfwj/miniconda3/envs/lerobot/lib/python3.10/multiprocessing/resource_tracker.py:224: UserWarning: resource_tracker: There appear to be 1 leaked semaphore objects to clean up at shutdown + warnings.warn('resource_tracker: There appear to be %d ' diff --git a/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/run_manifest.json b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/run_manifest.json new file mode 100644 index 0000000000000000000000000000000000000000..ecb2fb3b6674af7c192013fe100dbeb2c5fe2cf5 --- /dev/null +++ b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/run_manifest.json @@ -0,0 +1,23 @@ +{ + "checkpoint_type": "recap_value_sft", + "policy_executable": false, + "model_type": "pi05", + "robot_type": "franka", + "task": "stack_bowls", + "prompt": "Stack the three bowls in size order: the purple bowl first, then the beige bowl.", + "dataset_path_on_amax": "/data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc", + "num_episodes": 34, + "num_frames": 196579, + "success_episodes": 22, + "failure_episodes": 12, + "returns_tag": "fail300", + "return_min": -20713, + "return_max": 0, + "max_steps": 8000, + "resume_from": "global_step_5000", + "final_checkpoint": "global_step_8000", + "eval_loss": 2.1, + "eval_mae": 0.0219, + "eval_cat_acc_best": 0.287, + "eval_cat_acc_neighbor": 0.44 +} diff --git a/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/run_value_sft_fail300_resume5000.sh b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/run_value_sft_fail300_resume5000.sh new file mode 100755 index 0000000000000000000000000000000000000000..1a558fb6f3b039211d7cb46689f5f45521f212e3 --- /dev/null +++ b/franka/rlinf/20260903-202954-franka_stack_bowl_pi05_recap_value_sft_fail300/run_value_sft_fail300_resume5000.sh @@ -0,0 +1,37 @@ +set -euo pipefail +source /data/lfwj/miniconda3/etc/profile.d/conda.sh +conda activate lerobot +cd /data/yangky/test/RealWorld-RLinf +export RUN_ROOT=/data2/yangky/test/recap_stack_bowls +export REPO_PATH=/data/yangky/test/RealWorld-RLinf +export OPENPI_ARCH=/home/amax/.cache/uv/archive-v0/ZQ6tV-bbWGFB5mqO +export PYTHONNOUSERSITE=1 +export PYTHONPATH=$OPENPI_ARCH:$REPO_PATH:/data/linjianqi/RoboTwin/policy/pi0/packages/openpi-client/src:${PYTHONPATH:-} +export LD_LIBRARY_PATH=$CONDA_PREFIX/lib:${LD_LIBRARY_PATH:-} +export CUDA_VISIBLE_DEVICES=0 +export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True +export HF_HOME=$RUN_ROOT/hf_home +export HF_DATASETS_CACHE=$RUN_ROOT/hf_datasets_cache +export TRANSFORMERS_CACHE=$RUN_ROOT/hf_home/transformers +export MUJOCO_GL=egl +export PYOPENGL_PLATFORM=egl +export AV_LOG_FORCE_NOCOLOR=1 +export LIBAV_LOG_LEVEL=quiet +export OPENCV_LOG_LEVEL=off +ray stop -f || true +mkdir -p "/data2/yangky/test/rsb_ray" "$HF_HOME" "$HF_DATASETS_CACHE" "$TRANSFORMERS_CACHE" +ray start --head --include-dashboard=true --dashboard-host=127.0.0.1 --num-gpus=1 --temp-dir="/data2/yangky/test/rsb_ray" --disable-usage-stats +python examples/offline_rl/advantage_labeling/recap/train_value.py --config-path /data/yangky/test/RealWorld-RLinf/examples/offline_rl/config --config-name recap_value_model_sft \ + data.tag=fail300 +data.return_min=-20713 +data.return_max=0 \ + data.train_data_paths='[{dataset_path: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc, type: rollout, weight: 1.0, robot_type: franka, model_type: pi05}]' \ + data.eval_data_paths='[{dataset_path: /data2/yangky/test/recap_stack_bowls/datasets/stack_bowls_recap_rollout_rc, max_samples: 4096, robot_type: franka, model_type: pi05}]' \ + data.robot_type=franka data.model_type=pi05 data.action_dim=7 data.train_num_workers=2 data.eval_num_workers=1 \ + actor.micro_batch_size=2 actor.global_batch_size=16 actor.model.action_dim=7 \ + actor.model.siglip_path=/data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/siglip2-so400m-patch14-224 \ + actor.model.gemma3_path=/data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/gemma-3-270m \ + actor.model.tokenizer_path=/data2/yangky/test/recap_stack_bowls/models/recap_value_backbones/gemma-3-270m \ + runner.max_steps=8000 runner.save_interval=1000 runner.val_check_interval=500 actor.optim.total_training_steps=8000 \ + \ + +runner.resume_dir=/data2/yangky/test/recap_stack_bowls/logs/recap_stack_bowls_training/value_sft/stack_bowls_recap_value_sft_fail300/checkpoints/global_step_5000 \ + runner.logger.log_path=/data2/yangky/test/recap_stack_bowls/logs/recap_stack_bowls_training/value_sft \ + runner.logger.experiment_name=stack_bowls_recap_value_sft_fail300