W0710 02:07:21.116000 2176503 site-packages/torch/distributed/run.py:766] W0710 02:07:21.116000 2176503 site-packages/torch/distributed/run.py:766] ***************************************** W0710 02:07:21.116000 2176503 site-packages/torch/distributed/run.py:766] Setting OMP_NUM_THREADS environment variable for each process to be 1 in default, to avoid your system being overloaded, please further tune the variable for optimal performance in your application as needed. W0710 02:07:21.116000 2176503 site-packages/torch/distributed/run.py:766] ***************************************** [INFO] Running in WANDB offline mode[INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode[INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode[INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. Trainer._get_train_sampler replaced with custom implementation. Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-10 02:07:31,016] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-10 02:07:31,018] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-10 02:07:31,027] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-10 02:07:31,031] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) df: /home/dungpq6/.triton/autotune: No such file or directory df: /home/dungpq6/.triton/autotune: No such file or directory Trainer._get_train_sampler replaced with custom implementation. Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-10 02:07:31,153] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-10 02:07:31,153] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-10 02:07:31,330] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-10 02:07:31,387] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,390] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,401] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,418] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,425] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-10 02:07:31,464] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,496] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,496] [INFO] [comm.py:689:init_distributed] Initializing TorchBackend in DeepSpeed with backend nccl [2026-07-10 02:07:31,637] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-10 02:07:31,726] [INFO] [comm.py:658:init_distributed] cdb=None Loading weights: 0%| | 0/723 [00:00