W0706 04:51:26.684000 1886854 site-packages/torch/distributed/run.py:766] W0706 04:51:26.684000 1886854 site-packages/torch/distributed/run.py:766] ***************************************** W0706 04:51:26.684000 1886854 site-packages/torch/distributed/run.py:766] Setting OMP_NUM_THREADS environment variable for each process to be 1 in default, to avoid your system being overloaded, please further tune the variable for optimal performance in your application as needed. W0706 04:51:26.684000 1886854 site-packages/torch/distributed/run.py:766] ***************************************** [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode [INFO] Running in WANDB offline mode Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-06 04:51:35,958] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) df: /home/dungpq6/.triton/autotune: No such file or directory Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-06 04:51:36,156] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-06 04:51:36,264] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-06 04:51:36,366] [INFO] [comm.py:658:init_distributed] cdb=None Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. Trainer._get_train_sampler replaced with custom implementation. Trainer._get_train_sampler replaced with custom implementation. [2026-07-06 04:51:36,474] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-06 04:51:36,486] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-06 04:51:36,514] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-06 04:51:36,514] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-06 04:51:36,517] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) Trainer._get_train_sampler replaced with custom implementation. warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. [2026-07-06 04:51:36,581] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) [2026-07-06 04:51:36,585] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-06 04:51:36,820] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-06 04:51:36,828] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-06 04:51:36,829] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-06 04:51:36,829] [INFO] [comm.py:689:init_distributed] Initializing TorchBackend in DeepSpeed with backend nccl [2026-07-06 04:51:36,835] [INFO] [comm.py:658:init_distributed] cdb=None [2026-07-06 04:51:36,897] [INFO] [comm.py:658:init_distributed] cdb=None Loading weights: 0%| | 0/723 [00:00