diff --git "a/train.log" "b/train.log" new file mode 100644--- /dev/null +++ "b/train.log" @@ -0,0 +1,5194 @@ +W0615 16:04:04.968000 1402579 site-packages/torch/distributed/run.py:766] +W0615 16:04:04.968000 1402579 site-packages/torch/distributed/run.py:766] ***************************************** +W0615 16:04:04.968000 1402579 site-packages/torch/distributed/run.py:766] Setting OMP_NUM_THREADS environment variable for each process to be 1 in default, to avoid your system being overloaded, please further tune the variable for optimal performance in your application as needed. +W0615 16:04:04.968000 1402579 site-packages/torch/distributed/run.py:766] ***************************************** +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +[INFO] Running in WANDB offline mode +Trainer._get_train_sampler replaced with custom implementation. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +[2026-06-15 16:04:14,859] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +df: /home/dungpq6/.triton/autotune: No such file or directory +Trainer._get_train_sampler replaced with custom implementation. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +[2026-06-15 16:04:14,974] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +Trainer._get_train_sampler replaced with custom implementation. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +[2026-06-15 16:04:15,081] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +Trainer._get_train_sampler replaced with custom implementation. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +Trainer._get_train_sampler replaced with custom implementation. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +[2026-06-15 16:04:15,134] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +[2026-06-15 16:04:15,160] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +[2026-06-15 16:04:15,191] [INFO] [comm.py:658:init_distributed] cdb=None +Trainer._get_train_sampler replaced with custom implementation. +Trainer._get_train_sampler replaced with custom implementation. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +[2026-06-15 16:04:15,247] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +[2026-06-15 16:04:15,260] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +Trainer._get_train_sampler replaced with custom implementation. +[2026-06-15 16:04:15,304] [INFO] [comm.py:658:init_distributed] cdb=None +[2026-06-15 16:04:15,304] [INFO] [comm.py:689:init_distributed] Initializing TorchBackend in DeepSpeed with backend nccl +warmup_ratio is deprecated and will be removed in v5.2. Use `warmup_steps` instead. +[2026-06-15 16:04:15,362] [INFO] [real_accelerator.py:222:get_accelerator] Setting ds_accelerator to cuda (auto detect) +[2026-06-15 16:04:15,407] [INFO] [comm.py:658:init_distributed] cdb=None +[2026-06-15 16:04:15,498] [INFO] [comm.py:658:init_distributed] cdb=None +[2026-06-15 16:04:15,519] [INFO] [comm.py:658:init_distributed] cdb=None +[2026-06-15 16:04:15,603] [INFO] [comm.py:658:init_distributed] cdb=None +[2026-06-15 16:04:15,636] [INFO] [comm.py:658:init_distributed] cdb=None +[2026-06-15 16:04:15,723] [INFO] [comm.py:658:init_distributed] cdb=None + Loading weights: 0%| | 0/723 [00:00