luuuulinnnn's picture
Add training logs, curves, and configs for all 7 encoder-combination runs
1aa98bb verified
Raw
History Blame Contribute Delete
1.43 kB
#!/bin/bash
#SBATCH --job-name=train_camera_obj
#SBATCH --partition=def
#SBATCH --account=prj-02-phai-lab
#SBATCH --nodes=1
#SBATCH --gres=gpu:4
#SBATCH --cpus-per-task=8
#SBATCH --mem=400G
#SBATCH --time=48:00:00
#SBATCH --output=/scratch/project/prj-02-phai-lab/lulin/jichen/outputs/train_camera_obj/slurm-%j.out
export WANDB_MODE=offline TOKENIZERS_PARALLELISM=false HF_HOME=/scratch/project/prj-02-phai-lab/lulin/jichen/.hf_home DS_ACCELERATOR=cuda
cd /scratch/project/prj-02-phai-lab/lulin/jichen/egohoi_extension
echo "node=$(hostname) gpus=4"; nvidia-smi -L 2>/dev/null | head -4
/scratch/project/prj-02-phai-lab/lulin/jichen/egohoi_extension/.venv/bin/python scripts/train.py --set camera_encoder.enable=true --set hand_encoder.enable=false --set obj_encoder.enable=true --set data.root=/scratch/project/prj-02-phai-lab/lulin/jichen/hot3d_data/outputs/hot3d_preprocessed --set data.val_root=/scratch/project/prj-02-phai-lab/lulin/jichen/hot3d_data/outputs/hot3d_preprocessed --set data.caption_annotations_path=/scratch/project/prj-02-phai-lab/lulin/jichen/Jichen/hot3d_qwen_captions.json --set data.num_workers=2 --set logging.tensorboard.enabled=true --set logging.tensorboard.log_dir=/scratch/project/prj-02-phai-lab/lulin/jichen/outputs/train_camera_obj/tensorboard --set logging.wandb.name=train_camera_obj --set output_dir=/scratch/project/prj-02-phai-lab/lulin/jichen/outputs/train_camera_obj --requested-gpus 4