| #SBATCH --job-name=transformer_1_3b | |
| #SBATCH --time=72:00:00 | |
| #SBATCH --nodes=1 | |
| #SBATCH --gres=gpu:h200:1 | |
| #SBATCH --exclude=dcc-h200-gpu-04,dcc-h200-gpu-05 | |
| #SBATCH --nodelist=dcc-h200-gpu-01,dcc-h200-gpu-02,dcc-h200-gpu-03,dcc-h200-gpu-06,dcc-h200-gpu-07 | |
| #SBATCH --ntasks-per-node=1 | |
| #SBATCH --cpus-per-task=8 | |
| #SBATCH --mem=32G | |
| #SBATCH --partition=h200ea | |
| #SBATCH --output=../../logs/%x-%j.out | |
| #SBATCH --error=../../logs/%x-%j.err | |
| #SBATCH --account=h200ea | |
| cd ../../ | |
| if [ -f "./scripts/env/env.sh" ]; then | |
| source ./scripts/env/env.sh | |
| fi | |
| export OMP_NUM_THREADS=$SLURM_CPUS_PER_TASK | |
| export MASTER_ADDR=$(scontrol show hostnames $SLURM_NODELIST | head -n 1) | |
| RANDOM_OFFSET=$((100 + RANDOM % 100)) | |
| export MASTER_PORT=$((29500 + RANDOM_OFFSET)) | |
| echo "MASTER_ADDR: $MASTER_ADDR" | |
| echo "MASTER_PORT: $MASTER_PORT" | |
| echo "SLURM_NNODES: $SLURM_NNODES" | |
| echo "SLURM_NTASKS_PER_NODE: $SLURM_NTASKS_PER_NODE" | |
| echo "SLURM_PROCID: $SLURM_PROCID" | |
| echo "CUDA_VISIBLE_DEVICES: $CUDA_VISIBLE_DEVICES" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py mode=generate +training.resume_checkpoint_path="/hpc/group/carin/shared/hf_models/checkpoints/fst_1_3B/best" checkpoint_name=fst_1_3B_resume "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=8 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=3407 +training.resume_checkpoint_path="/hpc/group/carin/shared/hf_models/checkpoints/fst_353M/best" checkpoint_name=fst_353M_resume_3407 "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=3407 mode=generate checkpoint_name=fst_353M_resume "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=3407 mode=generate checkpoint_name=fst_353M_resume_3407 "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=8 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py +training.resume_checkpoint_path="/work/jf381/code/lm-research/pretrain_weights/fst_353M" checkpoint_name=fst_353M_resume_new "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py mode=generate checkpoint_name=fst_353M_resume_new "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=4 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py +training.resume_checkpoint_path="/work/jf381/code/lm-research/pretrain_weights/fst_1_3B" checkpoint_name=fst_1_3B_resume_new "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=4 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py +training.resume_checkpoint_path="/cwork/jf381/code/lm-research_backup/pretrain_weights/fst_353M" checkpoint_name=fst_353M_resume_new_4gpu_rerun_wo_fi_mlp "$@" | |
| # export CUDA_VISIBLE_DEVICES=4,5,6,7 && torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=4 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py +training.resume_checkpoint_path="/cwork/jf381/code/lm-research_backup/pretrain_weights/fst_353M" checkpoint_name=fst_353M_resume_new_4gpu_rerun_wo_phi_mlp "$@" | |
| torchrun \ | |
| --nnodes=$SLURM_NNODES \ | |
| --nproc_per_node=4 \ | |
| --node_rank=$SLURM_PROCID \ | |
| --master_addr=$MASTER_ADDR \ | |
| --master_port=$MASTER_PORT \ | |
| /work/jf381/code/lm-research/main.py \ | |
| model=fst_353M \ | |
| size=medium \ | |
| training=medium \ | |
| dataset=tinygsm_resume \ | |
| checkpoint_name=fst_353M_resume_new_4gpu_rerun_wo_fi_phi_mlp "$@" | |
| export CUDA_VISIBLE_DEVICES=4 && torchrun \ | |
| --nnodes=$SLURM_NNODES \ | |
| --nproc_per_node=1 \ | |
| --node_rank=$SLURM_PROCID \ | |
| --master_addr=$MASTER_ADDR \ | |
| --master_port=$MASTER_PORT \ | |
| /work/jf381/code/lm-research/main.py \ | |
| model=fst_353M \ | |
| size=medium \ | |
| training=medium \ | |
| mode=generate \ | |
| dataset=tinygsm_resume \ | |
| checkpoint_name=fst_353M_resume_new_4gpu_rerun_wo_fi_phi_mlp "$@" | |
| # export CUDA_VISIBLE_DEVICES=5 && torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py model=fst_353M mode=generate checkpoint_name=fst_353M_resume_new_4gpu_rerun_wo_phi_mlp "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=4 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=34077 +training.resume_checkpoint_path="/cwork/jf381/code/lm-research_backup/pretrain_weights/fst_353M" checkpoint_name=fst_353M_resume_new_4gpu_rerun_seed34077 "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py +training.resume_checkpoint_path="/hpc/group/carin/shared/hf_models/checkpoints/transformer_353M/best" checkpoint_name=transformer_353M_resume_new_4gpu_rerun model=transformer_353M "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py mode=generate checkpoint_name=fst_353M_resume_new "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=1 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py mode=generate checkpoint_name=fst_1_3B_resume "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=8 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=3407 checkpoint_name=fst_353M_3407 "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=8 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=42 +training.resume_checkpoint_path="/hpc/group/carin/shared/hf_models/checkpoints/fst_353M/best" checkpoint_name=fst_353M_resume_42 "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=8 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=2000 +training.resume_checkpoint_path="/hpc/group/carin/shared/hf_models/checkpoints/fst_353M/best" checkpoint_name=fst_353M_resume_2000 "$@" | |
| # torchrun \ | |
| # --nnodes=$SLURM_NNODES \ | |
| # --nproc_per_node=8 \ | |
| # --node_rank=$SLURM_PROCID \ | |
| # --master_addr=$MASTER_ADDR \ | |
| # --master_port=$MASTER_PORT \ | |
| # /work/jf381/code/lm-research/main.py seed=42 mode=generate checkpoint_name=fst_353M_resume_42 "$@" |