| #!/bin/bash |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| STOICHEIA_ROOT="${SLURM_SUBMIT_DIR:-$PWD}" |
| export STOICHEIA_ROOT |
| |
| |
| set -euo pipefail |
| STOICHEIA_ROOT=$STOICHEIA_ROOT |
| STOICHEIA_DATA=${STOICHEIA_DATA:?set STOICHEIA_DATA (source env.sh in your login shell before submitting)} |
| mkdir -p "$STOICHEIA_ROOT/logs" |
|
|
| |
| |
| |
| python3 -c " |
| import json |
| c = json.load(open('$STOICHEIA_ROOT/configs/pretrain/stoicheia.json')) |
| c['name'] = 'smoke' |
| c['total_steps'] = 150 |
| c['ckpt_every'] = 100 |
| c['log_every'] = 5 |
| c['eval_n'] = 64 |
| c['out_dir'] = '$STOICHEIA_DATA/runs/pretrain_smoke' |
| json.dump(c, open('$STOICHEIA_ROOT/configs/pretrain/_smoke.json', 'w'), indent=2) |
| " |
|
|
| |
| rm -rf "$STOICHEIA_DATA/runs/pretrain_smoke" |
|
|
| MASTER=$(scontrol show hostnames "$SLURM_JOB_NODELIST" | head -1) |
| export MASTER_ADDR=$MASTER MASTER_PORT=$((29000 + SLURM_JOB_ID % 1000)) |
| NGPU=${SLURM_GPUS_PER_NODE:-4} |
| echo "nodes=$SLURM_NNODES master=$MASTER gpus/node=$NGPU $(date)" |
|
|
| srun --ntasks="$SLURM_NNODES" --ntasks-per-node=1 bash -lc " |
| source $STOICHEIA_ROOT/env.sh |
| source $STOICHEIA_ROOT/scripts/pretrain/stage_shards.sh |
| apptainer exec --nv \$APPTAINER_BINDS \$STAGE_BIND \$SIF bash -lc ' |
| set -e |
| export PYTHONPATH=$STOICHEIA_ROOT |
| export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True |
| cd $STOICHEIA_ROOT |
| torchrun \ |
| --nnodes=$SLURM_NNODES --nproc_per_node=$NGPU \ |
| --rdzv_id=$SLURM_JOB_ID --rdzv_backend=c10d \ |
| --rdzv_endpoint=$MASTER_ADDR:$MASTER_PORT \ |
| --node_rank=\$SLURM_PROCID \ |
| -m train.train --config $STOICHEIA_ROOT/configs/pretrain/_smoke.json |
| ' |
| " |
| echo SMOKE_DONE |
|
|