| #!/bin/bash |
| |
| |
| |
| |
| |
| |
| |
| |
|
|
| set -euo pipefail |
|
|
| echo "============================================================" |
| echo "MoE Training Pipeline β Environment Setup" |
| echo "============================================================" |
|
|
| |
| |
| |
| echo "" |
| echo "--- Setting up Megatron-LM environment ---" |
|
|
| conda create -n megatron python=3.11 -y |
| conda activate megatron |
|
|
| |
| pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu124 |
|
|
| |
| cd /path/to/software |
| git clone https://github.com/NVIDIA/Megatron-LM.git |
| cd Megatron-LM |
| pip install -e . |
|
|
| |
| pip install megatron-core |
|
|
| |
| pip install megablocks |
| pip install grouped-gemm |
|
|
| |
| pip install flash-attn --no-build-isolation |
|
|
| |
| cd /path/to/software |
| git clone https://github.com/NVIDIA/apex.git |
| cd apex |
| pip install -v --disable-pip-version-check --no-cache-dir \ |
| --no-build-isolation \ |
| --config-settings "--build-option=--cpp_ext" \ |
| --config-settings "--build-option=--cuda_ext" . |
|
|
| |
| pip install transformer-engine[pytorch] |
|
|
| |
| pip install transformers datasets tokenizers |
| pip install sentencepiece tiktoken |
|
|
| |
| pip install tensorboard wandb |
|
|
| |
| pip install packaging ninja |
|
|
| echo "Megatron environment ready!" |
| conda deactivate |
|
|
| |
| |
| |
| echo "" |
| echo "--- Setting up SFT/RL environment ---" |
|
|
| conda create -n sft python=3.11 -y |
| conda activate sft |
|
|
| pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu124 |
| pip install flash-attn --no-build-isolation |
|
|
| |
| pip install transformers>=4.55.0 |
| pip install trl>=0.17.0 |
| pip install datasets |
| pip install accelerate |
| pip install peft |
| pip install bitsandbytes |
|
|
| |
| pip install evalplus |
| pip install lighteval |
| pip install vllm |
|
|
| |
| pip install openai anthropic |
|
|
| |
| pip install tensorboard wandb trackio |
|
|
| echo "SFT/RL environment ready!" |
| conda deactivate |
|
|
| |
| |
| |
| echo "" |
| echo "--- Setting up data curation environment ---" |
|
|
| conda create -n datacuration python=3.11 -y |
| conda activate datacuration |
|
|
| pip install datasets transformers tokenizers |
| pip install openai anthropic |
| pip install tiktoken sentencepiece |
|
|
| echo "Data curation environment ready!" |
| conda deactivate |
|
|
| echo "" |
| echo "============================================================" |
| echo "Setup Complete!" |
| echo "============================================================" |
| echo "" |
| echo "Environments:" |
| echo " conda activate megatron β for pre-training" |
| echo " conda activate sft β for SFT, RL, evaluation" |
| echo " conda activate datacuration β for data processing" |
| echo "" |
| echo "Next steps:" |
| echo " 1. Edit paths in scripts/pretrain_megatron.sh" |
| echo " 2. Run data curation pipeline" |
| echo " 3. Submit pre-training job: sbatch slurm/pretrain.sbatch" |
|
|