| # WANDB_MODE=online CUDA_VISIBLE_DEVICES=5 python src/lgmodeling/train_model.py \ | |
| # --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "learnable" \ | |
| # --num-shared-experts 1 --num-routed-experts 4 --topk 4 --rotary-dim 64 \ | |
| # --n_layer 12 --n_embd 192 --n_head 3 --n_inner 768 --attention-bias \ | |
| # --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ | |
| # --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-MoE" --wandb-entity "vinh-bui0512-hcmut"\ | |
| # --model-save-dir /mnt/data/vinhbk/weights/wt103 --data-path /mnt/data/vinhbk/datasets/wt103 | |
| # WANDB_MODE=online CUDA_VISIBLE_DEVICES=5 python src/lgmodeling/train_model.py \ | |
| # --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "rope" \ | |
| # --num-shared-experts 1 --num-routed-experts 4 --topk 4 --rotary-dim 64 \ | |
| # --n_layer 12 --n_embd 192 --n_head 3 --n_inner 768 --attention-bias \ | |
| # --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ | |
| # --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-MoE" --wandb-entity "vinh-bui0512-hcmut"\ | |
| # --model-save-dir /mnt/data/vinhbk/weights/wt103 --data-path /mnt/data/vinhbk/datasets/wt103 | |
| # WANDB_MODE=online CUDA_VISIBLE_DEVICES=5 python src/lgmodeling/train_model.py \ | |
| # --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "sinusoidal" \ | |
| # --num-shared-experts 1 --num-routed-experts 4 --topk 4 --rotary-dim 64 \ | |
| # --n_layer 12 --n_embd 192 --n_head 3 --n_inner 768 --attention-bias \ | |
| # --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ | |
| # --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-MoE" --wandb-entity "vinh-bui0512-hcmut"\ | |
| # --model-save-dir /mnt/data/vinhbk/weights/wt103 --data-path /mnt/data/vinhbk/datasets/wt103 | |
| # WANDB_MODE=online CUDA_VISIBLE_DEVICES=5 python src/lgmodeling/train_model.py \ | |
| # --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "learnable" \ | |
| # --num-shared-experts 1 --num-routed-experts 4 --topk 2 --rotary-dim 64 \ | |
| # --n_layer 12 --n_embd 192 --n_head 3 --n_inner 768 --attention-bias \ | |
| # --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ | |
| # --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-SMoE" --wandb-entity "vinh-bui0512-hcmut"\ | |
| # --model-save-dir /mnt/data/vinhbk/weights/wt103 --data-path /mnt/data/vinhbk/datasets/wt103 | |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=7 python src/lgmodeling/train_model.py \ | |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "rope" \ | |
| --num-shared-experts 1 --num-routed-experts 4 --topk 2 --rotary-dim 64 \ | |
| --n_layer 12 --n_embd 192 --n_head 3 --n_inner 768 --attention-bias \ | |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ | |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-SMoE" --wandb-entity "vinh-bui0512-hcmut"\ | |
| --model-save-dir /mnt/data/vinhbk/weights/wt103 --data-path /mnt/data/vinhbk/datasets/wt103 | |
| WANDB_MODE=offline CUDA_VISIBLE_DEVICES=7 python src/lgmodeling/train_model.py \ | |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "sinusoidal" \ | |
| --num-shared-experts 1 --num-routed-experts 4 --topk 2 --rotary-dim 64 \ | |
| --n_layer 12 --n_embd 192 --n_head 3 --n_inner 768 --attention-bias \ | |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ | |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-SMoE" --wandb-entity "vinh-bui0512-hcmut"\ | |
| --model-save-dir /mnt/data/vinhbk/weights/wt103 --data-path /mnt/data/vinhbk/datasets/wt103 | |