File size: 5,817 Bytes
a20151e
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
<<<<<<< HEAD
WANDB_MODE=online CUDA_VISIBLE_DEVICES=0,1  python src/lgmodeling/train_model.py \
=======
WANDB_MODE=offline CUDA_VISIBLE_DEVICES=0,1  python src/lgmodeling/train_model.py \
>>>>>>> master
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "rope" \
    --num-shared-experts 1 --num-routed-experts 0  --topk 0 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b 

WANDB_MODE=online CUDA_VISIBLE_DEVICES=2,3  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "sinusoidal" \
    --num-shared-experts 1 --num-routed-experts 0  --topk 0 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b

WANDB_MODE=online CUDA_VISIBLE_DEVICES=4,5  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "" \
    --num-shared-experts 1 --num-routed-experts 0  --topk 0 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b


WANDB_MODE=online CUDA_VISIBLE_DEVICES=0,1  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "rope" \
    --num-shared-experts 1 --num-routed-experts 4  --topk 4 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b 

WANDB_MODE=online CUDA_VISIBLE_DEVICES=2,3  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "sinusoidal" \
    --num-shared-experts 1 --num-routed-experts 4  --topk 4 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b

WANDB_MODE=online CUDA_VISIBLE_DEVICES=4,5  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "" \
    --num-shared-experts 1 --num-routed-experts 4  --topk 4 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b


WANDB_MODE=online CUDA_VISIBLE_DEVICES=0,1  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "rope" \
    --num-shared-experts 1 --num-routed-experts 4  --topk 2 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b 

WANDB_MODE=online CUDA_VISIBLE_DEVICES=2,3  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "sinusoidal" \
    --num-shared-experts 1 --num-routed-experts 4  --topk 2 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b

WANDB_MODE=online CUDA_VISIBLE_DEVICES=4,5  python src/lgmodeling/train_model.py \
    --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --position-embeddings "" \
    --num-shared-experts 1 --num-routed-experts 4  --topk 2 --rotary-dim 64 \
    --n_layer 12 --n_embd 768 --n_head 12 --n_inner 3072 --attention-bias \
    --learning-rate 0.00025 --batch-size 96 --max_step 500000 --warmup_step 2000 --dataset lm1b \
    --wandb-project LMC-Attention --wandb-group "GPT2-OneBillionWord-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/lm1b --data-path /mnt/data/vinhbk/datasets/lm1b