File size: 11,482 Bytes
a20151e
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 4 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 4 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 4 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 8 --lmc-layer-indices 0\
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 8 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 8 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8

WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 16 --lmc-layer-indices 0\
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8

WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 16 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8

WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
    --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
    --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 16 --lmc-layer-indices 0 \
    --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
    --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
    --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8



# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 8 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 8 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 8 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8

# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 16 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8

# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 16 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8

# WANDB_MODE=online CUDA_VISIBLE_DEVICES=1  python src/lgmodeling/finetune.py \
#     --model-path /mnt/data/vinhbk/weights/text8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0 \
#     --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128  --n_head 16 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11\
#     --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset text8 \
#     --wandb-project LMC-Attention --wandb-group "GPT2-Text8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
#     --model-save-dir /mnt/data/vinhbk/weights/text8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/text8