File size: 12,848 Bytes
a20151e | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 | #LEARNABLE
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=7 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
#ROPE
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=7 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103
|