lmc-code / scripts /enwik8 /finetune.sh
khanhvinh9's picture
Upload folder using huggingface_hub
a20151e verified
Raw
History Blame Contribute Delete
12.8 kB
#LEARNABLE
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=7 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-learnable-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
#ROPE
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 8 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 4 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 0 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 20 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
--model-path /mnt/data/vinhbk/weights/enwik8/lr0.00025-rope-step60000-warm0-size24-layer12-embd512-heads8-shared1-routed0-topk0/best_56000 \
--seed 40 --tgt_len 512 --mem_len 512 --eval_tgt_len 128 --n_head 16 --lmc-layer-indices 0 \
--learning-rate 0.00025 --batch-size 24 --max_step 60000 --warmup_step 0 --dataset enwik8 \
--wandb-project LMC-Attention --wandb-group "GPT2-Enwik8-FFN" --wandb-entity "vinh-bui0512-hcmut"\
--model-save-dir /mnt/data/vinhbk/weights/enwik8/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/enwik8
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=7 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \
# --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103
# WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \
# --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \
# --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \
# --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \
# --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\
# --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103