| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \ |
| ======= |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \ |
| ======= |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 \ |
| ======= |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 \ |
| ======= |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 \ |
| ======= |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \ |
| ======= |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \ |
| ======= |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-learnable-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \ |
| ======= |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \ |
| ======= |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \ |
| ======= |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 \ |
| ======= |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 3 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 \ |
| ======= |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 \ |
| ======= |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 \ |
| ======= |
| --seed 40 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 2 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
|
|
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \ |
| ======= |
| --seed 0 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
| |
| |
| WANDB_MODE=online CUDA_VISIBLE_DEVICES=6 python src/lgmodeling/finetune.py \ |
| --model-path /mnt/data/vinhbk/weights/wt103/lr0.00025-rope-step60000-warm2000-size64-layer12-embd192-heads3-shared1-routed0-topk0/best_60000 \ |
| <<<<<<< HEAD |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 \ |
| ======= |
| --seed 20 --tgt_len 256 --mem_len 256 --eval_tgt_len 256 --n_head 4 --lmc-layer-indices 0 1 2 3 4 5 6 7 8 9 10 11 \ |
| >>>>>>> master |
| --learning-rate 0.00025 --batch-size 64 --max_step 60000 --warmup_step 2000 --dataset wt103 \ |
| --wandb-project LMC-Attention --wandb-group "GPT2-Wikitext103-FFN" --wandb-entity "vinh-bui0512-hcmut"\ |
| --model-save-dir /mnt/data/vinhbk/weights/wt103/gpt2-finetune --data-path /mnt/data/vinhbk/datasets/wt103 |
|
|
|
|