Upload train_design_sft.py with huggingface_hub
Browse files- train_design_sft.py +11 -10
train_design_sft.py
CHANGED
|
@@ -1,5 +1,5 @@
|
|
| 1 |
# /// script
|
| 2 |
-
# dependencies = ["trl>=0.12.0", "peft>=0.7.0", "trackio", "datasets", "accelerate", "torch"]
|
| 3 |
# ///
|
| 4 |
|
| 5 |
from datasets import load_dataset, concatenate_datasets
|
|
@@ -83,8 +83,8 @@ trainer = SFTTrainer(
|
|
| 83 |
train_dataset=dataset_split["train"],
|
| 84 |
eval_dataset=dataset_split["test"],
|
| 85 |
peft_config=LoraConfig(
|
| 86 |
-
r=
|
| 87 |
-
lora_alpha=
|
| 88 |
target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
|
| 89 |
lora_dropout=0.05,
|
| 90 |
bias="none",
|
|
@@ -95,21 +95,22 @@ trainer = SFTTrainer(
|
|
| 95 |
push_to_hub=True,
|
| 96 |
hub_model_id="chaddy81/qwen3-0.6b-design-sft",
|
| 97 |
num_train_epochs=3,
|
| 98 |
-
per_device_train_batch_size=
|
| 99 |
-
gradient_accumulation_steps=
|
| 100 |
learning_rate=2e-4,
|
| 101 |
lr_scheduler_type="cosine",
|
| 102 |
warmup_ratio=0.1,
|
| 103 |
-
max_length=
|
| 104 |
logging_steps=10,
|
| 105 |
-
eval_strategy="
|
| 106 |
-
eval_steps=100,
|
| 107 |
save_strategy="steps",
|
| 108 |
-
save_steps=
|
| 109 |
bf16=True,
|
| 110 |
gradient_checkpointing=True,
|
|
|
|
|
|
|
| 111 |
report_to="trackio",
|
| 112 |
-
run_name="qwen3-design-sft-
|
| 113 |
)
|
| 114 |
)
|
| 115 |
|
|
|
|
| 1 |
# /// script
|
| 2 |
+
# dependencies = ["trl>=0.12.0", "peft>=0.7.0", "trackio", "datasets", "accelerate", "torch", "bitsandbytes"]
|
| 3 |
# ///
|
| 4 |
|
| 5 |
from datasets import load_dataset, concatenate_datasets
|
|
|
|
| 83 |
train_dataset=dataset_split["train"],
|
| 84 |
eval_dataset=dataset_split["test"],
|
| 85 |
peft_config=LoraConfig(
|
| 86 |
+
r=16, # Reduced from 32 to save memory
|
| 87 |
+
lora_alpha=32,
|
| 88 |
target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
|
| 89 |
lora_dropout=0.05,
|
| 90 |
bias="none",
|
|
|
|
| 95 |
push_to_hub=True,
|
| 96 |
hub_model_id="chaddy81/qwen3-0.6b-design-sft",
|
| 97 |
num_train_epochs=3,
|
| 98 |
+
per_device_train_batch_size=1, # Reduced from 2
|
| 99 |
+
gradient_accumulation_steps=16, # Increased to maintain effective batch size
|
| 100 |
learning_rate=2e-4,
|
| 101 |
lr_scheduler_type="cosine",
|
| 102 |
warmup_ratio=0.1,
|
| 103 |
+
max_length=2048, # Reduced from 4096 to save memory
|
| 104 |
logging_steps=10,
|
| 105 |
+
eval_strategy="no", # Skip eval during training to save memory
|
|
|
|
| 106 |
save_strategy="steps",
|
| 107 |
+
save_steps=300,
|
| 108 |
bf16=True,
|
| 109 |
gradient_checkpointing=True,
|
| 110 |
+
gradient_checkpointing_kwargs={"use_reentrant": False}, # More memory efficient
|
| 111 |
+
optim="adamw_8bit", # 8-bit optimizer to save memory
|
| 112 |
report_to="trackio",
|
| 113 |
+
run_name="qwen3-design-sft-v2",
|
| 114 |
)
|
| 115 |
)
|
| 116 |
|