chaddy81 commited on
Commit
658e879
·
verified ·
1 Parent(s): 1dd9bc4

Upload train_design_sft.py with huggingface_hub

Browse files
Files changed (1) hide show
  1. train_design_sft.py +11 -10
train_design_sft.py CHANGED
@@ -1,5 +1,5 @@
1
  # /// script
2
- # dependencies = ["trl>=0.12.0", "peft>=0.7.0", "trackio", "datasets", "accelerate", "torch"]
3
  # ///
4
 
5
  from datasets import load_dataset, concatenate_datasets
@@ -83,8 +83,8 @@ trainer = SFTTrainer(
83
  train_dataset=dataset_split["train"],
84
  eval_dataset=dataset_split["test"],
85
  peft_config=LoraConfig(
86
- r=32,
87
- lora_alpha=64,
88
  target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
89
  lora_dropout=0.05,
90
  bias="none",
@@ -95,21 +95,22 @@ trainer = SFTTrainer(
95
  push_to_hub=True,
96
  hub_model_id="chaddy81/qwen3-0.6b-design-sft",
97
  num_train_epochs=3,
98
- per_device_train_batch_size=2,
99
- gradient_accumulation_steps=8,
100
  learning_rate=2e-4,
101
  lr_scheduler_type="cosine",
102
  warmup_ratio=0.1,
103
- max_length=4096,
104
  logging_steps=10,
105
- eval_strategy="steps",
106
- eval_steps=100,
107
  save_strategy="steps",
108
- save_steps=200,
109
  bf16=True,
110
  gradient_checkpointing=True,
 
 
111
  report_to="trackio",
112
- run_name="qwen3-design-sft-v1",
113
  )
114
  )
115
 
 
1
  # /// script
2
+ # dependencies = ["trl>=0.12.0", "peft>=0.7.0", "trackio", "datasets", "accelerate", "torch", "bitsandbytes"]
3
  # ///
4
 
5
  from datasets import load_dataset, concatenate_datasets
 
83
  train_dataset=dataset_split["train"],
84
  eval_dataset=dataset_split["test"],
85
  peft_config=LoraConfig(
86
+ r=16, # Reduced from 32 to save memory
87
+ lora_alpha=32,
88
  target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
89
  lora_dropout=0.05,
90
  bias="none",
 
95
  push_to_hub=True,
96
  hub_model_id="chaddy81/qwen3-0.6b-design-sft",
97
  num_train_epochs=3,
98
+ per_device_train_batch_size=1, # Reduced from 2
99
+ gradient_accumulation_steps=16, # Increased to maintain effective batch size
100
  learning_rate=2e-4,
101
  lr_scheduler_type="cosine",
102
  warmup_ratio=0.1,
103
+ max_length=2048, # Reduced from 4096 to save memory
104
  logging_steps=10,
105
+ eval_strategy="no", # Skip eval during training to save memory
 
106
  save_strategy="steps",
107
+ save_steps=300,
108
  bf16=True,
109
  gradient_checkpointing=True,
110
+ gradient_checkpointing_kwargs={"use_reentrant": False}, # More memory efficient
111
+ optim="adamw_8bit", # 8-bit optimizer to save memory
112
  report_to="trackio",
113
+ run_name="qwen3-design-sft-v2",
114
  )
115
  )
116