Self-Forcing / configs /predictor_v4.yaml
Cccccz's picture
Add files using upload-large-folder tool
510ab6b verified
Raw
History Blame Contribute Delete
2.02 kB
# Offline Predictor-v4 Stage-1 training on 1,000 prompts (seed 0).
trainer: predictor_v4
mixed_precision: true
seed: 0
predictor_v4:
schema_version: self_forcing_predictor_v4_bf16_v1
prompt_count: 1000
data_root: /mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_1000_seed0
manifest: /mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_1000_seed0/train_manifest.jsonl
output_dir: /mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_training_1000_seed0
max_records: null
teacher_model_name: Wan2.1-T2V-1.3B
teacher_checkpoint: /mnt/s3files/s3-us-west2-default/zoubin/cz/projects/Self-Forcing/checkpoints/self_forcing_dmd.pt
teacher_checkpoint_key: generator_ema
strict_teacher_load: true
source_block_ids: [1, 28]
timestep_shift: 5.0
local_attn_size: -1
sink_size: 0
latent_height: 60
latent_width: 104
max_steps: 2000
batch_size: 32
gradient_accumulation_steps: 1
num_workers: 0
pin_memory: false
persistent_workers: false
fusion_lr: 1.0e-4
blocks_lr: 1.0e-5
beta1: 0.9
beta2: 0.95
weight_decay: 0.01
scheduler_warmup_steps: 100
# The copied Wan blocks have exactly zero LR for the first 100 optimizer steps.
block_warmup_steps: 100
hidden_loss_weight: 0.1
flow_loss_weight: 1.0
grad_clip: 1.0
fp32_trainable_params: true
gradient_checkpointing: false
find_unused_parameters: false
log_every: 10
save_every: 100
keep_snapshots: 20
resume: null
use_wandb: false
wandb_project: Self-Forcing-Predictor-v4
wandb_entity: null
wandb_name: predictor-v4-prefeature-blocks1-28-prompts1000-seed0
use_swanlab: true
swanlab_project: Self-Forcing-Predictor-v4
swanlab_workspace: null
swanlab_experiment: predictor-v4-prefeature-blocks1-28-prompts1000-seed0-bs32x8-from-scratch
swanlab_description: Self-Forcing Wan2.1 1.3B Predictor-v4 offline prefeature training
swanlab_tags:
- predictor-v4
- self-forcing
- wan2.1-1.3b
- offline-prefeature
- blocks-1-28
- 8gpu
- seed0
swanlab_mode: cloud