File size: 2,018 Bytes
510ab6b
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
# Offline Predictor-v4 Stage-1 training on 1,000 prompts (seed 0).
trainer: predictor_v4
mixed_precision: true
seed: 0

predictor_v4:
  schema_version: self_forcing_predictor_v4_bf16_v1
  prompt_count: 1000
  data_root: /mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_1000_seed0
  manifest: /mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_1000_seed0/train_manifest.jsonl
  output_dir: /mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_training_1000_seed0
  max_records: null

  teacher_model_name: Wan2.1-T2V-1.3B
  teacher_checkpoint: /mnt/s3files/s3-us-west2-default/zoubin/cz/projects/Self-Forcing/checkpoints/self_forcing_dmd.pt
  teacher_checkpoint_key: generator_ema
  strict_teacher_load: true
  source_block_ids: [1, 28]
  timestep_shift: 5.0
  local_attn_size: -1
  sink_size: 0
  latent_height: 60
  latent_width: 104

  max_steps: 2000
  batch_size: 32
  gradient_accumulation_steps: 1
  num_workers: 0
  pin_memory: false
  persistent_workers: false

  fusion_lr: 1.0e-4
  blocks_lr: 1.0e-5
  beta1: 0.9
  beta2: 0.95
  weight_decay: 0.01
  scheduler_warmup_steps: 100
  # The copied Wan blocks have exactly zero LR for the first 100 optimizer steps.
  block_warmup_steps: 100
  hidden_loss_weight: 0.1
  flow_loss_weight: 1.0
  grad_clip: 1.0

  fp32_trainable_params: true
  gradient_checkpointing: false
  find_unused_parameters: false
  log_every: 10
  save_every: 100
  keep_snapshots: 20
  resume: null

  use_wandb: false
  wandb_project: Self-Forcing-Predictor-v4
  wandb_entity: null
  wandb_name: predictor-v4-prefeature-blocks1-28-prompts1000-seed0

  use_swanlab: true
  swanlab_project: Self-Forcing-Predictor-v4
  swanlab_workspace: null
  swanlab_experiment: predictor-v4-prefeature-blocks1-28-prompts1000-seed0-bs32x8-from-scratch
  swanlab_description: Self-Forcing Wan2.1 1.3B Predictor-v4 offline prefeature training
  swanlab_tags:
    - predictor-v4
    - self-forcing
    - wan2.1-1.3b
    - offline-prefeature
    - blocks-1-28
    - 8gpu
    - seed0
  swanlab_mode: cloud