{ "activation_dtype": "bfloat16", "batch_size": 32, "beta1": 0.9, "beta2": 0.95, "block_warmup_steps": 100, "blocks_lr": 1e-05, "data_root": "/mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_1000_seed0", "dataset_pairs": 18000, "find_unused_parameters": false, "flow_loss_weight": 1.0, "fp32_trainable_params": true, "fusion_lr": 0.0001, "global_batch_size": 256, "grad_clip": 1.0, "gradient_accumulation_steps": 1, "gradient_checkpointing": false, "hidden_loss_weight": 0.1, "keep_snapshots": 20, "latent_height": 60, "latent_width": 104, "local_attn_size": -1, "log_every": 10, "manifest": "/mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_1000_seed0/train_manifest.jsonl", "manifest_records": 6000, "max_records": null, "max_steps": 2000, "num_workers": 0, "output_dir": "/mnt/local_nvme/zoubin/cz/self_forcing_predictor_v4_training_1000_seed0", "parameter_groups": { "feature_fusion.anchor_norm.bias": "fusion_residual", "feature_fusion.anchor_norm.weight": "fusion_residual", "feature_fusion.current_norm.bias": "fusion_residual", "feature_fusion.current_norm.weight": "fusion_residual", "feature_fusion.mlp.0.bias": "fusion_residual", "feature_fusion.mlp.0.weight": "fusion_residual", "feature_fusion.mlp.2.bias": "fusion_residual", "feature_fusion.mlp.2.weight": "fusion_residual", "feature_fusion.previous_norm.bias": "fusion_residual", "feature_fusion.previous_norm.weight": "fusion_residual", "predictor_blocks.0.cross_attn.norm_q.weight": "blocks", "predictor_blocks.0.cross_attn.o.bias": "blocks", "predictor_blocks.0.cross_attn.o.weight": "blocks", "predictor_blocks.0.cross_attn.q.bias": "blocks", "predictor_blocks.0.cross_attn.q.weight": "blocks", "predictor_blocks.0.ffn.0.bias": "blocks", "predictor_blocks.0.ffn.0.weight": "blocks", "predictor_blocks.0.ffn.2.bias": "blocks", "predictor_blocks.0.ffn.2.weight": "blocks", "predictor_blocks.0.modulation": "blocks", "predictor_blocks.0.norm3.bias": "blocks", "predictor_blocks.0.norm3.weight": "blocks", "predictor_blocks.0.self_attn.k.bias": "blocks", "predictor_blocks.0.self_attn.k.weight": "blocks", "predictor_blocks.0.self_attn.norm_k.weight": "blocks", "predictor_blocks.0.self_attn.norm_q.weight": "blocks", "predictor_blocks.0.self_attn.o.bias": "blocks", "predictor_blocks.0.self_attn.o.weight": "blocks", "predictor_blocks.0.self_attn.q.bias": "blocks", "predictor_blocks.0.self_attn.q.weight": "blocks", "predictor_blocks.0.self_attn.v.bias": "blocks", "predictor_blocks.0.self_attn.v.weight": "blocks", "predictor_blocks.1.cross_attn.norm_q.weight": "blocks", "predictor_blocks.1.cross_attn.o.bias": "blocks", "predictor_blocks.1.cross_attn.o.weight": "blocks", "predictor_blocks.1.cross_attn.q.bias": "blocks", "predictor_blocks.1.cross_attn.q.weight": "blocks", "predictor_blocks.1.ffn.0.bias": "blocks", "predictor_blocks.1.ffn.0.weight": "blocks", "predictor_blocks.1.ffn.2.bias": "blocks", "predictor_blocks.1.ffn.2.weight": "blocks", "predictor_blocks.1.modulation": "blocks", "predictor_blocks.1.norm3.bias": "blocks", "predictor_blocks.1.norm3.weight": "blocks", "predictor_blocks.1.self_attn.k.bias": "blocks", "predictor_blocks.1.self_attn.k.weight": "blocks", "predictor_blocks.1.self_attn.norm_k.weight": "blocks", "predictor_blocks.1.self_attn.norm_q.weight": "blocks", "predictor_blocks.1.self_attn.o.bias": "blocks", "predictor_blocks.1.self_attn.o.weight": "blocks", "predictor_blocks.1.self_attn.q.bias": "blocks", "predictor_blocks.1.self_attn.q.weight": "blocks", "predictor_blocks.1.self_attn.v.bias": "blocks", "predictor_blocks.1.self_attn.v.weight": "blocks", "residual_out.bias": "fusion_residual", "residual_out.weight": "fusion_residual" }, "persistent_workers": false, "pin_memory": false, "prompt_count": 1000, "resume": null, "save_every": 100, "scheduler_warmup_steps": 100, "schema_version": "self_forcing_predictor_v4_bf16_v1", "sink_size": 0, "source_block_ids": [ 1, 28 ], "steps_per_epoch_per_rank": 66, "strict_teacher_load": true, "supervision_pairs": [ [ 0, 1 ], [ 1, 2 ], [ 2, 3 ] ], "swanlab_description": "Self-Forcing Wan2.1 1.3B Predictor-v4 offline prefeature training", "swanlab_experiment": "predictor-v4-prefeature-blocks1-28-prompts1000-seed0-bs32x8-from-scratch", "swanlab_mode": "cloud", "swanlab_project": "Self-Forcing-Predictor-v4", "swanlab_run_id": "4kxa9v7b", "swanlab_tags": [ "predictor-v4", "self-forcing", "wan2.1-1.3b", "offline-prefeature", "blocks-1-28", "8gpu", "seed0" ], "swanlab_workspace": null, "teacher_checkpoint": "/mnt/s3files/s3-us-west2-default/zoubin/cz/projects/Self-Forcing/checkpoints/self_forcing_dmd.pt", "teacher_checkpoint_key": "generator_ema", "teacher_model_name": "Wan2.1-T2V-1.3B", "timestep_shift": 5.0, "trainable_parameter_dtype": "float32", "trainable_parameters": 104684032, "use_swanlab": true, "use_wandb": false, "wandb_entity": null, "wandb_name": "predictor-v4-prefeature-blocks1-28-prompts1000-seed0", "wandb_project": "Self-Forcing-Predictor-v4", "weight_decay": 0.01, "world_size": 8 }