defaults: - df_base n_frames: ${dataset.n_frames} frame_skip: ${dataset.frame_skip} metadata: ${dataset.metadata} memory_selection: ${dataset.memory_selection} memory_noise: enabled: true # Options: random_cleaner_fraction (query-bounded), independent (full schedule). mode: random_cleaner_fraction anchor_max_fraction: 0.25 dynamic_max_fraction: 0.50 revisit_max_fraction: 0.25 # Inference memory follows the WorldMem stabilization path by default. validation_noisy_memory: false # Per stream: all = always active, high = active for high query noise, # low = active for low query noise. noise_route: {anchor: all, dynamic: all, revisit: all} trainability: freeze_vae: true reference_attention: true adaln_mlp: true geometry_projections: true train_full_dit: false full_dit_start_step: null lr: memory_modules: 8.0e-5 base_dit: 2.0e-5 n_tokens: ${dataset.n_frames} action_cond_dim: ${dataset.action_cond_dim} pose_cond_dim: 5 use_plucker: true relative_embedding: true state_embed_only_on_qk: true use_memory_attention: true memory_attention_key_only_geometry: true add_timestamp_embedding: false ref_mode: sequential focal_length: 0.35 log_video: false save_local: true # 0 disables segment metrics; 100 logs generated-frame windows [0,100), [100,200), ... metric_report_segment: 0 require_pose_prediction: false # training hyperparameters weight_decay: 2e-3 warmup_steps: 1000 optimizer_beta: [0.9, 0.99] diffusion: beta_schedule: sigmoid objective: pred_v use_fused_snr: True cum_snr_decay: 0.96 clip_noise: 20. sampling_timesteps: 20 ddim_sampling_eta: 0.0 stabilization_level: 15 architecture: network_size: 64 attn_heads: 4 attn_dim_head: 64 dim_mults: [1, 2, 4, 8] resolution: ${dataset.resolution} attn_resolutions: [16, 32, 64, 128] use_init_temporal_attn: True use_linear_attn: True time_emb_type: rotary _name: dememwm_base