dirs: deps: ./deps raw_data: ./data outputs: ./outputs checkpoints: ./checkpoints exp_name: ldf_263 seed: 1234 debug: false train: true save_dir: ${dirs.outputs} resume_ckpt: null test_ckpt: ${dirs.checkpoints}/ldf_263/model.ckpt test_vae_ckpt: ${dirs.checkpoints}/vae_263/model.ckpt test_vae: target: models.vae_wan.VAEWanModel ema_decay: 0.99 params: input_dim: 263 z_dim: 4 test_setting: render: true recover_dim: 263 BABEL: compare_folders: - ${dirs.raw_data}/BABEL/HumanML3D263/animations compare_names: - Ground Truth HumanML3D: compare_folders: - ${dirs.raw_data}/HumanML3D/HumanML3D263/animations compare_names: - Ground Truth val_repeat: 1 logger: wandb: wandb_key: ${oc.env:WANDB_API_KEY,null} project: FloodDiffusion2 entity: ${oc.env:WANDB_ENTITY,null} trainer: max_steps: 300000 accelerator: gpu devices: 1 log_every_n_steps: 100 precision: bf16-mixed num_nodes: 1 validation: validation_steps: 5000 test_steps: 5000 save_every_n_steps: 5000 save_top_k: 100 metrics: dim: 263 t2m: target: metrics.HumanML3D263.t2m.T2MMetrics fid_target: original params: evaluate_text: true metric_mean_path: ${dirs.deps}/t2m/meta/mean.npy metric_std_path: ${dirs.deps}/t2m/meta/std.npy wordvectorizer: target: metrics.HumanML3D263.word_vectorizer.WordVectorizer params: meta_root: ${dirs.deps}/glove prefix: our_vab max_text_len: 20 textencoder: target: metrics.HumanML3D263.t2m_evaluator.TextEncoderBiGRUCo ckpt: ${dirs.deps}/t2m/humanml3d/text_encoder.pt params: word_size: 300 pos_size: 15 hidden_size: 512 output_size: 512 moveencoder: target: metrics.HumanML3D263.t2m_evaluator.MovementConvEncoder ckpt: ${dirs.deps}/t2m/humanml3d/movement_encoder.pt params: input_size: 259 hidden_size: 512 output_size: 512 motionencoder: target: metrics.HumanML3D263.t2m_evaluator.MotionEncoderBiGRUCo ckpt: ${dirs.deps}/t2m/humanml3d/motion_encoder.pt params: input_size: 512 hidden_size: 1024 output_size: 512 data: target: datasets.multi.MultiDataset collate_fn: datasets.multi.collate_fn train_bs: 32 val_bs: 16 test_bs: 16 num_workers: 8 datasets: - target: datasets.babel.BabelDataset train_meta_paths: - path: ${dirs.raw_data}/BABEL/HumanML3D263/train.txt name: BABEL val_meta_paths: [] test_meta_paths: - path: ${dirs.raw_data}/BABEL/HumanML3D263/test_min.txt name: BABEL feature_path: new_joint_vecs token_path: TOKENS_20260113_233726_vae_wan_z4_2250000 text_path: texts random_length: 0 min_length: 5 max_length: 99999 window_length: 200 feature_fps: 20 token_fps: 5 - target: datasets.humanml3d.HumanML3DDataset train_meta_paths: - path: ${dirs.raw_data}/HumanML3D/HumanML3D263/train.txt name: HumanML3D val_meta_paths: - path: ${dirs.raw_data}/HumanML3D/HumanML3D263/test.txt name: HumanML3D test_meta_paths: - path: ${dirs.raw_data}/HumanML3D/HumanML3D263/test_min.txt name: HumanML3D feature_path: new_joint_vecs token_path: TOKENS_20260113_233726_vae_wan_z4_2250000 text_path: texts random_length: 0 min_length: 40 max_length: 200 stream_mode: true model: target: models.diffusion_forcing_wan.DiffForcingWanModel ema_decay: 0.99 params: schedule_config: noise_type: linear chunk_size: 5 steps: 10 sigma_type: zero sigma_scale: 1.0 random_epsilon: 0.05 train_n_windows: 4 text_config: len: 512 dim: 4096 checkpoint_path: ${dirs.deps}/t5_umt5-xxl-enc-bf16/models_t5_umt5-xxl-enc-bf16.pth tokenizer_path: ${dirs.deps}/t5_umt5-xxl-enc-bf16/google/umt5-xxl input_dim: 4 mean_path: ${dirs.checkpoints}/ldf_263/assets/Mean.npy std_path: ${dirs.checkpoints}/ldf_263/assets/Std.npy input_keys: feature: token feature_length: token_length text: text text_end: token_text_end cfg_config: text_scale: 6.0 null_scale: -5.0 prediction_type: vel attn_type: partial optimizer: target: AdamW params: lr: 0.0002 betas: - 0.9 - 0.99 weight_decay: 0.0 eps: 1.0e-08 lr_scheduler: target: CosineAnnealingLR params: T_max: 1000 eta_min: 1.0e-06 representation: humanml3d263