caiyiyi1998's picture
Initial commit
2402033
Raw History Blame Contribute Delete
4.56 kB
dirs:
deps: ./deps
raw_data: ./data
outputs: ./outputs
checkpoints: ./checkpoints
exp_name: ldf_263
seed: 1234
debug: false
train: true
save_dir: ${dirs.outputs}
resume_ckpt: null
test_ckpt: ${dirs.checkpoints}/ldf_263/model.ckpt
test_vae_ckpt: ${dirs.checkpoints}/vae_263/model.ckpt
test_vae:
target: models.vae_wan.VAEWanModel
ema_decay: 0.99
params:
input_dim: 263
z_dim: 4
test_setting:
render: true
recover_dim: 263
BABEL:
compare_folders:
- ${dirs.raw_data}/BABEL/HumanML3D263/animations
compare_names:
- Ground Truth
HumanML3D:
compare_folders:
- ${dirs.raw_data}/HumanML3D/HumanML3D263/animations
compare_names:
- Ground Truth
val_repeat: 1
logger:
wandb:
wandb_key: ${oc.env:WANDB_API_KEY,null}
project: FloodDiffusion2
entity: ${oc.env:WANDB_ENTITY,null}
trainer:
max_steps: 300000
accelerator: gpu
devices: 1
log_every_n_steps: 100
precision: bf16-mixed
num_nodes: 1
validation:
validation_steps: 5000
test_steps: 5000
save_every_n_steps: 5000
save_top_k: 100
metrics:
dim: 263
t2m:
target: metrics.HumanML3D263.t2m.T2MMetrics
fid_target: original
params:
evaluate_text: true
metric_mean_path: ${dirs.deps}/t2m/meta/mean.npy
metric_std_path: ${dirs.deps}/t2m/meta/std.npy
wordvectorizer:
target: metrics.HumanML3D263.word_vectorizer.WordVectorizer
params:
meta_root: ${dirs.deps}/glove
prefix: our_vab
max_text_len: 20
textencoder:
target: metrics.HumanML3D263.t2m_evaluator.TextEncoderBiGRUCo
ckpt: ${dirs.deps}/t2m/humanml3d/text_encoder.pt
params:
word_size: 300
pos_size: 15
hidden_size: 512
output_size: 512
moveencoder:
target: metrics.HumanML3D263.t2m_evaluator.MovementConvEncoder
ckpt: ${dirs.deps}/t2m/humanml3d/movement_encoder.pt
params:
input_size: 259
hidden_size: 512
output_size: 512
motionencoder:
target: metrics.HumanML3D263.t2m_evaluator.MotionEncoderBiGRUCo
ckpt: ${dirs.deps}/t2m/humanml3d/motion_encoder.pt
params:
input_size: 512
hidden_size: 1024
output_size: 512
data:
target: datasets.multi.MultiDataset
collate_fn: datasets.multi.collate_fn
train_bs: 32
val_bs: 16
test_bs: 16
num_workers: 8
datasets:
- target: datasets.babel.BabelDataset
train_meta_paths:
- path: ${dirs.raw_data}/BABEL/HumanML3D263/train.txt
name: BABEL
val_meta_paths: []
test_meta_paths:
- path: ${dirs.raw_data}/BABEL/HumanML3D263/test_min.txt
name: BABEL
feature_path: new_joint_vecs
token_path: TOKENS_20260113_233726_vae_wan_z4_2250000
text_path: texts
random_length: 0
min_length: 5
max_length: 99999
window_length: 200
feature_fps: 20
token_fps: 5
- target: datasets.humanml3d.HumanML3DDataset
train_meta_paths:
- path: ${dirs.raw_data}/HumanML3D/HumanML3D263/train.txt
name: HumanML3D
val_meta_paths:
- path: ${dirs.raw_data}/HumanML3D/HumanML3D263/test.txt
name: HumanML3D
test_meta_paths:
- path: ${dirs.raw_data}/HumanML3D/HumanML3D263/test_min.txt
name: HumanML3D
feature_path: new_joint_vecs
token_path: TOKENS_20260113_233726_vae_wan_z4_2250000
text_path: texts
random_length: 0
min_length: 40
max_length: 200
stream_mode: true
model:
target: models.diffusion_forcing_wan.DiffForcingWanModel
ema_decay: 0.99
params:
schedule_config:
noise_type: linear
chunk_size: 5
steps: 10
sigma_type: zero
sigma_scale: 1.0
random_epsilon: 0.05
train_n_windows: 4
text_config:
len: 512
dim: 4096
checkpoint_path: ${dirs.deps}/t5_umt5-xxl-enc-bf16/models_t5_umt5-xxl-enc-bf16.pth
tokenizer_path: ${dirs.deps}/t5_umt5-xxl-enc-bf16/google/umt5-xxl
input_dim: 4
mean_path: ${dirs.checkpoints}/ldf_263/assets/Mean.npy
std_path: ${dirs.checkpoints}/ldf_263/assets/Std.npy
input_keys:
feature: token
feature_length: token_length
text: text
text_end: token_text_end
cfg_config:
text_scale: 6.0
null_scale: -5.0
prediction_type: vel
attn_type: partial
optimizer:
target: AdamW
params:
lr: 0.0002
betas:
- 0.9
- 0.99
weight_decay: 0.0
eps: 1.0e-08
lr_scheduler:
target: CosineAnnealingLR
params:
T_max: 1000
eta_min: 1.0e-06
representation: humanml3d263