twanghcmut's picture
download
raw
7.1 kB
┌──────────────────────────────────────────────────────────────────────┐
│ DiffSynth-Studio Model Downloader Configuration: │
│ │
│ [√] Download from https://modelscope.cn/
│ (default behavior) │
│ [ ] Download from https://modelscope.ai/
│ (enabled via `export MODELSCOPE_ENDPOINT=https://modelscope.ai`) │
│ [ ] Download from https://huggingface.co/
│ (enabled via `export DIFFSYNTH_DOWNLOAD_SOURCE=HuggingFace`) │
│ [ ] Skip download and load only pre-downloaded model files │
│ (enabled via `export DIFFSYNTH_SKIP_DOWNLOAD=True`) │
└──────────────────────────────────────────────────────────────────────┘
Loading models from: "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/diffusion_pytorch_model.safetensors"
Loaded model: {
"model_name": "wan_video_dit",
"model_class": "diffsynth.models.wan_video_dit.WanModel",
"extra_kwargs": {
"has_image_input": false,
"patch_size": [
1,
2,
2
],
"in_dim": 16,
"dim": 1536,
"ffn_dim": 8960,
"freq_dim": 256,
"text_dim": 4096,
"out_dim": 16,
"num_heads": 12,
"num_layers": 30,
"eps": 1e-06
}
}
Loaded model: {
"model_name": "wan_video_vace",
"model_class": "diffsynth.models.wan_video_vace.VaceWanModel",
"extra_kwargs": null
}
Loading models from: "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/models_t5_umt5-xxl-enc-bf16.pth"
Detected non-safetensors files, which may cause slower loading. It's recommended to convert it to a safetensors file.
Loaded model: {
"model_name": "wan_video_text_encoder",
"model_class": "diffsynth.models.wan_video_text_encoder.WanTextEncoder",
"extra_kwargs": null
}
Loading models from: "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/Wan2.1_VAE.pth"
Detected non-safetensors files, which may cause slower loading. It's recommended to convert it to a safetensors file.
Loaded model: {
"model_name": "wan_video_vae",
"model_class": "diffsynth.models.wan_video_vae.WanVideoVAE",
"extra_kwargs": null
}
Using wan_video_text_encoder from "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/models_t5_umt5-xxl-enc-bf16.pth".
Using wan_video_dit from "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/diffusion_pytorch_model.safetensors".
Using wan_video_vae from "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/Wan2.1_VAE.pth".
No wan_video_image_encoder models available. This is not an error.
No wan_video_motion_controller models available. This is not an error.
Using wan_video_vace from "/home/quang/.cache/huggingface/hub/models--Wan-AI--Wan2.1-VACE-1.3B/snapshots/574e6a744642ce3bee319afc31496b88bde8aac4/diffusion_pytorch_model.safetensors".
No wan_video_vap models available. This is not an error.
No wans2v_audio_encoder models available. This is not an error.
No wan_video_animate_adapter models available. This is not an error.
0 LoRA layers are cleared.
150 tensors are fused by LoRA. Fused LoRA layers cannot be cleared by `pipe.clear_lora()`.
LoRA fused: max |delta| on vace_blocks.0.cross_attn.q = 5.463e-03
VAE encoding: 0%| | 0/9 [00:00<?, ?it/s] VAE encoding: 11%|█ | 1/9 [00:00<00:05, 1.45it/s] VAE encoding: 22%|██▏ | 2/9 [00:01<00:03, 1.97it/s] VAE encoding: 33%|███▎ | 3/9 [00:01<00:02, 2.25it/s] VAE encoding: 44%|████▍ | 4/9 [00:01<00:02, 2.49it/s] VAE encoding: 56%|█████▌ | 5/9 [00:02<00:01, 2.62it/s] VAE encoding: 67%|██████▋ | 6/9 [00:02<00:01, 2.67it/s] VAE encoding: 78%|███████▊ | 7/9 [00:02<00:00, 2.67it/s] VAE encoding: 89%|████████▉ | 8/9 [00:03<00:00, 2.74it/s] VAE encoding: 100%|██████████| 9/9 [00:03<00:00, 2.76it/s] VAE encoding: 100%|██████████| 9/9 [00:03<00:00, 2.53it/s]
VAE encoding: 0%| | 0/9 [00:00<?, ?it/s] VAE encoding: 11%|█ | 1/9 [00:00<00:02, 2.87it/s] VAE encoding: 22%|██▏ | 2/9 [00:00<00:02, 2.76it/s] VAE encoding: 33%|███▎ | 3/9 [00:01<00:02, 2.73it/s] VAE encoding: 44%|████▍ | 4/9 [00:01<00:01, 2.77it/s] VAE encoding: 56%|█████▌ | 5/9 [00:01<00:01, 2.85it/s] VAE encoding: 67%|██████▋ | 6/9 [00:02<00:01, 2.84it/s] VAE encoding: 78%|███████▊ | 7/9 [00:02<00:00, 2.84it/s] VAE encoding: 89%|████████▉ | 8/9 [00:02<00:00, 2.84it/s] VAE encoding: 100%|██████████| 9/9 [00:03<00:00, 2.83it/s] VAE encoding: 100%|██████████| 9/9 [00:03<00:00, 2.82it/s]
VAE encoding: 0%| | 0/9 [00:00<?, ?it/s] VAE encoding: 33%|███▎ | 3/9 [00:00<00:00, 24.74it/s] VAE encoding: 67%|██████▋ | 6/9 [00:00<00:00, 27.44it/s] VAE encoding: 100%|██████████| 9/9 [00:00<00:00, 26.48it/s] VAE encoding: 100%|██████████| 9/9 [00:00<00:00, 26.43it/s]
0%| | 0/30 [00:00<?, ?it/s] 3%|▎ | 1/30 [00:02<01:21, 2.81s/it] 7%|▋ | 2/30 [00:05<01:20, 2.89s/it] 10%|█ | 3/30 [00:08<01:19, 2.93s/it] 13%|█▎ | 4/30 [00:11<01:16, 2.95s/it] 17%|█▋ | 5/30 [00:14<01:14, 2.96s/it] 20%|██ | 6/30 [00:17<01:11, 2.97s/it] 23%|██▎ | 7/30 [00:20<01:08, 2.97s/it] 27%|██▋ | 8/30 [00:23<01:05, 2.97s/it] 30%|███ | 9/30 [00:26<01:02, 2.97s/it] 33%|███▎ | 10/30 [00:29<00:59, 2.98s/it] 37%|███▋ | 11/30 [00:32<00:56, 2.98s/it] 40%|████ | 12/30 [00:35<00:53, 2.98s/it] 43%|████▎ | 13/30 [00:38<00:50, 2.99s/it] 47%|████▋ | 14/30 [00:41<00:47, 2.99s/it] 50%|█████ | 15/30 [00:44<00:44, 2.99s/it] 53%|█████▎ | 16/30 [00:47<00:41, 2.98s/it] 57%|█████▋ | 17/30 [00:50<00:38, 2.99s/it] 60%|██████ | 18/30 [00:53<00:35, 2.99s/it] 63%|██████▎ | 19/30 [00:56<00:32, 2.99s/it]

Xet Storage Details

Size:
7.1 kB
·
Xet hash:
5b846708180d039038347e770c8b3adb9b6161efae156642eb220069909f53a4

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.