Image-to-Video
Diffusers
Safetensors
English
Chinese
WanImageToVideoPipeline
mixture-of-experts
video-generation
vbvr
Instructions to use Video-Reason/VBVR-Pro-Wan2.2-I2V-A14B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use Video-Reason/VBVR-Pro-Wan2.2-I2V-A14B with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline from diffusers.utils import load_image, export_to_video # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("Video-Reason/VBVR-Pro-Wan2.2-I2V-A14B", dtype=torch.bfloat16, device_map="cuda") pipe.to("cuda") prompt = "A man with short gray hair plays a red electric guitar." image = load_image( "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/diffusers/guitar-man.png" ) output = pipe(image=image, prompt=prompt).frames[0] export_to_video(output, "output.mp4") - Notebooks
- Google Colab
- Kaggle
File size: 2,098 Bytes
bc824d4 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 | """VBVR-Pro-Wan2.2-I2V-A14B inference example.
Usage:
python example.py --model_path ./VBVR-Pro-Wan2.2-I2V-A14B \
--image input.png --prompt "Your video instruction"
"""
import argparse
import torch
from diffusers import AutoencoderKLWan, WanImageToVideoPipeline
from diffusers.utils import export_to_video, load_image
parser = argparse.ArgumentParser()
parser.add_argument("--model_path", type=str, default="VBVR-Pro-Wan2.2-I2V-A14B")
parser.add_argument("--image", type=str, required=True, help="Path or URL to input image")
parser.add_argument("--prompt", type=str, required=True, help="Video instruction")
parser.add_argument(
"--negative_prompt",
type=str,
default="Bright tones, overexposed, static, blurred details, subtitles, low quality",
)
parser.add_argument("--output", type=str, default="output.mp4")
parser.add_argument("--width", type=int, default=832)
parser.add_argument("--height", type=int, default=480)
parser.add_argument("--num_frames", type=int, default=81)
parser.add_argument("--steps", type=int, default=50)
parser.add_argument("--guidance_scale", type=float, default=5.0)
parser.add_argument("--fps", type=int, default=15)
parser.add_argument("--seed", type=int, default=42)
args = parser.parse_args()
print(f"Loading model from: {args.model_path}")
vae = AutoencoderKLWan.from_pretrained(
args.model_path, subfolder="vae", torch_dtype=torch.float32
)
pipe = WanImageToVideoPipeline.from_pretrained(
args.model_path, vae=vae, torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
image = load_image(args.image).convert("RGB").resize((args.width, args.height))
print(f"Input image: {args.image} ({image.size[0]}x{image.size[1]})")
frames = pipe(
image=image,
prompt=args.prompt,
negative_prompt=args.negative_prompt,
height=args.height,
width=args.width,
num_frames=args.num_frames,
num_inference_steps=args.steps,
guidance_scale=args.guidance_scale,
generator=torch.manual_seed(args.seed),
).frames[0]
export_to_video(frames, args.output, fps=args.fps)
print(f"Saved to: {args.output}")
|