File size: 2,138 Bytes
9fd4f11
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
"""VBVR-Pro-LTX2.3 image-to-audio-video inference example.

Usage:
    python example.py --model_path Video-Reason/VBVR-Pro-LTX2.3 \
        --image input.png --prompt "Your video instruction"
"""

import argparse

import torch
from diffusers import LTX2ImageToVideoPipeline
from diffusers.utils import encode_video, load_image


parser = argparse.ArgumentParser()
parser.add_argument("--model_path", type=str, default="Video-Reason/VBVR-Pro-LTX2.3")
parser.add_argument("--image", type=str, required=True, help="Path or URL to input image")
parser.add_argument("--prompt", type=str, required=True, help="Video instruction")
parser.add_argument(
    "--negative_prompt",
    type=str,
    default="blurry, low quality, flickering, motion blur, distorted",
)
parser.add_argument("--output", type=str, default="output.mp4")
parser.add_argument("--width", type=int, default=768)
parser.add_argument("--height", type=int, default=512)
parser.add_argument("--num_frames", type=int, default=49)
parser.add_argument("--steps", type=int, default=40)
parser.add_argument("--guidance_scale", type=float, default=5.0)
parser.add_argument("--fps", type=int, default=24)
parser.add_argument("--seed", type=int, default=42)
args = parser.parse_args()

print(f"Loading model from: {args.model_path}")
pipe = LTX2ImageToVideoPipeline.from_pretrained(
    args.model_path, torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

image = load_image(args.image).convert("RGB")
print(f"Input image: {args.image} ({image.size[0]}x{image.size[1]})")

video, audio = pipe(
    image=image,
    prompt=args.prompt,
    negative_prompt=args.negative_prompt,
    height=args.height,
    width=args.width,
    num_frames=args.num_frames,
    frame_rate=args.fps,
    num_inference_steps=args.steps,
    guidance_scale=args.guidance_scale,
    generator=torch.manual_seed(args.seed),
    output_type="np",
    return_dict=False,
)

encode_video(
    video[0][: args.num_frames],
    fps=args.fps,
    output_path=args.output,
    audio=audio[0].float().cpu(),
    audio_sample_rate=pipe.vocoder.config.output_sampling_rate,
)
print(f"Saved to: {args.output}")