minih33-loop-i2v / guia_comfyui.md
AdwolfCzar's picture
Upload guia_comfyui.md with huggingface_hub
b793ce8 verified
|
Raw
History Blame Contribute Delete
2.47 kB

minih33 — Guia de geração no ComfyUI

Arquivos

  • Modelo base: Comfy-Org/MiniMax-H3diffusion_models/minimax_h3_fl2va_bf16.safetensors (+ text encoder e VAEs do mesmo repo, workflow H3 padrão do ComfyUI)
  • LoRA: use a versão convertida para ComfyUI deste repo: checkpoints/comfy/minih33_quick-step00002500_comfy.safetensors (chaves diffusion_model.*; carregar com LoraLoaderModelOnly)
  • Os arquivos checkpoints/minih33_quick-step*.safetensors (sem _comfy) estão no formato musubi — servem para o musubi-tuner/inferência do fork, não para o ComfyUI.

Resoluções (importante — o H3 é sensível à área treinada)

A LoRA foi treinada em 3 áreas (multi-resolução obrigatória do H3):

Resolução Área Peso no treino
512×288 0,15 MP ~55%
640×384 0,25 MP ~28%
832×480 0,40 MP ~17%
  • Gere nessas resoluções (ou áreas próximas). Sempre múltiplos de 32.
  • O treino usou spatial density jitter 0.2 → tolerância de ~±20% de área além das treinadas.
  • Evite gerar muito acima de 832×480 (ex.: 1024×576+): área não treinada, risco de artefatos "fly-eye"/ruído. Para saída maior, gere a 832×480 e faça upscale externo.

Durações (24 fps, grid 17n+5)

Treinada com escada de durações: 56 / 73 / 90 / 124 frames — maioria em 124 frames (5,17 s).

  • Alvo ideal: 124 frames (~5 s). Também funcionam bem: 90 (3,75 s), 73 (3,04 s), 56 (2,33 s).
  • Frames válidos do H3: 5, 22, 39, 56, 73, 90, 107, 124, 141... (17n+5). O sampler faz snap.
  • Não mude o fps: o modelo é 24 fps fixo.

Modo de uso (o que a LoRA aprendeu)

  • Image-to-video (primeiro frame): task de treino foi i2va — forneça a imagem inicial no conditioning de primeiro frame do workflow H3. É o caso de uso principal.
  • Prompt no estilo das captions de treino: comece com A japanese style seamless loop animation, ... e descreva a ação/movimento desejado (veja exemplo_de_captions.txt neste repo).
  • Movimento aprendido: loops cíclicos (o movimento se repete dentro do clipe).

Parâmetros

  • Steps: 20 (modelo é CFG-distilled — 1 avaliação por step, sem negative prompt).
  • Força da LoRA: teste 0.75 / 1.0 (e 0.5 se estiver forte demais).
  • Áudio: o modelo gera trilha, mas a LoRA foi treinada video-only — o áudio vem do base.
  • Checkpoint deste guia: step 2500 do run "quick" (guidance 4 + jitter 0.2, LR 1e-4, rank 32).