Upload guia_comfyui.md with huggingface_hub
Browse files- guia_comfyui.md +45 -0
guia_comfyui.md
ADDED
|
@@ -0,0 +1,45 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# minih33 — Guia de geração no ComfyUI
|
| 2 |
+
|
| 3 |
+
## Arquivos
|
| 4 |
+
- Modelo base: `Comfy-Org/MiniMax-H3` → `diffusion_models/minimax_h3_fl2va_bf16.safetensors`
|
| 5 |
+
(+ text encoder e VAEs do mesmo repo, workflow H3 padrão do ComfyUI)
|
| 6 |
+
- LoRA: use a versão convertida para ComfyUI deste repo:
|
| 7 |
+
`checkpoints/comfy/minih33_quick-step00002500_comfy.safetensors`
|
| 8 |
+
(chaves `diffusion_model.*`; carregar com **LoraLoaderModelOnly**)
|
| 9 |
+
- Os arquivos `checkpoints/minih33_quick-step*.safetensors` (sem `_comfy`) estão no formato
|
| 10 |
+
musubi — servem para o musubi-tuner/inferência do fork, não para o ComfyUI.
|
| 11 |
+
|
| 12 |
+
## Resoluções (importante — o H3 é sensível à área treinada)
|
| 13 |
+
A LoRA foi treinada em 3 áreas (multi-resolução obrigatória do H3):
|
| 14 |
+
|
| 15 |
+
| Resolução | Área | Peso no treino |
|
| 16 |
+
|---|---|---|
|
| 17 |
+
| 512×288 | 0,15 MP | ~55% |
|
| 18 |
+
| 640×384 | 0,25 MP | ~28% |
|
| 19 |
+
| 832×480 | 0,40 MP | ~17% |
|
| 20 |
+
|
| 21 |
+
- **Gere nessas resoluções (ou áreas próximas)**. Sempre múltiplos de 32.
|
| 22 |
+
- O treino usou spatial density jitter 0.2 → tolerância de ~±20% de área além das treinadas.
|
| 23 |
+
- **Evite gerar muito acima de 832×480** (ex.: 1024×576+): área não treinada, risco de
|
| 24 |
+
artefatos "fly-eye"/ruído. Para saída maior, gere a 832×480 e faça upscale externo.
|
| 25 |
+
|
| 26 |
+
## Durações (24 fps, grid 17n+5)
|
| 27 |
+
Treinada com escada de durações: 56 / 73 / 90 / 124 frames — maioria em **124 frames (5,17 s)**.
|
| 28 |
+
|
| 29 |
+
- **Alvo ideal: 124 frames** (~5 s). Também funcionam bem: 90 (3,75 s), 73 (3,04 s), 56 (2,33 s).
|
| 30 |
+
- Frames válidos do H3: 5, 22, 39, 56, 73, 90, 107, 124, 141... (17n+5). O sampler faz snap.
|
| 31 |
+
- Não mude o fps: o modelo é 24 fps fixo.
|
| 32 |
+
|
| 33 |
+
## Modo de uso (o que a LoRA aprendeu)
|
| 34 |
+
- **Image-to-video (primeiro frame)**: task de treino foi i2va — forneça a imagem inicial
|
| 35 |
+
no conditioning de primeiro frame do workflow H3. É o caso de uso principal.
|
| 36 |
+
- Prompt no estilo das captions de treino: comece com
|
| 37 |
+
`A japanese style seamless loop animation, ...` e descreva a ação/movimento desejado
|
| 38 |
+
(veja `exemplo_de_captions.txt` neste repo).
|
| 39 |
+
- Movimento aprendido: loops cíclicos (o movimento se repete dentro do clipe).
|
| 40 |
+
|
| 41 |
+
## Parâmetros
|
| 42 |
+
- Steps: **20** (modelo é CFG-distilled — 1 avaliação por step, sem negative prompt).
|
| 43 |
+
- Força da LoRA: teste **0.75 / 1.0** (e 0.5 se estiver forte demais).
|
| 44 |
+
- Áudio: o modelo gera trilha, mas a LoRA foi treinada video-only — o áudio vem do base.
|
| 45 |
+
- Checkpoint deste guia: step 2500 do run "quick" (guidance 4 + jitter 0.2, LR 1e-4, rank 32).
|