| # minih33 — Guia de geração no ComfyUI |
|
|
| ## Arquivos |
| - Modelo base: `Comfy-Org/MiniMax-H3` → `diffusion_models/minimax_h3_fl2va_bf16.safetensors` |
| (+ text encoder e VAEs do mesmo repo, workflow H3 padrão do ComfyUI) |
| - LoRA: use a versão convertida para ComfyUI deste repo: |
| `checkpoints/comfy/minih33_quick-step00002500_comfy.safetensors` |
| (chaves `diffusion_model.*`; carregar com **LoraLoaderModelOnly**) |
| - Os arquivos `checkpoints/minih33_quick-step*.safetensors` (sem `_comfy`) estão no formato |
| musubi — servem para o musubi-tuner/inferência do fork, não para o ComfyUI. |
|
|
| ## Resoluções (importante — o H3 é sensível à área treinada) |
| A LoRA foi treinada em 3 áreas (multi-resolução obrigatória do H3): |
|
|
| | Resolução | Área | Peso no treino | |
| |---|---|---| |
| | 512×288 | 0,15 MP | ~55% | |
| | 640×384 | 0,25 MP | ~28% | |
| | 832×480 | 0,40 MP | ~17% | |
|
|
| - **Gere nessas resoluções (ou áreas próximas)**. Sempre múltiplos de 32. |
| - O treino usou spatial density jitter 0.2 → tolerância de ~±20% de área além das treinadas. |
| - **Evite gerar muito acima de 832×480** (ex.: 1024×576+): área não treinada, risco de |
| artefatos "fly-eye"/ruído. Para saída maior, gere a 832×480 e faça upscale externo. |
|
|
| ## Durações (24 fps, grid 17n+5) |
| Treinada com escada de durações: 56 / 73 / 90 / 124 frames — maioria em **124 frames (5,17 s)**. |
|
|
| - **Alvo ideal: 124 frames** (~5 s). Também funcionam bem: 90 (3,75 s), 73 (3,04 s), 56 (2,33 s). |
| - Frames válidos do H3: 5, 22, 39, 56, 73, 90, 107, 124, 141... (17n+5). O sampler faz snap. |
| - Não mude o fps: o modelo é 24 fps fixo. |
|
|
| ## Modo de uso (o que a LoRA aprendeu) |
| - **Image-to-video (primeiro frame)**: task de treino foi i2va — forneça a imagem inicial |
| no conditioning de primeiro frame do workflow H3. É o caso de uso principal. |
| - Prompt no estilo das captions de treino: comece com |
| `A japanese style seamless loop animation, ...` e descreva a ação/movimento desejado |
| (veja `exemplo_de_captions.txt` neste repo). |
| - Movimento aprendido: loops cíclicos (o movimento se repete dentro do clipe). |
|
|
| ## Parâmetros |
| - Steps: **20** (modelo é CFG-distilled — 1 avaliação por step, sem negative prompt). |
| - Força da LoRA: teste **0.75 / 1.0** (e 0.5 se estiver forte demais). |
| - Áudio: o modelo gera trilha, mas a LoRA foi treinada video-only — o áudio vem do base. |
| - Checkpoint deste guia: step 2500 do run "quick" (guidance 4 + jitter 0.2, LR 1e-4, rank 32). |
|
|