Update README.md
Browse files
README.md
CHANGED
|
@@ -1,50 +1 @@
|
|
| 1 |
# k2-context-rush-ofc-beta1
|
| 2 |
-
|
| 3 |
-
LoRA de edição por referência para **Krea 2** (DiT fp8-scaled, TE Qwen3-VL-4B),
|
| 4 |
-
treinada com o método `krea2_multiref_grounded` (N=1 referência) do fork
|
| 5 |
-
[diffusion-pipe-easycontrol@ic-lora](https://github.com/adbrasi/diffusion-pipe-easycontrol/tree/ic-lora).
|
| 6 |
-
|
| 7 |
-
## Método
|
| 8 |
-
|
| 9 |
-
- Sequência `[texto | target ruidoso | referência limpa]`, referência a t=0
|
| 10 |
-
- Posições RoPE da referência: width-shift
|
| 11 |
-
- LoRA rank 64 (alpha 64), condition-only routing nos 28 SingleStreamBlocks
|
| 12 |
-
- Canal semântico: grounding Qwen3-VL a 384² + txtfusion LoRA global rank 128
|
| 13 |
-
- caption_dropout 0.1 (uncond grounded per-sample para CFG)
|
| 14 |
-
- Otimizador AdamW8bitKahan, lr 1e-4, batch efetivo 4 (micro 1 × accum 4)
|
| 15 |
-
- Resolução de treino 512px, AR buckets 0.5–2.0 (7 buckets)
|
| 16 |
-
- 30.000 pares, 3 épocas = 22.500 steps, checkpoint a cada 500
|
| 17 |
-
|
| 18 |
-
## Dataset (30.000 pares A→B, subamostra seed 42 de 43.305)
|
| 19 |
-
|
| 20 |
-
| fonte | pares | conteúdo |
|
| 21 |
-
|---|---|---|
|
| 22 |
-
| recortados_dataset_captioned | 6.937 | pares _A control / _B target |
|
| 23 |
-
| parents_dataset_captioned | 4.815 | pares _A/_B |
|
| 24 |
-
| poxima_cena_v2 | 4.129 | next-scene pairs |
|
| 25 |
-
| comikontext | 4.950 | manga/comic context pairs |
|
| 26 |
-
| dataset_pares_contexto | 865 | context pairs |
|
| 27 |
-
| pico-banana-400k (subset) | 7.831 | 6 categorias: pose, add/remove, expressão, estilo, background, câmera |
|
| 28 |
-
| InScene-Dataset | 473 | same-scene cinematic pairs (completo) |
|
| 29 |
-
|
| 30 |
-
Captions originais de cada dataset, usadas como estão.
|
| 31 |
-
|
| 32 |
-
## Estrutura do repo
|
| 33 |
-
|
| 34 |
-
- `checkpoints/stepNNNN/` — adapter LoRA (`adapter_model.safetensors`) por checkpoint
|
| 35 |
-
- `samples/stepNNNN/` — 3 samples fixos gerados a cada 500 steps (turbo, 8 steps, seed 76)
|
| 36 |
-
- `sampling_inputs/` — os 3 inputs exatos do sampling (referência + prompt do dataset)
|
| 37 |
-
- `train.toml` / `dataset.toml` — configuração exata do treino
|
| 38 |
-
- `NOTES_KREA2_EDIT_SAGA.md` — notas da sessão (erros, causas, decisões)
|
| 39 |
-
|
| 40 |
-
## Inferência
|
| 41 |
-
|
| 42 |
-
```bash
|
| 43 |
-
python tools/infer_reference_adapter.py \
|
| 44 |
-
--config train.toml --adapter checkpoints/stepNNNN \
|
| 45 |
-
--reference ref.jpg --prompt "..." \
|
| 46 |
-
--width 512 --height 512 --seed 76 \
|
| 47 |
-
--turbo-lora krea2_turbo_lora_rank_64_bf16.safetensors
|
| 48 |
-
```
|
| 49 |
-
|
| 50 |
-
Treinado em 1× RTX 5090 32GB. Trainer: diffusion-pipe-easycontrol, branch ic-lora.
|
|
|
|
| 1 |
# k2-context-rush-ofc-beta1
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|