krea2-nvfp4-rig

Startfertiges Setup, um Krea 2 Turbo in NVFP4 auf einer gemieteten Blackwell-Karte (RTX 50xx) zu testen β€” mit dem ilore-Style-LoRA.

Zweck: messen, wie viel NVFP4 gegenueber FP8 bringt und ob das LoRA die 4-Bit-Quantisierung unbeschadet uebersteht.

Was hier liegt

Pfad Inhalt
lora/ilore_style_krea2_1000.safetensors Style-LoRA, Checkpoint 1000 (empfohlen)
lora/ilore_style_krea2_1250.safetensors Checkpoint 1250, zum Gegenvergleich
scripts/setup.sh Installiert ComfyUI + comfy-kitchen, laedt Modelle, startet Server
scripts/download_models.py Parallel-Download aller Komponenten von HF
scripts/bench.py Misst NVFP4 vs FP8, je mit/ohne LoRA
scripts/onstart.sh Einstiegspunkt fuer das vast.ai-Template
workflows/krea2_nvfp4_ilore.json ComfyUI-Workflow mit LoRA-Node

Die Modelle liegen bewusst nicht hier. Sie kommen direkt von Comfy-Org/Krea-2 β€” das ist von der Instanz aus um Groessenordnungen schneller als ein Upload von zuhause.

Komponente Groesse
krea2_turbo_nvfp4.safetensors 7,67 GB
qwen3vl_4b_fp8_scaled.safetensors 5,24 GB
qwen_image_vae.safetensors 0,25 GB
(Vergleichsvariante krea2_turbo_fp8_scaled) 13,14 GB

Der NVFP4-Stack braucht 13,16 GB und passt damit komplett in die 16 GB einer 5080. Der FP8-Stack (18,63 GB) tut das nicht.

Voraussetzungen an die Instanz

  • Blackwell-GPU (RTX 50xx / RTX PRO) β€” NVFP4 laeuft auf nichts anderem
  • CUDA 13.0+ β€” comfy-kitchen setzt das fuer die NVFP4-Kernel voraus
  • mind. 60 GB Disk

Token

Dieses Repo ist privat, die Instanz braucht also einen Lesezugriff. Kein Account-weiter Token β€” auf HuggingFace unter Settings β†’ Access Tokens einen fine-grained Token anlegen, der nur Read auf genau dieses Repository darf. Faellt die Mietinstanz in falsche Haende, ist der Schaden damit auf ein LoRA begrenzt.

Im vast-Template unter Environment als HF_TOKEN hinterlegen.

Ablauf

Automatisch ueber onstart.sh, oder von Hand:

export HF_TOKEN=hf_...
bash scripts/setup.sh          # laeuft bis ComfyUI auf :8188 lauscht

Danach den Web-Port der Instanz oeffnen (vast zeigt ihn unter Open an) und workflows/krea2_nvfp4_ilore.json in die Oberflaeche ziehen.

Messung:

python scripts/bench.py --runs 5 --size 1024x1024
python scripts/bench.py --runs 5 --size 680x1024   # Portrait-Format

Sampler-Werte

Krea 2 Turbo ist distilliert: 8 Steps, CFG 1,0, er_sde / simple. Der Negativ-Zweig laeuft ueber ConditioningZeroOut β€” ein echter Negativprompt hat hier keine Wirkung.

Was gegengeprueft werden muss

Ob das LoRA in NVFP4 identisch wirkt, ist nicht belegt. Die Quelle bestaetigt nur, dass LoRAs vom Raw-Basismodell gut auf Turbo uebertragen. Also: dieselben Motive mit gleichem Seed in FP8 und NVFP4 erzeugen und nebeneinanderlegen β€” besonders auf die Pinselstruktur und das Ausfransen des Torsos achten, das sind die Merkmale, die dieses LoRA ausmachen.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support