SDXS: Real-Time One-Step Latent Diffusion Models with Image Conditions
Paper • 2403.16627 • Published • 22
Export ONNX, prêt pour onnxruntime-node/onnxruntime-web, du modèle
IDKiro/sdxs-512-0.9 — utilisé par
le nœud « Texte → image » de Attic,
un studio nodal de traitement audio/créatif.
Pas de conversion officielle de ce modèle en ONNX au moment de la publication de ce dépôt : les fichiers ici sont une conversion indépendante, avec les choix documentés ci-dessous.
| Fichier | Rôle | Poids | Précision |
|---|---|---|---|
onnx/text_encoder_int8.onnx |
Encodeur de texte CLIP (OpenCLIP ViT-H, hidden_size 1024) | ~342 Mo | int8 (quantification dynamique) |
onnx/unet_int8.onnx |
UNet de diffusion (0,3 Md paramètres, 3 blocs down/up) | ~330 Mo | int8 (quantification dynamique) |
onnx/vae_decoder.onnx |
Décodeur TAESD (AutoencoderTiny, 1,2 M paramètres) |
~5 Mo | fp32 |
tokenizer/tokenizer.json + tokenizer_config.json |
Tokenizer CLIP rapide (format tokenizers/Rust) |
~3,6 Mo | — |
Total ≈ 680 Mo (à comparer aux ~4,3 Go du modèle original en fp32).
openrail++ (CreativeML Open
RAIL++-M). Cette licence autorise l'usage commercial et la redistribution
de dérivés, à condition de retransmettre les mêmes restrictions d'usage
aux utilisateurs en aval (pas de génération de contenu illégal, nuisible,
ou visant à tromper — voir le texte complet de la licence :
https://huggingface.co/spaces/CompVis/stable-diffusion-license/raw/main/license.txt).torch.onnx.export (exporteur legacy TorchScript, opset 17→18),
un composant à la fois (encodeur de texte, UNet, décodeur VAE), à partir des
poids fp32 du pipeline diffusers.text_encoder et unet quantifiés en int8 via
onnxruntime.quantization.quantize_dynamic (~4× plus petit que fp32, sans
réentraînement). Le décodeur TAESD est resté en fp32 (déjà minuscule).alpha_cumprod(999) ≈ 0.00466009508818388 ont été mesurées empiriquement en
instrumentant le scheduler PNDM de référence de diffusers, plutôt que
réimplémentées depuis la théorie — voir le code du nœud Attic
(electron/sdxs-image.cjs) pour l'implémentation JS complète.Prévu pour le nœud « Texte → image » d'Attic : téléchargez ce dépôt dans
public/oonx/sdxs-512-texte-image/ (ou tout chemin pointé par le paramètre
« Chemin modèle » du nœud). Utilisable indépendamment d'Attic avec
onnxruntime-node/onnxruntime-web (CPU) et un tokenizer CLIP compatible.
Base model
IDKiro/sdxs-512-0.9