diffsynth / README_zh.md
ymyy307's picture
Upload folder using huggingface_hub
5a5e271 verified
|
Raw
History Blame Contribute Delete
146 kB

DiffSynth-Studio

modelscope%2FDiffSynth-Studio | Trendshift

PyPI license open issues GitHub pull-requests GitHub latest commit Discord

Switch to English

简介

欢迎来到 Diffusion 模型的魔法世界!DiffSynth-Studio 是由魔搭社区团队开发和维护的开源 Diffusion 模型引擎。我们期望以框架建设孵化技术创新,凝聚开源社区的力量,探索生成式模型技术的丰富能力!

框架功能:

  • 模型支持:框架集成了主流的开源 Diffusion 模型,涵盖图像生成、视频生成、音频生成,以及图像指标模型。
  • 显存管理:在硬盘、内存、显存之间动态调度模型参数,让低显存的消费级 GPU 也能运行大模型的推理。
  • 参数量化:将模型参数转换为 NF4、INT8 等量化精度,大幅减少模型推理和 LoRA 模型训练的显存需求。
  • 任意训练:几乎所有支持推理的模型都支持训练,无论是基础模型、LoRA,还是任何带有额外输入的 Adapter 模型。
  • 拆分训练:使用计算图推理引擎追踪 Pipeline 中每个变量,将训练过程拆分为两阶段,高效训练。

参考资料:

查看更多:

更新历史

DiffSynth-Studio 经历了大版本更新,部分旧功能已停止维护,如需使用旧版功能,请切换到大版本更新前的最后一个历史版本

目前本项目的开发人员有限,大部分工作由 Artiprochermi804 负责,因此新功能的开发进展会比较缓慢,issue 的回复和解决速度有限,我们对此感到非常抱歉,请各位开发者理解。

  • 2026年8月31日 我们接入了 Qwen-Video-Edit,这是开源社区用户 yunpeng1998 基于图像编辑模型 Qwen-Image-Edit 训练的视频编辑模型,是探索模型能力拓展的优秀案例。

  • 2026年8月25日 我们开源了 DiffSynth-WebUI,一键私有化部署 LoRA 训练服务,与模型参数量化功能结合,用消费级 GPU 也能训练超大模型。

  • 2026年8月19日 我们发布了模型量化功能。它提供了统一的 QuantizeConfig 入口,支持 bitsandbytes、torchao、comfy-kitchen 等多种量化后端,具备在线量化、加载预量化权重、混合量化、保存量化模型、量化 + LoRA 训练等能力。详情请参考文档

  • 2026年8月17日 MiniMax-Music3 开源,欢迎加入音频生成模型家族!支持文生音乐推理和低显存推理能力。详情请参考文档示例代码

  • 2026年8月7日 我们为 Wan 系列新增了 Wan-Animate-2,输入一张参考图和一段驱动视频,即可让参考角色演绎驱动视频中的动作,生成高质量角色动画,包含标准与蒸馏两个变体。详情请参考文档示例代码

  • 2026年8月3日 MiniMax-H3 开源,欢迎加入视频生成模型家族!支持文生音视频、首尾帧引导生成、参考驱动生成、低显存推理以及 NF4 量化推理。详情请参考文档示例代码

  • 2026年7月28日 LingBot-Video 开源,欢迎加入视频生成模型家族!本次开源包含 Dense-1.3B 和 MoE-30B-A3B 两个版本(MoE 版总参数量 30B、每个 token 激活约 3B),均支持文生视频、图生视频、文生图推理、低显存推理以及 LoRA / 全量训练能力。详情请参考文档示例代码。特别感谢 NancyFyong 贡献了本模型的接入代码!

  • 2026年7月21日 我们开源了 DiffSynth-Studio Model Integration Skills。这是一套可组合的 Agent Skill 合集,将外部扩散模型接入 DiffSynth-Studio 的全流程自动化,大幅提升模型接入标准化程度与效率。从使用示例开始体验吧!

更多
  • 2026年6月29日 Boogu-Image 开源,已支持文生图推理、图像编辑、低显存推理和训练能力。详情请参考文档示例代码

  • 2026年6月24日 Krea-2 开源,我们已提供全面支持。详情请参考文档示例代码

  • 2026年6月16日 我们为 ACE-Step 新增了 Template 模型:vocals2music。详情请参考文档示例代码

  • 2026年6月15日 我们开源了 Image-to-LoRA V2,将动辄数小时的图像风格 LoRA 训练压缩到一次模型推理中,探索 LoRA 模型训练的新方式。技术报告已公开,本次开源包括三个模型:

  • 2026年6月5日 Ideogram 4 开源,已支持文生图推理。详情请参考文档示例代码

  • 2026年5月21日 新增图像质量评估模型的支持,包括 FID、CLIP、Aesthetic、PickScore、ImageReward、HPSv2、HPSv3,详情请参考文档示例代码

  • 2026年5月18日 新增 CPU Offload Training 功能,通过将模型权重逐层在 CPU 与 GPU 之间搬运,大幅降低训练时的 GPU 显存占用,让消费级显卡也能进行大模型 LoRA 训练,适配所有模型。只需在训练命令中添加 --enable_model_cpu_offload 即可启用(当前仅支持单卡训练)。详情请参考文档

  • 2026年5月14日 HiDream-O1-Image 开源,欢迎加入图像生成模型家族!支持文生图推理、图像编辑推理、低显存推理和训练能力。详情请参考文档示例代码

  • 2026年4月28日 我们发布了 Diffusion Templates,面向 Diffusion 模型的插件框架,大幅降低了可控生成模型的训练门槛,一起来探索新奇的技术吧!

  • 2026年4月27日 我们支持了 ACE-Step-1.5!包括文生音乐推理、低显存推理和 LoRA 训练能力。详情请参考文档示例代码

  • 2026年4月27日 我们重新支持了模型 Stable Diffusion v1.5 和 SDXL,仅对这两类模型提供学术科研支持。

  • 2026年4月14日 JoyAI-Image 开源,欢迎加入图像编辑模型家族!支持指令引导的图像编辑推理、低显存推理和训练能力。详情请参考文档示例代码

  • 2026年3月19日 新增对 openmoss/MOVA-720popenmoss/MOVA-360p 模型的支持,包括完整的训练和推理功能。文档示例代码现已可用。

  • 2026年3月12日 我们新增了 LTX-2.3 音视频生成模型的支持,模型支持的功能包括文生音视频、图生音视频、IC-LoRA控制、音频生视频、音视频局部Inpainting,框架支持完整的推理和训练功能。详细信息请参考 文档示例代码

  • 2026年3月3日 我们发布了 DiffSynth-Studio/Qwen-Image-Layered-Control-V2 模型,这是 Qwen-Image-Layered-Control 的更新版本。除了原本就支持的文本引导功能,新增了画笔控制的图层拆分能力。

  • 2026年3月2日 新增对Anima的支持,详见文档。这是一个有趣的动漫风格图像生成模型,我们期待其后续的模型更新。

  • 2026年2月26日 新增对LTX-2音视频生成模型全量微调与LoRA训练支持,详见文档

  • 2026年2月10日 新增对LTX-2音视频生成模型的推理支持,详见文档,后续将推进模型训练的支持。

  • 2026年2月2日 Research Tutorial 的第一篇文档上线,带你从零开始训练一个 0.1B 的小型文生图模型,详见文档模型,我们希望 DiffSynth-Studio 能够成为一个更强大的 Diffusion 模型训练框架。

  • 2026年1月27日 Z-Image 发布,我们的 Z-Image-i2L 模型同步发布,在魔搭创空间可直接体验,详见文档

  • 2026年1月19日 新增对 FLUX.2-klein-4BFLUX.2-klein-9B 模型的支持,包括完整的训练和推理功能。文档示例代码现已可用。

  • 2026年1月12日 我们训练并开源了一个文本引导的图层拆分模型(模型链接),这一模型输入一张图与一段文本描述,模型会将图像中与文本描述相关的图层拆分出来。更多细节请阅读我们的 blog(中文版英文版)。

  • 2025年12月24日 我们基于 Qwen-Image-Edit-2511 训练了一个 In-Context Editing LoRA 模型(模型链接),这个模型可以输入三张图:图A、图B、图C,模型会自行分析图A到图B的变化,并将这样的变化应用到图C,生成图D。更多细节请阅读我们的 blog(中文版英文版)。

  • 2025年12月9日 我们基于 DiffSynth-Studio 2.0 训练了一个疯狂的模型:Qwen-Image-i2L(Image to LoRA)。这一模型以图像为输入,以 LoRA 为输出。尽管这个版本的模型在泛化能力、细节保持能力等方面还有很大改进空间,我们将这些模型开源,以启发更多创新性的研究工作。更多细节,请参考我们的 blog

  • 2025年12月4日 DiffSynth-Studio 2.0 发布!众多新功能上线

    • 文档上线:我们的文档还在持续优化更新中
    • 显存管理模块升级,支持 Layer 级别的 Disk Offload,同时释放内存与显存
    • 新模型支持
    • 训练框架升级
      • 拆分训练:支持自动化地将训练过程拆分为数据处理和训练两阶段(即使训练的是 ControlNet 或其他任意模型),在数据处理阶段进行文本编码、VAE 编码等不需要梯度回传的计算,在训练阶段处理其他计算。速度更快,显存需求更少。
      • 差分 LoRA 训练:这是我们曾在 ArtAug 中使用的训练技术,目前已可用于任意模型的 LoRA 训练。
      • FP8 训练:FP8 在训练中支持应用到任意非训练模型,即梯度关闭或者梯度仅影响 LoRA 权重的模型。
  • 2025年11月4日 支持了 ByteDance/Video-As-Prompt-Wan2.1-14B 模型,该模型基于 Wan 2.1 训练,支持根据参考视频生成相应的动作。

  • 2025年10月30日 支持了 meituan-longcat/LongCat-Video 模型,该模型支持文生视频、图生视频、视频续写。这个模型在本项目中沿用 Wan 的框架进行推理和训练。

  • 2025年10月27日 支持了 krea/krea-realtime-video 模型,Wan 模型生态再添一员。

  • 2025年9月23日 DiffSynth-Studio/Qwen-Image-EliGen-Poster 发布!本模型由我们与淘天体验设计团队联合研发并开源。模型基于 Qwen-Image 构建,专为电商海报场景设计,支持精确的分区布局控制。 请参考我们的示例代码

  • 2025年9月9日 我们的训练框架支持了多种训练模式,目前已适配 Qwen-Image,除标准 SFT 训练模式外,已支持 Direct Distill,请参考我们的示例代码。这项功能是实验性的,我们将会继续完善已支持更全面的模型训练功能。

  • 2025年8月28日 我们支持了Wan2.2-S2V,一个音频驱动的电影级视频生成模型。请参见./examples/wanvideo/

  • 2025年8月21日 DiffSynth-Studio/Qwen-Image-EliGen-V2 发布!相比于 V1 版本,训练数据集变为 Qwen-Image-Self-Generated-Dataset,因此,生成的图像更符合 Qwen-Image 本身的图像分布和风格。 请参考我们的示例代码

  • 2025年8月21日 我们开源了 DiffSynth-Studio/Qwen-Image-In-Context-Control-Union 结构控制 LoRA 模型,采用 In Context 的技术路线,支持多种类别的结构控制条件,包括 canny, depth, lineart, softedge, normal, openpose。 请参考我们的示例代码

  • 2025年8月20日 我们开源了 DiffSynth-Studio/Qwen-Image-Edit-Lowres-Fix 模型,提升了 Qwen-Image-Edit 对低分辨率图像输入的编辑效果。请参考我们的示例代码

  • 2025年8月19日 Qwen-Image-Edit 开源,欢迎图像编辑模型新成员!

  • 2025年8月18日 我们训练并开源了 Qwen-Image 的图像重绘 ControlNet 模型 DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Inpaint,模型结构采用了轻量化的设计,请参考我们的示例代码

  • 2025年8月15日 我们开源了 Qwen-Image-Self-Generated-Dataset 数据集。这是一个使用 Qwen-Image 模型生成的图像数据集,共包含 160,000 张1024 x 1024图像。它包括通用、英文文本渲染和中文文本渲染子集。我们为每张图像提供了图像描述、实体和结构控制图像的标注。开发者可以使用这个数据集来训练 Qwen-Image 模型的 ControlNet 和 EliGen 等模型,我们旨在通过开源推动技术发展!

  • 2025年8月13日 我们训练并开源了 Qwen-Image 的 ControlNet 模型 DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Depth,模型结构采用了轻量化的设计,请参考我们的示例代码

  • 2025年8月12日 我们训练并开源了 Qwen-Image 的 ControlNet 模型 DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Canny,模型结构采用了轻量化的设计,请参考我们的示例代码

  • 2025年8月11日 我们开源了 Qwen-Image 的蒸馏加速模型 DiffSynth-Studio/Qwen-Image-Distill-LoRA,沿用了与 DiffSynth-Studio/Qwen-Image-Distill-Full 相同的训练流程,但模型结构修改为了 LoRA,因此能够更好地与其他开源生态模型兼容。

  • 2025年8月7日 我们开源了 Qwen-Image 的实体控制 LoRA 模型 DiffSynth-Studio/Qwen-Image-EliGen。Qwen-Image-EliGen 能够实现实体级可控的文生图。技术细节请参见论文。训练数据集:EliGenTrainSet

  • 2025年8月5日 我们开源了 Qwen-Image 的蒸馏加速模型 DiffSynth-Studio/Qwen-Image-Distill-Full,实现了约 5 倍加速。

  • 2025年8月4日 Qwen-Image 开源,欢迎图像生成模型家族新成员!

  • 2025年8月1日 FLUX.1-Krea-dev 开源,这是一个专注于美学摄影的文生图模型。我们第一时间提供了全方位支持,包括低显存逐层 offload、LoRA 训练、全量训练。详细信息请参考 ./examples/flux/

  • 2025年7月28日 Wan 2.2 开源,我们第一时间提供了全方位支持,包括低显存逐层 offload、FP8 量化、序列并行、LoRA 训练、全量训练。详细信息请参考 ./examples/wanvideo/

  • 2025年7月11日 我们提出 Nexus-Gen,一个将大语言模型(LLM)的语言推理能力与扩散模型的图像生成能力相结合的统一框架。该框架支持无缝的图像理解、生成和编辑任务。

  • 2025年6月15日 ModelScope 官方评测框架 EvalScope 现已支持文生图生成评测。请参考最佳实践指南进行尝试。

  • 2025年3月25日 我们的新开源项目 DiffSynth-Engine 现已开源!专注于稳定的模型部署,面向工业界,提供更好的工程支持、更高的计算性能和更稳定的功能。

  • 2025年3月31日 我们支持 InfiniteYou,一种用于 FLUX 的人脸特征保留方法。更多细节请参考 ./examples/InfiniteYou/

  • 2025年3月13日 我们支持 HunyuanVideo-I2V,即腾讯开源的 HunyuanVideo 的图像到视频生成版本。更多细节请参考 ./examples/HunyuanVideo/

  • 2025年2月25日 我们支持 Wan-Video,这是阿里巴巴开源的一系列最先进的视频合成模型。详见 ./examples/wanvideo/

  • 2025年2月17日 我们支持 StepVideo!先进的视频合成模型!详见 ./examples/stepvideo

  • 2024年12月31日 我们提出 EliGen,一种用于精确实体级别控制的文本到图像生成的新框架,并辅以修复融合管道,将其能力扩展到图像修复任务。EliGen 可以无缝集成现有的社区模型,如 IP-Adapter 和 In-Context LoRA,提升其通用性。更多详情,请见 ./examples/EntityControl

  • 2024年12月19日 我们为 HunyuanVideo 实现了高级显存管理,使得在 24GB 显存下可以生成分辨率为 129x720x1280 的视频,或在仅 6GB 显存下生成分辨率为 129x512x384 的视频。更多细节请参考 ./examples/HunyuanVideo/

  • 2024年12月18日 我们提出 ArtAug,一种通过合成-理解交互来改进文生图模型的方法。我们以 LoRA 格式为 FLUX.1-dev 训练了一个 ArtAug 增强模块。该模型将 Qwen2-VL-72B 的美学理解融入 FLUX.1-dev,从而提升了生成图像的质量。

  • 2024年10月25日 我们提供了广泛的 FLUX ControlNet 支持。该项目支持许多不同的 ControlNet 模型,并且可以自由组合,即使它们的结构不同。此外,ControlNet 模型兼容高分辨率优化和分区控制技术,能够实现非常强大的可控图像生成。详见 ./examples/ControlNet/

  • 2024年10月8日 我们发布了基于 CogVideoX-5B 和 ExVideo 的扩展 LoRA。您可以从 ModelScopeHuggingFace 下载此模型。

  • 2024年8月22日 本项目现已支持 CogVideoX-5B。详见 此处。我们为这个文生视频模型提供了几个有趣的功能,包括:

    • 文本到视频
    • 视频编辑
    • 自我超分
    • 视频插帧
  • 2024年8月22日 我们实现了一个有趣的画笔功能,支持所有文生图模型。现在,您可以在 AI 的辅助下使用画笔创作惊艳的图像了!

    • 在我们的 WebUI 中使用它。
  • 2024年8月21日 DiffSynth-Studio 现已支持 FLUX。

    • 启用 CFG 和高分辨率修复以提升视觉质量。详见 此处
    • LoRA、ControlNet 和其他附加模型将很快推出。
  • 2024年6月21日 我们提出 ExVideo,一种旨在增强视频生成模型能力的后训练微调技术。我们将 Stable Video Diffusion 进行了扩展,实现了长达 128 帧的长视频生成。

  • 2024年6月13日 DiffSynth Studio 已迁移至 ModelScope。开发团队也从“我”转变为“我们”。当然,我仍会参与后续的开发和维护工作。

  • 2024年1月29日 我们提出 Diffutoon,这是一个出色的卡通着色解决方案。

    • 项目页面
    • 源代码已在此项目中发布。
    • 技术报告(IJCAI 2024)已发布于 arXiv
  • 2023年12月8日 我们决定启动一个新项目,旨在释放扩散模型的潜力,尤其是在视频合成方面。该项目的开发工作正式开始。

  • 2023年11月15日 我们提出 FastBlend,一种强大的视频去闪烁算法。

  • 2023年10月1日 我们发布了该项目的早期版本,名为 FastSDXL。这是构建一个扩散引擎的初步尝试。

    • 源代码已发布于 GitHub
    • FastSDXL 包含一个可训练的 OLSS 调度器,以提高效率。
      • OLSS 的原始仓库位于 此处
      • 技术报告(CIKM 2023)已发布于 arXiv
      • 演示视频已发布于 Bilibili
      • 由于 OLSS 需要额外训练,我们未在本项目中实现它。
  • 2023年8月29日 我们提出 DiffSynth,一个视频合成框架。

安装

从源码安装(推荐):

git clone https://github.com/modelscope/DiffSynth-Studio.git
cd DiffSynth-Studio
pip install -e .

更多安装方式,以及非 NVIDIA GPU 的安装,请参考安装文档

下载源配置

在进行模型推理和训练前,可通过环境变量配置模型下载源等。

本项目默认从魔搭社区下载模型。对于非中国区域的用户,可以通过以下配置从魔搭社区国际站下载模型:

export MODELSCOPE_ENDPOINT=https://modelscope.ai

如需从 HuggingFace 下载模型,请修改环境变量,注意不同模型平台上的模型 ID 可能不同:

export DIFFSYNTH_DOWNLOAD_SOURCE="huggingface"

基础框架

DiffSynth-Studio 作为基础的模型框架,为主流 Diffusion 模型重新设计了推理和训练流水线,能够实现高效的显存管理、灵活的模型训练。

快速开始,体验热门和最新模型:

基础架构 模型 ID 推理 低显存推理 全量训练 全量训练后验证 LoRA 训练 LoRA 训练后验证
MiniMax-H3 MiniMax/MiniMax-H3: FL2VA code code code code code code
MiniMax-H3 DiffSynth-Studio/MiniMax-H3-NF4: FL2VA pruned code code - - code code
ACE-Step ACE-Step/acestep-v15-xl-sft code code code code code code
Z-Image Tongyi-MAI/Z-Image-Turbo code code code code code code
Krea-2 krea/Krea-2-Raw code code code code code code
Krea-2 krea/Krea-2-Turbo code code code code code code

模型一览:

查看全部支持的模型

创新成果

我们相信,一个完善的开源代码框架能够降低技术探索的门槛,我们基于这个代码库搞出了不少有意思的技术。或许你也有许多天马行空的构想,借助 DiffSynth-Studio,你可以快速实现这些想法。

TreeAdapter: 由结构化 LoRA 组建的模型系统

用 1w+ LoRA 组成的模型系统挑战上万个稀有物种的精准生成。

Image

Image-to-LoRA: 把模型训练压缩到模型推理中

真正的 Meta Learning:模型一端输入图像数据集,另一端直接输出训出来的 LoRA 模型。

输入样例1 输出样例1 输入样例2 输出样例2
Image Image Image Image
Diffusion-Templates: 插件化的可控生成框架

一个框架,让每一种可控生成能力都成为插件,让多个模型组合涌现出丰富生成能力。

参考图 局部编辑 风格迁移 清晰度增强
SES: 用于奖励对齐图像生成的高效推理阶段缩放

以推理时间为代价,提高生成内容的质量。

FLUX.1-dev FLUX.1-dev + SES Qwen-Image Qwen-Image + SES
Image Image Image Image
VIRAL:基于DiT模型的类比视觉上下文推理

根据图1到图2的变化把图3转化为图4,图像编辑模型的能力涌现。

Example 1 Example 2 Query Output
Image Image Image Image
AttriCtrl: 图像生成模型的属性强度控制

用数值属性也能精准地控制图像生成模型。

brightness scale = 0.1 brightness scale = 0.3 brightness scale = 0.5 brightness scale = 0.7 brightness scale = 0.9
Image Image Image Image Image
AutoLoRA: 自动化的 LoRA 检索和融合

LoRA 是需求和解决方案一体化的产物,如何更好地利用这些 LoRA?

Nexus-Gen: 统一架构的图像理解、生成、编辑

如果一个模型集齐图像理解、图像生成、图像编辑能力,会发生什么?

ArtAug: 图像生成模型的美学提升

一个 LoRA,大幅提升细节和美感。

FLUX.1-dev FLUX.1-dev + ArtAug LoRA
image_1_base image_1_enhance
EliGen: 精准的图像分区控制

如何用分区图层控制画面内容的位置?

实体控制区域 生成图像
eligen_example_2_mask_0 eligen_example_2_0
ExVideo: 视频生成模型的扩展训练

如果视频生成模型只能生成 25 帧,如何才能让它生成更长视频?

https://github.com/modelscope/DiffSynth-Studio/assets/35051019/d97f6aa9-8064-4b5b-9d49-ed6001bb9acc

Diffutoon: 高分辨率动漫风格视频渲染

我管你这那的,我就是喜欢二次元!

注意:Diffutoon 示例来自 2.0 之前的代码库,目前不包含在 main 分支中。请将上面的旧版本代码与对应版本的 DiffSynth-Studio 一起使用。

https://github.com/Artiprocher/DiffSynth-Studio/assets/35051019/b54c05c5-d747-4709-be5e-b39af82404dd

DiffSynth: 本项目的初代版本

在没有视频生成模型的时代,如何利用图像生成模型处理视频?

https://github.com/Artiprocher/DiffSynth-Studio/assets/35051019/59fb2f7b-8de0-4481-b79f-0c3a7361a1ea

联系我们

全部支持的模型

基础架构 模型 ID 推理 低显存推理 全量训练 全量训练后验证 LoRA 训练 LoRA 训练后验证
MiniMax-Music3 MiniMax/MiniMax-Music3 code code
MiniMax-H3 MiniMax/MiniMax-H3: FL2VA code code code code code code
MiniMax-H3 MiniMax/MiniMax-H3: Ref2VA code code code code code code
MiniMax-H3 MiniMax/MiniMax-H3: Retake code code - - - -
MiniMax-H3 DiffSynth-Studio/MiniMax-H3-NF4: FL2VA code code - - code code
MiniMax-H3 DiffSynth-Studio/MiniMax-H3-NF4: Ref2VA code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: FL2VA pruned code code code code code code
MiniMax-H3 Comfy-Org/MiniMax-H3: Ref2VA pruned code code code code code code
MiniMax-H3 DiffSynth-Studio/MiniMax-H3-NF4: FL2VA pruned code code - - code code
MiniMax-H3 DiffSynth-Studio/MiniMax-H3-NF4: Ref2VA pruned code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: FL2VA int8_convrot code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: Ref2VA int8_convrot code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: FL2VA pruned int8_convrot code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: Ref2VA pruned int8_convrot code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: FL2VA pruned fp8 code code - - code code
MiniMax-H3 Comfy-Org/MiniMax-H3: Ref2VA pruned fp8 code code - - code code
MiniMax-H3 lightx2v/Minimax-h3-Turbo: FL2VA 4steps code code - - - -
MiniMax-H3 DiffSynth-Studio/MiniMax-H3-Text-Embeddings code code code code - -
LingBot-Video Robbyant/lingbot-video-dense-1.3b: T2V code code code code code code
LingBot-Video Robbyant/lingbot-video-dense-1.3b: TI2V code code code code code code
LingBot-Video Robbyant/lingbot-video-dense-1.3b: T2I code code - - - -
LingBot-Video Robbyant/lingbot-video-moe-30b-a3b: T2V code code code code code code
LingBot-Video Robbyant/lingbot-video-moe-30b-a3b: TI2V code code code code code code
LingBot-Video Robbyant/lingbot-video-moe-30b-a3b: T2I code code - - - -
LingBot-Video Robbyant/lingbot-video-moe-30b-a3b: T2V + Refinement code code - - - -
LingBot-Video Robbyant/lingbot-video-moe-30b-a3b: TI2V + Refinement code code - - - -
ACE-Step ACE-Step/Ace-Step1.5 code code code code code code
ACE-Step ACE-Step/acestep-v15-turbo-shift1 code code code code code code
ACE-Step ACE-Step/acestep-v15-turbo-shift3 code code code code code code
ACE-Step ACE-Step/acestep-v15-turbo-continuous code code code code code code
ACE-Step ACE-Step/acestep-v15-base code code code code code code
ACE-Step ACE-Step/acestep-v15-base: CoverTask code code
ACE-Step ACE-Step/acestep-v15-base: RepaintTask code code
ACE-Step ACE-Step/acestep-v15-sft code code code code code code
ACE-Step ACE-Step/acestep-v15-xl-base code code code code code code
ACE-Step ACE-Step/acestep-v15-xl-sft code code code code code code
ACE-Step ACE-Step/acestep-v15-xl-turbo code code code code code code
ACE-Step DiffSynth-Studio/acestep15xlsft-lora-music code code code code - -
Boogu-Image Boogu/Boogu-Image-0.1-Base code code code code code code
Boogu-Image Boogu/Boogu-Image-0.1-Turbo code code code code code code
Boogu-Image Boogu/Boogu-Image-0.1-Edit code code code code code code
Krea-2 krea/Krea-2-Raw code code code code code code
Krea-2 krea/Krea-2-Turbo code code code code code code
Ideogram 4 ideogram-ai/ideogram-4-fp8 code - - - - -
Ideogram 4 DiffSynth-Studio/ideogram-4-bf16-repackage code code code - code code
HiDream-O1-Image HiDream-ai/HiDream-O1-Image code code code code code code
HiDream-O1-Image HiDream-ai/HiDream-O1-Image-Dev code code code code code code
HiDream-O1-Image DiffSynth-Studio/HidreamO1-i2L-v2 code code code code - -
JoyAI-Image jd-opensource/JoyAI-Image-Edit code code code code code code
ERNIE-Image PaddlePaddle/ERNIE-Image code code code code code code
ERNIE-Image PaddlePaddle/ERNIE-Image-Turbo code code
LTX-2 jd-opensource/JoyAI-Echo code code code code code code
LTX-2 Lightricks/LTX-2.3: OneStagePipeline-I2AV code code code code code code
LTX-2 Lightricks/LTX-2.3: TwoStagePipeline-I2AV code code - - - -
LTX-2 Lightricks/LTX-2.3: DistilledPipeline-I2AV code code - - - -
LTX-2 Lightricks/LTX-2.3: OneStagePipeline-T2AV code code code code code code
LTX-2 Lightricks/LTX-2.3: TwoStagePipeline-T2AV code code - - - -
LTX-2 Lightricks/LTX-2.3: DistilledPipeline-T2AV code code - - - -
LTX-2 Lightricks/LTX-2.3: A2V code code - - - -
LTX-2 Lightricks/LTX-2.3: Retake code code - - - -
LTX-2 Lightricks/LTX-2.3-22b-IC-LoRA-Union-Control code code - - code code
LTX-2 Lightricks/LTX-2.3-22b-IC-LoRA-Motion-Track-Control code code - - code code
LTX-2 Lightricks/LTX-2: OneStagePipeline-T2AV code code code code code code
LTX-2 Lightricks/LTX-2-19b-IC-LoRA-Union-Control code code - - code code
LTX-2 Lightricks/LTX-2-19b-IC-LoRA-Detailer code code - - code code
LTX-2 Lightricks/LTX-2: TwoStagePipeline-T2AV code code - - - -
LTX-2 Lightricks/LTX-2: DistilledPipeline-T2AV code code - - - -
LTX-2 Lightricks/LTX-2: OneStagePipeline-I2AV code code - - - -
LTX-2 Lightricks/LTX-2: TwoStagePipeline-I2AV code code - - - -
LTX-2 Lightricks/LTX-2: DistilledPipeline-I2AV code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Dolly-In code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Dolly-Out code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Dolly-Left code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Dolly-Right code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Jib-Up code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Jib-Down code code - - - -
LTX-2 Lightricks/LTX-2-19b-LoRA-Camera-Control-Static code code - - - -
FLUX.2 black-forest-labs/FLUX.2-dev code code - - code code
FLUX.2 black-forest-labs/FLUX.2-klein-4B code code code code code code
FLUX.2 black-forest-labs/FLUX.2-klein-9B code code code code code code
FLUX.2 black-forest-labs/FLUX.2-klein-base-4B code code code code code code
FLUX.2 black-forest-labs/FLUX.2-klein-base-9B code code code code code code
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Aesthetic code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Brightness code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Age code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-ControlNet code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Edit code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Inpaint code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-PandaMeme code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Sharpness code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-SoftRGB code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-Upscaler code code code code - -
FLUX.2 DiffSynth-Studio/Template-KleinBase4B-ContentRef code code code code - -
FLUX.2 DiffSynth-Studio/KleinBase4B-i2L-v2 code code code code - -
Z-Image Tongyi-MAI/Z-Image code code code code code code
Z-Image DiffSynth-Studio/Z-Image-i2L code code - - - -
Z-Image Tongyi-MAI/Z-Image-Turbo code code code code code code
Z-Image PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1 code code code code code code
Z-Image PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1-8steps code code code code code code
Z-Image PAI/Z-Image-Turbo-Fun-Controlnet-Tile-2.1-8steps code code code code code code
Z-Image DiffSynth-Studio/ZImage-i2L-v2 code code code code - -
Anima circlestone-labs/Anima code code code code code code
Qwen-Image Qwen/Qwen-Image code code code code code code
Qwen-Image Qwen/Qwen-Image-2512 code code code code code code
Qwen-Image Qwen/Qwen-Image-Edit code code code code code code
Qwen-Image Qwen/Qwen-Image-Edit-2509 code code code code code code
Qwen-Image Qwen/Qwen-Image-Edit-2511 code code code code code code
Qwen-Image FireRedTeam/FireRed-Image-Edit-1.0 code code code code code code
Qwen-Image FireRedTeam/FireRed-Image-Edit-1.1 code code code code code code
Qwen-Image lightx2v/Qwen-Image-Edit-2511-Lightning code code - - - -
Qwen-Image Qwen/Qwen-Image-Layered code code code code code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Layered-Control code code code code code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Layered-Control-V2 code code - - code code
Qwen-Image DiffSynth-Studio/Qwen-Image-EliGen code code - - code code
Qwen-Image DiffSynth-Studio/Qwen-Image-EliGen-V2 code code - - code code
Qwen-Image DiffSynth-Studio/Qwen-Image-EliGen-Poster code code - - code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Distill-Full code code code code code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Distill-LoRA code code - - code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Canny code code code code code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Depth code code code code code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Inpaint code code code code code code
Qwen-Image DiffSynth-Studio/Qwen-Image-In-Context-Control-Union code code - - code code
Qwen-Image DiffSynth-Studio/Qwen-Image-Edit-Lowres-Fix code code - - - -
Qwen-Image DiffSynth-Studio/Qwen-Image-i2L code code - - - -
Qwen-Video-Edit yunpeng1998/Qwen-Video-Edit code code code code code code
Wan Wan-AI/Wan2.1-T2V-1.3B code code code code code code
Wan Wan-AI/Wan2.1-T2V-14B code code code code code code
Wan Wan-AI/Wan2.1-I2V-14B-480P code code code code code code
Wan Wan-AI/Wan2.1-I2V-14B-720P code code code code code code
Wan Wan-AI/Wan2.1-FLF2V-14B-720P code code code code code code
Wan iic/VACE-Wan2.1-1.3B-Preview code code code code code code
Wan Wan-AI/Wan2.1-VACE-1.3B code code code code code code
Wan Wan-AI/Wan2.1-VACE-14B code code code code code code
Wan PAI/Wan2.1-Fun-1.3B-InP code code code code code code
Wan PAI/Wan2.1-Fun-1.3B-Control code code code code code code
Wan PAI/Wan2.1-Fun-14B-InP code code code code code code
Wan PAI/Wan2.1-Fun-14B-Control code code code code code code
Wan PAI/Wan2.1-Fun-V1.1-1.3B-Control code code code code code code
Wan PAI/Wan2.1-Fun-V1.1-14B-Control code code code code code code
Wan PAI/Wan2.1-Fun-V1.1-1.3B-InP code code code code code code
Wan PAI/Wan2.1-Fun-V1.1-14B-InP code code code code code code
Wan PAI/Wan2.1-Fun-V1.1-1.3B-Control-Camera code code code code code code
Wan PAI/Wan2.1-Fun-V1.1-14B-Control-Camera code code code code code code
Wan DiffSynth-Studio/Wan2.1-1.3b-speedcontrol-v1 code code code code code code
Wan krea/krea-realtime-video code code code code code code
Wan meituan-longcat/LongCat-Video code code code code code code
Wan ByteDance/Video-As-Prompt-Wan2.1-14B code code code code code code
Wan Wan-AI/Wan2.2-T2V-A14B code code code code code code
Wan Wan-AI/Wan2.2-I2V-A14B code code code code code code
Wan Wan-AI/Wan2.2-TI2V-5B code code code code code code
Wan Wan-AI/Wan2.2-Animate-14B code code code code code code
Wan Wan-AI/Wan2.2-Animate-2-14B code code code code code code
Wan Wan-AI/Wan2.2-Animate-2-14B: Distilled code code code code code code
Wan Wan-AI/Wan2.2-S2V-14B code code code code code code
Wan PAI/Wan2.2-VACE-Fun-A14B code code code code code code
Wan PAI/Wan2.2-Fun-A14B-InP code code code code code code
Wan PAI/Wan2.2-Fun-A14B-Control code code code code code code
Wan PAI/Wan2.2-Fun-A14B-Control-Camera code code code code code code
Wan openmoss/MOVA-360p code code code code code code
Wan openmoss/MOVA-720p code code code code code code
Wan Wan-AI/Wan-Dancer-14B (global model) code code code code code code
Wan Wan-AI/Wan-Dancer-14B (local model) code code code code code code
FLUX.1 black-forest-labs/FLUX.1-dev code code code code code code
FLUX.1 black-forest-labs/FLUX.1-Krea-dev code code code code code code
FLUX.1 black-forest-labs/FLUX.1-Kontext-dev code code code code code code
FLUX.1 black-forest-labs/FLUX.1-Fill-dev code code code code code code
FLUX.1 black-forest-labs/FLUX.1-Redux-dev code code code code code code
FLUX.1 HuanJue/Insert-Anything code code - - code code
FLUX.1 alimama-creative/FLUX.1-dev-Controlnet-Inpainting-Beta code code code code code code
FLUX.1 InstantX/FLUX.1-dev-Controlnet-Union-alpha code code code code code code
FLUX.1 jasperai/Flux.1-dev-Controlnet-Upscaler code code code code code code
FLUX.1 InstantX/FLUX.1-dev-IP-Adapter code code code code code code
FLUX.1 ByteDance/InfiniteYou code code code code code code
FLUX.1 DiffSynth-Studio/Eligen code code - - code code
FLUX.1 DiffSynth-Studio/LoRA-Encoder-FLUX.1-Dev code code code code - -
FLUX.1 DiffSynth-Studio/LoRAFusion-preview-FLUX.1-dev code - - - - -
FLUX.1 stepfun-ai/Step1X-Edit code code code code code code
FLUX.1 ostris/Flex.2-preview code code code code code code
FLUX.1 DiffSynth-Studio/Nexus-GenV2 code code code code code code
Stable Diffusion XL stabilityai/stable-diffusion-xl-base-1.0 code code code code code code
Stable Diffusion AI-ModelScope/stable-diffusion-v1-5 code code code code code code
- PickScore code - - - - -
- ImageReward code - - - - -
- HPSv2 code - - - - -
- HPSv3 code - - - - -
- CLIP Score code - - - - -
- UnifiedReward 2.0 code - - - - -
- Qwen-Image-Bench code - - - - -
- UnifiedReward Edit code - - - - -
- Aesthetic code - - - - -
- FID code - - - - -