DiffSynth-Studio
简介
欢迎来到 Diffusion 模型的魔法世界!DiffSynth-Studio 是由魔搭社区团队开发和维护的开源 Diffusion 模型引擎。我们期望以框架建设孵化技术创新,凝聚开源社区的力量,探索生成式模型技术的丰富能力!
框架功能:
- 模型支持:框架集成了主流的开源 Diffusion 模型,涵盖图像生成、视频生成、音频生成,以及图像指标模型。
- 显存管理:在硬盘、内存、显存之间动态调度模型参数,让低显存的消费级 GPU 也能运行大模型的推理。
- 参数量化:将模型参数转换为 NF4、INT8 等量化精度,大幅减少模型推理和 LoRA 模型训练的显存需求。
- 任意训练:几乎所有支持推理的模型都支持训练,无论是基础模型、LoRA,还是任何带有额外输入的 Adapter 模型。
- 拆分训练:使用计算图推理引擎追踪 Pipeline 中每个变量,将训练过程拆分为两阶段,高效训练。
参考资料:
- 开发者文档 (面向人类):中文版、English version
- Agent Skills (面向 AI):DiffSynth-Studio Model Integration Skills
查看更多:
- DiffSynth-WebUI: 基于 DiffSynth-Studio 构建的轻量化 LoRA 训练工具,可在消费级 GPU 上训练 LoRA 模型。
- 魔搭社区 AIGC 专区 (面向中国用户): 以 DiffSynth-Studio 为核心推理和训练引擎的产品化功能,体验开源模型生态的丰富潜力。
- ModelScope Civision (for global users): Unlock the vast potential of the open-source model ecosystem through productized capabilities powered by DiffSynth-Studio.
更新历史
DiffSynth-Studio 经历了大版本更新,部分旧功能已停止维护,如需使用旧版功能,请切换到大版本更新前的最后一个历史版本。
目前本项目的开发人员有限,大部分工作由 Artiprocher 和 mi804 负责,因此新功能的开发进展会比较缓慢,issue 的回复和解决速度有限,我们对此感到非常抱歉,请各位开发者理解。
2026年8月31日 我们接入了 Qwen-Video-Edit,这是开源社区用户 yunpeng1998 基于图像编辑模型 Qwen-Image-Edit 训练的视频编辑模型,是探索模型能力拓展的优秀案例。
2026年8月25日 我们开源了 DiffSynth-WebUI,一键私有化部署 LoRA 训练服务,与模型参数量化功能结合,用消费级 GPU 也能训练超大模型。
2026年8月19日 我们发布了模型量化功能。它提供了统一的
QuantizeConfig入口,支持 bitsandbytes、torchao、comfy-kitchen 等多种量化后端,具备在线量化、加载预量化权重、混合量化、保存量化模型、量化 + LoRA 训练等能力。详情请参考文档。2026年8月17日 MiniMax-Music3 开源,欢迎加入音频生成模型家族!支持文生音乐推理和低显存推理能力。详情请参考文档和示例代码。
2026年8月7日 我们为 Wan 系列新增了 Wan-Animate-2,输入一张参考图和一段驱动视频,即可让参考角色演绎驱动视频中的动作,生成高质量角色动画,包含标准与蒸馏两个变体。详情请参考文档和示例代码。
2026年8月3日 MiniMax-H3 开源,欢迎加入视频生成模型家族!支持文生音视频、首尾帧引导生成、参考驱动生成、低显存推理以及 NF4 量化推理。详情请参考文档和示例代码。
2026年7月28日 LingBot-Video 开源,欢迎加入视频生成模型家族!本次开源包含 Dense-1.3B 和 MoE-30B-A3B 两个版本(MoE 版总参数量 30B、每个 token 激活约 3B),均支持文生视频、图生视频、文生图推理、低显存推理以及 LoRA / 全量训练能力。详情请参考文档和示例代码。特别感谢 NancyFyong 贡献了本模型的接入代码!
2026年7月21日 我们开源了 DiffSynth-Studio Model Integration Skills。这是一套可组合的 Agent Skill 合集,将外部扩散模型接入 DiffSynth-Studio 的全流程自动化,大幅提升模型接入标准化程度与效率。从使用示例开始体验吧!
更多
2026年6月29日 Boogu-Image 开源,已支持文生图推理、图像编辑、低显存推理和训练能力。详情请参考文档和示例代码。
2026年6月16日 我们为 ACE-Step 新增了 Template 模型:vocals2music。详情请参考文档和示例代码。
2026年6月15日 我们开源了 Image-to-LoRA V2,将动辄数小时的图像风格 LoRA 训练压缩到一次模型推理中,探索 LoRA 模型训练的新方式。技术报告已公开,本次开源包括三个模型:
- DiffSynth-Studio/ZImage-i2L-v2:适配模型 Z-Image
- DiffSynth-Studio/KleinBase4B-i2L-v2:适配模型 FLUX.2-klein-base-4B
- DiffSynth-Studio/HidreamO1-i2L-v2:适配模型 Hidream-O1-Image
2026年5月21日 新增图像质量评估模型的支持,包括 FID、CLIP、Aesthetic、PickScore、ImageReward、HPSv2、HPSv3,详情请参考文档和示例代码
2026年5月18日 新增 CPU Offload Training 功能,通过将模型权重逐层在 CPU 与 GPU 之间搬运,大幅降低训练时的 GPU 显存占用,让消费级显卡也能进行大模型 LoRA 训练,适配所有模型。只需在训练命令中添加
--enable_model_cpu_offload即可启用(当前仅支持单卡训练)。详情请参考文档。2026年5月14日 HiDream-O1-Image 开源,欢迎加入图像生成模型家族!支持文生图推理、图像编辑推理、低显存推理和训练能力。详情请参考文档和示例代码。
2026年4月28日 我们发布了 Diffusion Templates,面向 Diffusion 模型的插件框架,大幅降低了可控生成模型的训练门槛,一起来探索新奇的技术吧!
- 开源代码:DiffSynth-Studio
- 技术报告:arXiv
- 项目主页:GitHub
- 文档参考:English Version、中文版
- 在线体验:魔搭社区创空间
- 模型集:ModelScope、ModelScope 国际站、HuggingFace
- 数据集:ModelScope、ModelScope 国际站、HuggingFace
2026年4月27日 我们支持了 ACE-Step-1.5!包括文生音乐推理、低显存推理和 LoRA 训练能力。详情请参考文档和示例代码。
2026年4月27日 我们重新支持了模型 Stable Diffusion v1.5 和 SDXL,仅对这两类模型提供学术科研支持。
2026年4月14日 JoyAI-Image 开源,欢迎加入图像编辑模型家族!支持指令引导的图像编辑推理、低显存推理和训练能力。详情请参考文档和示例代码。
2026年3月19日 新增对 openmoss/MOVA-720p 和 openmoss/MOVA-360p 模型的支持,包括完整的训练和推理功能。文档和示例代码现已可用。
2026年3月12日 我们新增了 LTX-2.3 音视频生成模型的支持,模型支持的功能包括文生音视频、图生音视频、IC-LoRA控制、音频生视频、音视频局部Inpainting,框架支持完整的推理和训练功能。详细信息请参考 文档 和 示例代码。
2026年3月3日 我们发布了 DiffSynth-Studio/Qwen-Image-Layered-Control-V2 模型,这是 Qwen-Image-Layered-Control 的更新版本。除了原本就支持的文本引导功能,新增了画笔控制的图层拆分能力。
2026年2月2日 Research Tutorial 的第一篇文档上线,带你从零开始训练一个 0.1B 的小型文生图模型,详见文档、模型,我们希望 DiffSynth-Studio 能够成为一个更强大的 Diffusion 模型训练框架。
2026年1月27日 Z-Image 发布,我们的 Z-Image-i2L 模型同步发布,在魔搭创空间可直接体验,详见文档。
2026年1月19日 新增对 FLUX.2-klein-4B 和 FLUX.2-klein-9B 模型的支持,包括完整的训练和推理功能。文档和示例代码现已可用。
2026年1月12日 我们训练并开源了一个文本引导的图层拆分模型(模型链接),这一模型输入一张图与一段文本描述,模型会将图像中与文本描述相关的图层拆分出来。更多细节请阅读我们的 blog(中文版、英文版)。
2025年12月24日 我们基于 Qwen-Image-Edit-2511 训练了一个 In-Context Editing LoRA 模型(模型链接),这个模型可以输入三张图:图A、图B、图C,模型会自行分析图A到图B的变化,并将这样的变化应用到图C,生成图D。更多细节请阅读我们的 blog(中文版、英文版)。
2025年12月9日 我们基于 DiffSynth-Studio 2.0 训练了一个疯狂的模型:Qwen-Image-i2L(Image to LoRA)。这一模型以图像为输入,以 LoRA 为输出。尽管这个版本的模型在泛化能力、细节保持能力等方面还有很大改进空间,我们将这些模型开源,以启发更多创新性的研究工作。更多细节,请参考我们的 blog。
2025年12月4日 DiffSynth-Studio 2.0 发布!众多新功能上线
2025年11月4日 支持了 ByteDance/Video-As-Prompt-Wan2.1-14B 模型,该模型基于 Wan 2.1 训练,支持根据参考视频生成相应的动作。
2025年10月30日 支持了 meituan-longcat/LongCat-Video 模型,该模型支持文生视频、图生视频、视频续写。这个模型在本项目中沿用 Wan 的框架进行推理和训练。
2025年10月27日 支持了 krea/krea-realtime-video 模型,Wan 模型生态再添一员。
2025年9月23日 DiffSynth-Studio/Qwen-Image-EliGen-Poster 发布!本模型由我们与淘天体验设计团队联合研发并开源。模型基于 Qwen-Image 构建,专为电商海报场景设计,支持精确的分区布局控制。 请参考我们的示例代码。
2025年9月9日 我们的训练框架支持了多种训练模式,目前已适配 Qwen-Image,除标准 SFT 训练模式外,已支持 Direct Distill,请参考我们的示例代码。这项功能是实验性的,我们将会继续完善已支持更全面的模型训练功能。
2025年8月28日 我们支持了Wan2.2-S2V,一个音频驱动的电影级视频生成模型。请参见./examples/wanvideo/。
2025年8月21日 DiffSynth-Studio/Qwen-Image-EliGen-V2 发布!相比于 V1 版本,训练数据集变为 Qwen-Image-Self-Generated-Dataset,因此,生成的图像更符合 Qwen-Image 本身的图像分布和风格。 请参考我们的示例代码。
2025年8月21日 我们开源了 DiffSynth-Studio/Qwen-Image-In-Context-Control-Union 结构控制 LoRA 模型,采用 In Context 的技术路线,支持多种类别的结构控制条件,包括 canny, depth, lineart, softedge, normal, openpose。 请参考我们的示例代码。
2025年8月20日 我们开源了 DiffSynth-Studio/Qwen-Image-Edit-Lowres-Fix 模型,提升了 Qwen-Image-Edit 对低分辨率图像输入的编辑效果。请参考我们的示例代码
2025年8月19日 Qwen-Image-Edit 开源,欢迎图像编辑模型新成员!
2025年8月18日 我们训练并开源了 Qwen-Image 的图像重绘 ControlNet 模型 DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Inpaint,模型结构采用了轻量化的设计,请参考我们的示例代码。
2025年8月15日 我们开源了 Qwen-Image-Self-Generated-Dataset 数据集。这是一个使用 Qwen-Image 模型生成的图像数据集,共包含 160,000 张
1024 x 1024图像。它包括通用、英文文本渲染和中文文本渲染子集。我们为每张图像提供了图像描述、实体和结构控制图像的标注。开发者可以使用这个数据集来训练 Qwen-Image 模型的 ControlNet 和 EliGen 等模型,我们旨在通过开源推动技术发展!2025年8月13日 我们训练并开源了 Qwen-Image 的 ControlNet 模型 DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Depth,模型结构采用了轻量化的设计,请参考我们的示例代码。
2025年8月12日 我们训练并开源了 Qwen-Image 的 ControlNet 模型 DiffSynth-Studio/Qwen-Image-Blockwise-ControlNet-Canny,模型结构采用了轻量化的设计,请参考我们的示例代码。
2025年8月11日 我们开源了 Qwen-Image 的蒸馏加速模型 DiffSynth-Studio/Qwen-Image-Distill-LoRA,沿用了与 DiffSynth-Studio/Qwen-Image-Distill-Full 相同的训练流程,但模型结构修改为了 LoRA,因此能够更好地与其他开源生态模型兼容。
2025年8月7日 我们开源了 Qwen-Image 的实体控制 LoRA 模型 DiffSynth-Studio/Qwen-Image-EliGen。Qwen-Image-EliGen 能够实现实体级可控的文生图。技术细节请参见论文。训练数据集:EliGenTrainSet。
2025年8月5日 我们开源了 Qwen-Image 的蒸馏加速模型 DiffSynth-Studio/Qwen-Image-Distill-Full,实现了约 5 倍加速。
2025年8月4日 Qwen-Image 开源,欢迎图像生成模型家族新成员!
2025年8月1日 FLUX.1-Krea-dev 开源,这是一个专注于美学摄影的文生图模型。我们第一时间提供了全方位支持,包括低显存逐层 offload、LoRA 训练、全量训练。详细信息请参考 ./examples/flux/。
2025年7月28日 Wan 2.2 开源,我们第一时间提供了全方位支持,包括低显存逐层 offload、FP8 量化、序列并行、LoRA 训练、全量训练。详细信息请参考 ./examples/wanvideo/。
2025年7月11日 我们提出 Nexus-Gen,一个将大语言模型(LLM)的语言推理能力与扩散模型的图像生成能力相结合的统一框架。该框架支持无缝的图像理解、生成和编辑任务。
2025年6月15日 ModelScope 官方评测框架 EvalScope 现已支持文生图生成评测。请参考最佳实践指南进行尝试。
2025年3月25日 我们的新开源项目 DiffSynth-Engine 现已开源!专注于稳定的模型部署,面向工业界,提供更好的工程支持、更高的计算性能和更稳定的功能。
2025年3月31日 我们支持 InfiniteYou,一种用于 FLUX 的人脸特征保留方法。更多细节请参考 ./examples/InfiniteYou/。
2025年3月13日 我们支持 HunyuanVideo-I2V,即腾讯开源的 HunyuanVideo 的图像到视频生成版本。更多细节请参考 ./examples/HunyuanVideo/。
2025年2月25日 我们支持 Wan-Video,这是阿里巴巴开源的一系列最先进的视频合成模型。详见 ./examples/wanvideo/。
2025年2月17日 我们支持 StepVideo!先进的视频合成模型!详见 ./examples/stepvideo。
2024年12月31日 我们提出 EliGen,一种用于精确实体级别控制的文本到图像生成的新框架,并辅以修复融合管道,将其能力扩展到图像修复任务。EliGen 可以无缝集成现有的社区模型,如 IP-Adapter 和 In-Context LoRA,提升其通用性。更多详情,请见 ./examples/EntityControl。
2024年12月19日 我们为 HunyuanVideo 实现了高级显存管理,使得在 24GB 显存下可以生成分辨率为 129x720x1280 的视频,或在仅 6GB 显存下生成分辨率为 129x512x384 的视频。更多细节请参考 ./examples/HunyuanVideo/。
2024年12月18日 我们提出 ArtAug,一种通过合成-理解交互来改进文生图模型的方法。我们以 LoRA 格式为 FLUX.1-dev 训练了一个 ArtAug 增强模块。该模型将 Qwen2-VL-72B 的美学理解融入 FLUX.1-dev,从而提升了生成图像的质量。
- 论文: https://arxiv.org/abs/2412.12888
- 示例: https://github.com/modelscope/DiffSynth-Studio/tree/main/examples/ArtAug
- 模型: ModelScope, HuggingFace
- 演示: ModelScope, HuggingFace (即将上线)
2024年10月25日 我们提供了广泛的 FLUX ControlNet 支持。该项目支持许多不同的 ControlNet 模型,并且可以自由组合,即使它们的结构不同。此外,ControlNet 模型兼容高分辨率优化和分区控制技术,能够实现非常强大的可控图像生成。详见
./examples/ControlNet/。2024年10月8日 我们发布了基于 CogVideoX-5B 和 ExVideo 的扩展 LoRA。您可以从 ModelScope 或 HuggingFace 下载此模型。
2024年8月22日 本项目现已支持 CogVideoX-5B。详见 此处。我们为这个文生视频模型提供了几个有趣的功能,包括:
- 文本到视频
- 视频编辑
- 自我超分
- 视频插帧
2024年8月22日 我们实现了一个有趣的画笔功能,支持所有文生图模型。现在,您可以在 AI 的辅助下使用画笔创作惊艳的图像了!
- 在我们的 WebUI 中使用它。
2024年8月21日 DiffSynth-Studio 现已支持 FLUX。
- 启用 CFG 和高分辨率修复以提升视觉质量。详见 此处
- LoRA、ControlNet 和其他附加模型将很快推出。
2024年6月21日 我们提出 ExVideo,一种旨在增强视频生成模型能力的后训练微调技术。我们将 Stable Video Diffusion 进行了扩展,实现了长达 128 帧的长视频生成。
- 项目页面
- 源代码已在此仓库中发布。详见
examples/ExVideo。 - 模型已发布于 HuggingFace 和 ModelScope。
- 技术报告已发布于 arXiv。
- 您可以在此 演示 中试用 ExVideo!
2024年6月13日 DiffSynth Studio 已迁移至 ModelScope。开发团队也从“我”转变为“我们”。当然,我仍会参与后续的开发和维护工作。
2024年1月29日 我们提出 Diffutoon,这是一个出色的卡通着色解决方案。
2023年12月8日 我们决定启动一个新项目,旨在释放扩散模型的潜力,尤其是在视频合成方面。该项目的开发工作正式开始。
2023年11月15日 我们提出 FastBlend,一种强大的视频去闪烁算法。
2023年10月1日 我们发布了该项目的早期版本,名为 FastSDXL。这是构建一个扩散引擎的初步尝试。
2023年8月29日 我们提出 DiffSynth,一个视频合成框架。
安装
从源码安装(推荐):
git clone https://github.com/modelscope/DiffSynth-Studio.git
cd DiffSynth-Studio
pip install -e .
更多安装方式,以及非 NVIDIA GPU 的安装,请参考安装文档。
下载源配置
在进行模型推理和训练前,可通过环境变量配置模型下载源等。
本项目默认从魔搭社区下载模型。对于非中国区域的用户,可以通过以下配置从魔搭社区国际站下载模型:
export MODELSCOPE_ENDPOINT=https://modelscope.ai如需从 HuggingFace 下载模型,请修改环境变量,注意不同模型平台上的模型 ID 可能不同:
export DIFFSYNTH_DOWNLOAD_SOURCE="huggingface"
基础框架
DiffSynth-Studio 作为基础的模型框架,为主流 Diffusion 模型重新设计了推理和训练流水线,能够实现高效的显存管理、灵活的模型训练。
快速开始,体验热门和最新模型:
| 基础架构 | 模型 ID | 推理 | 低显存推理 | 全量训练 | 全量训练后验证 | LoRA 训练 | LoRA 训练后验证 |
|---|---|---|---|---|---|---|---|
| MiniMax-H3 | MiniMax/MiniMax-H3: FL2VA | code | code | code | code | code | code |
| MiniMax-H3 | DiffSynth-Studio/MiniMax-H3-NF4: FL2VA pruned | code | code | - | - | code | code |
| ACE-Step | ACE-Step/acestep-v15-xl-sft | code | code | code | code | code | code |
| Z-Image | Tongyi-MAI/Z-Image-Turbo | code | code | code | code | code | code |
| Krea-2 | krea/Krea-2-Raw | code | code | code | code | code | code |
| Krea-2 | krea/Krea-2-Turbo | code | code | code | code | code | code |
模型一览:
创新成果
我们相信,一个完善的开源代码框架能够降低技术探索的门槛,我们基于这个代码库搞出了不少有意思的技术。或许你也有许多天马行空的构想,借助 DiffSynth-Studio,你可以快速实现这些想法。
TreeAdapter: 由结构化 LoRA 组建的模型系统
用 1w+ LoRA 组成的模型系统挑战上万个稀有物种的精准生成。
Image-to-LoRA: 把模型训练压缩到模型推理中
真正的 Meta Learning:模型一端输入图像数据集,另一端直接输出训出来的 LoRA 模型。
- 论文:Compressing Image Style Training into a Single Model Forward
- 模型:
- DiffSynth-Studio/ZImage-i2L-v2:适配模型 Z-Image
- DiffSynth-Studio/KleinBase4B-i2L-v2:适配模型 FLUX.2-klein-base-4B
- DiffSynth-Studio/HidreamO1-i2L-v2:适配模型 Hidream-O1-Image
Diffusion-Templates: 插件化的可控生成框架
一个框架,让每一种可控生成能力都成为插件,让多个模型组合涌现出丰富生成能力。
SES: 用于奖励对齐图像生成的高效推理阶段缩放
以推理时间为代价,提高生成内容的质量。
VIRAL:基于DiT模型的类比视觉上下文推理
根据图1到图2的变化把图3转化为图4,图像编辑模型的能力涌现。
AttriCtrl: 图像生成模型的属性强度控制
用数值属性也能精准地控制图像生成模型。
AutoLoRA: 自动化的 LoRA 检索和融合
LoRA 是需求和解决方案一体化的产物,如何更好地利用这些 LoRA?
Nexus-Gen: 统一架构的图像理解、生成、编辑
如果一个模型集齐图像理解、图像生成、图像编辑能力,会发生什么?
ArtAug: 图像生成模型的美学提升
一个 LoRA,大幅提升细节和美感。
EliGen: 精准的图像分区控制
如何用分区图层控制画面内容的位置?
ExVideo: 视频生成模型的扩展训练
如果视频生成模型只能生成 25 帧,如何才能让它生成更长视频?
- 项目页面:Project Page
- 论文:ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
- 代码样例:请前往旧版本查看
- 模型:ModelScope, HuggingFace
https://github.com/modelscope/DiffSynth-Studio/assets/35051019/d97f6aa9-8064-4b5b-9d49-ed6001bb9acc
Diffutoon: 高分辨率动漫风格视频渲染
我管你这那的,我就是喜欢二次元!
- 项目页面:Project Page
- 论文:Diffutoon: High-Resolution Editable Toon Shading via Diffusion Models
- 代码样例:请前往旧版本查看
注意:Diffutoon 示例来自 2.0 之前的代码库,目前不包含在 main 分支中。请将上面的旧版本代码与对应版本的 DiffSynth-Studio 一起使用。
https://github.com/Artiprocher/DiffSynth-Studio/assets/35051019/b54c05c5-d747-4709-be5e-b39af82404dd
DiffSynth: 本项目的初代版本
在没有视频生成模型的时代,如何利用图像生成模型处理视频?
- 项目页面:Project Page
- 论文:DiffSynth: Latent In-Iteration Deflickering for Realistic Video Synthesis
- 代码样例:请前往旧版本查看
https://github.com/Artiprocher/DiffSynth-Studio/assets/35051019/59fb2f7b-8de0-4481-b79f-0c3a7361a1ea
联系我们
| Discord:https://discord.gg/Mm9suEeUDc |
|---|





