Instructions to use KaKa427/luodian-vertical-model with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use KaKa427/luodian-vertical-model with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("fill-in-base-model", dtype=torch.bfloat16, device_map="cuda") pipe.load_lora_weights("KaKa427/luodian-vertical-model") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Draw Things
- DiffusionBee
螺钿垂直模型子项目方案(模型进阶 V2.1)
版本:V2.1(合并 V2 + V2.1修订清单) 日期:2026-02-10 状态:架构设计定稿,可进入实现阶段 变更来源:V2 双引擎/RAG架构 × Codex V2.1修订清单 本版新增:双轨训练策略 / 规则优先评估器 / 字段映射层 / 禁忌词库拦截 / 精简brief阶段策略
1. 文档定位与核心目标
1.1 文档定位
本文档是【螺钿垂直模型】进阶子项目的可执行框架,合并了 V2 架构设计与 V2.1 修订内容, 可直接进入实现阶段。
1.2 核心目标
在"全工艺可理解 + 工厂可落地 + 市场可接受"的前提下,使模型输出的设计方案具备:
- 工厂可执行:附带尺寸、材质、工序的技术参数卡,师傅看了能直接开工
- 市场高接受度:通过 AI 推理与规则评估,输出比一般设计工具更高概率在销售环节 产生收入与热度的方案
1.3 原始提示词(保留)
"我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定 吸引力的产品设计风格,提供产品创意以及设计画面的设计图。"
2. 材质体系与双轨训练策略
2.1 全材质体系(模型需要理解的全部范围)
胎体三大类:
| 类型 | 材质 | 特点 | 训练轨道 |
|---|---|---|---|
| 硬木胎 | 紫光檀、黑檀、红木、乌木 | 可量产主力,工厂友好 | core |
| 大漆胎 | 传统大漆木胎、脱胎漆器 | 高端传统,工时长 | extended |
| 金属胎 | 铜胎、银胎、混合胎 | 现代感强,适合首饰 | extended |
镶嵌材料全谱:
| 材料 | 特征 | 训练轨道 |
|---|---|---|
| 贝母螺钿(厚/薄/砌) | 虹彩光泽,主力材料 | core |
| 银丝螺钿 | 拉丝/编丝/线条感 | core |
| 朱砂 | 填色/点缀,传统感 | extended |
| 金属箔片(金/银箔) | 奢华感叠加 | extended |
| 组合工艺 | 多材质混嵌 | extended(core 稳定后) |
2.2 双轨训练策略(V2.1 核心修正)
原则:训练侧全工艺语义覆盖,但 core 必须先于 extended 稳定。
core(当前主线) extended(扩展域)
────────────── ──────────────────
硬木胎 + 贝母/银丝 大漆/金属胎/朱砂/组合
商业主力产品 工艺语义补全
先训练,先评估 core 稳定后按比例注入
分阶段样本比例:
| 阶段 | 图片总量 | core:extended | 说明 |
|---|---|---|---|
| Phase 1(当前) | < 30张 | 10:0 | 全 core,不引入 extended |
| Phase 2 | 30-100张 | 8:2 | 开始按比例注入 extended |
| Phase 3 | 100张+ | 7:3 或 6:4 | 视 extended 增益评估调整 |
防回归机制:
- extended 样本默认进
reference_only/,经人工合规审核后才能转trainable/ - 每轮训练固定保留独立的 core 验证集,extended 注入前后均需对比 core 指标不退化
3. 双引擎架构
┌─────────────────────────────────────────────────────┐
│ 用户输入(自然语言) │
└──────────────────────┬──────────────────────────────┘
│
┌──────────────▼──────────────────┐
│ [拦截层] 文化禁忌词库 │ ← 硬规则,命中即拒绝
│ cultural_taboos.yaml │ 不消耗推理 token
└──────────────┬──────────────────┘
│ 通过
┌──────────────▼──────────────────┐
│ 理解引擎(LLaVA QLoRA) │
│ - 理解用户需求与参考图片 │
│ - RAG 注入文化知识 │
│ - 生成 design_brief.json │
│ - 工艺可行性评估(规则打分) │
└──────────────┬──────────────────┘
│ design_brief.json
┌──────────────▼──────────────────┐
│ 规则评估器(Evaluator) │
│ - 工厂可行性(尺寸/工时/工序) │
│ - 市场匹配(客群/价格带/风格) │
│ score ≥ 0.6 → 继续 │
│ score < 0.6 → 返回修改建议 │
└──────────────┬──────────────────┘
│ 评分 ≥ 0.6
┌──────────────▼──────────────────┐
│ 生成引擎(SDXL LoRA → ComfyUI) │
│ - 接收 sdxl_prompt │
│ - 螺钿风格 LoRA 控制质量 │
│ - 输出位图(PNG / WebP) │
│ [SVG 为可选后处理,非原生能力] │
└──────────────┬──────────────────┘
│
┌──────────────▼──────────────────┐
│ 输出包(三件套) │
│ 1. 设计图(PNG/WebP) │
│ 2. 工厂参数卡 │
│ 3. 市场适配建议 │
└─────────────────────────────────┘
引擎选型确认:
- 生成引擎:SDXL + LoRA(非 FLUX)
- SDXL 推理 ~6GB,LoRA 训练 ~7GB,8GB 显存可用
- FLUX.1-dev 需 ~23GB,FLUX.1-schnell 量化版仍需 ~12GB,均超出限制
- kohya_ss 已在项目目录内,工具链现成
4. 子系统设计
4.1 子系统 A:采集器
目标:持续收集全工艺螺钿 + 时尚参考 + 文化素材
合规来源优先级:
- Unsplash / Pexels / Pixabay(CC0,可商用)
- 博物馆数字藏品(通常 CC BY)
- 网络采集(一律进 reference_only,不入训练集)
输出目录结构:
images/
├── trainable/
│ ├── core/ ← 硬木胎 + 贝母/银丝(经审核)
│ └── extended/ ← 大漆/金属/朱砂(经合规审核后入)
└── reference_only/
└── trend/ ← 时尚趋势参考(版权不明)
annotations/
├── core/
├── extended/
└── mapping_logs/ ← design_brief → dataset_schema 转换日志
必存合规字段:source_url、license、crawl_time、usage_note
4.2 子系统 B:文化知识库
技术栈(确定):
| 组件 | 选型 | 理由 |
|---|---|---|
| 向量数据库 | ChromaDB(本地) | 纯 CPU,不占显存 |
| Embedding 模型 | BGE-M3 | 中英双语,CPU 可运行 |
| 检索方式 | 语义 + 关键词混合 | 文化专业词汇关键词更精确 |
知识卡片结构:
- 文化元素词表(上海海派视觉符号、欧美偏好语言)
- 视觉映射(图形、色彩、材质倾向)
- 商业映射(客群、价格带、适配平台)
- 文化禁忌条目(单独提取入
cultural_taboos.yaml)
推理注入链:
用户提示词 → ChromaDB 检索 → 相关语义片段 → LLaVA 生成 design_brief
4.3 文化禁忌拦截层(B 的硬规则前置)
文件:knowledge/rules/cultural_taboos.yaml
拦截时机:在 brief 生成之前,直接对用户输入做词汇/语义匹配。命中即拒绝,返回具体原因。
禁忌类型举例:
color_taboos:
- market: EU_NA
pattern: ["纯白+葬礼语境", "纯黑+特定宗教语境"]
reason: "特定场景下的文化误用风险"
symbol_taboos:
- pattern: ["卍", "swastika"]
market: EU_NA
reason: "与纳粹符号混淆,欧美市场绝对禁止"
- pattern: ["倒五角星+特定组合"]
reason: "撒旦主义联想,欧美部分客群强烈抵触"
cultural_appropriation:
- pattern: ["印第安头饰", "土著图腾"]
market: NA
reason: "北美文化挪用敏感领域"
4.4 子系统 C:Orchestrator(提示词编排)
设计 Brief(分阶段字段策略)
Phase 1 精简版(当前使用,8个核心字段):
{
"product_type": "handheld_mirror",
"cultural_theme": {
"cn_element": "上海海派 Art Deco",
"market_target": "EU"
},
"visual_spec": {
"motif": "外滩建筑剪影 + 几何线条",
"style_keywords": ["geometric_silhouette", "iridescent", "minimalist"]
},
"material_spec": {
"substrate": "purple_sandalwood",
"inlay_primary": "nacre"
},
"production_params": {
"dimensions": "12x8x0.5cm",
"production_time": "6-8h"
},
"generation_params": {
"sdxl_prompt": ""
}
}
Phase 2 完整版(管道跑通后扩展,18个字段):
完整字段在 Phase 1 基础上新增:
material_spec.inlay_secondary(组合材质)material_spec.surface_finishproduction_params.cost_tierproduction_params.complexityproduction_params.factory_notesgeneration_params.negative_promptgeneration_params.style_loracultural_theme.cultural_notes(RAG 召回片段)evaluation(评分器填入)
4.5 规则评估器(V2.1 修正:规则优先,不做模型打分)
评分维度与规则:
维度1:工厂可行性(manufacturability)
| 检查项 | 规则 | 权重 |
|---|---|---|
| 尺寸合理性 | 长/宽/高在工厂标准加工范围内 | 0.3 |
| 工时范围 | 单品 6-10 小时(超出为 complex,低于为 simple) | 0.25 |
| 材质组合现实性 | substrate × inlay 组合在已知工艺体系内 | 0.25 |
| 工序复杂度 | complexity ≠ "complex"(本阶段不接 complex) | 0.2 |
维度2:市场匹配(market_fit)—— Phase 1 纯规则版
| 检查项 | 规则 | 权重 |
|---|---|---|
| 风格与目标市场匹配 | EU/NA → geometric/minimalist ≥ 1个关键词 | 0.3 |
| 价格带匹配 | 产品类型 × cost_tier 在合理区间 | 0.25 |
| 文化禁忌缺席 | 通过禁忌拦截层则此项满分 | 0.3 |
| 主题可识别性 | motif 非空且可解释 | 0.15 |
为何不做模型打分(V2.1 修正理由): 当前无市场销售反馈数据,模型对自己生成的 brief 打分会形成"自评自证"的伪精确。 规则打分透明、可审计、可随销售数据积累后升级为模型打分。
三档评分行动:
| 综合分 | 标签 | dataset_schema production_feasibility | 行动 |
|---|---|---|---|
| ≥ 0.8 | 高可行性 | "high" |
自动通过,直接生成 |
| 0.6-0.8 | 中等 | "medium" |
带警告生成,标注待人工确认 |
| < 0.6 | 不可行 | 不入数据集 | 返回修改建议,拒绝生成 |
4.6 字段映射层(V2.1 新增:design_brief → dataset_schema)
这一层是数据飞轮的关键:使 brief 生成的设计可以回流为新的训练数据。
| design_brief 字段 | dataset_schema 字段 | 映射规则 |
|---|---|---|
product_type |
product_type |
直接映射 |
cultural_theme.cn_element |
visual_subject |
主题抽取为可视对象 |
visual_spec.style_keywords |
design_style |
关键词归并 |
visual_spec.motif |
visual_description_cn |
中文视觉主描述 |
material_spec.substrate |
base_material |
术语标准化(purple_sandalwood→紫光檀) |
material_spec.inlay_primary + inlay_secondary |
inlay_material |
组合拼接 |
production_params.complexity |
complexity_level |
simple/medium 直接映射 |
production_params.factory_notes |
technical_specs.inlay_technique |
提取工艺关键词 |
production_params.dimensions |
technical_specs.dimensions |
直接映射 |
production_params.production_time |
technical_specs.production_time |
直接映射 |
production_params.cost_tier |
technical_specs.cost_level |
low/mid/high → 经济/中等/高端 |
cultural_theme.market_target |
market_orientation |
EU/NA/CN → 欧美/中国/全球 |
generation_params.sdxl_prompt |
prompt_template |
存模板或实例文本 |
evaluation.manufacturability_score |
production_feasibility |
按三档阈值映射 |
user_prompt_raw |
visual_description_cn(附注) |
保留用户原文 |
自动生成字段:
visual_description_en:由tags_mapping.json规则标准化reference_tags:由style_keywords + cultural_notes自动提取
5. 完整脚手架目录
模型进阶V1/
├── README.md
├── docs/
│ ├── 子项目执行计划-V2.1.md
│ ├── 数据合规与授权规范.md
│ ├── design_brief字段说明.md ← Phase1精简版 + Phase2完整版
│ └── 评估规则说明.md
│
├── collector/
│ ├── configs/
│ │ ├── keyword_pools.yaml ← 全工艺中英关键词(core/extended分类)
│ │ └── source_whitelist.yaml ← 合规来源白名单
│ └── scripts/
│ ├── crawl_images.py
│ ├── deduplicate_images.py ← pHash 感知哈希去重
│ └── build_source_meta.py
│
├── knowledge/
│ ├── corpus/ ← 文化资料原文(PDF/MD/TXT)
│ ├── rules/
│ │ ├── cultural_taboos.yaml ← 硬规则拦截词库(V2.1 新增)
│ │ ├── manufacturability_rules.yaml
│ │ └── market_fit_rules.yaml
│ ├── scripts/
│ │ ├── ingest_texts.py
│ │ ├── build_vector_index.py ← ChromaDB + BGE-M3
│ │ └── query_knowledge.py
│ └── index/ ← ChromaDB 本地索引
│
├── orchestrator/
│ ├── templates/
│ │ ├── design_brief_phase1.json ← 精简版(8字段)
│ │ └── design_brief_phase2.json ← 完整版(18字段)
│ └── scripts/
│ ├── generate_design_brief.py
│ └── brief_to_schema_mapping.py ← 字段映射层(V2.1 新增)
│
├── evaluator/
│ └── scripts/
│ └── score_design.py ← 规则打分(三档:high/medium/reject)
│
└── generation/
├── comfyui_workflows/
│ └── luodian_sdxl.json ← ComfyUI SDXL workflow 模板
└── scripts/
└── run_generation.py ← 调用 ComfyUI API,输出 PNG/WebP
6. 执行节奏(V2.1 版)
| 阶段 | 时长 | 内容 | 优先理由 |
|---|---|---|---|
| 第1阶段 | 1周 | 锁定 core 数据定义 + 字段映射层建立 | 保证数据闭环可跑 |
| 第2阶段 | 1周 | 文化知识库(ChromaDB+BGE-M3 最小可用)+ 禁忌词库初版 | RAG 上线,brief 生成有内容 |
| 第3阶段 | 1周 | 编排器(Phase1精简brief + 规则评估器) | 最快路径出第一个可验证结果 |
| 第4阶段 | 2周 | SDXL 螺钿风格 LoRA 训练(kohya_ss + ComfyUI) | 独立于LLaVA,可并行推进 |
| 第5阶段 | 2-3周 | 采集链路打通 + core 数据扩充至30张 | 合规审查需要时间,后置 |
| 第6阶段 | 持续 | extended 按比例注入 + LLaVA 新一轮 LoRA 迭代 | core 稳定后启动 |
7. 多 Agent 扩展开口(预留,不入核心架构)
当前决策:基于 Token 成本与项目盈利预期,Swarms 多 Agent 协同暂不纳入核心架构。 所有模块按"单 Agent 顺序执行"模式实现。
开口条件(满足任一可评估升级):
- 项目产生稳定收入,Token 成本可被商业化抵消
- Claude Code Swarms 官方正式发布且成本结构明确
- 单 Agent 模式出现明显瓶颈(如数据采集与知识库更新串行太慢)
接口规范(现在即按此编写,升级零成本):
# 每个子系统统一接口 → 未来改为 Agent 委托时,逻辑不变,调用方式变
def run_taboo_check(user_input: str) -> TabooResult: ...
def run_knowledge_query(query: str) -> KnowledgeResult: ...
def run_brief_generator(user_input: str, knowledge: KnowledgeResult) -> DesignBrief: ...
def run_evaluator(brief: DesignBrief) -> EvaluationResult: ...
def run_generator(brief: DesignBrief) -> GenerationResult: ...
def map_brief_to_schema(brief: DesignBrief) -> DatasetRecord: ...
# 当前:顺序执行
taboo = run_taboo_check(user_input)
if taboo.blocked: return taboo.reason
knowledge = run_knowledge_query(user_input)
brief = run_brief_generator(user_input, knowledge)
eval_ = run_evaluator(brief)
if eval_.score < 0.6: return eval_.suggestions
result = run_generator(brief)
record = map_brief_to_schema(brief) # 回流训练数据
# 未来 Swarms:并发委托(接口签名不变)
8. 验收标准
8.1 架构验收
- 双引擎分工清晰,design_brief.json 是唯一跨引擎接口
- 禁忌拦截层在 brief 生成之前执行
- 规则评估器独立于生成引擎(不存在"自评自证")
8.2 数据验收
-
core/trainable与extended/reference_only边界明确 - 所有图片有
source_url/license/crawl_time合规追踪 - 字段映射层可将 brief 自动转换为 dataset_schema 格式
8.3 训练验收
- Phase 2 注入 extended 前后,core 验证集指标不退化
- 生成结果包含可执行的工厂参数卡(不只是视觉概念图)
8.4 商业验收
- 输出包含:客群、价格带、平台建议
- score < 0.6 的方案返回具体修改建议(闭环)
- 输出设计的市场适配分高于无垂直训练的通用模型基准
9. 当前决议
已落版:
- 全工艺双轨训练策略(core 先行,extended 按比例注入)
- 双引擎结构(LLaVA 理解 + SDXL 生成,ComfyUI 管道)
- 禁忌拦截层(YAML 硬规则,brief 生成前执行)
- 规则优先评估器(三档阈值,不做模型打分)
- 字段映射层(design_brief → dataset_schema,数据飞轮闭环)
- Phase 1 精简 brief(8 字段),Phase 2 完整 brief(18 字段)
- Swarms 预留接口(开口但不入核心)
暂不执行:
- 脚手架代码开发
- 爬取脚本开发
- 知识库服务化部署
下一步决策点:
- 确认第1阶段启动时间(锁定 core 定义 + 字段映射)
- 提供文化资料文本(上海海派、欧美偏好)供知识库构建
- 提供 SDXL 螺钿风格参考图(10-20张,供 LoRA 训练)