luodian-vertical-model / project_docs /framework_design_v2_1.md
KaKa427's picture
Add framework design V2.1 final
224c57c verified
|
Raw
History Blame Contribute Delete
20 kB

螺钿垂直模型子项目方案(模型进阶 V2.1)

版本:V2.1(合并 V2 + V2.1修订清单) 日期:2026-02-10 状态:架构设计定稿,可进入实现阶段 变更来源:V2 双引擎/RAG架构 × Codex V2.1修订清单 本版新增:双轨训练策略 / 规则优先评估器 / 字段映射层 / 禁忌词库拦截 / 精简brief阶段策略


1. 文档定位与核心目标

1.1 文档定位

本文档是【螺钿垂直模型】进阶子项目的可执行框架,合并了 V2 架构设计与 V2.1 修订内容, 可直接进入实现阶段。

1.2 核心目标

在"全工艺可理解 + 工厂可落地 + 市场可接受"的前提下,使模型输出的设计方案具备:

  1. 工厂可执行:附带尺寸、材质、工序的技术参数卡,师傅看了能直接开工
  2. 市场高接受度:通过 AI 推理与规则评估,输出比一般设计工具更高概率在销售环节 产生收入与热度的方案

1.3 原始提示词(保留)

"我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定 吸引力的产品设计风格,提供产品创意以及设计画面的设计图。"


2. 材质体系与双轨训练策略

2.1 全材质体系(模型需要理解的全部范围)

胎体三大类:

类型 材质 特点 训练轨道
硬木胎 紫光檀、黑檀、红木、乌木 可量产主力,工厂友好 core
大漆胎 传统大漆木胎、脱胎漆器 高端传统,工时长 extended
金属胎 铜胎、银胎、混合胎 现代感强,适合首饰 extended

镶嵌材料全谱:

材料 特征 训练轨道
贝母螺钿(厚/薄/砌) 虹彩光泽,主力材料 core
银丝螺钿 拉丝/编丝/线条感 core
朱砂 填色/点缀,传统感 extended
金属箔片(金/银箔) 奢华感叠加 extended
组合工艺 多材质混嵌 extended(core 稳定后)

2.2 双轨训练策略(V2.1 核心修正)

原则:训练侧全工艺语义覆盖,但 core 必须先于 extended 稳定。

core(当前主线)              extended(扩展域)
──────────────               ──────────────────
硬木胎 + 贝母/银丝            大漆/金属胎/朱砂/组合
商业主力产品                  工艺语义补全
先训练,先评估                core 稳定后按比例注入

分阶段样本比例:

阶段 图片总量 core:extended 说明
Phase 1(当前) < 30张 10:0 全 core,不引入 extended
Phase 2 30-100张 8:2 开始按比例注入 extended
Phase 3 100张+ 7:3 或 6:4 视 extended 增益评估调整

防回归机制:

  • extended 样本默认进 reference_only/,经人工合规审核后才能转 trainable/
  • 每轮训练固定保留独立的 core 验证集,extended 注入前后均需对比 core 指标不退化

3. 双引擎架构

┌─────────────────────────────────────────────────────┐
│                   用户输入(自然语言)                  │
└──────────────────────┬──────────────────────────────┘
                       │
        ┌──────────────▼──────────────────┐
        │  [拦截层] 文化禁忌词库            │ ← 硬规则,命中即拒绝
        │  cultural_taboos.yaml            │   不消耗推理 token
        └──────────────┬──────────────────┘
                       │ 通过
        ┌──────────────▼──────────────────┐
        │  理解引擎(LLaVA QLoRA)          │
        │  - 理解用户需求与参考图片          │
        │  - RAG 注入文化知识               │
        │  - 生成 design_brief.json        │
        │  - 工艺可行性评估(规则打分)      │
        └──────────────┬──────────────────┘
                       │ design_brief.json
        ┌──────────────▼──────────────────┐
        │  规则评估器(Evaluator)          │
        │  - 工厂可行性(尺寸/工时/工序)   │
        │  - 市场匹配(客群/价格带/风格)   │
        │  score ≥ 0.6 → 继续              │
        │  score < 0.6 → 返回修改建议      │
        └──────────────┬──────────────────┘
                       │ 评分 ≥ 0.6
        ┌──────────────▼──────────────────┐
        │  生成引擎(SDXL LoRA → ComfyUI) │
        │  - 接收 sdxl_prompt              │
        │  - 螺钿风格 LoRA 控制质量         │
        │  - 输出位图(PNG / WebP)         │
        │  [SVG 为可选后处理,非原生能力]   │
        └──────────────┬──────────────────┘
                       │
        ┌──────────────▼──────────────────┐
        │  输出包(三件套)                 │
        │  1. 设计图(PNG/WebP)            │
        │  2. 工厂参数卡                    │
        │  3. 市场适配建议                  │
        └─────────────────────────────────┘

引擎选型确认:

  • 生成引擎:SDXL + LoRA(非 FLUX)
    • SDXL 推理 ~6GB,LoRA 训练 ~7GB,8GB 显存可用
    • FLUX.1-dev 需 ~23GB,FLUX.1-schnell 量化版仍需 ~12GB,均超出限制
    • kohya_ss 已在项目目录内,工具链现成

4. 子系统设计

4.1 子系统 A:采集器

目标:持续收集全工艺螺钿 + 时尚参考 + 文化素材

合规来源优先级

  1. Unsplash / Pexels / Pixabay(CC0,可商用)
  2. 博物馆数字藏品(通常 CC BY)
  3. 网络采集(一律进 reference_only,不入训练集)

输出目录结构:

images/
  ├── trainable/
  │   ├── core/            ← 硬木胎 + 贝母/银丝(经审核)
  │   └── extended/        ← 大漆/金属/朱砂(经合规审核后入)
  └── reference_only/
      └── trend/           ← 时尚趋势参考(版权不明)

annotations/
  ├── core/
  ├── extended/
  └── mapping_logs/        ← design_brief → dataset_schema 转换日志

必存合规字段source_urllicensecrawl_timeusage_note


4.2 子系统 B:文化知识库

技术栈(确定):

组件 选型 理由
向量数据库 ChromaDB(本地) 纯 CPU,不占显存
Embedding 模型 BGE-M3 中英双语,CPU 可运行
检索方式 语义 + 关键词混合 文化专业词汇关键词更精确

知识卡片结构:

  • 文化元素词表(上海海派视觉符号、欧美偏好语言)
  • 视觉映射(图形、色彩、材质倾向)
  • 商业映射(客群、价格带、适配平台)
  • 文化禁忌条目(单独提取入 cultural_taboos.yaml

推理注入链:

用户提示词 → ChromaDB 检索 → 相关语义片段 → LLaVA 生成 design_brief

4.3 文化禁忌拦截层(B 的硬规则前置)

文件:knowledge/rules/cultural_taboos.yaml

拦截时机:在 brief 生成之前,直接对用户输入做词汇/语义匹配。命中即拒绝,返回具体原因。

禁忌类型举例:

color_taboos:
  - market: EU_NA
    pattern: ["纯白+葬礼语境", "纯黑+特定宗教语境"]
    reason: "特定场景下的文化误用风险"

symbol_taboos:
  - pattern: ["卍", "swastika"]
    market: EU_NA
    reason: "与纳粹符号混淆,欧美市场绝对禁止"
  - pattern: ["倒五角星+特定组合"]
    reason: "撒旦主义联想,欧美部分客群强烈抵触"

cultural_appropriation:
  - pattern: ["印第安头饰", "土著图腾"]
    market: NA
    reason: "北美文化挪用敏感领域"

4.4 子系统 C:Orchestrator(提示词编排)

设计 Brief(分阶段字段策略)

Phase 1 精简版(当前使用,8个核心字段):

{
  "product_type": "handheld_mirror",
  "cultural_theme": {
    "cn_element": "上海海派 Art Deco",
    "market_target": "EU"
  },
  "visual_spec": {
    "motif": "外滩建筑剪影 + 几何线条",
    "style_keywords": ["geometric_silhouette", "iridescent", "minimalist"]
  },
  "material_spec": {
    "substrate": "purple_sandalwood",
    "inlay_primary": "nacre"
  },
  "production_params": {
    "dimensions": "12x8x0.5cm",
    "production_time": "6-8h"
  },
  "generation_params": {
    "sdxl_prompt": ""
  }
}

Phase 2 完整版(管道跑通后扩展,18个字段):

完整字段在 Phase 1 基础上新增:

  • material_spec.inlay_secondary(组合材质)
  • material_spec.surface_finish
  • production_params.cost_tier
  • production_params.complexity
  • production_params.factory_notes
  • generation_params.negative_prompt
  • generation_params.style_lora
  • cultural_theme.cultural_notes(RAG 召回片段)
  • evaluation(评分器填入)

4.5 规则评估器(V2.1 修正:规则优先,不做模型打分)

评分维度与规则:

维度1:工厂可行性(manufacturability)

检查项 规则 权重
尺寸合理性 长/宽/高在工厂标准加工范围内 0.3
工时范围 单品 6-10 小时(超出为 complex,低于为 simple) 0.25
材质组合现实性 substrate × inlay 组合在已知工艺体系内 0.25
工序复杂度 complexity ≠ "complex"(本阶段不接 complex) 0.2

维度2:市场匹配(market_fit)—— Phase 1 纯规则版

检查项 规则 权重
风格与目标市场匹配 EU/NA → geometric/minimalist ≥ 1个关键词 0.3
价格带匹配 产品类型 × cost_tier 在合理区间 0.25
文化禁忌缺席 通过禁忌拦截层则此项满分 0.3
主题可识别性 motif 非空且可解释 0.15

为何不做模型打分(V2.1 修正理由): 当前无市场销售反馈数据,模型对自己生成的 brief 打分会形成"自评自证"的伪精确。 规则打分透明、可审计、可随销售数据积累后升级为模型打分。

三档评分行动:

综合分 标签 dataset_schema production_feasibility 行动
≥ 0.8 高可行性 "high" 自动通过,直接生成
0.6-0.8 中等 "medium" 带警告生成,标注待人工确认
< 0.6 不可行 不入数据集 返回修改建议,拒绝生成

4.6 字段映射层(V2.1 新增:design_brief → dataset_schema)

这一层是数据飞轮的关键:使 brief 生成的设计可以回流为新的训练数据。

design_brief 字段 dataset_schema 字段 映射规则
product_type product_type 直接映射
cultural_theme.cn_element visual_subject 主题抽取为可视对象
visual_spec.style_keywords design_style 关键词归并
visual_spec.motif visual_description_cn 中文视觉主描述
material_spec.substrate base_material 术语标准化(purple_sandalwood→紫光檀)
material_spec.inlay_primary + inlay_secondary inlay_material 组合拼接
production_params.complexity complexity_level simple/medium 直接映射
production_params.factory_notes technical_specs.inlay_technique 提取工艺关键词
production_params.dimensions technical_specs.dimensions 直接映射
production_params.production_time technical_specs.production_time 直接映射
production_params.cost_tier technical_specs.cost_level low/mid/high → 经济/中等/高端
cultural_theme.market_target market_orientation EU/NA/CN → 欧美/中国/全球
generation_params.sdxl_prompt prompt_template 存模板或实例文本
evaluation.manufacturability_score production_feasibility 按三档阈值映射
user_prompt_raw visual_description_cn(附注) 保留用户原文

自动生成字段:

  • visual_description_en:由 tags_mapping.json 规则标准化
  • reference_tags:由 style_keywords + cultural_notes 自动提取

5. 完整脚手架目录

模型进阶V1/
├── README.md
├── docs/
│   ├── 子项目执行计划-V2.1.md
│   ├── 数据合规与授权规范.md
│   ├── design_brief字段说明.md          ← Phase1精简版 + Phase2完整版
│   └── 评估规则说明.md
│
├── collector/
│   ├── configs/
│   │   ├── keyword_pools.yaml           ← 全工艺中英关键词(core/extended分类)
│   │   └── source_whitelist.yaml        ← 合规来源白名单
│   └── scripts/
│       ├── crawl_images.py
│       ├── deduplicate_images.py         ← pHash 感知哈希去重
│       └── build_source_meta.py
│
├── knowledge/
│   ├── corpus/                          ← 文化资料原文(PDF/MD/TXT)
│   ├── rules/
│   │   ├── cultural_taboos.yaml         ← 硬规则拦截词库(V2.1 新增)
│   │   ├── manufacturability_rules.yaml
│   │   └── market_fit_rules.yaml
│   ├── scripts/
│   │   ├── ingest_texts.py
│   │   ├── build_vector_index.py        ← ChromaDB + BGE-M3
│   │   └── query_knowledge.py
│   └── index/                           ← ChromaDB 本地索引
│
├── orchestrator/
│   ├── templates/
│   │   ├── design_brief_phase1.json     ← 精简版(8字段)
│   │   └── design_brief_phase2.json     ← 完整版(18字段)
│   └── scripts/
│       ├── generate_design_brief.py
│       └── brief_to_schema_mapping.py   ← 字段映射层(V2.1 新增)
│
├── evaluator/
│   └── scripts/
│       └── score_design.py              ← 规则打分(三档:high/medium/reject)
│
└── generation/
    ├── comfyui_workflows/
    │   └── luodian_sdxl.json            ← ComfyUI SDXL workflow 模板
    └── scripts/
        └── run_generation.py            ← 调用 ComfyUI API,输出 PNG/WebP

6. 执行节奏(V2.1 版)

阶段 时长 内容 优先理由
第1阶段 1周 锁定 core 数据定义 + 字段映射层建立 保证数据闭环可跑
第2阶段 1周 文化知识库(ChromaDB+BGE-M3 最小可用)+ 禁忌词库初版 RAG 上线,brief 生成有内容
第3阶段 1周 编排器(Phase1精简brief + 规则评估器) 最快路径出第一个可验证结果
第4阶段 2周 SDXL 螺钿风格 LoRA 训练(kohya_ss + ComfyUI) 独立于LLaVA,可并行推进
第5阶段 2-3周 采集链路打通 + core 数据扩充至30张 合规审查需要时间,后置
第6阶段 持续 extended 按比例注入 + LLaVA 新一轮 LoRA 迭代 core 稳定后启动

7. 多 Agent 扩展开口(预留,不入核心架构)

当前决策:基于 Token 成本与项目盈利预期,Swarms 多 Agent 协同暂不纳入核心架构。 所有模块按"单 Agent 顺序执行"模式实现。

开口条件(满足任一可评估升级):

  1. 项目产生稳定收入,Token 成本可被商业化抵消
  2. Claude Code Swarms 官方正式发布且成本结构明确
  3. 单 Agent 模式出现明显瓶颈(如数据采集与知识库更新串行太慢)

接口规范(现在即按此编写,升级零成本):

# 每个子系统统一接口 → 未来改为 Agent 委托时,逻辑不变,调用方式变

def run_taboo_check(user_input: str) -> TabooResult: ...
def run_knowledge_query(query: str) -> KnowledgeResult: ...
def run_brief_generator(user_input: str, knowledge: KnowledgeResult) -> DesignBrief: ...
def run_evaluator(brief: DesignBrief) -> EvaluationResult: ...
def run_generator(brief: DesignBrief) -> GenerationResult: ...
def map_brief_to_schema(brief: DesignBrief) -> DatasetRecord: ...

# 当前:顺序执行
taboo  = run_taboo_check(user_input)
if taboo.blocked: return taboo.reason
knowledge = run_knowledge_query(user_input)
brief     = run_brief_generator(user_input, knowledge)
eval_     = run_evaluator(brief)
if eval_.score < 0.6: return eval_.suggestions
result    = run_generator(brief)
record    = map_brief_to_schema(brief)   # 回流训练数据

# 未来 Swarms:并发委托(接口签名不变)

8. 验收标准

8.1 架构验收

  • 双引擎分工清晰,design_brief.json 是唯一跨引擎接口
  • 禁忌拦截层在 brief 生成之前执行
  • 规则评估器独立于生成引擎(不存在"自评自证")

8.2 数据验收

  • core/trainableextended/reference_only 边界明确
  • 所有图片有 source_url/license/crawl_time 合规追踪
  • 字段映射层可将 brief 自动转换为 dataset_schema 格式

8.3 训练验收

  • Phase 2 注入 extended 前后,core 验证集指标不退化
  • 生成结果包含可执行的工厂参数卡(不只是视觉概念图)

8.4 商业验收

  • 输出包含:客群、价格带、平台建议
  • score < 0.6 的方案返回具体修改建议(闭环)
  • 输出设计的市场适配分高于无垂直训练的通用模型基准

9. 当前决议

已落版:

  • 全工艺双轨训练策略(core 先行,extended 按比例注入)
  • 双引擎结构(LLaVA 理解 + SDXL 生成,ComfyUI 管道)
  • 禁忌拦截层(YAML 硬规则,brief 生成前执行)
  • 规则优先评估器(三档阈值,不做模型打分)
  • 字段映射层(design_brief → dataset_schema,数据飞轮闭环)
  • Phase 1 精简 brief(8 字段),Phase 2 完整 brief(18 字段)
  • Swarms 预留接口(开口但不入核心)

暂不执行:

  • 脚手架代码开发
  • 爬取脚本开发
  • 知识库服务化部署

下一步决策点:

  • 确认第1阶段启动时间(锁定 core 定义 + 字段映射)
  • 提供文化资料文本(上海海派、欧美偏好)供知识库构建
  • 提供 SDXL 螺钿风格参考图(10-20张,供 LoRA 训练)