luodian-vertical-model / project_docs /framework_design_v1.md
KaKa427's picture
Add sub-project framework design V1
40598d2 verified
|
Raw
History Blame Contribute Delete
6.94 kB

螺钿垂直模型子项目方案(模型进阶 V1)

1. 文档定位

  • 文档用途:作为【螺钿垂直模型】的进阶子项目立项与执行框架,用于你与 Claude 的同步评估。
  • 当前状态:仅做方案落版与架构设计,不在本阶段生成代码脚手架。
  • 目标导向:在“工艺可落地 + 市场可接受 + 文化可解释”的前提下,提升螺钿设计生成质量与商业可用性。

2. 你的原文提示词(保留)

我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定吸引力的产品设计风格,提供产品创意以及设计画面的设计图。(提示词结束)


3. 项目核心判断

  1. 现有 LLaVA QLoRA 路线更擅长“图文理解/描述”,不等同于“高质量图片生成主力模型”。
  2. 文化理解能力优先通过 RAG(检索增强) 注入,不建议在 8GB 显存下先做重型文本微调。
  3. 需要把“文化知识注入”和“设计图生成”解耦,形成双引擎协作:
    • 文化知识引擎:理解上海/欧美文化语义与市场偏好;
    • 设计生成引擎:输出可制造、可销售的设计方案与视觉图。

4. 子项目总体架构

4.1 子系统 A:互联网图片采集与训练素材准备

  • 目标:持续收集螺钿图、时尚元素图、欧美偏好图、中国文化符号图。
  • 输入:关键词模板、来源白名单、采集配额。
  • 输出:
    • images/ 分层目录(seed / student_xxx / trend_xxx)
    • annotations/ 对应 JSON 标注
    • source_meta.jsonl(记录来源、时间、license、url)

4.2 子系统 B:文化理解模块(知识库)

  • 目标:学习你上传的书籍、论文、文化文本(如上海文化、欧美文化偏好),并在推理时召回。
  • 输入:PDF/Word/TXT/Markdown 文本资料。
  • 输出:
    • 分块后的知识库语料
    • 向量索引
    • 结构化知识卡(文化元素、视觉符号、禁忌、市场偏好)

4.3 子系统 C:提示词编排与落地评估

  • 目标:把用户自然语言需求转换为“可生成 + 可制造 + 可销售”的设计任务。
  • 输出:
    • design_brief.json(创意目标、市场定位、工艺限制、成本级别)
    • 图像生成 prompt 套件
    • 工艺可行性评分与风险说明

5. 互联网抓图模块设计(A)

5.1 采集对象范围

  • 螺钿与相关工艺:贝母、银丝、木胎、平嵌、浅雕、海派工艺等。
  • 时尚元素:奢侈品牌视觉语言、欧美生活方式、音乐/展陈/产品视觉。
  • 中国元素:海派文化、城市符号、传统纹样的现代化表达。

5.2 采集流程

  1. 关键词池生成(含中英关键词)。
  2. 多源抓取(优先 API 和可授权来源)。
  3. 下载入临时区。
  4. 自动去重(pHash/感知哈希)。
  5. 质量过滤(清晰度、分辨率、可读性)。
  6. 标注增强(主题、风格、材质、市场方向)。
  7. 入正式库并同步 source_meta.jsonl

5.3 合规与风控

  • 必存字段:source_urllicensecrawl_timeusage_note
  • 严禁将版权风险不明素材直接进入训练主集。
  • 建议把素材分为:
    • trainable/(可训练)
    • reference_only/(仅风格参考,不入训练)

6. 文化理解模块设计(B)

6.1 知识输入与处理

  1. 文本解析:PDF/Docx/TXT 标准化。
  2. 语义分块:按章节与主题切片。
  3. 向量化建库:支持相似检索与关键词检索。
  4. 生成知识卡片:
    • 文化元素词表(上海海派、欧美偏好)
    • 视觉映射(图形、色彩、材质倾向)
    • 商业映射(客群、价格带、场景)

6.2 推理注入机制(推荐)

  • 用户提示词 -> 检索知识 -> 生成 design_brief -> 图像生成
  • 优先 RAG 注入 而非先做文本微调。
  • 只有当知识稳定且样本量足够时,再考虑做小规模 SFT。

7. 与主体模型的协作关系

  1. 主体(当前):螺钿工艺理解 + 基础视觉语义能力(LLaVA)。
  2. 子项目增强:
    • 数据层:更多“螺钿 + 时尚 + 文化”多样素材;
    • 知识层:文化语义检索增强;
    • 决策层:可落地评估与市场导向过滤。
  3. 目标输出:
    • 创意文本说明
    • 设计画面(生成模型输出)
    • 工艺参数(可工厂执行)
    • 市场适配建议(欧美/中国)

8. 脚手架思路(本阶段只设计,不实现)

8.1 建议目录

模型进阶V1/
├─ README.md
├─ docs/
│  ├─ 子项目执行计划.md
│  ├─ 数据合规与授权规范.md
│  └─ Claude评估清单.md
├─ collector/
│  ├─ configs/
│  │  ├─ keyword_pools.yaml
│  │  └─ source_whitelist.yaml
│  ├─ scripts/
│  │  ├─ crawl_images.py
│  │  ├─ deduplicate_images.py
│  │  └─ build_source_meta.py
│  └─ output/
├─ knowledge/
│  ├─ corpus/
│  ├─ scripts/
│  │  ├─ ingest_texts.py
│  │  ├─ build_vector_index.py
│  │  └─ query_knowledge.py
│  └─ index/
├─ orchestrator/
│  ├─ templates/
│  │  └─ design_brief.template.json
│  └─ scripts/
│     └─ generate_design_brief.py
└─ evaluator/
   ├─ rules/
   │  ├─ manufacturability_rules.yaml
   │  └─ market_fit_rules.yaml
   └─ scripts/
      └─ score_design.py

8.2 接口思路

  • collector -> dataset:输出图片与标注草稿。
  • knowledge -> orchestrator:返回检索片段和文化要点。
  • orchestrator -> evaluator:生成可评分设计任务。
  • evaluator -> training/inference:通过阈值过滤低可行方案。

9. 执行节奏建议(V1)

  1. 第1阶段(1-2周):采集链路打通 + 合规标注字段固定。
  2. 第2阶段(1周):文化知识库最小可用(可检索、可注入)。
  3. 第3阶段(1-2周):提示词编排 + 工艺/市场双评分。
  4. 第4阶段:回灌训练集,启动新一轮 LoRA/生成模型迭代。

10. 给 Claude 的同步评估清单

  1. 架构是否正确解耦了“文化理解”和“图像生成”?
  2. 在 8GB 显存约束下,RAG 优先是否合理?
  3. 采集与训练数据的版权合规流程是否足够?
  4. design_brief 字段是否满足工厂落地与市场评估?
  5. 当前 V1 是否需要先做“参考库”与“训练库”分离?
  6. 主体模型(LLaVA)与后续生成模型(如 SDXL/FLUX)协作边界是否清晰?
  7. 哪些模块应最先实现,才能最快产生可验证业务价值?

11. 当前决议

  • 已落版:子项目总体框架、原始提示词保留、脚手架设计思路、执行节奏与评估清单。
  • 暂不执行:脚手架代码生成、抓取脚本开发、知识库服务化部署。