luodian-vertical-model / project_docs /framework_design_v1.md
KaKa427's picture
Add sub-project framework design V1
40598d2 verified
|
Raw
History Blame Contribute Delete
6.94 kB
# 螺钿垂直模型子项目方案(模型进阶 V1)
## 1. 文档定位
- 文档用途:作为【螺钿垂直模型】的进阶子项目立项与执行框架,用于你与 Claude 的同步评估。
- 当前状态:仅做方案落版与架构设计,不在本阶段生成代码脚手架。
- 目标导向:在“工艺可落地 + 市场可接受 + 文化可解释”的前提下,提升螺钿设计生成质量与商业可用性。
---
## 2. 你的原文提示词(保留)
> 我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定吸引力的产品设计风格,提供产品创意以及设计画面的设计图。(提示词结束)
---
## 3. 项目核心判断
1. 现有 LLaVA QLoRA 路线更擅长“图文理解/描述”,不等同于“高质量图片生成主力模型”。
2. 文化理解能力优先通过 `RAG(检索增强)` 注入,不建议在 8GB 显存下先做重型文本微调。
3. 需要把“文化知识注入”和“设计图生成”解耦,形成双引擎协作:
- 文化知识引擎:理解上海/欧美文化语义与市场偏好;
- 设计生成引擎:输出可制造、可销售的设计方案与视觉图。
---
## 4. 子项目总体架构
## 4.1 子系统 A:互联网图片采集与训练素材准备
- 目标:持续收集螺钿图、时尚元素图、欧美偏好图、中国文化符号图。
- 输入:关键词模板、来源白名单、采集配额。
- 输出:
- `images/` 分层目录(seed / student_xxx / trend_xxx)
- `annotations/` 对应 JSON 标注
- `source_meta.jsonl`(记录来源、时间、license、url)
## 4.2 子系统 B:文化理解模块(知识库)
- 目标:学习你上传的书籍、论文、文化文本(如上海文化、欧美文化偏好),并在推理时召回。
- 输入:PDF/Word/TXT/Markdown 文本资料。
- 输出:
- 分块后的知识库语料
- 向量索引
- 结构化知识卡(文化元素、视觉符号、禁忌、市场偏好)
## 4.3 子系统 C:提示词编排与落地评估
- 目标:把用户自然语言需求转换为“可生成 + 可制造 + 可销售”的设计任务。
- 输出:
- `design_brief.json`(创意目标、市场定位、工艺限制、成本级别)
- 图像生成 prompt 套件
- 工艺可行性评分与风险说明
---
## 5. 互联网抓图模块设计(A)
## 5.1 采集对象范围
- 螺钿与相关工艺:贝母、银丝、木胎、平嵌、浅雕、海派工艺等。
- 时尚元素:奢侈品牌视觉语言、欧美生活方式、音乐/展陈/产品视觉。
- 中国元素:海派文化、城市符号、传统纹样的现代化表达。
## 5.2 采集流程
1. 关键词池生成(含中英关键词)。
2. 多源抓取(优先 API 和可授权来源)。
3. 下载入临时区。
4. 自动去重(pHash/感知哈希)。
5. 质量过滤(清晰度、分辨率、可读性)。
6. 标注增强(主题、风格、材质、市场方向)。
7. 入正式库并同步 `source_meta.jsonl`
## 5.3 合规与风控
- 必存字段:`source_url``license``crawl_time``usage_note`
- 严禁将版权风险不明素材直接进入训练主集。
- 建议把素材分为:
- `trainable/`(可训练)
- `reference_only/`(仅风格参考,不入训练)
---
## 6. 文化理解模块设计(B)
## 6.1 知识输入与处理
1. 文本解析:PDF/Docx/TXT 标准化。
2. 语义分块:按章节与主题切片。
3. 向量化建库:支持相似检索与关键词检索。
4. 生成知识卡片:
- 文化元素词表(上海海派、欧美偏好)
- 视觉映射(图形、色彩、材质倾向)
- 商业映射(客群、价格带、场景)
## 6.2 推理注入机制(推荐)
- `用户提示词 -> 检索知识 -> 生成 design_brief -> 图像生成`
- 优先 `RAG 注入` 而非先做文本微调。
- 只有当知识稳定且样本量足够时,再考虑做小规模 SFT。
---
## 7. 与主体模型的协作关系
1. 主体(当前):螺钿工艺理解 + 基础视觉语义能力(LLaVA)。
2. 子项目增强:
- 数据层:更多“螺钿 + 时尚 + 文化”多样素材;
- 知识层:文化语义检索增强;
- 决策层:可落地评估与市场导向过滤。
3. 目标输出:
- 创意文本说明
- 设计画面(生成模型输出)
- 工艺参数(可工厂执行)
- 市场适配建议(欧美/中国)
---
## 8. 脚手架思路(本阶段只设计,不实现)
## 8.1 建议目录
```text
模型进阶V1/
├─ README.md
├─ docs/
│ ├─ 子项目执行计划.md
│ ├─ 数据合规与授权规范.md
│ └─ Claude评估清单.md
├─ collector/
│ ├─ configs/
│ │ ├─ keyword_pools.yaml
│ │ └─ source_whitelist.yaml
│ ├─ scripts/
│ │ ├─ crawl_images.py
│ │ ├─ deduplicate_images.py
│ │ └─ build_source_meta.py
│ └─ output/
├─ knowledge/
│ ├─ corpus/
│ ├─ scripts/
│ │ ├─ ingest_texts.py
│ │ ├─ build_vector_index.py
│ │ └─ query_knowledge.py
│ └─ index/
├─ orchestrator/
│ ├─ templates/
│ │ └─ design_brief.template.json
│ └─ scripts/
│ └─ generate_design_brief.py
└─ evaluator/
├─ rules/
│ ├─ manufacturability_rules.yaml
│ └─ market_fit_rules.yaml
└─ scripts/
└─ score_design.py
```
## 8.2 接口思路
- `collector -> dataset`:输出图片与标注草稿。
- `knowledge -> orchestrator`:返回检索片段和文化要点。
- `orchestrator -> evaluator`:生成可评分设计任务。
- `evaluator -> training/inference`:通过阈值过滤低可行方案。
---
## 9. 执行节奏建议(V1)
1. 第1阶段(1-2周):采集链路打通 + 合规标注字段固定。
2. 第2阶段(1周):文化知识库最小可用(可检索、可注入)。
3. 第3阶段(1-2周):提示词编排 + 工艺/市场双评分。
4. 第4阶段:回灌训练集,启动新一轮 LoRA/生成模型迭代。
---
## 10. 给 Claude 的同步评估清单
1. 架构是否正确解耦了“文化理解”和“图像生成”?
2. 在 8GB 显存约束下,RAG 优先是否合理?
3. 采集与训练数据的版权合规流程是否足够?
4. `design_brief` 字段是否满足工厂落地与市场评估?
5. 当前 V1 是否需要先做“参考库”与“训练库”分离?
6. 主体模型(LLaVA)与后续生成模型(如 SDXL/FLUX)协作边界是否清晰?
7. 哪些模块应最先实现,才能最快产生可验证业务价值?
---
## 11. 当前决议
- 已落版:子项目总体框架、原始提示词保留、脚手架设计思路、执行节奏与评估清单。
- 暂不执行:脚手架代码生成、抓取脚本开发、知识库服务化部署。