# 螺钿垂直模型子项目方案(模型进阶 V1) ## 1. 文档定位 - 文档用途:作为【螺钿垂直模型】的进阶子项目立项与执行框架,用于你与 Claude 的同步评估。 - 当前状态:仅做方案落版与架构设计,不在本阶段生成代码脚手架。 - 目标导向:在“工艺可落地 + 市场可接受 + 文化可解释”的前提下,提升螺钿设计生成质量与商业可用性。 --- ## 2. 你的原文提示词(保留) > 我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定吸引力的产品设计风格,提供产品创意以及设计画面的设计图。(提示词结束) --- ## 3. 项目核心判断 1. 现有 LLaVA QLoRA 路线更擅长“图文理解/描述”,不等同于“高质量图片生成主力模型”。 2. 文化理解能力优先通过 `RAG(检索增强)` 注入,不建议在 8GB 显存下先做重型文本微调。 3. 需要把“文化知识注入”和“设计图生成”解耦,形成双引擎协作: - 文化知识引擎:理解上海/欧美文化语义与市场偏好; - 设计生成引擎:输出可制造、可销售的设计方案与视觉图。 --- ## 4. 子项目总体架构 ## 4.1 子系统 A:互联网图片采集与训练素材准备 - 目标:持续收集螺钿图、时尚元素图、欧美偏好图、中国文化符号图。 - 输入:关键词模板、来源白名单、采集配额。 - 输出: - `images/` 分层目录(seed / student_xxx / trend_xxx) - `annotations/` 对应 JSON 标注 - `source_meta.jsonl`(记录来源、时间、license、url) ## 4.2 子系统 B:文化理解模块(知识库) - 目标:学习你上传的书籍、论文、文化文本(如上海文化、欧美文化偏好),并在推理时召回。 - 输入:PDF/Word/TXT/Markdown 文本资料。 - 输出: - 分块后的知识库语料 - 向量索引 - 结构化知识卡(文化元素、视觉符号、禁忌、市场偏好) ## 4.3 子系统 C:提示词编排与落地评估 - 目标:把用户自然语言需求转换为“可生成 + 可制造 + 可销售”的设计任务。 - 输出: - `design_brief.json`(创意目标、市场定位、工艺限制、成本级别) - 图像生成 prompt 套件 - 工艺可行性评分与风险说明 --- ## 5. 互联网抓图模块设计(A) ## 5.1 采集对象范围 - 螺钿与相关工艺:贝母、银丝、木胎、平嵌、浅雕、海派工艺等。 - 时尚元素:奢侈品牌视觉语言、欧美生活方式、音乐/展陈/产品视觉。 - 中国元素:海派文化、城市符号、传统纹样的现代化表达。 ## 5.2 采集流程 1. 关键词池生成(含中英关键词)。 2. 多源抓取(优先 API 和可授权来源)。 3. 下载入临时区。 4. 自动去重(pHash/感知哈希)。 5. 质量过滤(清晰度、分辨率、可读性)。 6. 标注增强(主题、风格、材质、市场方向)。 7. 入正式库并同步 `source_meta.jsonl`。 ## 5.3 合规与风控 - 必存字段:`source_url`、`license`、`crawl_time`、`usage_note`。 - 严禁将版权风险不明素材直接进入训练主集。 - 建议把素材分为: - `trainable/`(可训练) - `reference_only/`(仅风格参考,不入训练) --- ## 6. 文化理解模块设计(B) ## 6.1 知识输入与处理 1. 文本解析:PDF/Docx/TXT 标准化。 2. 语义分块:按章节与主题切片。 3. 向量化建库:支持相似检索与关键词检索。 4. 生成知识卡片: - 文化元素词表(上海海派、欧美偏好) - 视觉映射(图形、色彩、材质倾向) - 商业映射(客群、价格带、场景) ## 6.2 推理注入机制(推荐) - `用户提示词 -> 检索知识 -> 生成 design_brief -> 图像生成` - 优先 `RAG 注入` 而非先做文本微调。 - 只有当知识稳定且样本量足够时,再考虑做小规模 SFT。 --- ## 7. 与主体模型的协作关系 1. 主体(当前):螺钿工艺理解 + 基础视觉语义能力(LLaVA)。 2. 子项目增强: - 数据层:更多“螺钿 + 时尚 + 文化”多样素材; - 知识层:文化语义检索增强; - 决策层:可落地评估与市场导向过滤。 3. 目标输出: - 创意文本说明 - 设计画面(生成模型输出) - 工艺参数(可工厂执行) - 市场适配建议(欧美/中国) --- ## 8. 脚手架思路(本阶段只设计,不实现) ## 8.1 建议目录 ```text 模型进阶V1/ ├─ README.md ├─ docs/ │ ├─ 子项目执行计划.md │ ├─ 数据合规与授权规范.md │ └─ Claude评估清单.md ├─ collector/ │ ├─ configs/ │ │ ├─ keyword_pools.yaml │ │ └─ source_whitelist.yaml │ ├─ scripts/ │ │ ├─ crawl_images.py │ │ ├─ deduplicate_images.py │ │ └─ build_source_meta.py │ └─ output/ ├─ knowledge/ │ ├─ corpus/ │ ├─ scripts/ │ │ ├─ ingest_texts.py │ │ ├─ build_vector_index.py │ │ └─ query_knowledge.py │ └─ index/ ├─ orchestrator/ │ ├─ templates/ │ │ └─ design_brief.template.json │ └─ scripts/ │ └─ generate_design_brief.py └─ evaluator/ ├─ rules/ │ ├─ manufacturability_rules.yaml │ └─ market_fit_rules.yaml └─ scripts/ └─ score_design.py ``` ## 8.2 接口思路 - `collector -> dataset`:输出图片与标注草稿。 - `knowledge -> orchestrator`:返回检索片段和文化要点。 - `orchestrator -> evaluator`:生成可评分设计任务。 - `evaluator -> training/inference`:通过阈值过滤低可行方案。 --- ## 9. 执行节奏建议(V1) 1. 第1阶段(1-2周):采集链路打通 + 合规标注字段固定。 2. 第2阶段(1周):文化知识库最小可用(可检索、可注入)。 3. 第3阶段(1-2周):提示词编排 + 工艺/市场双评分。 4. 第4阶段:回灌训练集,启动新一轮 LoRA/生成模型迭代。 --- ## 10. 给 Claude 的同步评估清单 1. 架构是否正确解耦了“文化理解”和“图像生成”? 2. 在 8GB 显存约束下,RAG 优先是否合理? 3. 采集与训练数据的版权合规流程是否足够? 4. `design_brief` 字段是否满足工厂落地与市场评估? 5. 当前 V1 是否需要先做“参考库”与“训练库”分离? 6. 主体模型(LLaVA)与后续生成模型(如 SDXL/FLUX)协作边界是否清晰? 7. 哪些模块应最先实现,才能最快产生可验证业务价值? --- ## 11. 当前决议 - 已落版:子项目总体框架、原始提示词保留、脚手架设计思路、执行节奏与评估清单。 - 暂不执行:脚手架代码生成、抓取脚本开发、知识库服务化部署。