Instructions to use KaKa427/luodian-vertical-model with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use KaKa427/luodian-vertical-model with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("fill-in-base-model", dtype=torch.bfloat16, device_map="cuda") pipe.load_lora_weights("KaKa427/luodian-vertical-model") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Draw Things
- DiffusionBee
螺钿垂直模型子项目方案(模型进阶 V1)
1. 文档定位
- 文档用途:作为【螺钿垂直模型】的进阶子项目立项与执行框架,用于你与 Claude 的同步评估。
- 当前状态:仅做方案落版与架构设计,不在本阶段生成代码脚手架。
- 目标导向:在“工艺可落地 + 市场可接受 + 文化可解释”的前提下,提升螺钿设计生成质量与商业可用性。
2. 你的原文提示词(保留)
我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定吸引力的产品设计风格,提供产品创意以及设计画面的设计图。(提示词结束)
3. 项目核心判断
- 现有 LLaVA QLoRA 路线更擅长“图文理解/描述”,不等同于“高质量图片生成主力模型”。
- 文化理解能力优先通过
RAG(检索增强)注入,不建议在 8GB 显存下先做重型文本微调。 - 需要把“文化知识注入”和“设计图生成”解耦,形成双引擎协作:
- 文化知识引擎:理解上海/欧美文化语义与市场偏好;
- 设计生成引擎:输出可制造、可销售的设计方案与视觉图。
4. 子项目总体架构
4.1 子系统 A:互联网图片采集与训练素材准备
- 目标:持续收集螺钿图、时尚元素图、欧美偏好图、中国文化符号图。
- 输入:关键词模板、来源白名单、采集配额。
- 输出:
images/分层目录(seed / student_xxx / trend_xxx)annotations/对应 JSON 标注source_meta.jsonl(记录来源、时间、license、url)
4.2 子系统 B:文化理解模块(知识库)
- 目标:学习你上传的书籍、论文、文化文本(如上海文化、欧美文化偏好),并在推理时召回。
- 输入:PDF/Word/TXT/Markdown 文本资料。
- 输出:
- 分块后的知识库语料
- 向量索引
- 结构化知识卡(文化元素、视觉符号、禁忌、市场偏好)
4.3 子系统 C:提示词编排与落地评估
- 目标:把用户自然语言需求转换为“可生成 + 可制造 + 可销售”的设计任务。
- 输出:
design_brief.json(创意目标、市场定位、工艺限制、成本级别)- 图像生成 prompt 套件
- 工艺可行性评分与风险说明
5. 互联网抓图模块设计(A)
5.1 采集对象范围
- 螺钿与相关工艺:贝母、银丝、木胎、平嵌、浅雕、海派工艺等。
- 时尚元素:奢侈品牌视觉语言、欧美生活方式、音乐/展陈/产品视觉。
- 中国元素:海派文化、城市符号、传统纹样的现代化表达。
5.2 采集流程
- 关键词池生成(含中英关键词)。
- 多源抓取(优先 API 和可授权来源)。
- 下载入临时区。
- 自动去重(pHash/感知哈希)。
- 质量过滤(清晰度、分辨率、可读性)。
- 标注增强(主题、风格、材质、市场方向)。
- 入正式库并同步
source_meta.jsonl。
5.3 合规与风控
- 必存字段:
source_url、license、crawl_time、usage_note。 - 严禁将版权风险不明素材直接进入训练主集。
- 建议把素材分为:
trainable/(可训练)reference_only/(仅风格参考,不入训练)
6. 文化理解模块设计(B)
6.1 知识输入与处理
- 文本解析:PDF/Docx/TXT 标准化。
- 语义分块:按章节与主题切片。
- 向量化建库:支持相似检索与关键词检索。
- 生成知识卡片:
- 文化元素词表(上海海派、欧美偏好)
- 视觉映射(图形、色彩、材质倾向)
- 商业映射(客群、价格带、场景)
6.2 推理注入机制(推荐)
用户提示词 -> 检索知识 -> 生成 design_brief -> 图像生成- 优先
RAG 注入而非先做文本微调。 - 只有当知识稳定且样本量足够时,再考虑做小规模 SFT。
7. 与主体模型的协作关系
- 主体(当前):螺钿工艺理解 + 基础视觉语义能力(LLaVA)。
- 子项目增强:
- 数据层:更多“螺钿 + 时尚 + 文化”多样素材;
- 知识层:文化语义检索增强;
- 决策层:可落地评估与市场导向过滤。
- 目标输出:
- 创意文本说明
- 设计画面(生成模型输出)
- 工艺参数(可工厂执行)
- 市场适配建议(欧美/中国)
8. 脚手架思路(本阶段只设计,不实现)
8.1 建议目录
模型进阶V1/
├─ README.md
├─ docs/
│ ├─ 子项目执行计划.md
│ ├─ 数据合规与授权规范.md
│ └─ Claude评估清单.md
├─ collector/
│ ├─ configs/
│ │ ├─ keyword_pools.yaml
│ │ └─ source_whitelist.yaml
│ ├─ scripts/
│ │ ├─ crawl_images.py
│ │ ├─ deduplicate_images.py
│ │ └─ build_source_meta.py
│ └─ output/
├─ knowledge/
│ ├─ corpus/
│ ├─ scripts/
│ │ ├─ ingest_texts.py
│ │ ├─ build_vector_index.py
│ │ └─ query_knowledge.py
│ └─ index/
├─ orchestrator/
│ ├─ templates/
│ │ └─ design_brief.template.json
│ └─ scripts/
│ └─ generate_design_brief.py
└─ evaluator/
├─ rules/
│ ├─ manufacturability_rules.yaml
│ └─ market_fit_rules.yaml
└─ scripts/
└─ score_design.py
8.2 接口思路
collector -> dataset:输出图片与标注草稿。knowledge -> orchestrator:返回检索片段和文化要点。orchestrator -> evaluator:生成可评分设计任务。evaluator -> training/inference:通过阈值过滤低可行方案。
9. 执行节奏建议(V1)
- 第1阶段(1-2周):采集链路打通 + 合规标注字段固定。
- 第2阶段(1周):文化知识库最小可用(可检索、可注入)。
- 第3阶段(1-2周):提示词编排 + 工艺/市场双评分。
- 第4阶段:回灌训练集,启动新一轮 LoRA/生成模型迭代。
10. 给 Claude 的同步评估清单
- 架构是否正确解耦了“文化理解”和“图像生成”?
- 在 8GB 显存约束下,RAG 优先是否合理?
- 采集与训练数据的版权合规流程是否足够?
design_brief字段是否满足工厂落地与市场评估?- 当前 V1 是否需要先做“参考库”与“训练库”分离?
- 主体模型(LLaVA)与后续生成模型(如 SDXL/FLUX)协作边界是否清晰?
- 哪些模块应最先实现,才能最快产生可验证业务价值?
11. 当前决议
- 已落版:子项目总体框架、原始提示词保留、脚手架设计思路、执行节奏与评估清单。
- 暂不执行:脚手架代码生成、抓取脚本开发、知识库服务化部署。