Instructions to use KaKa427/luodian-vertical-model with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use KaKa427/luodian-vertical-model with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("fill-in-base-model", dtype=torch.bfloat16, device_map="cuda") pipe.load_lora_weights("KaKa427/luodian-vertical-model") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Draw Things
- DiffusionBee
| # 螺钿垂直模型子项目方案(模型进阶 V1) | |
| ## 1. 文档定位 | |
| - 文档用途:作为【螺钿垂直模型】的进阶子项目立项与执行框架,用于你与 Claude 的同步评估。 | |
| - 当前状态:仅做方案落版与架构设计,不在本阶段生成代码脚手架。 | |
| - 目标导向:在“工艺可落地 + 市场可接受 + 文化可解释”的前提下,提升螺钿设计生成质量与商业可用性。 | |
| --- | |
| ## 2. 你的原文提示词(保留) | |
| > 我希望设计款螺钿的产品,这个产品包含上海海派文化元素,并面向欧美市场具有一定吸引力的产品设计风格,提供产品创意以及设计画面的设计图。(提示词结束) | |
| --- | |
| ## 3. 项目核心判断 | |
| 1. 现有 LLaVA QLoRA 路线更擅长“图文理解/描述”,不等同于“高质量图片生成主力模型”。 | |
| 2. 文化理解能力优先通过 `RAG(检索增强)` 注入,不建议在 8GB 显存下先做重型文本微调。 | |
| 3. 需要把“文化知识注入”和“设计图生成”解耦,形成双引擎协作: | |
| - 文化知识引擎:理解上海/欧美文化语义与市场偏好; | |
| - 设计生成引擎:输出可制造、可销售的设计方案与视觉图。 | |
| --- | |
| ## 4. 子项目总体架构 | |
| ## 4.1 子系统 A:互联网图片采集与训练素材准备 | |
| - 目标:持续收集螺钿图、时尚元素图、欧美偏好图、中国文化符号图。 | |
| - 输入:关键词模板、来源白名单、采集配额。 | |
| - 输出: | |
| - `images/` 分层目录(seed / student_xxx / trend_xxx) | |
| - `annotations/` 对应 JSON 标注 | |
| - `source_meta.jsonl`(记录来源、时间、license、url) | |
| ## 4.2 子系统 B:文化理解模块(知识库) | |
| - 目标:学习你上传的书籍、论文、文化文本(如上海文化、欧美文化偏好),并在推理时召回。 | |
| - 输入:PDF/Word/TXT/Markdown 文本资料。 | |
| - 输出: | |
| - 分块后的知识库语料 | |
| - 向量索引 | |
| - 结构化知识卡(文化元素、视觉符号、禁忌、市场偏好) | |
| ## 4.3 子系统 C:提示词编排与落地评估 | |
| - 目标:把用户自然语言需求转换为“可生成 + 可制造 + 可销售”的设计任务。 | |
| - 输出: | |
| - `design_brief.json`(创意目标、市场定位、工艺限制、成本级别) | |
| - 图像生成 prompt 套件 | |
| - 工艺可行性评分与风险说明 | |
| --- | |
| ## 5. 互联网抓图模块设计(A) | |
| ## 5.1 采集对象范围 | |
| - 螺钿与相关工艺:贝母、银丝、木胎、平嵌、浅雕、海派工艺等。 | |
| - 时尚元素:奢侈品牌视觉语言、欧美生活方式、音乐/展陈/产品视觉。 | |
| - 中国元素:海派文化、城市符号、传统纹样的现代化表达。 | |
| ## 5.2 采集流程 | |
| 1. 关键词池生成(含中英关键词)。 | |
| 2. 多源抓取(优先 API 和可授权来源)。 | |
| 3. 下载入临时区。 | |
| 4. 自动去重(pHash/感知哈希)。 | |
| 5. 质量过滤(清晰度、分辨率、可读性)。 | |
| 6. 标注增强(主题、风格、材质、市场方向)。 | |
| 7. 入正式库并同步 `source_meta.jsonl`。 | |
| ## 5.3 合规与风控 | |
| - 必存字段:`source_url`、`license`、`crawl_time`、`usage_note`。 | |
| - 严禁将版权风险不明素材直接进入训练主集。 | |
| - 建议把素材分为: | |
| - `trainable/`(可训练) | |
| - `reference_only/`(仅风格参考,不入训练) | |
| --- | |
| ## 6. 文化理解模块设计(B) | |
| ## 6.1 知识输入与处理 | |
| 1. 文本解析:PDF/Docx/TXT 标准化。 | |
| 2. 语义分块:按章节与主题切片。 | |
| 3. 向量化建库:支持相似检索与关键词检索。 | |
| 4. 生成知识卡片: | |
| - 文化元素词表(上海海派、欧美偏好) | |
| - 视觉映射(图形、色彩、材质倾向) | |
| - 商业映射(客群、价格带、场景) | |
| ## 6.2 推理注入机制(推荐) | |
| - `用户提示词 -> 检索知识 -> 生成 design_brief -> 图像生成` | |
| - 优先 `RAG 注入` 而非先做文本微调。 | |
| - 只有当知识稳定且样本量足够时,再考虑做小规模 SFT。 | |
| --- | |
| ## 7. 与主体模型的协作关系 | |
| 1. 主体(当前):螺钿工艺理解 + 基础视觉语义能力(LLaVA)。 | |
| 2. 子项目增强: | |
| - 数据层:更多“螺钿 + 时尚 + 文化”多样素材; | |
| - 知识层:文化语义检索增强; | |
| - 决策层:可落地评估与市场导向过滤。 | |
| 3. 目标输出: | |
| - 创意文本说明 | |
| - 设计画面(生成模型输出) | |
| - 工艺参数(可工厂执行) | |
| - 市场适配建议(欧美/中国) | |
| --- | |
| ## 8. 脚手架思路(本阶段只设计,不实现) | |
| ## 8.1 建议目录 | |
| ```text | |
| 模型进阶V1/ | |
| ├─ README.md | |
| ├─ docs/ | |
| │ ├─ 子项目执行计划.md | |
| │ ├─ 数据合规与授权规范.md | |
| │ └─ Claude评估清单.md | |
| ├─ collector/ | |
| │ ├─ configs/ | |
| │ │ ├─ keyword_pools.yaml | |
| │ │ └─ source_whitelist.yaml | |
| │ ├─ scripts/ | |
| │ │ ├─ crawl_images.py | |
| │ │ ├─ deduplicate_images.py | |
| │ │ └─ build_source_meta.py | |
| │ └─ output/ | |
| ├─ knowledge/ | |
| │ ├─ corpus/ | |
| │ ├─ scripts/ | |
| │ │ ├─ ingest_texts.py | |
| │ │ ├─ build_vector_index.py | |
| │ │ └─ query_knowledge.py | |
| │ └─ index/ | |
| ├─ orchestrator/ | |
| │ ├─ templates/ | |
| │ │ └─ design_brief.template.json | |
| │ └─ scripts/ | |
| │ └─ generate_design_brief.py | |
| └─ evaluator/ | |
| ├─ rules/ | |
| │ ├─ manufacturability_rules.yaml | |
| │ └─ market_fit_rules.yaml | |
| └─ scripts/ | |
| └─ score_design.py | |
| ``` | |
| ## 8.2 接口思路 | |
| - `collector -> dataset`:输出图片与标注草稿。 | |
| - `knowledge -> orchestrator`:返回检索片段和文化要点。 | |
| - `orchestrator -> evaluator`:生成可评分设计任务。 | |
| - `evaluator -> training/inference`:通过阈值过滤低可行方案。 | |
| --- | |
| ## 9. 执行节奏建议(V1) | |
| 1. 第1阶段(1-2周):采集链路打通 + 合规标注字段固定。 | |
| 2. 第2阶段(1周):文化知识库最小可用(可检索、可注入)。 | |
| 3. 第3阶段(1-2周):提示词编排 + 工艺/市场双评分。 | |
| 4. 第4阶段:回灌训练集,启动新一轮 LoRA/生成模型迭代。 | |
| --- | |
| ## 10. 给 Claude 的同步评估清单 | |
| 1. 架构是否正确解耦了“文化理解”和“图像生成”? | |
| 2. 在 8GB 显存约束下,RAG 优先是否合理? | |
| 3. 采集与训练数据的版权合规流程是否足够? | |
| 4. `design_brief` 字段是否满足工厂落地与市场评估? | |
| 5. 当前 V1 是否需要先做“参考库”与“训练库”分离? | |
| 6. 主体模型(LLaVA)与后续生成模型(如 SDXL/FLUX)协作边界是否清晰? | |
| 7. 哪些模块应最先实现,才能最快产生可验证业务价值? | |
| --- | |
| ## 11. 当前决议 | |
| - 已落版:子项目总体框架、原始提示词保留、脚手架设计思路、执行节奏与评估清单。 | |
| - 暂不执行:脚手架代码生成、抓取脚本开发、知识库服务化部署。 | |