方案与实例研究 · 2026-09-02

AI 辅助工业设计:
从抽卡到流水线

为什么用 GPT / WorkBuddy 做外观设计还像抽奖,行业里谁已经不抽了、靠什么,以及一套落到你本机工具链上的流水线。

四路并行调研 · 约 150 个来源 · 覆盖 30 余款工具、40 余个团队案例、20 余篇 2025–2026 论文 · 原始调研见文末附录

一句话结论

行业里没有"短剧式"的端到端 ID 流水线产品。Vizcom 是唯一以工业设计为核心客群的 AI 工作台,但它官方口径是"AI 只在项目前 30% 有价值,品牌一致性、可制造性、生产交接不该交给 AI",评审留给人。短剧圈那种把 SOP 固化成节点平台的东西(LibTV),ID 领域不存在。

但成熟团队的做法高度一致,可以直接抄骨架。GM、Kia、Toyota TRI、Samsung、Key Tech、赫兹、KAIST 的公开流程套进同一个结构:人先定骨架(草图 / 白模),AI 批量填皮,人再过三道闸。一致性靠四件套:锚是形态不是 prompt、一个自训小模型、一份设计语言规范、把 AI 关在特定环节。与"聊天式抽卡"的本质区别是主输入是形态而不是文字,迭代是在上一轮上局部改而不是重抽。

你痛点的根因在两头。前面的需求输入层(AI 没关注到的输入直接出错)和后面的质检回环,2026 年没有人卖现成的,得自己搭;中间的流程编排和工具执行已经是选型问题。而 ID 比短剧有一个天然优势:ID 有 3D。白模是比短剧"首尾帧"强得多的结构锚,这一段你本机 8 月 24 日已经打通(CadQuery → STEP / GLB → Blender),缺的是前后两头。

01 / 方法论

短剧为什么不抽卡了:8 条原则,逐条对到 ID

AI 短剧 2026 年从"抽卡"变成"生产",靠的不是某个更强的模型,而是七八件事叠在一起。最关键的增量是视频模型原生支持"多参考 + @引用"(Seedance 2.0 全能参考 12 文件、可灵 3.0 主体参考 + API 角色库、Vidu Q3 参考生),把角色一致性从 ComfyUI 手工活变成模型内置能力;工作流层的共识是七步 SOP、JSON 分镜表、定妆照→三视图→角色库;LibTV 把整套 SOP 固化成节点平台,300 多家短剧公司在用。

把这些原则逐条翻译到 ID,成熟度差异极大。下表的成熟度是本次调研对 2026 年公开资料的判断,不是厂商口径。

#短剧原则ID 对应2026 成熟度关键证据 / 判断
1资产先行
定妆照→三视图→角色库,镜头只引用不重述
产品 DNA 文档(JSON)+ 3D 白模 + 固定参考图组★★☆没有行业标准的"产品 DNA schema",ALStudio、Sameness 做了雏形。但 Seedream 5.0 Pro / GPT Image 2 能吃 10–16 张参考,"DNA = 结构化 JSON + 一组固定参考图"已可操作。
2中间产物结构化
剧本→JSON 分镜表(镜号/景别/运镜/时长)
视角表(视角号/方位角/仰角/焦距/景别/材质版本/光照/用途)+ CMF 表★★★字段可以照抄短剧分镜表;LibTV 的"15 环绕点位 / 9 宫格"就是短剧版视角表生成器。爆炸图是空白:没有可靠的 AI 爆炸图方案,只能走 3D。
3描述改引用
@图片1、主体参考、--oref 消掉语义层随机性
多图参考 + mask 局部重绘:Seedream 5.0 Pro(10 图,官方示例就是"材质图 + 色卡改产品")、Nano Banana Pro(14 图)、GPT Image 2(16 图)、FLUX.2(10 图)、Qwen-Image-Edit-2511(官方写明"工业设计 / 材质替换")同视角 ★★★★
跨视角 ★★☆
同一视角下换材质 / 换色 / 局部改已是生产级;换视角同时保住细节仍靠"多参考 + 运气"。
4一致性分层叠加
身份(LoRA / FaceID)、结构(ControlNet / 首尾帧)、风格(style ref)各用各的
身份 = 3D 白模;结构 = depth / normal / canny ControlNet;风格 = 品牌 LoRA 或 Vizcom Palette结构 ★★★★
风格 LoRA ★★★
单品身份 LoRA ★☆
Liblib 上有多个工业设计品类模型(Cosin1.1、云墨阁、FLUX Detail),Vizcom Palette 是商业化的风格 LoRA。但"单款产品身份 LoRA"公开案例为零,原因合理:设计阶段产品本身在变,锁死没意义,ID 圈用白模当身份。
5局部修复代替整图重抽
ADetailer、inpaint、截图重绘
mask inpaint 只改坏的局部(Qwen-Edit-2511 / Flux Kontext / GPT Image 2 mask)★★★★你 8 月那份 260 条会话最大的浪费就在这里:9 轮整图重抽。API 走 mask 是刚需,ChatGPT 网页版没有。
6节点化 + 参数固化 + 一键重跑
ComfyUI / LibTV / Dify 打组
ID 专用 ComfyUI 工作流 / Claude Code skill 串联★★☆找到 10 个 ID 相关 ComfyUI 工作流(Liblib 工业产品精修、Reallusion 3D 控制集、akihungac 28 节点 depth+tile 栈等),全是单点工具,没有端到端流水线。这是空位。
7验收标准外置
抖音 2026-05 审片标准把穿模 / 同步 / 稳定写成硬指标
把"可接受漂移"定义成指标,再谈自动化★★☆短剧生产端也没有自动质检,QC 是人工看片 + 平台审片;VLM 打分只在学术端。ID 侧同理,见第 05 节。
8按可靠性分流
极速流(1 小时 50 元日更)vs 精品流(5–10 人 500–2000 元/集)
探索流(纯 2D 多参考,快,不保工程一致)vs 交付流(3D 优先,慢,保一致)★★★★不追求一条流程通吃。你现在的问题一部分就是用探索流的方法在要交付流的结果。

与短剧最大的不同

短剧的"一致"是观众感知层面的,LoRA 和参考图够用;ID 的"一致"最终要落到 CAD,分型线、孔位、R 角要跨视角不变。所有 2D 多视角方案(MV-Adapter、ViewMask-1-to-3、Nano Banana 多角度、Qwen 内置多角度)的评价指标都是 PSNR / IoU / 相似度,没有任何一篇公开资料用 ID 指标验证过。工程级一致 2026 年只有一条可靠路径:先有 3D,再固定相机出图。所以 ID 流水线应当以"3D 优先"而不是"LoRA 优先"组织,主锚是白模,LoRA 只管品牌风格层。

02 / 实例

谁在怎么干:40 多个案例里能找到步骤的

看了 40 多个来源之后的实际情况:大厂公开的多是态度,能找到"分几步、每步什么工具、人在哪把关"的不到 15 个。国内小米 / 华为 / 追觅 / 安克 / 云鲸 / 蔚来的设计中心没有带步骤的公开分享,洛可可只有访谈口径。下面是最有信息量的几个。

A · GM 设计部 · 2026-03

草图 → Vizcom 几十个变体 → 人选 → 动画

Chevy 草图到演示动画,原来多个团队几个月,现在一个设计师一天。原话:"什么像 Buick、什么像 Cadillac 仍然由我们决定。"设计师角色转为 art director,AI 只接管搭 CGI 这种耗人的环节。

A · Kia × Autodesk Research · AU 2024

关键词 + 草图 → 按 Kia 工作方式训练的轮毂生成工具

Kia 2018 年就试过市面 AI 工具,不满意,才走"和 Autodesk 一起按自己工作流定制训练"的路。设计约束整合进生成过程。全球设计团队约 400 人,未减员。

A · Toyota Research Institute · 2023-06

草图 + 风格词 + 工程约束 → 优化嵌进生成

风阻、离地间隙、座舱尺寸作为生成过程的一等输入,不是事后筛选。少数把工程约束前置的公开案例,仍属研究成果。

A · Samsung 家电 · 2025 Bespoke 洗碗机

AI 只做场景图,且标注披露

Magnific + Midjourney 出四张厨房场景图,Firefly 出开门演示图,每张标"由生成式 AI 创建"。产品本体(无把手结构、缎面玻璃门)全部人设计。大厂"AI 限定在沟通层不碰规格"的典型样本。

A · Key Tech 医疗器械设计咨询 · 2025-08 / 2026-05

唯一有公司级治理的样本

调研 ChatGPT → 品牌发散 Midjourney / Recraft → 实体 Midjourney 概念 + Vizcom 精修 + Luma 动画 → 展示图 Vizcom + KeyShot 合成。季度工具审计、Do / Don't 清单、计划做"设计评审 GPT"。原话:"Midjourney 对训练集外的新形态无力"、"任何涉及形态、比例、生产的输出必须由资深设计师和工程师审"。

A · Star 设计负责人 · 2026-02

按保真度切 AI 用法

低保真:多方向、轮廓比例、快速变体。中保真:材料工艺色彩、设计语言一致性检查、使用场景叙事。高保真:文档自动化、sanity check、公差配合、壁厚体积检查。主张学"AI 语言"(提示结构、参考策展、约束参数化、输出评估)而非某个工具。

B · 赫兹工业设计 深圳 · 2026-04

国内少见的五阶段工具 / 把关表

需求洞察(Google Trends AI)→ 概念发散(MJ / SD 百余图,人筛选 + 二创)→ 三维结构(Fusion 360 AI + 拓扑优化,人评可制造性)→ CMF(AI 渲染 + KeyShot,人定)→ 验证(ANSYS AI,人做工程决策)。三条教训:同质化必须二创、版权要专利检索、保留手绘建模防能力退化。

B · 普象 "无人区保险员" · 2024-02

国内最节点级的个人工作流

SD 出产品图 → MJ 出背景 → SAM 分割抠产品 → 遮罩 → IP-Adapter + 自训电商背景 LoRA 重绘融合 → 扩画板 → 放大 → PS 修饰。9 步全部有节点。一致性靠 IP-Adapter + 自训 LoRA。

C · Vizcom 平台层 · 2024-12 → 2026-02

企业客户共用的"一致性基础设施"

Custom Palette(4–30 张图训私有风格模型,团队共享);Component Library 指南(签名组件的圆角 / 比例 / 表面处理 + Pantone / RAL + 审批 owner + 季度复审);官方立场:AI 在项目前 1/3 加值最大,输入是草图定形态比例、提示词只管材质光照,输出 50–100 个变体,建立品牌一致性 / 可制造性 / 创意质量三重评审。

D · KAIST · UIST 2025

3D 草图解决多视角一致

2D 生成的两个痛点是每个视角要重画草图、多视角不一致;方案是先做表达性 3D 草图,再从任意视角出 2D 线稿喂生成。把"锚"从 2D 提升到 3D。

D · MIT Sketch2Prototype · 2024

文本作为中间模态

草图 → 文本(GPT-4V)→ 图像 → 3D → 打印 looks-like 原型。关键发现:以文本为中间层比直接 sketch→3D 更多样、更可制造,且便于人工反馈。

D · GID-HGCC 框架 · Symmetry 2026-02

可追溯的跨阶段工件链

需求确认 → 概念生成 → 概念评估 → 3D 建模,四阶段之间传"结构化提示 → 候选概念 → 评估输出 → 3D 工程问题清单",让约束一路传到工程交接。直指现有做法三缺:阶段角色不清、约束不可追溯、缺阶段化评估。

共同骨架:五段、三道闸、四个一致性装置

[0 调研 / brief]   LLM 整理需求、竞品、人物画像               ← Key Tech / 赫兹 / Konzepthaus / GID-HGCC
[1 发散]           文生图或草图生图出 50–1000 张              ← 全员;有经验者压缩此段
[2 收敛 / 锚定]    人手绘草图 / 白模 / 鞋楦 / 3D 草图 作为"锚"  ← GM / Mueller / KAIST / Braun 课程
[3 上皮]           草图驱动渲染(Vizcom / ComfyUI + ControlNet)← 最普遍、最稳定的 AI 落点
[4 3D / 工程]      Sub-D → NURBS / CAD;AI 3D 只当粗模         ← CATIA / Vizcom 客户 / Sketch2Prototype
[5 表达]           CMF 变体、场景、动画、展示图                ← Samsung / GM / Arsutoria / 普象

人工把关点固定在三道闸:1→2 选方向 · 3→4 形态 / 比例 / 可制造性 · 4→5 品牌一致性

聊天式抽卡(你现在的状态)

  • 主输入是文字 prompt,一张参考图
  • 每次从零重新生成
  • 一致性靠运气和反复 reroll
  • 约束事后肉眼筛
  • 全流程都想让 AI 做
  • 产物是一张图
  • 靠个人技巧

成功流程

  • 主输入是草图 / 白模 / 3D 草图,文字只管表皮
  • 在上一轮结果上局部修改,保留锚
  • 自训 Palette / LoRA + 组件规范 + 固定参考图组
  • 约束作为输入(TRI 风阻、Kia 设计约束)或固定检查闸
  • AI 限定在前 1/3 发散 + 上皮 + 表达层
  • 可追溯的工件链:草图 → 变体 → 选定 → 3D → 问题清单
  • 有 owner、指南、季度审计、披露标注
对话驱动的范式迫使视觉型设计师从视觉思维切换到组织语言指令,本身就是错配;专业工具的方向是多模态输入分解、直接视觉操控和节点式决策追踪。CHI 2026 工作坊《Design Generative AI for Practitioners》(Paris-Saclay / Lille),从业者访谈结论。这一句解释了为什么"GPT 聊天出图"再怎么写 prompt 都不对劲。

03 / 工具

工具地图:像素层可控的是外观,不是几何

盘了 30 余款工具,四个判断:

  1. 像素层已经"可控",但控的是外观。行业共识从 ControlNet 转向"多参考图 + 指令式局部编辑 + 私有风格模型":Midjourney V8.2 把四种参考机制合并成 Edit Model(4 参考图);Nano Banana Pro 14 图、FLUX.2 10 图、Seedream 5.0 Pro 10 图带点选 / 套索改材质和图层分离;Qwen-Image-Edit-2511 原生多角度视图。它们保的是"看起来像",尺寸、分型线、公差不可信。
  2. 图生 3D 全部只出网格,没有一家出 STEP。混元 3D 3.1(8 视角、水密网格、Omni 的 bbox / 骨架 / 点云控制、Part 组件级生成)、Tripo H3.1、Rodin Gen-2.5、Meshy 7(首个公开几何对齐基准)、TRELLIS.2 输出清一色 GLB / OBJ / STL。Tripo 官方博客自己写"非 CAD 精度"。定位是手板 / 打印 / 效果图底模,不是工程交付。
  3. "AI 原生 CAD"只在两个窄口跑通。代码型参数化(Zoo Zookeeper 2026-01,agent 写 KCL → B-rep,$20 / $99;Adam 已转做 Onshape / Fusion copilot)和扫描 → 参数化逆向(Backflip 2026-08 GA,网格 → 特征树 + STEP,车厂在用,$20/月起)。大厂路线仍未 GA:Autodesk Neural CAD pre-beta 无日期;SolidWorks LEO 说"2026 年中"没见公告;Onshape AI Advisor 不能读模型。
  4. "3D 优先、像素做上皮"在有 CAD 基线的品类已是共识,但没取代前期 2D。Vizcom 2026-01 官方博客标题就是"从第一天用 3D",Autodesk Form Explorer、Alias 路线一致。Vizcom 自己的产品数据表明用户主入口仍是草图 → 渲染,3D 是可选分支。混合流程会是 2026–2027 主流:2D 找方向 → 粗 3D 锁比例 → 像素层做 CMF / 场景。
工具调研情绪板草图效果图CMF3D工程 CAD评审可控机制 / 价格
Vizcom◐ 网格草图影响力滑杆、Palette 私有风格、3D 底、Free View 相机、Color Variations · Pro $49/月 · 客户 Ford / Honda / New Balance / Dell / 蔚来
Liblib / 星流LoRA 训练(10–20 图)+ ControlNet + ComfyUI,国内最接近 Vizcom 的自建路线 · 会员 5 次 LoRA 训练/月
Seedream 5.0 Pro10 参考图、点选 / 套索 / 草图交互编辑、材质色彩替换、图层分离 · 2026-07-08 发布 · 即梦入口
Nano Banana Pro / 214 参考图、局部选区、相机角度 · 品牌色会漂移,不适合最终交付
GPT Image 216 参考图(API,网页版只 5 张)、mask inpaint、带推理 · 约 $0.03–0.08/张
Qwen-Image-Edit-2511开源 Apache 2.0,原生多角度视图,官方列"工业设计 / 材质替换"用例 · 多步连续编辑会漂
Midjourney V8.2Edit Model 4 参考、sref · 无草图底控制 · 情绪板与方向探索之王
混元 3D 3.1 / Omni / Part8 视角重建、bbox / 骨架 / 点云控制、组件级生成 · 开源可控性最全 · 腾讯云 ¥0.1/积分 20 积分/次
Tripo H3.1 / Rodin 2.5 / Meshy 7多图、Quad 拓扑、对称强制、几何对齐基准 · 全部无 STEP
Zoo Zookeeperagent 写 KCL → 真 B-rep,多角度自检,STEP 导出 · Free / $20 / $99 · 小零件可用,A 级曲面不行
Backflip扫描 / STL / 网格 → 特征树 + STEP,Fusion add-in · 2026-08 GA · 效果图↔工程 CAD 之间唯一的桥
Fusion / SolidWorks / Onshape AI● 本体AutoConstrain 已上线;Neural CAD pre-beta、LEO 未 GA、AI Advisor 不读模型 · 2026 能落地的是约束自动化、出图自动化
即梦 / 可灵 / Lovart通用视觉与品牌设计,无 ID 流程 · 即梦 2026 年内多次涨价

● 核心能力 ◐ 可用但非主打 ○ 勉强 / 间接 — 不覆盖。完整 30 行矩阵及每个工具的来源见附录一。

空白带

调研环节几乎没有 ID 专门工具,靠通用 LLM;"效果图 ↔ 工程 CAD"之间只有 Backflip 一座桥;"CMF 数字化"里只有 Vizcom Color Variations、Seedream 材质替换、Substance Text-to-Texture 三个真正的功能点。国内格局是 3D 强(混元、Tripo 已盈利)、流程弱(没有对标 Vizcom 的 ID 工作台)。

04 / 需求输入层

一份可直接用的 ID 需求输入 Checklist

你说"要像产品经理一样,有些东西它不明确,AI 没关注到就直接错"。这件事行业早有标准答案,只是没人把它做成 AI 的必填字段。设计简报没有国际公认标准(Design Society 2012 综述明确说"很少见到真正完整的 brief"),但中文世界最可引用的是团体标准 T/GDIDA 001-2022《工业设计服务流程与质量控制要求》(广东省工业设计协会,起草单位含小熊电器、华帝、海信),第 4.5 条规定设计需求书必须包含的内容,5.2.2 规定设计输入须书面签署、输出不满足输入则须评审后变更输入。2025-09 挂网的国标《工业设计 产品形态设计指南》征求意见稿 6.3.3 又给出了形态设计的任务分解:布局 → 人机 → 比例 → 线型 → 色彩 → 装饰 → 效果图。

把 T/GDIDA、HFES 人体尺寸 7 步、Fictiv CMF 字段、Komaspec 注塑 DFM 数值规则合并,得到下面 11 个模块。这就是"先问清再生成"的字段表,也是后面质检回环的尺子。

模块字段来源
A 项目设计目的、设计类型(全新 / 改款 / 家族化)、成本目标(BOM / 售价)、设计周期、安全 / 可靠性要求、交付方式与版本T/GDIDA 4.5 注 3
B 商业产品定位、销售区域与渠道、竞品(定价 / 销量 / 趋势)、现有产品线中的位置T/GDIDA 4.5b/f;Phillips 7 要素
C 用户目标人群(年龄 / 性别 / 地域 / 职业)、使用场景、购买者 ≠ 使用者、地域文化色彩禁忌T/GDIDA 4.5c/d、4.8
D 品牌CI / VI / PI 要求、VBL 属性词、签名元素、"全家福不是克隆"约束、必须继承 / 必须回避的特征T/GDIDA 4.5g;Bolt Group;DCA
E 技术内部堆叠 / 关键零部件尺寸(PCB、电池、电机、屏)、接口 / 开孔、散热 / 防水等级、结构框架T/GDIDA 4.5i、4.16
F 人机目标人群百分位、关键身体尺寸、操作力 / 频率、握持 / 显示 / 操作区、姿势与衣物余量HFES 7 步;GB/T 草案 5.3
G 工艺 / CMF主材牌号与状态、工艺(注塑 / 压铸 / 钣金 / CNC)、表面(SPI、Mold-Tech 纹理号、漆型)、Pantone / RAL、供应商、金样、合规Fictiv;T/GDIDA 4.18c
H DFM 约束分型线 / 拔模方向、壁厚 map、筋 / boss 规则(壁厚变化 ≤±10%,筋根 40–60% 壁厚,内 R ≥0.5× 壁厚)、A/B/C 面等级、允许的分件 / 拼缝位置Komaspec;Crescent;Honokage
I 策略设计主题、意像板、ID / CMF / UX 关键词、理念诠释T/GDIDA 4.9
J 交付六面图 / 透视 / 局部透视 / 结构图 / CMF 板 / 丝印图 / 专利图 / stp 格式 3DT/GDIDA 4.18、5.3.2、5.3.4
K 评审四维度评审(质量性能含可制造性 / 用户体验含 CMF / 竞争力 / 品牌含形象一致性)+ 输入达成(成本 / 专利 / 上阶段问题闭环)T/GDIDA 5.2.3.3;ISO 9001 8.3.4

这一层市面上没有产品。所有设计 agent 里,"多步编排"已普及(Krea Node Agent 2026-03 的"先出计划 → 用户批准 → 图校验 → 增量重跑"是最好的参考实现),但"先问清再生成"只有 MasterGo 做了半步,而且是 UI 领域;Vizcom 明确把 brief 和评审划给人。你之前 8 月那份会话里最值钱的第 39 条(它用 18650 尺寸倒推包络否掉你的初始尺寸)恰恰是 E 模块被填了之后才发生的事,其余 8 轮的漂移是因为 D / F / H 三个模块从没被填过。

追问怎么生成,有论文依据

RE 2025(arXiv 2507.02858):GPT-4o 生成需求访谈的追问时,用"常见访谈错误类型框架"引导,追问在清晰度、相关性、信息量上超过人写的。Autodesk Research 的 Elicitron(arXiv 2404.16045)让 LLM 模拟多样用户走产品场景再访谈,找到的隐性需求比人类访谈多。做法就是:11 模块字段表 → 缺口检测 → 按错误类型框架追问 → 输出签署版设计需求书。这是纯 prompt 工程,一周内可上线。

05 / 质检回环

VLM 能做什么、不能做什么

结论先说:VLM 对"整体好不好"有感觉,对"哪条原则被违反、在哪"很弱;能量化的一律交给几何 / 规则引擎,VLM 只做粗筛和定位。

几何量交给内核:CADSmith 的双环结构

CMU 2026-03 的 CADSmith 是目前最可复现的原型:自然语言 → CadQuery 代码,内环修执行错误,外环 = OpenCASCADE 精确测量 + VLM Judge 视觉评估。100 题上执行率 95→100%,IoU 0.81→0.96。同组的 AgentsCAD(2026-07)做 DFM:STEP 解析 → 45° 悬垂检测 → Claude 推理改法 → GPT-4o 视觉验证 → 输出修改后 STEP,FDM 打印实物验证。你本机的 CadQuery 路线正好就是这条路的执行器。

检查项交给谁怎么做
尺寸、包络、壁厚、R 角、比例几何内核CadQuery / OpenCASCADE 直接量,对照 constraints.md 判定,超限即报
分型线、拔模、悬垂、筋 / boss 规则规则引擎Komaspec 数值规则编码;复杂件接 Xometry DFM API(唯一明确可接的),CoLab AutoReview 企业级
按键数量、logo 位置、分件逻辑、签名元素在不在VLM 定性把 DNA 文档编译成 checklist 逐条问答,要求输出位置
多视角是不是同一个产品3D 兜底交付流从同一 B-rep 出图,物理上不可能不一致;探索流用固定视角 + 双 VLM 粗筛
品牌一致性、"AI 味"VLM + 人反模式黑名单(浮空产品、无分型线、无拔模、拼缝乱、logo 糊、材质不物理)VLM 初筛,人终审

国内 DFM 工具的情况:嘉立创 DFM 只做 PCB;三维猴 3D 打印有自动解析计价但没有公开 API;Protolabs ProDesk、SolidWorks DFMXpress 都没找到 API。外观件级别的检查要么接 Xometry,要么用 CadQuery 自写规则。

06 / 方案

落到你这里:三期流水线

你的现状:CadQuery → STEP / GLB → Blender Cycles 的本地渲染链 8 月 24 日已打通,KiCad MCP 在位(本次会话连接失败是 venv 路径问题,不是能力缺失),WorkBuddy 工作台可跑定时任务,Claude Code 可写 skill。缺的是前面的输入层和后面的质检回环,以及把中间串成一条能重跑的线。下面按收益 / 成本排序分三期。

第一期 · 输入层:brief-intake skill

纯 prompt 工程 · 约 1 周 · 收益最大

做一个 Claude Code skill(或 WorkBuddy 项目提示词),行为是拒绝在 brief 有缺口时出图。结构照抄 Anthropic 那个装机 83 万的 frontend-design skill:"先脑暴一套 token 系统 → 第二遍对着 brief 自审,像通用默认值的地方改掉并说明理由 → 再执行"。ID 版映射:token 系统 = 形态语言(体量 / 线型 / R 角家族 / 分件逻辑)+ CMF token + 签名特征;自审 = 对照第 04 节 11 模块做缺口检测;追问按 RE 2025 的错误类型框架生成。

产出两份文件:brief.md(签署版设计需求书,11 模块)和 constraints.md(可判定的硬约束表:电芯包络、最小壁厚、按键行程、单手握持宽度上限、IP 等级、拔模角)。后面每一轮评审都拿 constraints.md 当尺子,"60 mm 宽超了单手握持上限 55 mm"是一句可判定的话,不是感觉。这一步是防尺寸单向膨胀的唯一手段。

第二期 · 编排层:把中间串成一条能重跑的线

选型 + 串接 · 2–3 周 · 需要解锁一把付费出图通路
1

DNA 文档 + 固定参考图组 LLM

从 brief 生成 dna.json:形体 / 材质 / 色彩 / 比例 / 标志位 / 禁忌,配 ≤10 张固定参考图(竞品实拍、上一版外观、CMF 板)。这是短剧的"角色设定图",所有后续生成只引用它,不重述。

2

参数化 CAD 白模 LLM 改脚本CadQuery

尺寸全部提成 params 字典,LLM 改数字和建模代码,不画图。产出真 B-rep STEP + GLB。改造型 = 改参数 + 重跑,几何内核当场校验是否超 constraints.md。

3

视角表 + 白模批量出图 Blender

视角表字段照抄短剧分镜表:视角号 / 方位角 / 仰角 / 焦距 / 景别 / 材质版本 / 光照 / 背景 / 用途。blender -b 按表批量渲 depth / normal / canny + 白模正 / 侧 / 背 / 45° / 内部透视 / 爆炸图。三视图天然一致、电芯排布天然正确、尺寸天然守恒,你 8 月 9 轮没解决的问题在这一步全部消失。

4

上皮:只改 CMF,不许改形 Seedream 5.0 Pro / GPT Image 2 / Nano Banana Pro

白模 + depth 当结构锚,材质图 + 色卡当引用(Seedream 官方示例就是"Image 1 材质 + Image 2 色卡改 Image 3"),mask 圈定只允许改动的区域。prompt 从"设计一个……"变成"保持轮廓、比例、分件、按键位置完全不变,只替换材质表现与灯光环境"。开源路线用 Liblib / ComfyUI:depth + lineart 双 ControlNet 栈 + 品类 LoRA(Cosin1.1 / FLUX Detail)。

5

局部修复 mask inpaint

坏了只修那一块,不整图重抽。走 API 不走网页:GPT Image 2 API 16 张参考图 + mask,ChatGPT 网页版只有 5 张且没有 mask,这是你之前一致性差的操作层原因之一。

6

探索流 / 交付流分流

探索流:Midjourney / Nano Banana 纯 2D 多参考找方向,快,不保工程一致,AI 3D(混元 3D 3.1 / Tripo)只当看比例的粗模。交付流:从第 2 步进,3D 优先,慢,保一致。评审和客户看的图必须来自交付流。

编排工具选型:Claude Code skill 串联最贴你现状(本地文件、CadQuery、Blender 都在同一台机器上);Coze / Dify 的循环节点适合把"生成 → VLM 打分 → 不合格重来"做成 WorkBuddy 定时任务;ComfyUI 只在开源出图路线上需要。Krea Node Agent 的"先出计划让用户批准、改动只重跑下游"是编排层的目标形态。

第三期 · 质检回环:规则 + 几何量为主,VLM 定位为辅

先规则和几何,后 VLM · 持续迭代

按第 05 节的分工表:CadQuery 量尺寸 / 壁厚 / R 角对照 constraints.md;Komaspec 规则编码做拔模 / 筋 / boss 检查;VLM 拿 dna.json 编译出的 checklist 逐条问答并要求定位;多视角一致由交付流的同源 B-rep 兜底;"AI 味"反模式黑名单 VLM 初筛人终审。评审输出结构化问题清单(GID-HGCC 的"3D 工程问题清单"),回灌第 2 步改参数。Key Tech 计划做的"设计评审 GPT"就是这一层。

需要付费的通路

选项解决什么成本判断
OpenAI 充值(GPT Image 2 API)16 张参考 + mask 局部重绘 + 推理评审一次到位$0.03–0.08/张第 4、5 步的刚需,"只改挂钩不动机身"没有 mask 就退化成碰运气。8 月报告的结论不变。
Seedream 5.0 Pro(即梦 / 火山 API)材质 + 色卡引用改产品、图层分离Pro 未公布;5.0 Lite $0.035/张CMF 环节最对口的机制,中文生态,作为第 4 步主力或备份。
Vizcom Pro草图 → 渲染 → 网格 3D,Palette 私有风格,Free View 相机$49/月如果你要走"草图先行"的探索流,这是唯一 ID 专用工作台;交付流用不上它。
Liblib 会员LoRA 训练 + ControlNet + ComfyUI 工作流5 次 LoRA 训练/月要训品牌风格 LoRA 时用,国内最接近 Vizcom Palette 的路线。
Zoo Zookeeper不想自己写 CadQuery 时的对话式 CAD agent$20 / $99 月唯一验证走通"输入 → 可编辑 B-rep → STEP"的商用产品,但你已有 CadQuery,优先级低。

先拿移位机手控器做靶子

CadQuery 脚本、STEP、Blender 渲染全在位,只缺第一期的 brief.md / constraints.md。用它把三期跑通一遍,成本最低。轮椅整车不适合:整车尺度的形面质量不是参数化 CAD 的强项,AI 在那里的价值是竞品设计语言拆解和 CMF 策略,形还得人类设计师出。无人机清洗设备反而适配度更高:偏机构和工程件,约束权重高、外观权重低,正好落在参数化路线的甜区。

07 / 边界

三件不该指望的事,和本次未证实的项

未证实项(四份原始调研的清单合并,请勿当事实引用):Vizcom 是否有 agent 产品或 2026-05 Fusion 插件;Hunyuan3D "3.5" 仅见第三方站;Krea / Tripo / Rodin / Lovart 官方定价档位;SolidWorks LEO 是否已 GA;Lovart 是否有澄清提问 / 自动 QC;adidas "18 个月 → 24 小时"等数字无一手来源;洛可可"3 秒 1000 方案"为访谈口径;LoRA "97%"、可灵 "95%"、Vidu "80%" 一致性均为厂商口径;Protolabs / DFMXpress / 嘉立创三维猴的 API;Ford、Kia、MDPI、Springer 多篇原文被 403 仅据摘要;小米 / 华为 / 追觅 / 安克 / 云鲸 / 小鹏 / 理想设计中心本轮未找到带步骤的公开分享。