原始调研 · 2026-09-02

附录三 · 短剧流水线方法论及其向 ID 的迁移

这是《AI 辅助工业设计:从抽卡到流水线》的原始调研之一,由研究 agent 生成,逐条带来源 URL,未证实项已标注。

从"抽卡"到"生产":AI 短剧流水线方法论及其向工业设计(ID)的迁移

调研日期:2026-09-02。优先采用 2025-2026 资料,中英文来源混合。标注规则:[官方] = 厂商/平台一手来源;[二手] = 媒体/博客/教程转述;[未证实] = 只有单一非官方来源或本次未能抓取原文。


0. 一句话结论

AI 短剧把随机性关进笼子,靠的不是某个更强的模型,而是"资产先行 + 结构化中间产物 + 引用式锚定 + 分层一致性 + 局部修复 + 节点化可重跑 + 外置验收标准"这七件事叠在一起。其中 2026 年最关键的增量是视频模型原生支持"多参考 + @引用"(Seedance 2.0 / 可灵 3.0 / Vidu Q2-Q3),把角色一致性从 ComfyUI 手工活变成了模型内置能力。

迁移到 ID 时,七条原则全部有对应技术,但成熟度极不均衡:"3D 白模 → ControlNet 出图"是 ID 最成熟的一环(比短剧的首尾帧还强)"多视角工程级一致"和"自动质检"是最弱的两环,2026 年没有任何公开资料证明纯 2D 生成能做到分型线/孔位/R 角级别的跨视角不变——工程级一致目前只有一条路:先有 3D,再固定相机出图。


第一部分:AI 短剧成熟流水线到底靠什么把"抽卡"变成"生产"

1.1 模型层:2026 年"引用式锚定"成为标配

模型 版本/时间 一致性机制(官方口径) 上限/数字 来源
即梦 Seedance 2.0 2026-02 "全能参考"模式,图/视频/音频/文本四模态混输,提示词用 @图片1 @视频1 指定每个素材的用途;另有"首尾帧"模式 文件上限 12 个:图片最多 9 张,视频、音频各最多 3 个;15 秒生成 [二手] 腾讯新闻上手指南SegmentFault 上传限制Wikipedia
可灵 3.0 / 3.0 Omni 2026-02-05 全球上线 "图生视频 + 主体参考"对画面元素二次锚定;Omni 用"特征解耦"把角色/道具/音色抽出来跨场景复用 参考视频 3-10 秒;官方宣称"多镜头角色相似度 95%";API 端"角色库":上传参考图训练专属角色约 50 元/角色 [二手] 中国日报火星时代 2026-08
Vidu Q2 参考生 Pro / Q3 Q2 2025;Q3 2026-01-30 参考生视频,支持"2 个视频 + 4 张图片"多模态并发输入,增删改减式编辑 知乎称"最多 7 个主体" [未证实];Q3 宣称"分镜一抽可用率约 80%" [二手] 腾讯云开发者Vidu Q3 百科
海螺 Hailuo 2026 多次生成同一主体一致性口碑好,但机制未公开描述 toolcenter 2026-05 横评
Sora 2 2025-10 → 2026-02 政策收紧 Cameo 机制;2026-02 起禁止上传任何人脸(真人/数字人/卡通人脸)作角色参考;API 只能靠文字描述,一致性约 70% [二手] 短剧圈基本放弃 WentuoAI 博客
Midjourney Omni-Reference 2025-05 起 --oref + --ow(0-1000,默认 100) 锁角色/物体 V8.x 下 oref 会"路由回 V7",得不到 V8 画风;高权重会软化细节 Blake Crosley 8.2 指南CometAPI

图像端(分镜图/角色图)同样进入"多参考"时代: - Nano Banana Pro(Gemini 3 Pro Image,2025-11-20):最多 14 张参考图,最多 5 人保持一致 [官方] — Google 博客 - GPT Image 2(2026-04-21):每次最多 16 张参考图 [官方渠道转述] — Together AI - Seedream 5.0 Pro(2026-07-08):最多 10 张参考图;官方示例直接就是 "Image 1 材质 + Image 2 色卡 → 改 Image 3" [官方] — ByteDance Seed 博客EvoLink - FLUX.2(2025-11-25):最多 10 张参考,官方宣称"character / product / style consistency" [官方] — BFL 博客 - Qwen-Image-Edit-2509(2025-09):最多 3 张输入图;2511(2025-12)把社区"多角度视角"LoRA 内置进底模,官方明确写了"增强工业设计生成 / 批量产品设计迭代 / 材质替换" [官方] — HF 模型卡Comfy 官方 2511 教程

1.2 工作流层:中间产物结构化 + 资产先行

标准 SOP(七步):剧本创作 → 角色场景资产建设 → 分镜设计 → 视频生成 → 配音音效 → 后期剪辑合成 → 分发运营;行业报告称"分镜设计环节集中 70% 创意精力" [二手] — TVtalk 深度调研 2023-2026

结构化脚本:Dify + ComfyUI 方案里 LLM 直接输出 JSON:"集数、每集分镜(镜头号、时长、提示词、运镜、对话)",然后角色库(参考图 + LoRA)+ IP-Adapter/ControlNet/FaceID 锁一致性,视频用 LTX-2.3/Wan2.1 — 博客园 2026。分镜表字段共识:镜号、画面描述(含光影/构图)、景别、镜头运动、角色动作、情绪、对白、时长、BGM 情绪;1-2 分钟 8-15 个分镜 — 塔猴 2026 指南CSDN 2026

资产先行(角色三视图 → 角色库): - 流程共识:"先生成一张满意的定妆照 → 以此为基准生成不同角度/表情 → 每角色 3-5 张多角度参考存入角色库";三视图 = 正面/侧面/背面全身 + 左侧头部特写放大 — 搜狐 2026 大厂漫剧工作流搜狐 6 周流程 - 三种一致性做法排序:参考图驱动(推荐)> LoRA 训练(多角度照片)> 资产库管理(正面照 + 多表情 + 统一视觉描述卡片) — 塔猴 - 五方法对比(2026):参考图 img2img(低成本/高)、Turnaround Sheet 三视图(低-中/高)、固定 seed + 逐字描述(低/中)、LoRA 15-50 图(高/极高,"几百个镜头最小漂移")、换脸清理(中/仅脸) — Flick 2026

平台化产品把 SOP 固化成节点:LibTV(LiblibAI,2026-03-18 上线):无限画布 + 节点工作流,文本/图片/视频/音频/脚本五种基础节点,"剧本自动拆解为结构化分镜,角色、场景、道具作为独立资产管理","每个生成节点可独立调参数、换参考图、改提示词",整套流程"打组保存、一键重复执行";内置角色三视图、"15 个环绕点位视角生成"、9/25 宫格分镜、剧情推演四宫格;集成可灵 3.0/Seedance 2.0 等 20+ 模型;团队版 2026-05-18 上线,称 300+ 短剧公司成 B 端客户 [二手] — 网易AIHubUIED

1.3 ComfyUI 一致性技术栈(2025-2026 短剧圈实际在用的)

1.4 团队与分工

1.5 质检:平台硬标准有了,自动质检还是空白

1.6 提炼:把随机性关进笼子的 8 条原则

  1. 资产先行(Asset-first):先把角色/场景/道具做成可引用的资产(定妆照 → 三视图 → 资产库),所有镜头只"引用"资产,不重新描述。
  2. 中间产物结构化:剧本→JSON 分镜表(镜号/景别/运镜/时长/情绪)是硬产物,生成只是最后一步;节点里每个变量都是显式字段。
  3. 从"描述"改为"引用":用 @图片1、主体参考、--oref 把语义层随机性消掉,剩下的随机性只在细节层。
  4. 一致性分层叠加:身份(LoRA/角色库/FaceID)、结构(ControlNet/首尾帧/参考视频运镜)、风格(风格 LoRA/style ref)各用各的工具,同时上。
  5. 局部修复代替整图重抽:ADetailer、inpaint、换脸清理、截图重绘——只修坏的那一块。
  6. 节点化 + 参数固化 + 一键重跑:ComfyUI/LibTV/Dify 把流程打组,只换变量不换流程。
  7. 抽卡预算化 + 验收标准外置:一抽可用率(Vidu Q3 称 80%)、相似度(可灵称 95%)变成 KPI;平台审片标准(穿模/同步/稳定)倒逼硬指标;仍以人工看片为主。
  8. 按可靠性分流:极速流和精品流用不同的成本和一致性等级,不追求单一流程通吃。

第二部分:每条原则在 ID 里的对应技术与 2026 成熟度

成熟度:★☆☆☆☆ 概念 / ★★☆☆☆ 有零件无流水线 / ★★★☆☆ 可用需人工兜底 / ★★★★☆ 工程可用 / ★★★★★ 成熟

2.1 角色设定图 → 设计语言/DNA 文档 + 产品三视图  成熟度:DNA 文档 ★★☆ 三视图 ★★★☆

2.2 角色 LoRA → 品牌/产品 LoRA  成熟度:品类/风格 LoRA ★★★ 单款产品身份 LoRA ★☆

真实存在的"产品外观 LoRA/模型"实例(全部是品类或风格级别,不是某一款产品的身份): 1. Civitai Flux Product Design v3.0 IC_CONSIS In-Context LoRA:In-Context 多面板产品一致性 LoRA(页面本次三次抓取失败,训练数据/触发词 [未证实])— CivitaiPromptHero v2 2. Liblib Cosin1.1 工业设计通识大模型(Checkpoint,合囤科技/余弦设计):"大量高质量产品图片"训练,覆盖电饭煲/洗地机/空气净化器/筋膜枪/医疗台车等;给出白模上色提示词公式"产品品类 + 产品名字 + 基础形体 + 材料工艺 + 色彩 + 场景氛围";参数 Euler a karras / Clip skip 2 / vae-ft-mse(SD1.5 系)— Liblib 3. Liblib 云墨阁 产品设计通识 LoRA(Jan-Design):"大量高清产品渲染微调",触发词 product design,CFG 7 — Liblib 4. Liblib FLUX Detail 细节/材质 工业/产品设计增强器(子羽):Flux 底模,权重表——机械类 0.15-0.8、3D 模型 0.25-0.5、纯材质(玻璃/金属/毛绒)0.5-0.8 — Liblib 5. Liblib 汽车设计/未来汽车工业设计 LoRA:Flux1/麦橘 Flux1 底模,权重 0.6-1.2,CFG 3.5,训练资料"前沿汽车设计理念",未指向特定品牌Liblib 6. Liblib 工业设计/创意表达 多风格草图 LoRA:可配 ControlNet 出概念草图 — Liblib 7. 学术:Scientific Reports 2025《Enhancing product concept image generation through semantic feature prompts and LoRA training》:E-Prime 语义启动实验抽关键词 → DeepSeek 按"心理意象/功能意象/物理意象"解码细粒度特征 → 按语义特征提示词分别训 LoRA — Nature 8. Vizcom Palette:4-30 张图、分钟级训练的私有模型,学的是"风格/品牌美学"(例:Scott Robertson 环境风格、Chris Ference 的"Bone"渲染风格),不锁具体几何;Vizcom 2026-01 的"Component Library"文章讲的是"同一 R 角/表面处理跨产品线复用"的理念,落地仍靠 Palette + Color Match — Vizcom PalettesComponent Library 9. Scenario 平台把 Flux Kontext LoRA 用于"给 3D 模型/照片套上某建筑事务所的渲染风格"(配对数据训练)[二手] — Scenario

结论:"品牌设计语言 LoRA"技术上就是风格 LoRA,2025 年已很成熟(Vizcom Palette 就是商业化版本);"单款产品身份 LoRA"技术上等价于角色 LoRA(15-50 张图),但公开工程案例为零 [未证实]——原因很可能是:产品在设计阶段本身就在变,训 LoRA 锁死它没意义;ID 圈更倾向用 3D 白模当"身份"。

2.3 多参考图锁定 → 多图参考 + mask 局部重绘  成熟度:单视角 CMF/局部改 ★★★★ 跨视角锁定 ★★☆

2.4 分镜表 → 视角表 / 爆炸图 / CMF 表  成熟度:视角表 ★★★ CMF 表 ★★★☆ 爆炸图 ★☆

2.5 图生视频保持结构 → 3D 白模 + ControlNet depth/canny/normal  成熟度:★★★★☆(ID 最成熟一环)

2.6 ComfyUI 节点化 → ID 专用工作流  成熟度:★★☆(零件齐、无整条流水线)

本次实际找到的 ID 相关工作流(节点结构能抓到的已列出): 1. Liblib「工业产品精修」(Dream2046):金属零件/五金/机械设备/注塑件,材质真实感 + 光泽/瑕疵 + 高清放大;节点结构页面未公开 — Liblib 2. OpenArt「Product Design」(Islam Ayoub):24 个自定义节点 [页面为 JS 渲染,节点清单未证实] — OpenArt 3. OpenArt「3D Asset to Futuristic Industrial Design Render」(nouvo_ai):3D 资产图 → 工业设计渲染,改光照/材质/构图 — OpenArt 4. Reallusion AI Render 集(RunComfy):RL AI Render UI Core → Load Checkpoint → ControlNet(Pose/Depth/Canny 各带强度) → Flux Guidance → CLIP Text Encode → UpscaleData;可换 Wan2.1 VACE 做视频 — RunComfy 5. 「Architecture Illustration Sketch」(akihungac,OpenArt/RunningHub 双平台):28 节点——AIO_Preprocessor、TilePreprocessor、Zoe-DepthMap、CR Multi-ControlNet Stack、CR LoRA Stack、IPAdapter + UnifiedLoader、ImpactKSamplerBasicPipe、ImageUpscaleWithModel、WD14Tagger、ColorMatch;作者注明"重采样会变形建筑结构与材质,需多次迭代"。这套"depth+tile 多 ControlNet 栈 + IPAdapter + 放大"的骨架可直接改为产品用 — RunningHub 6. Mickmumpitz 3D-RENDERING IMG SD15/SDXL/VIDEO v3(GitHub 镜像):3D 渲染 → AI 重绘 — GitHub hktalent 7. Comfy 官方 Qwen-Image-Edit-2511 材质替换模板:2×LoadImage → TextEncoder(qwen_2.5_vl_7b_fp8) → Diffusion(qwen_image_edit_2511_bf16) → VAE → 可选 Lightning LoRA — Comfy 文档 8. Comfy 官方 Hunyuan3D-2mv:4×LoadImage → Hunyuan3Dv2ConditioningMultiView → GLB — Comfy 文档 9. ComfyUI-MVAdapter:text/image/mesh → 6 视图(SDXL 768,可叠 LoRA/ControlNet,ICCV 2025)— GitHub 10. Comfy 官方 Depth ControlNet:Load Checkpoint → Load Image(depth) → Load ControlNet → ControlNetApplyAdvanced — Comfy 文档

RunningHub / 吐司 站内搜索本次受工具限制未能直接检索(站点 JS 渲染),仅确认吐司有"建筑&空间设计"板块、RunningHub 有 8000+ 工作流 [未证实是否有专门 ID 流水线] — 吐司RunningHub

结论:ID 圈的 ComfyUI 资产是"单点工具"(精修、材质、草图渲染、3D 转换),没有像短剧那样"剧本→分镜→资产→生图→视频"的端到端公开工作流,也没有 LibTV 这种把 ID SOP 固化成节点的平台。这正是可以做的空位。

2.7 多视角一致性:能不能做到工程级?  成熟度:2D 直接生成 ★★☆ 3D 先行 ★★★★

学术方案(按时间): - Zero123++(2023):6 视图 3×2 拼一张图联合建模,SD2 底模 — HF - SyncDreamer:多视图特征投影到 3D 体积、噪声空间对齐;GSO 基准被 Hunyuan3D-1.0 超越 — Hunyuan3D 1.0 - MV-Adapter(ICCV 2025):SDXL 768,6 视/任意视,行列注意力,支持 mesh 引导贴图,ComfyUI 可用,image-to-multiview 需 14G 显存 — GitHub - Hunyuan3D 2.1 Paint:多视图 PBR 扩散,"3D-aware RoPE 提升跨视图一致性" — arXiv - ViewMask-1-to-3(2026-03):离散 token 序列建模,GSO/3D-FUTURE 平均排名 1.7,3D-FUTURE IoU +10.6%,自认"视角多样性和光照鲁棒性仍有空间" — arXiv

产品级工具口碑: - Nano Banana Pro:官方"5 人一致 / 14 图",角色 turnaround 口碑好;产品多角度一致性被竞品博客点名差 — GoogleRapidDirect - Midjourney oref:侧面"效果非常好",俯视"保住了脸但不完美",高权重"软化细节(雀斑/纹身)";V8 下退回 V7 — CometAPIBlake Crosley - Qwen-Image-Edit-2511 内置多角度、LibTV 15 环绕点位:均为"视觉上一致",无尺寸/分型线验证 [未证实]

结论:所有 2D 多视角方案的评价指标是 PSNR/IoU/相似度,没有任何一篇资料用"分型线位置、孔位、R 角、比例"这类 ID 指标验证过;"看起来是同一个产品"可达,"工程级一致"没有证据。 工程级一致 2026 年只有一条可靠路径:先出 3D(人工 CAD / Vizcom 3D / Hunyuan3D 3.1 八视图)→ 固定相机渲 depth/normal → ControlNet 出各视角。这也是 2.5 与 2.7 互为因果的原因。

2.8 质检 → VLM 约束核查  成熟度:定性核查 ★★☆ 定量核查 ★


第三部分:迁移路线图(把 8 条原则翻译成 ID 流水线)

[1 资产先行]   DNA 文档(JSON: 形体/材质/色彩/比例/标志位/禁忌) + 3D 白模(或草图) + 固定参考图组(≤10张)
      ↓
[2 结构化]     视角表(视角号/方位角/仰角/焦距/景别/材质版本/光照/背景/用途) + CMF 表
      ↓
[3 结构锚定]   Blender/KeyShot 按视角表批量渲 depth/normal/canny → ComfyUI ControlNet 栈(depth+lineart) 出主视角
      ↓
[4 引用锚定]   主视角图 + 材质图 + 色卡 → Seedream 5.0 Pro / GPT Image 2 / FLUX.2 多参考出其余视角与 CMF 变体
      ↓
[5 局部修复]   mask inpaint(Qwen-Edit-2511 / Flux Kontext) 只改坏的局部;不整图重抽
      ↓
[6 节点化]     以 akihungac 28 节点骨架 + Reallusion 3D 控制节点为底改成 ID 工作流;参数固化,一键重跑
      ↓
[7 质检]       VLM checklist(定性) + depth 差异/Hunyuan3D 3.1 回 3D 比对(定量) + 人工评审
      ↓
[8 分流]       探索流(纯 2D 多参考,快、不保工程一致) vs 交付流(3D 优先,慢、保一致)

与短剧最大的不同:短剧的"一致"是观众感知层面的,所以 LoRA/参考图够用;ID 的"一致"最终要落到 CAD,所以主锚必须是 3D 白模而不是 LoRA,LoRA/Palette 只负责品牌风格层。


未证实/空白清单

来源汇总(按出现顺序去重)

← 返回主报告