← 返回首页

产品立论 · AI 副导演

实拍的魂,动画的骨,AI 的手

我们做的不是动画片,也不是实拍片。我们把三种制片传统熔成一种新流程:向实拍大师借创作的魂(主题先行,每个选择都服务于一个想法),用动画造世界的骨(从无到有造一个处处一致的世界),再靠 AI 这双新的手(便宜、快、可并行地生成,只是它没有记忆,一致性要每帧重新压上去)。下面先讲三者怎么合一,再给一份逐步可执行的清单。

01

不是动画,也不是实拍:三种流程,熔成一种

实拍片是对着一个已经存在的世界举起相机——演员、布景、阳光都是真的,一致性是免费的。我们没有这份免费:每一帧都要从无到有生成。所以单靠实拍的方法,会把一致性的责任错误地推到"拍摄"那一步去补救。

动画片正相反:它默认一切都不存在,整套工艺就是为了从虚空里造出一个可信、且处处一致的世界。这恰好是我们的处境——但动画的世界是确定的(造好就不再变),而 AI 是概率的,每帧都可能漂。所以我们取三家之长,熔成一条新流程:

实拍 · 魂

给"意义":主题先行,每个选择都服务于一个想法。

局限:它假设有真演员、真景、真光当免费的一致性;我们没有。

动画 · 骨

给"造世界":从无到有造一个处处一致的世界(角色/场景/物理规则/风格,全锁死)。

局限:它的世界是确定的;AI 是概率的、会漂。

AI · 手

给"一双新手":便宜、快、可并行地生成任何画面。

代价:它没有记忆,一致性要每帧重新压上去。

一句话:取实拍的魂,动画的骨,AI 的手,熔成一条新流程。下面三节分别讲透这三样。
02

动画的骨:造一个处处一致的世界

动画把"造世界 + 保一致"做成了一台成熟的机器。拆成七件可借的东西——省钱只是其中一件。

角色一致

给每个角色一张"造型定稿表":正/侧/背/四分之三,加一套表情、一套姿势,加精确到不能误读的文字。

就像一张身份证——几十个画师照同一张证画,角色才不会从这镜到那镜变样。

场景一致

一张"布景施工图"锁死谁站哪、相机怎么摇推拉、每镜多长、光从哪来。

就像舞台的施工图——所有人照同一张画,空间才不乱。

虚构世界的物理设计

给一个不存在的世界定下内在逻辑:年代、地域、材质、光怎么落、什么能存在、什么不能。

越奇幻越要把规则锁死。世界可信,靠的是同一套规则一致地统治每个元素。

风格与色彩

一本"风格说明书"定整片长什么样;一条"色彩脚本"把开头到结尾的情绪铺成一条曲线。

几百个不同画师做的镜头,照它才连成一气。

造一次,全片复用

角色、房间、道具做好就入库,后面所有镜头直接调用或微调,不必每镜从零重捏。

就像乐高:模子开一次、到处拼;改一块,系统知道哪些镜头要重做。

从粗到精

先出最便宜的草稿定大局,批了再上一档,最贵的质感留到最后、只给已经过关的画面。

便宜不只省钱:同样预算能多试几次,反而出更好的结果。

每一道审核门

在制品做到一半就拿出来给全组评议,导演一人拍板能不能升到下一档。

没有便宜版过关,绝不进入更贵的一档。

03

实拍的魂:让世界有意义

一部处处一致却没有灵魂的片,是空的。实拍大师教的是"意义"——这是一致性给不了的。

主题先行 · 案头

开拍前先用一句话说清"这部片到底讲什么",再让选角、灯光、剪辑、配乐全部弯向它。

全在文字里完成,一个像素都还没生成。

每个选择服务于一个想法

画面里没有装饰,只有意义;任何一个镜头不是凭空生成,而是从主题里长出来的。

马梅、卢梅特、科波拉、默奇一脉的共同信条。

几何先于光

先把空间、相机、物体的位置定死,光几乎留到最后再处理。

这正是动画"施工图先于打光"的同一条原则——先锁画面,再谈氛围。

导演保留最终决定权

剧组充分提案、给方案,但怎么处理由导演定。

手是剧组的,要点是导演的。

主创审核到底在审什么:两个问题

对每一个被提议的细节(道具、服装、台词、机位、颜色),只问两件事:① 真实吗?服务这个主题吗? 不服务的就是俗套,砍掉——"反俗套"就是第二问的反面:俗套 = 服务品类的默认值(欧洲球迷的围巾、老人的鸟笼),不服务你这个专属主题。这是一个会循环的决策环:提议 → 审 → 砍 / 改 → 再审,直到细节最服务主题(围巾 → 奖杯 → 也许更优)。剧组提议,导演按主题决断,AI 自己驱动这个环——你只给方向。这是整个产品的核心:角色智能的本质,就是主题契合判断。
谁来审、何时问你:每个决定前先派对的人(画面左右 = 摄影 + 导演 + 演员;物件年代 = 美术 + 考据,各不同),能内部定就内部定;只在花钱(出图)前才跳出问你——问"要不要花这个钱",不拿创作细节问你

04

AI 的手,与它的代价

AI 给了一双能凭空生成任何画面的手,但它没有记忆。一致性不是免费的,要被制造、并每帧重新压上去。

没有记忆,每帧会漂

引擎对"这个角色是谁"没有真正的记忆,等于每镜都换一个长得像的演员;脸、身高、年代、场景都会乱走。

这是头号敌人。

黄金铁律:绝不文字直出视频

永远先定一张你批准过的关键画面,再让模型只往里加动作,长相不许变。

把"发明角色"和"让它动起来"两件事拆开。

一致性是一摞要造的零件

角色训练件(只演这一个角色)+ 参考图锁脸 + 一段逐字写死的"角色档案"文字 + 写死的尺寸 + 收尾统一调色。

到 2026,参考图已是多数镜头的实用默认。

门比传统动画更必要

动画的世界造好就不变;AI 的漂移是概率性、随机发生的,所以每一档都要强制门 + 尺寸核对,把漂掉的纠回来。

不是更不必要,是更必要。

场景也要锁,不只角色

像给角色发身份证一样,给关键场景锁一张可复用的"定场参考图"(或 3D 灰盒),每镜贴着它画。

否则单独生成的下一镜,不保证还是同一间屋。少角度用 2D 定场图,多角度/穿行用 3D 景。

05

产品形态:AI 副导演

把三层心智模型落到产品上,分工就清楚了:你做导演,守主题、审美、价值观;AI 做剧组,只诊断、出方案;模型做后端,照图干活。它替你把一部作品立起来,而不是替你赌一段视频。

卖点不是一句话出片,而是像一个真剧组那样把作品立出来。先立起四份定稿件,再驱动模型一镜镜照着画。

角色证(model sheet):每个角色的多视角、表情、文字 DNA,锁定长相。
施工图(layout):每个镜头的走位、相机运动、时长、光位。
世界规则(production design):这个虚构世界的年代、材质、光与物理法则。
色彩脚本(color script):从头到尾的情绪颜色曲线,后端全程对它。
06

迭代次序:更省,且更好

成本次序和质量是同一件事的两面。便宜的草稿不只是省钱:同样预算能多迭代几轮,反而收敛到更好的世界。皮克斯把大约 75% 的功夫花在草稿与打磨这些便宜阶段,贵的定稿留到最后,只画已经过关的画面。迭代的真正价值是质量探索,省钱是副产品。

草稿(铅笔 / 分镜)
最便宜。只回答一个问题:构图和走位对不对?批了才升档。
打磨(线稿 / 布局 / 参考图)
中等成本。锁人物、锁空间、锁脸。这一层之前绝不开火做贵的。
定稿镜(成片质感 / 动作 / 调色)
最贵。只给前两档已经过关的镜头,绝不在没批的画面上烧成本。

门机制贯穿始终:在制品做到 25% 到 75% 就拿给全组看,剧组诊断、导演拍板,没有便宜版过关,绝不升到贵档。又因为漂移随机发生,每一档都要加尺寸审计(身高、比例、年代逐项核对),把漂掉的找出来,而不是假设它会自己保持。

底线

脊柱让世界处处一致,灵魂让世界值得一致,AI 纪律让这套一致性在一个没有记忆的引擎上、每一帧都重新成立。三者合起来,才是一部 AI 动画片,而不是一段惊艳三秒的素材。

07

完整流程:从念头到成片的执行清单

上面是方向,这里是计划——每一步做什么、谁参与、进什么出什么、过哪道门,逐条列清。一步比一步贵,绝不跳层;每过一层,主创审一轮,不过回炉。

开发 Development(全文字)

火花 · 开发

一个起点:一桩品牌命题,或一个打动你的瞬间。

制片人(你)带来 · 产出 起点(intake)·

调研 · 开发

掘品牌、产品、红线、同类作品,带回几个方向而非一个答案;该调研才调研、带来源、不臆造。

调研 · 产出 几个方向 + 红线 · 方向是否扎实有来源

三元案例:拦下"鹿晗非代言人""三元和足球无渊源"等会毁片的错。

立基 · 开发 · 门

导演+编剧双环 OODA 推敲出根:主题 → 故事 → 人物[为什么这几个] → 对白 → 时间 → 场景;双环可推翻整个主题。

导演 + 编剧 · 产出 锁定的 story bible · story bible 锁定(否决理由留档)

三元案例:双环推翻平庸的"凌晨四点是奶"父子版,定下"早起的人,不孤单" + 老周。
前期筹备 Pre-production(文字 + 草图,一步比一步贵)

案头 · 锁本 · 前期

把立基的 story bible 收成"锁定的本"(等于传统的定稿剧本)。

导演 · 产出 锁定的本 · 本锁了没

主创阐述 · 前期 · 门 · 产品核心

开拍前主创围桌,在纯文字里把每个镜头"传达什么、为什么"想清。三步:

导演主持 + 摄影/美术/表演/声音 · 导演评估通过(= 主题一致性判断)

  • 导演阐述:主题 + 两级脊柱 + 节拍表(只定拍什么,不碰机位)。
  • 各部门阐述:摄影/美术/表演/声音各写创作方案 + 禁拍清单。
  • 导演评估:导演回桌当主题评估者,逐份审是否服务主题。
三元案例:九拍节拍表;四份阐述;导演评估抓出每份"即便自律仍会跑偏"的风险。

场景地图 + 物理世界 · 前期 · 门

几何先于光。三块:

美术 + 导演(摄影/考据/物理尺度) · 几何 + 尺度 + 世界锁定

  • 场景地图:俯视图(墙/门/家具)+ 走位 + 机位 + 180 线。
  • 物理尺度:三维灰盒 / 世界圣经写死测量值(身高、道具尺寸、手-瓶/人-门比例)。
  • 世界圣经 + 考据:年代/地域/材质/光的规则,带源核查真实对应。
  • 场景参考资产(锁视觉锚):为关键场景锁一张可复用的定场图(2D)或 3D 灰盒,像角色 turnaround 一样,生成时每镜复用——景不持久,必须显式锁。
三元案例:客厅 4.5×5m、座左门右、180 线=座位→门;老周 172cm、玻璃瓶≈145mm、手:瓶 1.3:1;窗外国槐非棕榈、玻璃瓶非白瓷瓶。

形象资产 · 前期 · 门A/B

创作前半 + 技术后半:

选角导演/服化/导演/演员/编剧(创作)+ 物理尺度 · A(线稿形与比例)+ B(资产交付)

  • 创作前半:选角 + 造型的主创讨论(消费人物小传,不重新发明)。
  • 技术后半:身份规格(转面图 + 表情表 + 姿势表 + 精确色)+ 角色训练件 + 一张主参考图。
三元案例:老周线稿转面图;门 A 回炉补头身比 + 尺度基准 → 过;机油黑/茧留写实质感档。

分镜 · 前期 · 门

把每一拍翻成镜头:在已锁定的场景内"发现机位"(像动画的 Layout),不是空间再造;从已走位的场景地图派生,每镜继承锁定的几何与尺度。

摄影 + 导演 · 产出 逐镜表(每镜 spec)· 机位不越线、继承几何尺度

光影 · 近乎最后 · 前期 · 门

在锁定的景 + 走位 + 机位之上做光影,先出黑白光影稿测光(抽象中性,只判光)。

摄影 + 导演 · 主创审核(合理?符合主题?回炉?)

  • 火候阶梯:线稿(构图)→ 黑白光影稿(光影)→ 色彩稿(色彩)→ 写实(仅锁定镜头)。渲到够做决定就停。
三元案例:光影层回炉四轮(植物/白盒 → 对地图 → 量纲+置景 → 灯位)才锁定。
拍摄 Production

生成 · 拍摄

逐镜生成成片帧:先定一张批准过的关键帧、再让模型只加动作(绝不文字直出视频),尺度焊在几何上。

后端模型(人监修)· 产出 候选镜头

物理 + 尺度 + 连续性校验 · 拍摄 · 门 · AI 新增

抽查道具-手/人-环境比例,并审生成画面合不合物理与现实常识(穿越物件/南方的树/六指);漂了回灰盒重来,不靠改指令补。

尺度 + 物理/现实审查 · 连续性 + 物理过

后期 Post

剪辑 · 声音 · 调色 · 后期

剪辑(库里肖夫并置 / 概念碰撞 vs 时间压力两套剪点)· 声音(那一声"叮"为唯一设计音,全片无渐强配乐)· 调色(统一各批次色温,粘成一部片)。

导演 + 各部门 · 每步主创审核

贯穿全程的纪律(每一步都守)

每过一层,主创审一轮(强制门):过 → 前进;不过 → 回炉(OODA)。WHAT 先于 HOW(导演定拍什么,摄影才定怎么拍)· 几何先于光 · 一致性是挣来的(只锁已定,太早求一致=假精确)· 抽象保护判断(渲到够做决定就停)· taste = 钉专属主题 + 显式烧俗套 · 决策智能(给你的问题都带理由 + 推荐,不甩开放题)· 该调研才调研 · 改动/新增的层必重过门 · 这道门是 AI 自己驱动的职责,不甩给你

08

想看它真跑一遍

以上是立论。把它放到一个真实命题上从头走到底(三元 × 世界杯广告,角色"老周"),见案例:开发 · 前期筹备(选角→案头→场景与世界→形象资产→分镜→光影);画面这块的技术要求与模型选型见 画面技术要求。完整操作手册(每一步的输入/产出/审核门)在项目的流水线主文档里。