产品立论 · AI 副导演
我们做的不是动画片,也不是实拍片。我们把三种制片传统熔成一种新流程:向实拍大师借创作的魂(主题先行,每个选择都服务于一个想法),用动画造世界的骨(从无到有造一个处处一致的世界),再靠 AI 这双新的手(便宜、快、可并行地生成,只是它没有记忆,一致性要每帧重新压上去)。下面先讲三者怎么合一,再给一份逐步可执行的清单。
实拍片是对着一个已经存在的世界举起相机——演员、布景、阳光都是真的,一致性是免费的。我们没有这份免费:每一帧都要从无到有生成。所以单靠实拍的方法,会把一致性的责任错误地推到"拍摄"那一步去补救。
动画片正相反:它默认一切都不存在,整套工艺就是为了从虚空里造出一个可信、且处处一致的世界。这恰好是我们的处境——但动画的世界是确定的(造好就不再变),而 AI 是概率的,每帧都可能漂。所以我们取三家之长,熔成一条新流程:
给"意义":主题先行,每个选择都服务于一个想法。
局限:它假设有真演员、真景、真光当免费的一致性;我们没有。
给"造世界":从无到有造一个处处一致的世界(角色/场景/物理规则/风格,全锁死)。
局限:它的世界是确定的;AI 是概率的、会漂。
给"一双新手":便宜、快、可并行地生成任何画面。
代价:它没有记忆,一致性要每帧重新压上去。
动画把"造世界 + 保一致"做成了一台成熟的机器。拆成七件可借的东西——省钱只是其中一件。
给每个角色一张"造型定稿表":正/侧/背/四分之三,加一套表情、一套姿势,加精确到不能误读的文字。
就像一张身份证——几十个画师照同一张证画,角色才不会从这镜到那镜变样。
一张"布景施工图"锁死谁站哪、相机怎么摇推拉、每镜多长、光从哪来。
就像舞台的施工图——所有人照同一张画,空间才不乱。
给一个不存在的世界定下内在逻辑:年代、地域、材质、光怎么落、什么能存在、什么不能。
越奇幻越要把规则锁死。世界可信,靠的是同一套规则一致地统治每个元素。
一本"风格说明书"定整片长什么样;一条"色彩脚本"把开头到结尾的情绪铺成一条曲线。
几百个不同画师做的镜头,照它才连成一气。
角色、房间、道具做好就入库,后面所有镜头直接调用或微调,不必每镜从零重捏。
就像乐高:模子开一次、到处拼;改一块,系统知道哪些镜头要重做。
先出最便宜的草稿定大局,批了再上一档,最贵的质感留到最后、只给已经过关的画面。
便宜不只省钱:同样预算能多试几次,反而出更好的结果。
在制品做到一半就拿出来给全组评议,导演一人拍板能不能升到下一档。
没有便宜版过关,绝不进入更贵的一档。
一部处处一致却没有灵魂的片,是空的。实拍大师教的是"意义"——这是一致性给不了的。
开拍前先用一句话说清"这部片到底讲什么",再让选角、灯光、剪辑、配乐全部弯向它。
全在文字里完成,一个像素都还没生成。
画面里没有装饰,只有意义;任何一个镜头不是凭空生成,而是从主题里长出来的。
马梅、卢梅特、科波拉、默奇一脉的共同信条。
先把空间、相机、物体的位置定死,光几乎留到最后再处理。
这正是动画"施工图先于打光"的同一条原则——先锁画面,再谈氛围。
剧组充分提案、给方案,但怎么处理由导演定。
手是剧组的,要点是导演的。
主创审核到底在审什么:两个问题
对每一个被提议的细节(道具、服装、台词、机位、颜色),只问两件事:① 真实吗? ② 服务这个主题吗? 不服务的就是俗套,砍掉——"反俗套"就是第二问的反面:俗套 = 服务品类的默认值(欧洲球迷的围巾、老人的鸟笼),不服务你这个专属主题。这是一个会循环的决策环:提议 → 审 → 砍 / 改 → 再审,直到细节最服务主题(围巾 → 奖杯 → 也许更优)。剧组提议,导演按主题决断,AI 自己驱动这个环——你只给方向。这是整个产品的核心:角色智能的本质,就是主题契合判断。
谁来审、何时问你:每个决定前先派对的人(画面左右 = 摄影 + 导演 + 演员;物件年代 = 美术 + 考据,各不同),能内部定就内部定;只在花钱(出图)前才跳出问你——问"要不要花这个钱",不拿创作细节问你。
AI 给了一双能凭空生成任何画面的手,但它没有记忆。一致性不是免费的,要被制造、并每帧重新压上去。
引擎对"这个角色是谁"没有真正的记忆,等于每镜都换一个长得像的演员;脸、身高、年代、场景都会乱走。
这是头号敌人。
永远先定一张你批准过的关键画面,再让模型只往里加动作,长相不许变。
把"发明角色"和"让它动起来"两件事拆开。
角色训练件(只演这一个角色)+ 参考图锁脸 + 一段逐字写死的"角色档案"文字 + 写死的尺寸 + 收尾统一调色。
到 2026,参考图已是多数镜头的实用默认。
动画的世界造好就不变;AI 的漂移是概率性、随机发生的,所以每一档都要强制门 + 尺寸核对,把漂掉的纠回来。
不是更不必要,是更必要。
像给角色发身份证一样,给关键场景锁一张可复用的"定场参考图"(或 3D 灰盒),每镜贴着它画。
否则单独生成的下一镜,不保证还是同一间屋。少角度用 2D 定场图,多角度/穿行用 3D 景。
把三层心智模型落到产品上,分工就清楚了:你做导演,守主题、审美、价值观;AI 做剧组,只诊断、出方案;模型做后端,照图干活。它替你把一部作品立起来,而不是替你赌一段视频。
卖点不是一句话出片,而是像一个真剧组那样把作品立出来。先立起四份定稿件,再驱动模型一镜镜照着画。
成本次序和质量是同一件事的两面。便宜的草稿不只是省钱:同样预算能多迭代几轮,反而收敛到更好的世界。皮克斯把大约 75% 的功夫花在草稿与打磨这些便宜阶段,贵的定稿留到最后,只画已经过关的画面。迭代的真正价值是质量探索,省钱是副产品。
门机制贯穿始终:在制品做到 25% 到 75% 就拿给全组看,剧组诊断、导演拍板,没有便宜版过关,绝不升到贵档。又因为漂移随机发生,每一档都要加尺寸审计(身高、比例、年代逐项核对),把漂掉的找出来,而不是假设它会自己保持。
底线
脊柱让世界处处一致,灵魂让世界值得一致,AI 纪律让这套一致性在一个没有记忆的引擎上、每一帧都重新成立。三者合起来,才是一部 AI 动画片,而不是一段惊艳三秒的素材。
上面是方向,这里是计划——每一步做什么、谁参与、进什么出什么、过哪道门,逐条列清。一步比一步贵,绝不跳层;每过一层,主创审一轮,不过回炉。
一个起点:一桩品牌命题,或一个打动你的瞬间。
掘品牌、产品、红线、同类作品,带回几个方向而非一个答案;该调研才调研、带来源、不臆造。
导演+编剧双环 OODA 推敲出根:主题 → 故事 → 人物[为什么这几个] → 对白 → 时间 → 场景;双环可推翻整个主题。
把立基的 story bible 收成"锁定的本"(等于传统的定稿剧本)。
开拍前主创围桌,在纯文字里把每个镜头"传达什么、为什么"想清。三步:
几何先于光。三块:
创作前半 + 技术后半:
把每一拍翻成镜头:在已锁定的场景内"发现机位"(像动画的 Layout),不是空间再造;从已走位的场景地图派生,每镜继承锁定的几何与尺度。
在锁定的景 + 走位 + 机位之上做光影,先出黑白光影稿测光(抽象中性,只判光)。
逐镜生成成片帧:先定一张批准过的关键帧、再让模型只加动作(绝不文字直出视频),尺度焊在几何上。
抽查道具-手/人-环境比例,并审生成画面合不合物理与现实常识(穿越物件/南方的树/六指);漂了回灰盒重来,不靠改指令补。
剪辑(库里肖夫并置 / 概念碰撞 vs 时间压力两套剪点)· 声音(那一声"叮"为唯一设计音,全片无渐强配乐)· 调色(统一各批次色温,粘成一部片)。
贯穿全程的纪律(每一步都守)
每过一层,主创审一轮(强制门):过 → 前进;不过 → 回炉(OODA)。WHAT 先于 HOW(导演定拍什么,摄影才定怎么拍)· 几何先于光 · 一致性是挣来的(只锁已定,太早求一致=假精确)· 抽象保护判断(渲到够做决定就停)· taste = 钉专属主题 + 显式烧俗套 · 决策智能(给你的问题都带理由 + 推荐,不甩开放题)· 该调研才调研 · 改动/新增的层必重过门 · 这道门是 AI 自己驱动的职责,不甩给你。
以上是立论。把它放到一个真实命题上从头走到底(三元 × 世界杯广告,角色"老周"),见案例:开发 · 前期筹备(选角→案头→场景与世界→形象资产→分镜→光影);画面这块的技术要求与模型选型见 画面技术要求。完整操作手册(每一步的输入/产出/审核门)在项目的流水线主文档里。