最近我在尝试不同类型的 AI 创作:AI 写小说、AI 写代码,以及 AI 短剧。

越往后做,我越觉得一个很有意思的结论正在变得清晰:

AI 短剧可能不是“AI 恰好能做的一种内容”,而是目前少数几个天然符合生成式 AI 工作方式的完整生产形态。

原因并不只是今天的视频模型越来越强,而是影视制作本身有几个非常特殊的属性:

可视、可拆、可重置、可筛选。

这四点,恰好把生成式 AI 最麻烦的几个问题——幻觉、不一致、不可控、随机性——从系统性风险,变成了可以被观察、隔离和重新生成的局部问题。


1. 我最初的感受:模型越自由,结果反而越惊艳

以我自己尝试 AI 短剧的过程为例:

  • 视频生成统一使用 Seedance 2.5;
  • 图片和人物资产使用 GPT Image;
  • 分镜头设计也通过 GPT Image 完成。

一个很明显的现象是:

当 Seedance 2.5 不被加入太多限制时,它经常能生成非常出彩的结果。

镜头、光影、动作、微表情,甚至一些没有明确要求的细节,会出现很强的“导演感”。

但当我开始给它加入剧情、人物一致性、动作顺序、道具状态、场景限制之后,生成结果反而容易变平。

它完成了剧情。

但不一定有戏。

于是问题开始变得很明确:

不能让一个视频模型同时负责理解剧情、导演、摄影、演员表演、美术和连续性。

真正适合 AI 短剧的方式,不是把剧本直接交给模型,而是把这些职责拆开。


2. AI 短剧真正适合的是“受控生成”

一个成熟的 AI 短剧流程,应该逐渐从:

剧本
Prompt
视频

变成:

剧本
剧情 Beat
导演拆解
人物 / 场景 / 道具资产
Blocking(人物与镜头调度)
Storyboard(分镜)
Production Keyframe(关键帧)
视频生成
Take 筛选
粗剪
补镜 / 重拍
成片

这里真正重要的已经不是“Prompt 写得多漂亮”,而是:

剧情中哪些东西必须被锁死,哪些东西应该留给模型自由发挥。

我更喜欢把这种方法理解成:

Macro Control + Micro Freedom

也就是:

宏观锁死,微观放权。

必须锁死的包括:

  • 人物身份;
  • 服装;
  • 场景;
  • 道具;
  • 人物初始位置;
  • 镜头景别;
  • 关键动作;
  • 镜头结束时必须达到的状态。

而可以交给模型发挥的包括:

  • 呼吸;
  • 眼神;
  • 微表情;
  • 头发和衣料的运动;
  • 非关键的小动作;
  • 轻微的镜头漂移;
  • 环境中的自然动态。

这样,AI 的不可控并不会消失。

但不可控的部分被限制在了一个安全的范围内。

甚至,模型的随机性反而会变成一种表演资源。


3. “抽卡”不是缺陷,它很像真人拍摄中的“再来一条”

过去我们往往把生成模型的随机性看成问题。

同样的输入,每次生成都会有差异。

但如果放到影视生产里,它其实很像一件非常传统的事情:

Take 1、Take 2、Take 3……

真人拍摄时,导演本来就会说:

“再来一条。”

演员每一遍的停顿、眼神、呼吸、动作都会不同。

最终挑出最好的一条。

生成式视频也是一样。

如果一个镜头的宏观状态已经被锁定:

State A
人物表演
State B

那么模型中间产生的随机性就不再是“错误”,而是:

Sampling Space。

一次生成五个 Take:

Take 01
Take 02
Take 03
Take 04
Take 05

然后选最有表现力的一条。

从这个角度看,AI 的随机性甚至和影视工业天然兼容。


4. 剧情应该由剪辑完成,而不是由单个生成任务完成

这是我现在越来越认同的一条原则:

剧情由剪辑完成,表演由镜头完成。

比如一个剧情是:

女主推开办公室门,看见丈夫正在替另一个女人戴项链。她愣住,没有哭,只是慢慢攥紧手里的检查报告。

如果直接交给视频模型,它需要同时完成:

  • 女主进入;
  • 丈夫和另一个女人的位置;
  • 戴项链动作;
  • 女主的发现;
  • 情绪变化;
  • 检查报告;
  • 镜头设计;
  • 人物一致性。

最后往往会变成一个“把事情演完”的镜头。

但如果拆成:

SHOT 01
女主走向办公室。
CUT
SHOT 02
门缝视角,男人替女人戴项链。
CUT
SHOT 03
项链扣合特写。
CUT
SHOT 04
女主停住。
CUT
SHOT 05
检查报告被慢慢攥皱。
CUT
SHOT 06
眼睛微微泛红,但没有流泪。

模型的任务突然变得非常简单。

每一个镜头只需要负责:

一个信息 + 一个动作 + 一个情绪变化。

而剧情的完整性由剪辑来恢复。

这恰好非常适合生成式 AI。


5. 剪辑甚至可以“合理化”AI 的能力边界

如果模型很难一次生成:

男人走进房间 → 拿起杯子 → 倒酒 → 转身 → 开口说话。

那就不要让它做。

可以变成:

SHOT 01
男人走进房间。
CUT
SHOT 02
酒倒进杯子的特写。
CUT
SHOT 03
男人已经拿着酒杯。
CUT
SHOT 04
男人说话。

从生成模型的角度看,这是四个独立任务。

但从观众的角度看,它们会自然地被理解为一个连续事件。

电影剪辑一百多年来一直在利用人脑自动补全时间和空间的能力。

过去它主要用来压缩时间、组织叙事。

到了 AI 时代,它又多了一个新作用:

把模型无法稳定完成的复杂连续过程,拆成多个模型可以稳定完成的小任务。

所以短剧比长镜头电影更适合 AI,并不是偶然。

短剧本来就依赖快速剪辑、反打、特写、Reaction Shot、Insert Shot。

这些语言结构,本身就像是在不断给生成模型“重置世界”。


6. 和 AI 写小说相比:短剧最大的优势是“错误是可见的”

我之前也尝试过 AI 写小说。

小说真正麻烦的地方,不是模型不会写文字,而是:

长篇小说拥有大量不可见的隐状态。

比如:

  • 人物到底 17 岁还是 19 岁;
  • A 一直称呼 B 为“哥”,还是叫名字;
  • 第 23 章人物受过什么伤;
  • 第 55 章他说过自己不吃什么;
  • 第 102 章埋了什么伏笔;
  • 某个人知道什么,另一个人不知道什么;
  • 主角口袋里到底还有多少钱;
  • 某个道具现在到底在谁手里;
  • 两个人的关系现在发展到了什么阶段。

最麻烦的并不是这些状态多。

而是:

错误发生的时候,它不一定会立刻表现出来。

比如主角口袋里只剩 20 元,AI 却写了一句:

“老板,再来两斤牛肉。”

句子本身完全通顺。

人物也没有崩。

读者甚至不一定马上发现问题。

但世界状态已经错了。

几十章以后,这个错误可能会继续传播。

所以 AI 小说最终往往需要建立:

  • Character State;
  • World State;
  • Timeline;
  • Knowledge State;
  • Inventory;
  • Relationship Graph;
  • Foreshadowing / Promise Tracking。

也就是说,为了让小说保持一致,最后不得不建立一个越来越复杂的隐状态管理系统。


7. 和 AI 写代码相比:代码的问题是“错误虽然可验证,但不容易定位”

AI 写代码的体验又不同。

现在 Coding Agent 已经非常强。

它可以在很短的时间里:

  • 修改十几个文件;
  • 写几千行代码;
  • 增加接口;
  • 修改数据结构;
  • 添加测试;
  • 重构模块。

真正的问题开始从:

“AI 能不能写代码?”

变成:

“AI 一次性输出太多代码之后,人类还能不能理解系统发生了什么?”

程序员原本最大的优势之一,是可以在脑中维持项目结构。

但 Coding Agent 的代码生成速度已经远高于人类阅读和理解代码的速度。

于是会出现:

AI 对系统的修改速度 > 人脑重新建立系统模型的速度。

当 Bug 出现时,你看到的可能只是:

页面 A 出错

但实际原因可能是:

A
→ B
→ C
→ D

真正坏掉的是 C。

所以我现在在 AI Coding 上越来越关心的不是“让 AI 少写一点”,而是:

可视化、Observability、定位能力。

我可以不关心 AI 写出来的每个函数内部细节。

但当系统出问题时,我希望尽快看到:

  • 哪个模块发生变化;
  • 哪条调用链出现异常;
  • 哪个状态和预期不一致;
  • 哪次 Agent 修改引入了问题;
  • 哪些问题可能来自同一个根因。

这实际上是在解决:

AI 大量生产代码之后,人类如何重新获得系统控制权。


8. 而 AI 短剧天然就是可视化的

AI 短剧最有意思的地方恰好在这里。

如果模型给人物右脸多生成了一道疤:

一眼就能看见。

如果上一镜人物穿的是黑色外套,下一镜变成白色:

一眼就能看见。

如果杯子上一镜在右手,下一镜在左手:

一眼就能看见。

如果门的位置突然从左边跑到了右边:

一眼就能看见。

甚至最重要的是:

我不一定需要知道模型为什么出错。

代码出了 Bug,往往还需要寻找根因,修复以后还要确认副作用。

AI 视频如果一个 Take 不对:

不用。

重新生成。

如果只有一个镜头不对:

SHOT 134 ✓
SHOT 135 ✕
SHOT 136 ✓

只重做 135。

错误的传播成本非常低。


9. 这让我想到一个衡量 AI 适用性的公式

一个领域到底适不适合生成式 AI,也许可以粗略理解成:

AI 价值 ≈ 生成能力 × 可验证性 × 可拆分性 ÷ 错误传播成本

AI 小说

生成能力:高
可验证性:低
可拆分性:一般
错误传播成本:很高

AI 代码

生成能力:极高
可验证性:理论上很高
可拆分性:中等到高
错误传播成本:中高,而且依赖关系复杂

AI 短剧

生成能力:快速上升
可验证性:极高
可拆分性:极高
错误传播成本:低

这也许才是 AI 短剧真正特殊的地方。

不是模型“更懂影视”。

而是这个问题空间本身,非常适合生成模型。


10. AI 短剧真正的生产单位,也许不是“视频”,而是“状态转换”

如果继续往工程方向抽象,我觉得一个镜头最适合描述成:

输入状态 State A
发生一个动作 / 情绪变化 / 信息揭示
输出状态 State B

比如:

SHOT 37
Input State:
Character:
LINWAN
Location:
Office Corridor
Right Hand:
Medical Report
Emotion:
Calm
Face:
Normal
Event:
看见丈夫正在替另一个女人戴项链
Output State:
Emotion:
Suppressed Shock
Eyes:
Slightly Red
Medical Report:
Crumpled 20%
Location:
Office Corridor

Seedance 真正需要负责的,只是:

如何把 State A 演到 State B。

中间到底怎么呼吸、怎么眨眼、怎么出现细微表情变化,可以让模型发挥。

这样一来,AI 的幻觉被限制在“表演空间”里。

而剧情本身不会跑掉。


11. 人物一致性最终也会变成一个“版本管理问题”

比如一个人物在剧情中受伤。

完全可以建立:

LINWAN_V1
EP01 - EP08
无伤
LINWAN_V2
EP09
右脸刚刚受伤
LINWAN_V3
EP10 - EP14
伤口结痂
LINWAN_V4
EP15+
留下淡疤

那么 EP12 的镜头自动使用:

LINWAN_V3

这比小说中的状态管理有一个巨大的优势:

人物状态本身就是可视化的。

你甚至不需要把所有信息都语言化。

传统数据库可能需要记录:

scar:
position: right_cheek
healing: 0.7
color: ...

而 AI 短剧完全可以直接拿上一阶段已经确认过的人物图作为视觉事实。

所以 Production State 可以同时拥有两层:

Symbolic State
+
Visual State

Symbolic State

保存:

  • 人物 ID;
  • 服装 ID;
  • 道具;
  • 人物位置;
  • 情绪;
  • 当前剧情知识;
  • 人物关系;
  • 剧情阶段。

Visual State

保存:

  • 人物参考图;
  • 服装图;
  • 场景图;
  • 上一镜;
  • First Frame;
  • End Frame;
  • 确认过的角色版本。

文字负责逻辑。

图片负责视觉事实。

两者一起控制视频生成。


12. 所以未来的核心可能不是 Prompt Engineering,而是 Shot Engineering

当模型越来越强以后,Prompt 本身很可能会逐渐贬值。

因为普通人也可以写:

女主发现丈夫出轨,非常悲伤。

但真正有镜头语言的人会知道:

SHOT A
先不给丈夫。
女主进入画面。
她的视线停住。
CUT
SHOT B
项链扣合特写。
CUT
SHOT C
女主眼神。
CUT
SHOT D
检查报告被慢慢攥皱。
CUT
SHOT E
最后才给丈夫。

这个差距并不是 Prompt 技巧。

而是:

什么时候应该给信息,什么时候不应该给。

什么时候用特写。

什么时候切 Reaction。

什么时候让人物不说话。

什么时候让观众比角色先知道。

什么时候让角色比观众先知道。

这才是真正的导演能力。

所以 AI 并没有消灭专业性。

恰恰相反:

执行门槛在极速下降,而审美和决策门槛正在上升。

过去一个人即使非常会讲故事,也需要:

  • 摄影机;
  • 灯光;
  • 演员;
  • 场地;
  • 摄影;
  • 美术;
  • 后期;
  • 大量资金。

未来这些门槛都可能大幅下降。

竞争最后越来越集中到:

你到底知不知道应该拍什么。


13. AI 导演、AI 制片人的门槛反而会越来越高

这也是我现在一个很明确的感觉。

很多人看到 AI 视频以后,会认为:

“以后人人都是导演。”

从“能把一个画面做出来”的意义上,也许是。

但从“能持续产出好作品”的意义上,不一定。

因为 AI 把执行成本降下来之后,过去被团队执行能力掩盖的专业差距会被放大。

一个真正懂镜头的人,会不断做这些决策:

  • 这个信息什么时候出现;
  • 这里应该切还是不切;
  • 用 Wide 还是 Close-up;
  • 这里是不是应该给一个 Reaction;
  • 这一句台词是不是不说更好;
  • 是否应该把一个连续动作拆成三镜;
  • 哪个镜头应该让模型自由发挥;
  • 哪个镜头必须严格控制;
  • 哪个镜头值得抽 20 次;
  • 哪个镜头 60 分就够;
  • 哪些镜头看起来漂亮,但放进 Sequence 里没有意义。

所以真正的核心能力,会越来越从:

“怎么执行?”

转向:

“做什么?”以及“为什么这样做?”


14. 不应该逐镜头追求完美,而应该先保证 Sequence 成立

AI 视频还有一个很容易掉进去的坑:

每个镜头都抽到特别漂亮。

SHOT 01 抽 8 次。

终于很漂亮。

SHOT 02 抽 10 次。

也很漂亮。

SHOT 03 再抽。

最后每个镜头单独拿出来都像广告片。

但剪在一起却不好看。

因为影视真正的单位从来不是单个 Shot。

而是:

Sequence。

所以更合理的工作方式应该是:

第一阶段

整集所有镜头快速做到 60~70 分。

马上粗剪。

第二阶段

看完整 Sequence:

  • 哪个镜头多余;
  • 哪个镜头太长;
  • 哪个地方缺 Reaction;
  • 哪个信息出现太早;
  • 哪个节奏断掉;
  • 哪个镜头应该被替换。

第三阶段

只重做真正重要的 Hero Shot。

这样既能控制成本,也避免陷入“局部最优”。


15. 这让我想到:AI 短剧最终需要的可能不是生成平台,而是 Production IDE

如果从产品角度继续往下推,我越来越不看好纯粹的:

“输入一个剧本,一键生成整部短剧。”

它演示起来很震撼。

但真正生产时,很难给专业团队足够的控制能力。

我更期待的是一种:

Visual Production IDE。

它可能长得更像:

EP01
├── Scene 01
│ ├── Shot 001 ✓
│ ├── Shot 002 ✓
│ ├── Shot 003 ⚠
│ └── Shot 004 ✓
└── Scene 02

点击 Shot 003

Continuity Warning
Character:
LINWAN ✓
Wardrobe:
OFFICE_A ✓
Scene:
OFFICE_V3 ✓
Prop:
Medical Report ⚠
Previous Shot:
Right Hand
Current Shot:
Left Hand

再往下:

Take 01 ★★★☆☆
Take 02 ★★★★★ Selected
Take 03 ★★☆☆☆
Take 04 Face Error

旁边还有:

Narrative Coverage
Beat 01 ✓
发现异常
Beat 02 ✓
项链信息
Beat 03 ⚠
女主情绪反应不足
Beat 04 ✓
检查报告

对于导演来说,他甚至不需要看到最终 Prompt。

他真正关心的是:

  • 景别;
  • 镜头运动;
  • 人物站位;
  • 情绪;
  • 注意力方向;
  • 信息暴露;
  • 节奏;
  • Entry State;
  • Exit State。

系统再把这些信息转换成具体模型需要的 Prompt。

这样以后即使底层从 Seedance 2.5 换成下一代 Seedance、Veo 或其他模型,上层工作流也不需要推倒重来。


16. AI 短剧和 AI Coding,其实在解决同一个问题

表面上看:

一个是代码。

一个是影视。

但我现在越来越觉得,它们底层其实在面对同一件事:

当 AI 的生成速度远高于人的理解和执行速度之后,人类如何继续保持控制权?

AI Coding 需要:

  • 可观察;
  • 可定位;
  • 可追踪;
  • 可回滚;
  • 可验证。

AI 短剧也一样:

  • 哪个 Shot 有问题;
  • 哪个人物状态错了;
  • 哪个 Take 被选中;
  • 哪个道具出现了连续性错误;
  • 哪个 Beat 没有被视觉覆盖;
  • 哪个镜头成本异常;
  • 哪个角色版本正在生效;
  • 哪一次生成改变了什么。

所以 AI 时代真正稀缺的东西,也许越来越不是“生成”。

而是:

控制、观察、诊断和决策。


17. 一个可能非常重要的结论

过去我们很自然地认为:

AI 首先是语言模型,所以 AI 最适合文字。

但从真正的大规模生产角度,也许并不是。

生成式 AI 更适合的,可能是:

那些生成结果可以被人类快速验证,而且错误能够被局部隔离和重新生成的领域。

而视频恰好拥有这些特征。

AI 不需要一次性生成一个绝对正确的世界。

它只需要:

在一个被定义好的局部状态中,生成足够好的下一段。

错了就丢。

不够好就再抽一条。

状态变了就更新角色版本。

连续性错了就重做一个 Shot。

剧情本身通过 Beat、Shot 和剪辑牢牢控制。

这可能才是 AI 短剧真正的优势。


结语:AI 没有降低“导演”的价值,而是重新定义了导演的价值

AI 短剧最让我感兴趣的地方,不是:

“以后不用真人拍摄了。”

而是影视制作正在发生一次非常彻底的重新分工。

AI 越来越负责:

怎么把东西做出来。

人越来越负责:

到底应该做什么。

模型负责生成。

系统负责保持状态。

剪辑负责组织剧情。

导演负责做选择。

而一个成熟的 AI 短剧生产系统,最终可能不再像一个 Prompt 输入框。

它更像:

影视行业的 IDE。

在这个 IDE 里,每一个 Episode、Scene、Beat、Shot、Take、Character State、Visual State 都是可以被观察、修改、版本化和回滚的。

当这种生产方式真正成熟以后,所谓“AI 短剧”也许就不会再是一个独立概念了。

它只是影视生产进入了一个新的阶段:

从拍摄驱动,变成状态管理 + 生成 + 筛选 + 剪辑驱动。

而这也许才是生成式 AI 最擅长的工作方式。