最近我在尝试不同类型的 AI 创作:AI 写小说、AI 写代码,以及 AI 短剧。
越往后做,我越觉得一个很有意思的结论正在变得清晰:
AI 短剧可能不是“AI 恰好能做的一种内容”,而是目前少数几个天然符合生成式 AI 工作方式的完整生产形态。
原因并不只是今天的视频模型越来越强,而是影视制作本身有几个非常特殊的属性:
可视、可拆、可重置、可筛选。
这四点,恰好把生成式 AI 最麻烦的几个问题——幻觉、不一致、不可控、随机性——从系统性风险,变成了可以被观察、隔离和重新生成的局部问题。
1. 我最初的感受:模型越自由,结果反而越惊艳
以我自己尝试 AI 短剧的过程为例:
- 视频生成统一使用 Seedance 2.5;
- 图片和人物资产使用 GPT Image;
- 分镜头设计也通过 GPT Image 完成。
一个很明显的现象是:
当 Seedance 2.5 不被加入太多限制时,它经常能生成非常出彩的结果。
镜头、光影、动作、微表情,甚至一些没有明确要求的细节,会出现很强的“导演感”。
但当我开始给它加入剧情、人物一致性、动作顺序、道具状态、场景限制之后,生成结果反而容易变平。
它完成了剧情。
但不一定有戏。
于是问题开始变得很明确:
不能让一个视频模型同时负责理解剧情、导演、摄影、演员表演、美术和连续性。
真正适合 AI 短剧的方式,不是把剧本直接交给模型,而是把这些职责拆开。
2. AI 短剧真正适合的是“受控生成”
一个成熟的 AI 短剧流程,应该逐渐从:
剧本 ↓Prompt ↓视频变成:
剧本 ↓剧情 Beat ↓导演拆解 ↓人物 / 场景 / 道具资产 ↓Blocking(人物与镜头调度) ↓Storyboard(分镜) ↓Production Keyframe(关键帧) ↓视频生成 ↓Take 筛选 ↓粗剪 ↓补镜 / 重拍 ↓成片这里真正重要的已经不是“Prompt 写得多漂亮”,而是:
剧情中哪些东西必须被锁死,哪些东西应该留给模型自由发挥。
我更喜欢把这种方法理解成:
Macro Control + Micro Freedom
也就是:
宏观锁死,微观放权。
必须锁死的包括:
- 人物身份;
- 服装;
- 场景;
- 道具;
- 人物初始位置;
- 镜头景别;
- 关键动作;
- 镜头结束时必须达到的状态。
而可以交给模型发挥的包括:
- 呼吸;
- 眼神;
- 微表情;
- 头发和衣料的运动;
- 非关键的小动作;
- 轻微的镜头漂移;
- 环境中的自然动态。
这样,AI 的不可控并不会消失。
但不可控的部分被限制在了一个安全的范围内。
甚至,模型的随机性反而会变成一种表演资源。
3. “抽卡”不是缺陷,它很像真人拍摄中的“再来一条”
过去我们往往把生成模型的随机性看成问题。
同样的输入,每次生成都会有差异。
但如果放到影视生产里,它其实很像一件非常传统的事情:
Take 1、Take 2、Take 3……
真人拍摄时,导演本来就会说:
“再来一条。”
演员每一遍的停顿、眼神、呼吸、动作都会不同。
最终挑出最好的一条。
生成式视频也是一样。
如果一个镜头的宏观状态已经被锁定:
State A ↓人物表演 ↓State B那么模型中间产生的随机性就不再是“错误”,而是:
Sampling Space。
一次生成五个 Take:
Take 01Take 02Take 03Take 04Take 05然后选最有表现力的一条。
从这个角度看,AI 的随机性甚至和影视工业天然兼容。
4. 剧情应该由剪辑完成,而不是由单个生成任务完成
这是我现在越来越认同的一条原则:
剧情由剪辑完成,表演由镜头完成。
比如一个剧情是:
女主推开办公室门,看见丈夫正在替另一个女人戴项链。她愣住,没有哭,只是慢慢攥紧手里的检查报告。
如果直接交给视频模型,它需要同时完成:
- 女主进入;
- 丈夫和另一个女人的位置;
- 戴项链动作;
- 女主的发现;
- 情绪变化;
- 检查报告;
- 镜头设计;
- 人物一致性。
最后往往会变成一个“把事情演完”的镜头。
但如果拆成:
SHOT 01女主走向办公室。
CUT
SHOT 02门缝视角,男人替女人戴项链。
CUT
SHOT 03项链扣合特写。
CUT
SHOT 04女主停住。
CUT
SHOT 05检查报告被慢慢攥皱。
CUT
SHOT 06眼睛微微泛红,但没有流泪。模型的任务突然变得非常简单。
每一个镜头只需要负责:
一个信息 + 一个动作 + 一个情绪变化。
而剧情的完整性由剪辑来恢复。
这恰好非常适合生成式 AI。
5. 剪辑甚至可以“合理化”AI 的能力边界
如果模型很难一次生成:
男人走进房间 → 拿起杯子 → 倒酒 → 转身 → 开口说话。
那就不要让它做。
可以变成:
SHOT 01男人走进房间。
CUT
SHOT 02酒倒进杯子的特写。
CUT
SHOT 03男人已经拿着酒杯。
CUT
SHOT 04男人说话。从生成模型的角度看,这是四个独立任务。
但从观众的角度看,它们会自然地被理解为一个连续事件。
电影剪辑一百多年来一直在利用人脑自动补全时间和空间的能力。
过去它主要用来压缩时间、组织叙事。
到了 AI 时代,它又多了一个新作用:
把模型无法稳定完成的复杂连续过程,拆成多个模型可以稳定完成的小任务。
所以短剧比长镜头电影更适合 AI,并不是偶然。
短剧本来就依赖快速剪辑、反打、特写、Reaction Shot、Insert Shot。
这些语言结构,本身就像是在不断给生成模型“重置世界”。
6. 和 AI 写小说相比:短剧最大的优势是“错误是可见的”
我之前也尝试过 AI 写小说。
小说真正麻烦的地方,不是模型不会写文字,而是:
长篇小说拥有大量不可见的隐状态。
比如:
- 人物到底 17 岁还是 19 岁;
- A 一直称呼 B 为“哥”,还是叫名字;
- 第 23 章人物受过什么伤;
- 第 55 章他说过自己不吃什么;
- 第 102 章埋了什么伏笔;
- 某个人知道什么,另一个人不知道什么;
- 主角口袋里到底还有多少钱;
- 某个道具现在到底在谁手里;
- 两个人的关系现在发展到了什么阶段。
最麻烦的并不是这些状态多。
而是:
错误发生的时候,它不一定会立刻表现出来。
比如主角口袋里只剩 20 元,AI 却写了一句:
“老板,再来两斤牛肉。”
句子本身完全通顺。
人物也没有崩。
读者甚至不一定马上发现问题。
但世界状态已经错了。
几十章以后,这个错误可能会继续传播。
所以 AI 小说最终往往需要建立:
- Character State;
- World State;
- Timeline;
- Knowledge State;
- Inventory;
- Relationship Graph;
- Foreshadowing / Promise Tracking。
也就是说,为了让小说保持一致,最后不得不建立一个越来越复杂的隐状态管理系统。
7. 和 AI 写代码相比:代码的问题是“错误虽然可验证,但不容易定位”
AI 写代码的体验又不同。
现在 Coding Agent 已经非常强。
它可以在很短的时间里:
- 修改十几个文件;
- 写几千行代码;
- 增加接口;
- 修改数据结构;
- 添加测试;
- 重构模块。
真正的问题开始从:
“AI 能不能写代码?”
变成:
“AI 一次性输出太多代码之后,人类还能不能理解系统发生了什么?”
程序员原本最大的优势之一,是可以在脑中维持项目结构。
但 Coding Agent 的代码生成速度已经远高于人类阅读和理解代码的速度。
于是会出现:
AI 对系统的修改速度 > 人脑重新建立系统模型的速度。
当 Bug 出现时,你看到的可能只是:
页面 A 出错但实际原因可能是:
A → B → C → D真正坏掉的是 C。
所以我现在在 AI Coding 上越来越关心的不是“让 AI 少写一点”,而是:
可视化、Observability、定位能力。
我可以不关心 AI 写出来的每个函数内部细节。
但当系统出问题时,我希望尽快看到:
- 哪个模块发生变化;
- 哪条调用链出现异常;
- 哪个状态和预期不一致;
- 哪次 Agent 修改引入了问题;
- 哪些问题可能来自同一个根因。
这实际上是在解决:
AI 大量生产代码之后,人类如何重新获得系统控制权。
8. 而 AI 短剧天然就是可视化的
AI 短剧最有意思的地方恰好在这里。
如果模型给人物右脸多生成了一道疤:
一眼就能看见。
如果上一镜人物穿的是黑色外套,下一镜变成白色:
一眼就能看见。
如果杯子上一镜在右手,下一镜在左手:
一眼就能看见。
如果门的位置突然从左边跑到了右边:
一眼就能看见。
甚至最重要的是:
我不一定需要知道模型为什么出错。
代码出了 Bug,往往还需要寻找根因,修复以后还要确认副作用。
AI 视频如果一个 Take 不对:
不用。
重新生成。
如果只有一个镜头不对:
SHOT 134 ✓SHOT 135 ✕SHOT 136 ✓只重做 135。
错误的传播成本非常低。
9. 这让我想到一个衡量 AI 适用性的公式
一个领域到底适不适合生成式 AI,也许可以粗略理解成:
AI 价值 ≈ 生成能力 × 可验证性 × 可拆分性 ÷ 错误传播成本
AI 小说
生成能力:高
可验证性:低
可拆分性:一般
错误传播成本:很高
AI 代码
生成能力:极高
可验证性:理论上很高
可拆分性:中等到高
错误传播成本:中高,而且依赖关系复杂
AI 短剧
生成能力:快速上升
可验证性:极高
可拆分性:极高
错误传播成本:低
这也许才是 AI 短剧真正特殊的地方。
不是模型“更懂影视”。
而是这个问题空间本身,非常适合生成模型。
10. AI 短剧真正的生产单位,也许不是“视频”,而是“状态转换”
如果继续往工程方向抽象,我觉得一个镜头最适合描述成:
输入状态 State A ↓发生一个动作 / 情绪变化 / 信息揭示 ↓输出状态 State B比如:
SHOT 37
Input State:
Character:LINWAN
Location:Office Corridor
Right Hand:Medical Report
Emotion:Calm
Face:Normal
Event:
看见丈夫正在替另一个女人戴项链
Output State:
Emotion:Suppressed Shock
Eyes:Slightly Red
Medical Report:Crumpled 20%
Location:Office CorridorSeedance 真正需要负责的,只是:
如何把 State A 演到 State B。
中间到底怎么呼吸、怎么眨眼、怎么出现细微表情变化,可以让模型发挥。
这样一来,AI 的幻觉被限制在“表演空间”里。
而剧情本身不会跑掉。
11. 人物一致性最终也会变成一个“版本管理问题”
比如一个人物在剧情中受伤。
完全可以建立:
LINWAN_V1EP01 - EP08无伤
LINWAN_V2EP09右脸刚刚受伤
LINWAN_V3EP10 - EP14伤口结痂
LINWAN_V4EP15+留下淡疤那么 EP12 的镜头自动使用:
LINWAN_V3这比小说中的状态管理有一个巨大的优势:
人物状态本身就是可视化的。
你甚至不需要把所有信息都语言化。
传统数据库可能需要记录:
scar: position: right_cheek healing: 0.7 color: ...而 AI 短剧完全可以直接拿上一阶段已经确认过的人物图作为视觉事实。
所以 Production State 可以同时拥有两层:
Symbolic State+Visual StateSymbolic State
保存:
- 人物 ID;
- 服装 ID;
- 道具;
- 人物位置;
- 情绪;
- 当前剧情知识;
- 人物关系;
- 剧情阶段。
Visual State
保存:
- 人物参考图;
- 服装图;
- 场景图;
- 上一镜;
- First Frame;
- End Frame;
- 确认过的角色版本。
文字负责逻辑。
图片负责视觉事实。
两者一起控制视频生成。
12. 所以未来的核心可能不是 Prompt Engineering,而是 Shot Engineering
当模型越来越强以后,Prompt 本身很可能会逐渐贬值。
因为普通人也可以写:
女主发现丈夫出轨,非常悲伤。
但真正有镜头语言的人会知道:
SHOT A先不给丈夫。
女主进入画面。
她的视线停住。
CUT
SHOT B项链扣合特写。
CUT
SHOT C女主眼神。
CUT
SHOT D检查报告被慢慢攥皱。
CUT
SHOT E最后才给丈夫。这个差距并不是 Prompt 技巧。
而是:
什么时候应该给信息,什么时候不应该给。
什么时候用特写。
什么时候切 Reaction。
什么时候让人物不说话。
什么时候让观众比角色先知道。
什么时候让角色比观众先知道。
这才是真正的导演能力。
所以 AI 并没有消灭专业性。
恰恰相反:
执行门槛在极速下降,而审美和决策门槛正在上升。
过去一个人即使非常会讲故事,也需要:
- 摄影机;
- 灯光;
- 演员;
- 场地;
- 摄影;
- 美术;
- 后期;
- 大量资金。
未来这些门槛都可能大幅下降。
竞争最后越来越集中到:
你到底知不知道应该拍什么。
13. AI 导演、AI 制片人的门槛反而会越来越高
这也是我现在一个很明确的感觉。
很多人看到 AI 视频以后,会认为:
“以后人人都是导演。”
从“能把一个画面做出来”的意义上,也许是。
但从“能持续产出好作品”的意义上,不一定。
因为 AI 把执行成本降下来之后,过去被团队执行能力掩盖的专业差距会被放大。
一个真正懂镜头的人,会不断做这些决策:
- 这个信息什么时候出现;
- 这里应该切还是不切;
- 用 Wide 还是 Close-up;
- 这里是不是应该给一个 Reaction;
- 这一句台词是不是不说更好;
- 是否应该把一个连续动作拆成三镜;
- 哪个镜头应该让模型自由发挥;
- 哪个镜头必须严格控制;
- 哪个镜头值得抽 20 次;
- 哪个镜头 60 分就够;
- 哪些镜头看起来漂亮,但放进 Sequence 里没有意义。
所以真正的核心能力,会越来越从:
“怎么执行?”
转向:
“做什么?”以及“为什么这样做?”
14. 不应该逐镜头追求完美,而应该先保证 Sequence 成立
AI 视频还有一个很容易掉进去的坑:
每个镜头都抽到特别漂亮。
SHOT 01 抽 8 次。
终于很漂亮。
SHOT 02 抽 10 次。
也很漂亮。
SHOT 03 再抽。
最后每个镜头单独拿出来都像广告片。
但剪在一起却不好看。
因为影视真正的单位从来不是单个 Shot。
而是:
Sequence。
所以更合理的工作方式应该是:
第一阶段
整集所有镜头快速做到 60~70 分。
马上粗剪。
第二阶段
看完整 Sequence:
- 哪个镜头多余;
- 哪个镜头太长;
- 哪个地方缺 Reaction;
- 哪个信息出现太早;
- 哪个节奏断掉;
- 哪个镜头应该被替换。
第三阶段
只重做真正重要的 Hero Shot。
这样既能控制成本,也避免陷入“局部最优”。
15. 这让我想到:AI 短剧最终需要的可能不是生成平台,而是 Production IDE
如果从产品角度继续往下推,我越来越不看好纯粹的:
“输入一个剧本,一键生成整部短剧。”
它演示起来很震撼。
但真正生产时,很难给专业团队足够的控制能力。
我更期待的是一种:
Visual Production IDE。
它可能长得更像:
EP01 ├── Scene 01 │ ├── Shot 001 ✓ │ ├── Shot 002 ✓ │ ├── Shot 003 ⚠ │ └── Shot 004 ✓ │ └── Scene 02点击 Shot 003:
Continuity Warning
Character:LINWAN ✓
Wardrobe:OFFICE_A ✓
Scene:OFFICE_V3 ✓
Prop:Medical Report ⚠
Previous Shot:Right Hand
Current Shot:Left Hand再往下:
Take 01 ★★★☆☆Take 02 ★★★★★ SelectedTake 03 ★★☆☆☆Take 04 Face Error旁边还有:
Narrative Coverage
Beat 01 ✓发现异常
Beat 02 ✓项链信息
Beat 03 ⚠女主情绪反应不足
Beat 04 ✓检查报告对于导演来说,他甚至不需要看到最终 Prompt。
他真正关心的是:
- 景别;
- 镜头运动;
- 人物站位;
- 情绪;
- 注意力方向;
- 信息暴露;
- 节奏;
- Entry State;
- Exit State。
系统再把这些信息转换成具体模型需要的 Prompt。
这样以后即使底层从 Seedance 2.5 换成下一代 Seedance、Veo 或其他模型,上层工作流也不需要推倒重来。
16. AI 短剧和 AI Coding,其实在解决同一个问题
表面上看:
一个是代码。
一个是影视。
但我现在越来越觉得,它们底层其实在面对同一件事:
当 AI 的生成速度远高于人的理解和执行速度之后,人类如何继续保持控制权?
AI Coding 需要:
- 可观察;
- 可定位;
- 可追踪;
- 可回滚;
- 可验证。
AI 短剧也一样:
- 哪个 Shot 有问题;
- 哪个人物状态错了;
- 哪个 Take 被选中;
- 哪个道具出现了连续性错误;
- 哪个 Beat 没有被视觉覆盖;
- 哪个镜头成本异常;
- 哪个角色版本正在生效;
- 哪一次生成改变了什么。
所以 AI 时代真正稀缺的东西,也许越来越不是“生成”。
而是:
控制、观察、诊断和决策。
17. 一个可能非常重要的结论
过去我们很自然地认为:
AI 首先是语言模型,所以 AI 最适合文字。
但从真正的大规模生产角度,也许并不是。
生成式 AI 更适合的,可能是:
那些生成结果可以被人类快速验证,而且错误能够被局部隔离和重新生成的领域。
而视频恰好拥有这些特征。
AI 不需要一次性生成一个绝对正确的世界。
它只需要:
在一个被定义好的局部状态中,生成足够好的下一段。
错了就丢。
不够好就再抽一条。
状态变了就更新角色版本。
连续性错了就重做一个 Shot。
剧情本身通过 Beat、Shot 和剪辑牢牢控制。
这可能才是 AI 短剧真正的优势。
结语:AI 没有降低“导演”的价值,而是重新定义了导演的价值
AI 短剧最让我感兴趣的地方,不是:
“以后不用真人拍摄了。”
而是影视制作正在发生一次非常彻底的重新分工。
AI 越来越负责:
怎么把东西做出来。
人越来越负责:
到底应该做什么。
模型负责生成。
系统负责保持状态。
剪辑负责组织剧情。
导演负责做选择。
而一个成熟的 AI 短剧生产系统,最终可能不再像一个 Prompt 输入框。
它更像:
影视行业的 IDE。
在这个 IDE 里,每一个 Episode、Scene、Beat、Shot、Take、Character State、Visual State 都是可以被观察、修改、版本化和回滚的。
当这种生产方式真正成熟以后,所谓“AI 短剧”也许就不会再是一个独立概念了。
它只是影视生产进入了一个新的阶段:
从拍摄驱动,变成状态管理 + 生成 + 筛选 + 剪辑驱动。
而这也许才是生成式 AI 最擅长的工作方式。