雨天小六

用 AI 做视频,其实和传统拍片是一回事

· 专栏:AI 视频生成

#AI视频#Seedance#GPT-Image-2#工作流#即梦

这是「AI 视频生成」专栏的第一篇。不绕弯子,直接把整套流程摊开给你看。

传统影视剧是怎么做的

先别急着打开 AI 工具。花两分钟想想,传统影视是怎么拍出来的。

一部片子,无论长短,流程大致都是这样:

剧本分镜美术/选角拍摄剪辑

每一步都在为下一步铺路:剧本定故事,分镜定画面,美术和选角定角色造型与场景氛围,拍摄把分镜变成素材,剪辑再把素材拼成完整的片子。

这套流程有一个很朴素的好处:哪一步出了问题,就退回哪一步修改,不必因为一个镜头不对,把整个项目推倒重来。

先记住这套流程。接下来你会发现,AI 做视频的逻辑与它几乎一模一样。

AI 做视频,套路完全一样

把 AI 影视的创作流程拆开来看,大致是这样:

剧本分段人物图/场景图分镜提示词生成

把两套流程放在一起对比,你会发现它们本质上是同一件事。分镜还是分镜,美术变成了用图片模型生成角色图和场景图,拍摄变成了写提示词、让视频模型生成镜头。只是工具换了而已。

唯一的区别是什么?

目前最强的视频模型,一次最多生成 15 秒。

Sora 2 是这样,Seedance 2.0 也是这样。15 秒,就是现在的天花板。

这意味着,只要视频超过 15 秒,就必须把它拆开:30 秒拆成两个 15 秒,1 分钟拆成四个 15 秒。每段 15 秒的内容,都独立走一遍完整流程。

听起来有些麻烦,但习惯之后反而更顺手。因为每个 15 秒都是一个独立的“小项目”,出了问题只影响这一小段,不会连累整部片子。

举一个具体的例子

先看一个具体案例。我们直接拆解一段 30 秒的视频。

假设你想做一部末日题材的短片:黄昏时分,一名女幸存者独自站在海边废弃别墅的露台上。她手里攥着一张褪色的老照片,望着海面出神。

30 秒,怎么拆?

拆成两个 15 秒。

  • 第一个 15 秒:环境铺陈。露台全景,散落的杂物,海面反射着金色落日,远处有废弃的高楼剪影。
  • 第二个 15 秒:人物情绪。镜头推进到女幸存者身上,她低头看照片,抬头望向海面,远处隐约传来一声汽笛。

每段 15 秒的内容,都按下面这套固定流程走一遍。两段各自完成,再拼到一起。

每个 15 秒的固定流程

整套流程分为五步,每段 15 秒的内容都照此执行。

第一步:把这一段写成画面描述

不用写成正式剧本,自己看得懂就行。只要交代清楚三件事:谁、在哪儿、做什么。

比如第一个 15 秒(环境铺陈):

黄昏,金色逆光从海面方向照过来。一栋现代风格的海边别墅已经废弃,露台地面散落着碎玻璃、泛黄的旧报纸和一把倒下的藤椅。无边泳池边缘长出青苔,池水浑浊。远处是被藤蔓覆盖的高楼废墟剪影,背景则是橙红色的海面落日。整个画面笼罩在“文明消亡之后”的氛围里,安静,却仍有一种残存的美。

这就够了。你写的是画面,不是台词。

第二步:出人物图和场景图

很多人会跳过这一步,但它恰恰是最容易翻车的一环。

如果不先固定形象,后续片段里的女主角很可能长得不一样——第一个镜头还是短发,第二个镜头就变成长发,第三个镜头连衣服颜色都换了。视频模型不会自动记住上一个片段,每次生成都相当于重新开始。

所以要先出图。生图模型现在最强的是 GPT-Image-2,可以直接用它生成需要的角色和场景。

场景图的提示词,按照第一段 15 秒的环境描述来写即可,直接用中文:

废弃的现代风格海边别墅露台,黄昏时刻,金色逆光从海面方向照射过来。露台地面散落着碎玻璃、泛黄的旧报纸和一把倒下的藤椅。无边泳池边缘长满青苔,池水浑浊呈绿色。远处是藤蔓覆盖的高楼废墟剪影,背景是橙红色的海面落日。写实摄影风格,35 mm 镜头,电影感,高对比度。

角色图提示词:

一个 25 岁的亚洲女性幸存者,利落的短发有些凌乱,脸上有几道灰痕,眼神疲惫但仍有光。她身穿一件旧军绿色风衣,领口已有磨损,里面是深灰色背心,脖子上挂着一串用弹壳改成的吊坠。她站在废弃别墅的露台栏杆边,海风轻轻吹动头发和衣角。写实摄影风格,35 mm 人像,逆光,电影感。

场景图生成两三张,角色图则准备正面、侧面和半身各一张。这些图片就是后续所有镜头的“视觉锚点”。

第三步:写分镜

把 15 秒的画面描述拆成具体镜头。每个镜头都要写清楚:景别、机位、运镜方式、画面内容和持续时间。

比如第一个 15 秒拆成这样:

镜头时长景别机位运镜画面内容
15s远景平视,1.5 m 高度固定→缓推露台全景,以海面落日和废弃高楼剪影为背景,铺陈整体氛围
24s中近景低机位,30 cm 高度固定微推地面杂物:反光的碎玻璃、被风掀起一角的泛黄报纸、倒下的藤椅
33s中景平视,1.2 m 高度横移从泳池边缘向露台栏杆匀速横移,掠过散落的杂物,最终停在栏杆边
43s特写平视,1.6 m 高度固定无边泳池的水面,浑浊的绿色池水上漂着一片枯叶,落日倒影随水波跳动

四个镜头合计 15 秒。分镜写得越具体,后续生成越不容易跑偏。

第四步:写提示词

这是最关键的一步:把分镜表里的每一行,改写成 Seedance 2.0 能理解的中文提示词。

每条提示词的写法,参照下面这个格式:

@图片1 是主要人物·女幸存者
@图片2 是场景·废弃海边别墅露台
@图片3 是场景·海面落日

【0-5s | 第1镜 | 远景露台全景→海面落日 | 固定缓推】黄昏,金色逆光从海面方向铺满整个废弃海边别墅露台。镜头从露台中央缓慢向前推进约 1 米。前景是一把倒下的藤椅,椅面上积了一层灰。左侧无边泳池边缘青苔斑驳,池水浑浊呈绿色,水面上漂着一片枯叶。露台地面散落着碎玻璃碴和几张泛黄的旧报纸,报纸边角被海风轻轻掀动。远处天际线是一排藤蔓覆盖的高楼废墟剪影,橙红色落日在海面上拉出一条长光带。空气中飘着细小的尘埃粒子。画面带有末日后的荒芜感,但夕阳又留下一丝温度。无台词。

拆开来看,这套格式只有两部分:

开头先声明参考图。

@图片1@图片2@图片3——告诉模型每张参考图分别对应什么。角色图负责约束人物的脸、发型和服装,场景图负责约束环境的色调与结构。模型会综合这些图片和文字描述,生成最终画面。

方括号里写清拍摄指令。

【时间 | 镜号 | 景别和画面主体 | 运镜方式】——这几个信息决定了镜头怎么动、拍什么、拍多久。

方括号后的正文就是画面描述。尽量补全有用的细节:光从哪里来、地面是什么质感、空气里有什么、哪些物体正在运动。描述越具体,模型越容易理解你想要的画面。

再看第二个镜头的提示词:

@图片1 是主要人物·女幸存者
@图片2 是场景·废弃海边别墅露台

【0-4s | 第2镜 | 低机位地面杂物特写→碎玻璃报纸 | 固定微推】极低视角贴近露台地面,镜头以约 0.2 m/s 的速度缓慢向前微推。前景清晰呈现一块碎裂的玻璃碴,玻璃边缘反射着金色夕阳。旁边是一张泛黄的旧报纸,日期模糊不清,一角被海风轻轻掀起又落下。藤椅倒在地上,椅腿投出长长的影子。地面留有干涸的暗色水渍。海面方向投来逆光,整个画面笼罩在暖金色调里,灰尘粒子在光柱中缓慢浮动。末日废墟质感,写实摄影风格,无台词。

到了镜头 3,女主角会出现在画面里,因此也要带上角色参考图:

@图片1 是主要人物·女幸存者
@图片2 是场景·废弃海边别墅露台
@图片3 是场景·海面落日

【0-3s | 第3镜 | 中景露台横移→女幸存者背影入画 | 匀速横移】中景,机位高度约 1.2 米。镜头从泳池边缘向右匀速横移,经过地面散落的杂物——碎玻璃的反光一闪而过,泛黄报纸的边角微微颤动。镜头继续横移,一截褪色的藤椅扶手入画又出画,最终停在露台栏杆前。一个身穿旧军绿色风衣的女性背影站在栏杆边,短发被海风轻轻吹动。她面朝大海,站姿疲惫,脊背却依然挺直。夕阳在她身上勾出金色轮廓光。画面安静,无台词。

镜头 4 不需要角色参考图,但需要场景和水面参考图:

@图片3 是场景·海面落日

【0-3s | 第4镜 | 特写无边泳池水面→枯叶落日倒影 | 固定】固定机位,特写无边泳池的浑浊水面。水面呈暗绿色,池底隐约可见沉积的灰泥。一片枯黄的叶子漂在水面上,随着微小的水波轻轻旋转。橙红色的落日在水面上投下一个抖动的倒影,光斑随水纹向外扩散。远处海面在失焦中融化成一片模糊的金色。逆光,水面隐约反射出露台栏杆的轮廓。安静、缓慢、末日后的残存诗意,无台词。

几个要点:

  • @图片 声明一定要写清楚,明确哪张是角色、哪张是场景。模型需要据此区分参考图的用途。
  • 方括号里的运镜要具体。别只写“推镜”,可以写“镜头缓慢向前推进约 1 米”或“以约 0.2 m/s 的速度向前微推”。数据越明确,生成的镜头运动越稳定。
  • 画面描述少用抽象情绪词。与其写“孤独”“悲伤”“绝望”,不如呈现具体画面:地面散落着碎玻璃,报纸被风吹动,灰尘在光柱里漂浮。让画面本身传递情绪,而不是用形容词替画面喊出来。

然后把这些提示词和对应的参考图一起提交到即梦。

第五步:生成视频

打开即梦官网,用 Seedance 2.0全能参考功能。

全能参考一次最多上传 10 张参考图。把第二步生成的角色图和场景图都传进去——角色正面、角色侧面、露台全景、海面落日,一个都别漏。然后在提示词里用 @图片N 逐一声明清楚。

一个镜头通常要生成 3 到 5 次,再从中挑出最好的一条。如果试了几次还是不对,就别再死磕提示词,往前退一步检查:人物脸崩了就换角色参考图,氛围不对就重做场景图,动作奇怪就回去修改分镜。

这就是前面提到的原则:哪一步出问题,就退回哪一步修改。

两段 15 秒的内容都按这套流程完成后,你就有了若干条视频素材。接下来,把它们放进剪辑软件拼起来即可。

剪辑收尾

到了这一步,基本都是执行层面的工作:

  1. 按分镜顺序把片段拖进剪辑软件(剪映够用了)
  2. 配音:ElevenLabs、豆包语音都行,哪个顺手用哪个
  3. BGM:Suno 生成,或者直接找素材库
  4. 调色:AI 生成的素材色调大概率不统一,统一拉一遍调色,质感瞬间上来
  5. 加字幕,导出

一部 30 秒的片子,一个人一天就能完成,成本大约几十元。

几句实在话

做 AI 视频,最容易陷进去的一件事,就是和提示词死磕。一个镜头反复生成都不对,便开始怀疑是不是 prompt 写得不够好,接着花两个小时来回修改措辞。

问题很可能不在提示词。退回去看看:参考图是否足够清晰,分镜是否写得太笼统,场景图的氛围是否已经跑偏。提示词是最后一步,补不了前面环节留下的坑。

另外,这些工具更新得太快。今天用的是 GPT-Image-2 和 Seedance 2.0,或许三个月后又会换成另一套工具。工具会变,但这套拆解流程不会轻易过时。掌握了流程,无论换成什么工具,都能继续创作。

接下来的几篇文章,我会把每一步拆开细讲——剧本怎么写,模型才更容易理解;如何保持角色一致性;怎样把分镜转化为提示词;以及几个主流模型生成同一镜头时的横向对比。

如果感兴趣,欢迎收藏这个专栏。我会继续一篇篇写下去。

评论


← 返回文章列表