这篇能做出什么
读完并跟着做一遍,你会得到一支 60~90 秒、8~12 个镜头的短片,风格指向《沙丘 3》那类美学:赭红色沙海、巨型岩石构造体、裹着蒸馏服的独行旅人、沙面下若隐若现的巨物。成片带完整音轨,画幅统一,镜头之间能接得上,不是十条互不相干的炫技片段拼盘。
交付物清单:
- 一份分镜表(镜号、时长、景别、内容、运镜、声音)
- 一份「风格圣经」(固定风格串 + 固定参考图)
- 一套可复用的提示词模板
- 一支带音轨的 MP4 成片
- 一份避坑清单
整条路径的核心思路只有一句:把 AI 当成摄影师,而不是导演。 你负责分镜、连贯性和剪辑,模型负责单镜头内的画面生成。
前置条件清单
- 可用的 Seedance 2.5 视频生成入口(网页端或 API,具体入口、参数名、支持的时长与分辨率以官方文档当前版本为准)
- 图生视频能力;如果支持首尾帧模式,效果会更好
- 一个能出静帧的图片生成工具(用来做关键帧,和视频模型风格对齐)
- ffmpeg(本地命令行)或任意一款剪辑软件
- 可商用授权或自录的音乐、音效素材
- 一块能顺畅播 1080p 的机器,和至少两三个小时的耐心
不要一上来就想着「一句话生成一条完整短片」。AI 视频目前的能力边界在单镜头内,跨镜头的叙事必须由人来缝合。
第 0 步:先写风格圣经,再写剧本
绝大多数人翻车在第一步:直接开始写提示词。结果是十个人物长得不一样、十个场景色调不一样。
先产出一份风格圣经,内容是一段固定文本加一组固定参考图:
```text
【风格圣经 · 沙丘式】
影调:暖橙与灰褐主色,高光偏白偏硬,暗部压深但保留细节
光线:正午硬光为主,逆光轮廓光,空气中悬浮尘埃
质感:实拍电影感,细颗粒胶片,低饱和,高对比
镜头:长焦压缩感为主,浅景深,缓慢运镜
画幅:宽银幕比例,全片统一
```
这段文本此后每次生成都原样粘贴,一个字不改。改一个字,色调就可能飘。
参考图准备三类:主角(正面、背面、侧面各一张)、主场景(沙海、岩壁、营地)、一个视觉锚点(比如旅人胸前的金属徽章)。锚点是后面做连贯性的关键道具。
第 1 步:把剧本拆成分镜表
AI 短片适合「弱叙事、强氛围」,不要写复杂对白。目标定在 8~12 个镜头,每镜 3~6 秒。
分镜表结构如下,可以直接抄:
| 镜号 | 时长 | 景别 | 画面内容 | 运镜 | 声音 |
|---|---|---|---|---|---|
| 01 | 4s | 大远景 | 无垠沙海,远处岩壁剪影 | 缓慢横移 | 低频风 |
| 02 | 3s | 远景 | 沙面突然隆起一条线,又落下 | 固定 | 沙粒摩擦、闷响 |
| 03 | 3s | 中景 | 旅人背影行走,风衣飘动 | 跟随移动 | 布料拍打 |
| 04 | 2s | 特写 | 面罩上的沙粒与凝结水汽 | 微推 | 呼吸声 |
| 05 | 4s | 大全景 | 巨大构造体前的渺小身影 | 缓慢上升 | 低频嗡鸣渐入 |
| 06 | 3s | 中近景 | 旅人抬手遮光,抬头 | 固定 | 呼吸停顿 |
| 07 | 4s | 远景 | 沙下巨物再次隆起,这次更大 | 缓慢右移 | 沙层碎裂 |
| 08 | 5s | 大远景 | 身影继续前行,镜头拉远留白 | 缓慢后拉 | 音乐收尾 |
写完这张表,你会发现两件事:一是镜头之间的方向必须有规律,二是总时长和你想的不一样。这两件事都要在生成之前解决。
第 2 步:先出静帧,再让画面动起来
能图生视频就不要文生视频。原因很直接:静帧可以反复重出、逐张挑,成本低、可控;视频生成的随机性大得多。
做法是:按分镜表逐个生成关键帧静帧,全部用同一套风格串和参考图。挑出满意的 8~12 张,确认它们的色调、人物特征、画幅比例一致,再拿去做图生视频。
如果模型支持首尾帧模式,可以额外为每镜准备尾帧,让运动有明确终点,画面不容易飘。
第 3 步:六段式提示词模板
把提示词结构化,比堆形容词有效得多。模板如下:
```text
【主体】一名裹着深色蒸馏服的旅人,面罩上凝着细沙
【动作】缓慢抬头,望向远处沙脊
【环境】无边赭红色沙海,远处巨大岩石构造体,地表有风纹
【光线】正午硬光,逆光轮廓,空气中有悬浮尘埃
【镜头】长焦压缩感,低角度,缓慢向右横移,浅景深
【风格】电影感实拍质感,暖橙灰褐调,细胶片颗粒,宽银幕比例
【约束】画面中不要出现文字,人物比例正常,不要快速甩镜
```
对照一个反面例子:
```text
超震撼史诗级沙漠大片,电影级画质,8K,超写实,沙虫出现,
人物很帅,光影绝美,非常震撼,大气磅礴
```
后者的问题是把「结果」当成了「指令」。模型不知道你要的是长焦还是广角、固定还是横移,只能随机给。
动作段只写一个动作。 「抬头」和「转身」写在一起,大概率变成身体扭曲。
第 4 步:镜头连贯性的四种接法
接法一:首尾帧接力
把上一镜的最后一帧抽出来,作为下一镜的首帧。适合连续场景。
```bash
抽出镜头 03 的首帧和尾帧
ffmpeg -i shot03.mp4 -frames:v 1 shot03_first.png
ffmpeg -sseof -0.1 -i shot03.mp4 -frames:v 1 shot03_last.png
```
接法二:方向守恒
全片统一运动方向。前三个镜头都是向右移动,第四个突然向左,观众会瞬间出戏。这和实拍的 180 度线是一个道理。
接法三:遮挡转场
让角色走过镜头前方、让沙尘漫过画面,用遮挡完成切换。这种接法对画面相似度要求低,容错高,适合风格略有差异的两镜之间。
接法四:锚点复用
同一块岩石、同一个徽章、同一条沙脊反复出现,观众会自动把它们串成一个空间。
第 5 步:风格一致性控制
除了固定风格串和参考图,还有几件事要在生成前锁死:
- 画幅比例:全片统一,中途改比例后期要裁切,构图全毁
- 帧率:统一,避免拼接时画面抖动
- 种子:如果模型支持固定种子,同一场景的多个镜头尽量用同一组
- 调色:生成时统一是上策,后期再套统一 LUT 是补救
第 6 步:批量生成与筛选
同一提示词生成多条,选一条。这是常规操作,不必心疼次数。
文件命名要能追溯参数,例如 shot03_take2_v1.mp4。建一个表格记录每镜的提示词、参考图、种子和选用版本,改到第十版时你会感谢自己。
第 7 步:音频三层搭建
声音决定成片质感。按三层做:
1. 环境底噪:低频风、远处嗡鸣,全程铺底
2. 拟音:沙粒摩擦、布料拍打、呼吸声、金属扣件轻响
3. 音乐:氛围型低频音乐,进出于第 05 镜和第 08 镜
响度统一,避免拼接后忽大忽小:
```bash
ffmpeg -i mix.wav -af loudnorm=I=-16:TP=-1.5:LRA=11 -ar 48000 mix_norm.wav
```
音乐务必用可商用素材或自己录制,不要用电影原声。
第 8 步:剪辑拼装与输出
先粗剪,把所有镜头按分镜表顺序排好,再看节奏:开场两个空镜建立世界观,中段推进,结尾留白。
如果所有片段编码参数一致,可以直接拼接:
```bash
list.txt 内容:
file 'shot01.mp4'
file 'shot02.mp4'
ffmpeg -f concat -safe 0 -i list.txt -c copy rough_cut.mp4
```
参数不一致时改用重编码:
```bash
ffmpeg -f concat -safe 0 -i list.txt -c:v libx264 -crf 18 -pix_fmt yuv420p -r 24 rough_cut.mp4
```
最后合成音轨:
```bash
ffmpeg -i rough_cut.mp4 -i mix_norm.wav -map 0:v -map 1:a -c:v copy -shortest final.mp4
```
常见坑与排错
| 现象 | 原因 | 处理 |
|---|---|---|
| 人物脸部扭曲、手部畸形 | 近景特写过多 | 多用背影、面罩遮挡、远景剪影 |
| 一条片段里出现多个动作 | 提示词堆了多个动作 | 拆成两条,一文一镜 |
| 镜头接不上 | 运动方向相反 | 全片统一左右方向 |
| 色调一镜一个样 | 风格串被改动 | 复制粘贴,不改字 |
| 画面里出现乱码文字 | 提示词未加约束 | 加「不要出现文字」 |
| 巨物像塑料玩具 | 直接描述完整巨物 | 只拍沙下隆起、局部、暗示 |
| 成片忽明忽暗 | 生成时画幅/光线不一致 | 统一参数,后期套同一 LUT |
| 声音忽大忽小 | 各素材响度不一 | 统一跑 loudnorm |
| 拼接后音画不同步 | 帧率不一致 | 生成前锁定帧率 |
| 分辨率不够上大屏 | 生成分辨率偏低 | 生成后超分,或调整播放场景 |
| 音乐被平台判侵权 | 用了受版权保护的曲目 | 换可商用曲库或自录 |
下一步建议
跑通一支之后,可以做这几件事:
1. 建素材库:把满意的风格串、参考图、音效分层归档,下一支片子直接调用
2. 加旁白:写 5~8 句短句,压在人声频段,注意与音乐错开
3. 做多画幅版本:同一支片子导出横屏与竖屏各一版,注意竖屏要重新构图,不能直接裁
4. 延长片长:把 8 镜扩到 20 镜,用章节结构组织,避免线性堆砌
5. 反向学习:找一支实拍短片,逐镜写分镜表,再尝试用 AI 复现,这是提升最快的方式
模型能力边界会变,具体参数和入口以官方文档当前版本为准。分镜、连贯性、剪辑这三件事不会变,它们才是成片和素材堆的分界线。
