跳到主内容
快讯直播
AI智模界
教程

用 Seedance 2.5 拍有分镜的 AI 短片全流程

这篇能做出什么

读完并跟着做一遍,你会得到一支 60~90 秒、8~12 个镜头的短片,风格指向《沙丘 3》那类美学:赭红色沙海、巨型岩石构造体、裹着蒸馏服的独行旅人、沙面下若隐若现的巨物。成片带完整音轨,画幅统一,镜头之间能接得上,不是十条互不相干的炫技片段拼盘。

交付物清单:

  • 一份分镜表(镜号、时长、景别、内容、运镜、声音)
  • 一份「风格圣经」(固定风格串 + 固定参考图)
  • 一套可复用的提示词模板
  • 一支带音轨的 MP4 成片
  • 一份避坑清单

整条路径的核心思路只有一句:把 AI 当成摄影师,而不是导演。 你负责分镜、连贯性和剪辑,模型负责单镜头内的画面生成。

前置条件清单

  • 可用的 Seedance 2.5 视频生成入口(网页端或 API,具体入口、参数名、支持的时长与分辨率以官方文档当前版本为准)
  • 图生视频能力;如果支持首尾帧模式,效果会更好
  • 一个能出静帧的图片生成工具(用来做关键帧,和视频模型风格对齐
  • ffmpeg(本地命令行)或任意一款剪辑软件
  • 可商用授权或自录的音乐、音效素材
  • 一块能顺畅播 1080p 的机器,和至少两三个小时的耐心

不要一上来就想着「一句话生成一条完整短片」。AI 视频目前的能力边界在单镜头内,跨镜头的叙事必须由人来缝合。

第 0 步:先写风格圣经,再写剧本

绝大多数人翻车在第一步:直接开始写提示词。结果是十个人物长得不一样、十个场景色调不一样。

先产出一份风格圣经,内容是一段固定文本加一组固定参考图:

```text

【风格圣经 · 沙丘式】

影调:暖橙与灰褐主色,高光偏白偏硬,暗部压深但保留细节

光线:正午硬光为主,逆光轮廓光,空气中悬浮尘埃

质感:实拍电影感,细颗粒胶片,低饱和,高对比

镜头:长焦压缩感为主,浅景深,缓慢运镜

画幅:宽银幕比例,全片统一

```

这段文本此后每次生成都原样粘贴,一个字不改。改一个字,色调就可能飘。

参考图准备三类:主角(正面、背面、侧面各一张)、主场景(沙海、岩壁、营地)、一个视觉锚点(比如旅人胸前的金属徽章)。锚点是后面做连贯性的关键道具。

第 1 步:把剧本拆成分镜表

AI 短片适合「弱叙事、强氛围」,不要写复杂对白。目标定在 8~12 个镜头,每镜 3~6 秒。

分镜表结构如下,可以直接抄:

镜号时长景别画面内容运镜声音
014s大远景无垠沙海,远处岩壁剪影缓慢横移低频风
023s远景沙面突然隆起一条线,又落下固定沙粒摩擦、闷响
033s中景旅人背影行走,风衣飘动跟随移动布料拍打
042s特写面罩上的沙粒与凝结水汽微推呼吸声
054s大全景巨大构造体前的渺小身影缓慢上升低频嗡鸣渐入
063s中近景旅人抬手遮光,抬头固定呼吸停顿
074s远景沙下巨物再次隆起,这次更大缓慢右移沙层碎裂
085s大远景身影继续前行,镜头拉远留白缓慢后拉音乐收尾

写完这张表,你会发现两件事:一是镜头之间的方向必须有规律,二是总时长和你想的不一样。这两件事都要在生成之前解决。

第 2 步:先出静帧,再让画面动起来

能图生视频就不要文生视频。原因很直接:静帧可以反复重出、逐张挑,成本低、可控;视频生成的随机性大得多。

做法是:按分镜表逐个生成关键帧静帧,全部用同一套风格串和参考图。挑出满意的 8~12 张,确认它们的色调、人物特征、画幅比例一致,再拿去做图生视频。

如果模型支持首尾帧模式,可以额外为每镜准备尾帧,让运动有明确终点,画面不容易飘。

第 3 步:六段式提示词模板

把提示词结构化,比堆形容词有效得多。模板如下:

```text

【主体】一名裹着深色蒸馏服的旅人,面罩上凝着细沙

【动作】缓慢抬头,望向远处沙脊

【环境】无边赭红色沙海,远处巨大岩石构造体,地表有风纹

【光线】正午硬光,逆光轮廓,空气中有悬浮尘埃

【镜头】长焦压缩感,低角度,缓慢向右横移,浅景深

【风格】电影感实拍质感,暖橙灰褐调,细胶片颗粒,宽银幕比例

【约束】画面中不要出现文字,人物比例正常,不要快速甩镜

```

对照一个反面例子:

```text

超震撼史诗级沙漠大片,电影级画质,8K,超写实,沙虫出现,

人物很帅,光影绝美,非常震撼,大气磅礴

```

后者的问题是把「结果」当成了「指令」。模型不知道你要的是长焦还是广角、固定还是横移,只能随机给。

动作段只写一个动作。 「抬头」和「转身」写在一起,大概率变成身体扭曲。

第 4 步:镜头连贯性的四种接法

接法一:首尾帧接力

把上一镜的最后一帧抽出来,作为下一镜的首帧。适合连续场景。

```bash

抽出镜头 03 的首帧和尾帧

ffmpeg -i shot03.mp4 -frames:v 1 shot03_first.png

ffmpeg -sseof -0.1 -i shot03.mp4 -frames:v 1 shot03_last.png

```

接法二:方向守恒

全片统一运动方向。前三个镜头都是向右移动,第四个突然向左,观众会瞬间出戏。这和实拍的 180 度线是一个道理。

接法三:遮挡转场

让角色走过镜头前方、让沙尘漫过画面,用遮挡完成切换。这种接法对画面相似度要求低,容错高,适合风格略有差异的两镜之间。

接法四:锚点复用

同一块岩石、同一个徽章、同一条沙脊反复出现,观众会自动把它们串成一个空间。

第 5 步:风格一致性控制

除了固定风格串和参考图,还有几件事要在生成前锁死:

  • 画幅比例:全片统一,中途改比例后期要裁切,构图全毁
  • 帧率:统一,避免拼接时画面抖动
  • 种子:如果模型支持固定种子,同一场景的多个镜头尽量用同一组
  • 调色:生成时统一是上策,后期再套统一 LUT 是补救

第 6 步:批量生成与筛选

同一提示词生成多条,选一条。这是常规操作,不必心疼次数。

文件命名要能追溯参数,例如 shot03_take2_v1.mp4。建一个表格记录每镜的提示词、参考图、种子和选用版本,改到第十版时你会感谢自己。

第 7 步:音频三层搭建

声音决定成片质感。按三层做:

1. 环境底噪:低频风、远处嗡鸣,全程铺底

2. 拟音:沙粒摩擦、布料拍打、呼吸声、金属扣件轻响

3. 音乐:氛围型低频音乐,进出于第 05 镜和第 08 镜

响度统一,避免拼接后忽大忽小:

```bash

ffmpeg -i mix.wav -af loudnorm=I=-16:TP=-1.5:LRA=11 -ar 48000 mix_norm.wav

```

音乐务必用可商用素材或自己录制,不要用电影原声。

第 8 步:剪辑拼装与输出

先粗剪,把所有镜头按分镜表顺序排好,再看节奏:开场两个空镜建立世界观,中段推进,结尾留白。

如果所有片段编码参数一致,可以直接拼接:

```bash

list.txt 内容:

file 'shot01.mp4'

file 'shot02.mp4'

ffmpeg -f concat -safe 0 -i list.txt -c copy rough_cut.mp4

```

参数不一致时改用重编码:

```bash

ffmpeg -f concat -safe 0 -i list.txt -c:v libx264 -crf 18 -pix_fmt yuv420p -r 24 rough_cut.mp4

```

最后合成音轨:

```bash

ffmpeg -i rough_cut.mp4 -i mix_norm.wav -map 0:v -map 1:a -c:v copy -shortest final.mp4

```

常见坑与排错

现象原因处理
人物脸部扭曲、手部畸形近景特写过多多用背影、面罩遮挡、远景剪影
一条片段里出现多个动作提示词堆了多个动作拆成两条,一文一镜
镜头接不上运动方向相反全片统一左右方向
色调一镜一个样风格串被改动复制粘贴,不改字
画面里出现乱码文字提示词未加约束加「不要出现文字」
巨物像塑料玩具直接描述完整巨物只拍沙下隆起、局部、暗示
成片忽明忽暗生成时画幅/光线不一致统一参数,后期套同一 LUT
声音忽大忽小各素材响度不一统一跑 loudnorm
拼接后音画不同步帧率不一致生成前锁定帧率
分辨率不够上大屏生成分辨率偏低生成后超分,或调整播放场景
音乐被平台判侵权用了受版权保护的曲目换可商用曲库或自录

下一步建议

跑通一支之后,可以做这几件事:

1. 建素材库:把满意的风格串、参考图、音效分层归档,下一支片子直接调用

2. 加旁白:写 5~8 句短句,压在人声频段,注意与音乐错开

3. 做多画幅版本:同一支片子导出横屏与竖屏各一版,注意竖屏要重新构图,不能直接裁

4. 延长片长:把 8 镜扩到 20 镜,用章节结构组织,避免线性堆砌

5. 反向学习:找一支实拍短片,逐镜写分镜表,再尝试用 AI 复现,这是提升最快的方式

模型能力边界会变,具体参数和入口以官方文档当前版本为准。分镜、连贯性、剪辑这三件事不会变,它们才是成片和素材堆的分界线。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。