这篇教程能做出什么
照着走完一遍,你会得到一条 30~60 秒的竖屏短视频:画面来自 AI 生视频工具,脚本由 AI 辅助起草,粗剪靠改字幕完成(而不是在时间线上拖来拖去),配乐自动对齐节拍,最后统一包装并导出。同时你会留下一套可复用的目录结构、提示词模板和导出检查清单,下次换素材和文案就能再产一条。
具体例子:做一条「三个方法让会议少开一半」的口播短视频,手上有 3 段 AI 生成画面(每段约 5 秒)、一份约 40 秒的口播文案、一首 120 BPM 的背景音乐。整条片子拆成七步,其中第 4 步(自然语言粗剪)和第 5 步(卡点)是效率差别最大的环节。
一个重要的心理准备:AI 生成的视频片段通常只有几秒,且首尾常有轻微形变或抖动,不要指望一次生成就能直接用。真正省时间的做法是「多生成、快筛选、统一规格、再进剪辑」,而不是在剪辑软件里反复微调单条素材。
前置条件清单
开始之前把下面这些准备好,后面会顺很多:
- 剪映客户端:桌面版与移动版的功能位置和名称不完全一致,以官方当前版本为准。AI 相关功能大多需要登录账号,云端生成类能力通常有额度或队列限制,具体以官方页面说明为准。
- AI 生视频工具产出的素材:建议统一导出为 mp4、竖屏 1080×1920、固定帧率(如 30fps)。不同工具默认分辨率不同,先统一再剪。
- 一段可商用的背景音乐:优先选择节奏清晰的曲子,鼓点明显更容易踩准。
- 一份纯文本脚本:白话口播稿即可,不用写得像分镜脚本。
- 可选的命令行工具:
ffmpeg/ffprobe,用来批量统一素材规格、校验导出结果。没有也不影响主流程,只是批量处理时会慢一些。 - 磁盘与网络:AI 生成和云端合成会吃带宽与空间,预留出素材体积 3 倍左右的空余磁盘。
分步骤操作
第 1 步:建立工程目录,把「生视频」的产出收纳进来
先固定目录结构,后面所有操作都围绕它走。这样便于批量处理,也方便换机器时直接拷走。
```bash
mkdir -p ~/video_project/{raw,clips,audio,subs,export}
```
raw/:生视频工具下载的原始文件clips/:转码统一规格后的可用片段audio/:配音与背景音乐subs/:字幕文件export/:成片
接着批量统一规格。这一步的意义是:让后续所有片段分辨率、帧率、像素格式一致,避免导出时出现黑边、变速、音画不同步。下面命令会把任意尺寸的横竖屏素材裁成竖屏 1080×1920、30fps,并去掉原声(AI 生成片段的自带音效通常没用):
```bash
cd ~/video_project
for f in raw/*.mp4; do
ffmpeg -y -i "$f" \
-vf "scale=1080:1920:force_original_aspect_ratio=increase,crop=1080:1920,fps=30" \
-c:v libx264 -preset medium -crf 20 -pix_fmt yuv420p -an \
"clips/$(basename "$f")"
done
```
顺手检查一下每条素材的真实时长,方便后面分配镜头:
```bash
for f in clips/*.mp4; do
echo -n "$f "
ffprobe -v error -show_entries format=duration -of csv=p=0 "$f"
done
```
第 2 步:把文案写成「生视频提示词 + 口播稿」两栏
AI 生视频的提示词结构建议固定成六要素:主体 + 动作 + 镜头 + 光线 + 风格 + 时长。写死结构的好处是,同一个产品换不同卖点时,只需要替换主体和动作。
```text
[镜头1] 主体:一杯手冲咖啡在木质桌面上
动作:蒸汽缓慢升起
镜头:微距特写,缓慢推进
光线:清晨侧逆光,暖色调
风格:写实,浅景深
时长:5 秒
```
口播稿按「钩子 → 三个要点 → 收束」写,每段控制在两句话以内,方便后面卡点对齐:
```text
00-03s 钩子:一周开九个会,真正有用的可能只有两个。
03-15s 要点一:开会前先发一页纸,把结论写在最上面。
15-27s 要点二:只邀请能拍板的人,旁听改成会后看纪要。
27-39s 要点三:散会前定下责任人和时间点,没定就不散。
39-45s 收束:会议不是流程,是解决问题的工具。
```
第 3 步:先用「文字成片」拿到一条带字幕和配音的骨架
把口播稿贴进剪映的文字成片 / 图文成片入口,让工具先基于文案生成一版带配音、带字幕的时间线。这一版画面通常不理想,没关系——你要的是骨架:时间轴长度、断句位置、字幕轨道、配音节奏都已经就位。
拿到骨架后,把自动匹配的画面逐段替换成第 1 步整理好的 clips/ 素材。替换比从零搭建快得多,因为字幕与配音的对齐关系已经建立。
如果不用文字成片,也可以手动新建项目后依次导入:配音音频 → 智能字幕 → 再铺画面。顺序很重要:先音后画,剪辑节奏才跟着语言走。
第 4 步:自然语言粗剪——改字幕就等于改视频
这是整个流程里体感差异最大的一步。核心思路是:把剪辑动作从「拖时间轴」换成「改文字」。
做法一,用「智能剪口播」类功能:导入口播音频后开启识别,工具会标出停顿、重复、语气词(「嗯」「那个」「就是说」),一键删除并自动闭合画面。适合录制时状态一般、需要大量去水词的情况。
做法二,手动但更可控:在字幕面板直接删掉不要的那一行文字,对应的视频和音频片段会一起被删掉。比如发现第 3 句话啰嗦,删掉那行字幕即可,不用去时间轴上找切点。
做法三,批量处理:把识别出的字幕导出成 SRT,在文本编辑器里集中删改,再导回剪映。
```srt
1
00:00:00,000 --> 00:00:03,000
一周开九个会
2
00:00:03,000 --> 00:00:07,500
真正有用的可能只有两个
3
00:00:07,500 --> 00:00:12,000
开会前先发一页纸
```
两个实用技巧:
1. 先锁配音,再删字幕。删字幕会连带裁音频,如果配音还没定稿,会反复裁出毛边。
2. 保留半秒呼吸感。全删干净会显得急促,句与句之间留 0.2~0.5 秒的空白更自然。
第 5 步:卡点——让画面切换落在鼓点上
剪映里有「自动踩点」类功能,导入音乐后会生成节拍标记,把画面切点吸附上去即可。功能名称与位置以官方当前版本为准。
如果没有自动踩点,或者踩出来的点不够准,用 BPM 手算也很够用。公式是:一拍秒数 = 60 ÷ BPM。
```python
bpm = 120
beat = 60 / bpm # 0.5 秒一拍
bars = 16
for i in range(bars * 4):
print(f"第 {i+1:>2} 个拍点: {i * beat:.2f}s")
```
拿到拍点列表后,在音乐轨道上手动打标记,再把每个镜头的切换对齐到强拍。经验法则:
- 强拍(每小节第一拍)放转场或画面切换,冲击感更强。
- 弱拍放字幕出现、花字弹出,避免和画面切换抢注意力。
- 一个镜头跨 2 拍还是 4 拍,取决于它承载的信息量。上面 40 秒文案配 120 BPM,大致能铺 40 个左右拍点,3~5 个镜头完全够分。
如果音乐节奏始终对不上,先确认音乐文件没有被变速过——变速后的音频在时间轴上会累积误差。
第 6 步:AI 包装,让整条片子看起来是「一套」
统一性比花哨更重要。建议只做四件事,并且全片只用一套:
1. 字幕样式:一种字体、一个字号、一个描边色。竖屏字幕建议放在画面下方约 1/5 高度处,避开平台 UI 遮挡区。
2. 配音音色:全片只用一个人声。换音色等于换人格,观众会出戏。
3. 转场:主转场用一种(如叠化或推拉),只在章节切换时用第二种。
4. 调色:套同一个预设或同一组参数,AI 生成素材之间色温差异往往比实拍更大。
如果时间紧,可以用一键成片类功能先出一版,再逐项替换不满意的部分。它适合做草稿,不适合直接导出。
第 7 步:导出与校验
导出参数建议:竖屏 1080×1920、30fps、H.264 编码,码率落在平台建议区间内(较常见的区间在 8~12 Mbps 附近,具体以目标平台的上传建议为准)。导出完成后用 ffprobe 校验一下实际参数,避免出现「导出设置是 1080p、实际文件却是别的尺寸」这种问题:
```bash
ffprobe -v error \
-show_entries stream=codec_name,width,height,r_frame_rate,nb_frames \
-show_entries format=duration,bit_rate \
-of default=noprint_wrappers=1 \
export/final.mp4
```
导出自检清单:
- 首帧不是黑场或模糊过渡帧
- 字幕没有超出安全区,也没有被平台按钮遮住
- 全程音量平稳,背景音乐没有盖过人声
- 结尾有明确收束(一句话或一个定格),不要突然掐断
- 文件体积在平台上传限制内
常见坑与排错
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 导出后画面有黑边 | 素材比例不统一 | 回到第 1 步批量转码,统一 1080×1920 |
| 音画不同步、越到后面越偏 | 素材帧率不一致被自动变速 | 用 ffprobe 检查帧率,重转码为同一帧率 |
| 卡点总是差半拍 | 音乐被变速,或自动踩点识别的是弱拍 | 关闭变速,改用手算拍点 |
| 字幕识别错专业词 | 专有名词未进词典 | 识别后集中替换,剪映里可批量查找替换 |
| AI 生成片段首尾抖动 | 生成模型常见现象 | 每条素材首尾各裁 3~5 帧,或加轻微缩放动画掩盖 |
| 导出文件比预览糊 | 码率过低或二次压缩 | 提高导出码率,避免用第三方工具再压一遍 |
| 云端功能排队慢、提示额度不足 | 账号额度或并发限制 | 以官方页面说明为准,错峰使用或改用本地功能 |
| 替换素材后字幕错位 | 素材时长与原片段不同 | 先替换素材,再统一微调字幕时间轴 |
排错通用顺序:先看素材规格 → 再看时间轴对齐 → 最后看导出参数。多数「剪映有问题」其实出在素材本身。
下一步建议
1. 把提示词和脚本做成表格。一行一个镜头,列固定为「镜头号 / 提示词 / 计划时长 / 对应文案」。填表比现场想快得多,也方便交给别人执行。
2. 沉淀个人素材库。把每次生成的多余片段按主题归档,下次做同类内容直接调用,减少生成等待。
3. 模板化包装。把字幕样式、转场、调色参数存成草稿模板,新项目从模板复制,跳过第 6 步的大部分手工操作。
4. 用数据回流优化前 3 秒。发布后重点看前 3 秒的留存,把表现好的钩子句式记录下来,替换掉效果差的。
5. 尝试批量化。当单条流程跑顺后,把文案、素材、导出目录按编号扩展,用相同的步骤串行处理多条,把重复操作集中到一次完成。
整条链路的关键不在于某个 AI 按钮有多强,而在于把「生成 → 筛选 → 统一规格 → 文字驱动粗剪 → 卡点 → 统一包装 → 校验导出」固定成一套可重复的流程。流程稳定之后,单条视频的制作时间会明显下降。
