先说清楚能拿到什么:跟着这篇做完,你会得到一条 30 秒到 1 分钟的 AI 短片,由 4 到 6 个镜头组成,主角在不同镜头里基本是同一个人,画面前后能连上,最后导出成视频文件落到手机相册,可以直接发到社交平台。
整套流程在手机上完成,不需要电脑。分工是这样:Flow 负责把文字变成画面,手机剪辑 App 负责拼接、字幕、配乐。
这篇教程能做出什么
具体交付物:
- 一份能直接喂给模型的分镜表
- 4 到 6 段、每段 4 到 8 秒的 AI 视频片段,角色形象基本一致
- 一条拼好的成片,带字幕和配乐
- 一套你自己能反复用的提示词模板
也要先说清楚做不到什么:AI 视频目前很难一次成功,画面里的中文文字、手部细节、快速连贯动作仍然是弱项。下面会给出「哪一步该改提示词、哪一步该直接重来」的判断标准。
前置条件清单
| 项目 | 要求 | 说明 |
|---|---|---|
| 手机 | iOS 或 Android,系统版本较新 | 具体最低系统版本以官方文档当前版本为准 |
| 账号 | 可正常登录的 Google 账号 | 部分地区、部分账号暂时看不到入口 |
| 订阅 | 可能需要 Google AI 相关订阅计划 | 生成会消耗额度,额度与套餐规则以官方页面为准 |
| 网络 | 稳定的 Wi-Fi | 生成在云端完成,中途断网容易白等 |
| 存储 | 预留几百 MB 以上空间 | 视频文件比图片大得多 |
| 素材 | 1 到 3 张角色参考图、一份脚本 | 参考图能明显提升跨镜头一致性 |
| 可选 | 手机剪辑 App | 用于拼接、字幕、配乐 |
开工前顺手检查三件事:
- App 有相册写入权限(导出时要用)
- 手机时间设为自动同步(登录失败的常见原因)
- 关掉严格的后台限制和省电模式
步骤 1:装好 Flow 并登录
在 App Store 或 Google Play 搜索 Flow,认准开发者是 Google。搜不到的话,先用手机浏览器打开 Flow 网页版,界面逻辑基本一致,操作方式可以对照着看。
登录用 Google 账号。卡在登录页时按顺序试:换一次网络;确认系统时间自动同步;清一次 App 或浏览器缓存。
登录后别急着生成,先花两分钟做三件事:
1. 确认默认画幅。做短视频选竖屏 9:16,做横屏内容选 16:9,中途换画幅会让后期很痛苦。
2. 看一眼当前剩余额度,心里有数。
3. 找到「项目 / 作品」入口。后面所有镜头都放进同一个项目,方便统一管理。
步骤 2:把脚本改写成「分镜表」
这一步往往决定成败。AI 视频翻车,多数情况不是模型不行,是提示词没法变成画面。
提示词公式,可以直接照抄:
```text
[主体] + [动作] + [环境] + [机位/镜头运动] + [光线/色调] + [风格] + [画幅]
```
一个填好的例子:
```text
一位三十岁上下的女性咖啡师,短发,深蓝色围裙,
双手把拿铁放到木质吧台上,热气升起,
清晨的街角咖啡馆,窗外有行人虚影,
中景,镜头缓慢向右平移,
自然侧光偏暖,浅景深,
写实纪录片质感,
9:16
```
分镜表模板:
| 镜号 | 时长 | 画面内容 | 提示词要点 | 字幕/旁白 |
|---|---|---|---|---|
| 1 | 5s | 咖啡馆外景,推门 | 中景,镜头缓慢前推 | 早上七点 |
| 2 | 5s | 磨豆特写 | 特写,固定机位 | — |
| 3 | 5s | 拉花 | 俯拍特写 | 一杯拿铁的时间 |
| 4 | 5s | 递杯子 | 过肩,镜头轻微跟随 | 她笑了 |
如果想把分镜表存成结构化文件、方便复用和批量改,可以写成这样:
```json
{
"shot": 3,
"duration_sec": 5,
"aspect_ratio": "9:16",
"anchors": "三十岁上下的女性咖啡师,短发,深蓝色围裙,白色 T 恤",
"action": "双手把拿铁放到木质吧台上,热气升起",
"environment": "清晨的街角咖啡馆,窗外有行人虚影",
"camera": "中景,镜头缓慢向右平移",
"lighting": "自然侧光偏暖,浅景深",
"style": "写实纪录片质感"
}
```
三条硬规则:
1. 一个镜头只做一件事。「她走进咖啡馆、点单、坐下、打开电脑」塞进一个 5 秒镜头,结果大概率是一堆糊掉的肢体。
2. 每次只改一个变量。不满意时先只改机位,或只改光线,别整段重写,否则你不知道是哪个词起了作用。
3. 时长按 4 到 8 秒设计。太短来不及看明白,太长容易出现动作穿帮。
步骤 3:生成首个镜头,先跑通再谈质量
在项目里新建一个镜头,选文生视频,把提示词粘进去。
首轮生成建议:
- 用默认时长
- 先不追画质,先看构图和动作对不对
- 一次生成多个候选,挑一个继续
挑片按优先级判断:
1. 主体对不对(人、物、场景)
2. 动作是否完整、有没有穿帮
3. 镜头运动是否符合预期
4. 画面细节好不好
前两条不过关,直接改提示词重生成;第三条不过关,改机位描述;只有第四条不过关,才考虑提分辨率或换生成档位。
步骤 4:用参考图锁住角色一致性
跨镜头「换脸」是很明显的出戏点。Flow 里有一类功能是把参考图当作素材喂给模型(界面上通常叫 Ingredients 或类似名字),用来保持人物、场景、道具一致。
做法:
1. 先定一张主角定妆图:正面或四分之三侧面,光线均匀,背景干净。
2. 在项目里把它设为这个镜头的参考素材,按界面提示上传或引用。
3. 每个镜头的提示词里,保持同一组描述锚点,逐字不变。
```text
固定锚点(每个镜头都照抄这一行):
三十岁上下的女性咖啡师,短发,深蓝色围裙,白色 T 恤
```
要改的是机位、动作、光线,锚点别动。今天写「短发」,明天写「齐耳发」,模型就换人了。
手上没有合适定妆图,可以先用文生图生成一张,再拿它当参考图去生成视频。
步骤 5:图生视频与首尾帧
除了文生视频,还有两种更可控的玩法:
- 图生视频:先有一张满意的静态画面,再让它动起来。适合产品展示、风景空镜、人物特写。动作描述要克制,一句「头发被风吹动,镜头缓慢推近」就够了。
- 首尾帧:给模型一张起始画面和一张结束画面,让它补中间过程。适合做转场,比如从门口走到桌前。
首尾帧的坑:两张图构图差太远,中间会生成一段糊状过渡。两张图的机位、光线、主体位置尽量接近,只让主体移动。
步骤 6:延长镜头与场景串联
单段只有几秒,故事要靠延长和串联。
- 延长片段:把已有片段往后续写。每次延长只加一个动作,比如「她端起杯子喝了一口」。连续延长多次后画面容易漂,一般延长一到两次就切新镜头。
- 场景串联:把同一场景下的多个镜头按时间顺序排好,整体预览。
按顺序预览一遍,不顺的地方通常是两种问题:节奏太拖(删短镜头)或跳得太硬(补一个过渡镜头,或者用首尾帧做连贯运动)。
步骤 7:导出
确认所有镜头都满意了再导出。导出前做三件事:
1. 统一画幅,别把横屏和竖屏混在一起。
2. 检查每段的首尾帧,切镜时不要出现半张脸、半只手。
3. 记下每段时长,方便后面配乐卡点。
在项目里选导出或下载,成品会存到手机相册。导出分辨率、是否带水印、能否导出无水印版本,都和套餐有关,以官方页面为准。
相册里找不到文件时,检查 App 的照片和文件写入权限,或者先在 App 内下载到「文件」App,再另存到相册。
步骤 8:在手机上做最后一遍加工
AI 生成的片段通常没有字幕和音乐,这一步交给手机剪辑 App。
流程:
1. 新建项目,按分镜顺序导入全部片段。
2. 决定转场。快剪用硬切,慢叙事用淡入淡出,别每段都加花哨转场。
3. 加字幕。不要指望 AI 在画面里生成正确的中文,字幕全部后期加。
4. 加配乐,按镜头切点卡节拍。
5. 导出成片。
想在电脑上做更细的拼接,可以用 ffmpeg(需先自行安装):
```bash
同目录下按顺序拼接片段
先写一个清单文件 list.txt,每行形如:file 'clip01.mp4'
ffmpeg -f concat -safe 0 -i list.txt -c copy output.mp4
```
注意:-c copy 要求所有片段的编码参数一致,参数不一致时去掉 -c copy 重新编码。
常见坑与排错
1. 提示词写成文学描写,画面失控
「她心里泛起一阵惆怅」没法可视化。改成能拍的东西:表情、动作、光线、机位。
2. 一个镜头塞太多信息
出现多手多脚、人物突然变形,多半是主体太多或动作太快。拆成两个镜头,或者把动作放慢。
3. 每个镜头都换脸
没用参考图,或者描述锚点每段都在改。固定一张定妆图加固定一段文字描述。
4. 镜头运动互相打架
「固定机位」和「镜头快速推进」同时写,画面会抽搐。一个镜头只保留一种主要运动。
5. 画面里冒出乱码文字
模型对画面内文字的还原还不稳定,中文字符尤其容易出错。需要文字就后期加,或者让画面避开招牌、屏幕、书本。
6. 一直转圈或生成失败
先切 Wi-Fi,再退出重进;生成过程中别把 App 长时间放后台。系统时间不对也会导致请求失败。
7. 额度很快用完
先用短时长、低一档清晰度试稿,定稿后再输出高质量版本。改提示词时先只改一个变量,减少无效重生成。
8. 生成结果和参考图不像
参考图背景太乱、脸太小、有多个人的时候,模型容易抓错。换成干净背景、单人、脸部占比大的图。
9. 想用真人肖像或知名 IP
未经授权使用他人肖像、受版权保护的角色和品牌元素,会有法律风险,平台也可能限制。用原创或已授权的素材。
10. 地区或账号看不到某些功能
开放范围、可用模型、功能名称会随地区和账号变化,以官方页面和 App 内的实际提示为准。
下一步建议
跑通一遍之后,可以往这几个方向加难度:
1. 做系列内容。固定主角、固定场景、固定风格,把分镜表和锚点描述存成模板,下一集直接套用。
2. 练人物对话镜头。两个角色面对面时,用正反打(各自一个镜头)代替同框,比让模型画两个人说话稳得多。
3. 用首尾帧做高级转场。同一机位下从 A 画面过渡到 B 画面,做出接近「一镜到底」的效果。
4. 建立自己的提示词库。按人物、环境、机位、光线、风格分类存句子,每次拼装,比从零写快很多。
5. 补上音频层。配乐、旁白、环境音分开做,旁白用手机录音或 TTS,注意音量平衡。
6. 固定发布规格。把画幅、时长、字幕样式定死,形成自己的输出标准,后面批量生产会省下大量时间。
最后提醒一句:AI 视频工具更新很快,按钮位置、功能名称、可用模型和额度规则都可能变。遇到和教程描述不一致的地方,先看 App 内的实际提示和官方文档当前版本,再回来对照流程即可。整体思路不会变:分镜表、单镜头试稿、参考图锁一致性、串联、导出、后期加工。
