一句话定义:Codec(编码解码器,coder + decoder)负责把视频"压缩打包"再"拆包还原",Bitrate(码率)决定每秒允许流过多少数据——这两者的上限,往往比生成模型的画质更早决定一个产品能不能用。
为什么瓶颈常在模型之外
视频本质上是连续的画面加声音。不做任何压缩,一秒钟的 1080p、30 帧画面就是上百兆字节。模型辛辛苦苦"画"出来的内容,如果原样传输和存储,成本会瞬间失控。
打个比方:编码像搬家打包。原始视频是一整套实木家具,直接搬得开大卡车;编码就是把家具拆成平板、螺丝装袋、贴上编号,到了地方再按编号装回去。码率则是"每秒允许运几个箱子"——箱子给得多,还原就精细;给得少,边角料只能丢。
编码器主要靠两种"省法":空间冗余(同一帧里相邻像素往往很像)和时间冗余(相邻两帧差别很小,只记变化的部分)。代价是,绝大多数编码都是有损的:模型费劲算出来的细微纹理、噪点、渐变,很可能被编码器当成"没用的细节"抹平。所以你看到的糊,未必是模型画得糊。
和相邻概念的区别
| 概念 | 管什么 | 类比 | 典型影响 |
|---|---|---|---|
| 分辨率 | 画面有多少像素 | 画布多大 | 细节上限 |
| 帧率 | 每秒多少张画面 | 翻页速度 | 流畅度 |
| Codec | 怎么压缩与解压 | 打包方式 | 兼容性、压缩效率、算力 |
| Bitrate | 每秒多少数据 | 每秒运几个箱子 | 清晰度与带宽成本 |
四者互相牵制:同样的码率下,分辨率越高、帧率越高,分给每个像素的"配额"就越少,画面反而更容易糊。
对从业者和普通人的意义
对做 AI 产品的人:
1. 生成侧省钱不等于端到端省钱。推理成本降下来了,但输出若走高码率直播链路,带宽与分发成本会顶上来,账单会换个地方出现。
2. 首帧延迟。要做"边生成边播放",就得先把画面编成可播放的切片,编码器的缓冲会直接加在用户的等待时间里。
3. 评测要对齐编码参数。两个模型对比时若码率不同,你比较的可能是编码器而不是模型。
4. 算力占用。软件编码吃 CPU,硬件编码吃专用单元或 GPU,直接影响单机能跑多少路并发。
对普通人:视频通话发糊、直播卡顿,多半是当下带宽被码率顶住了;上传后被平台二次压缩变糊,也是同一回事。
常见的 H.264、H.265、AV1 等标准各有取舍,各家平台支持的格式、推荐上传码率与计费规则并不相同,具体以官方页面为准。
