一句话定义:端云协同推理(Hybrid On-Device / Cloud AI 词典:Inference">Inference),是指同一个 AI 任务被拆成两半——一部分在手机、电脑、车机等终端本地跑,另一部分发给云端服务器跑,由系统根据当前情况决定怎么切、怎么路由。
打个厨房的比方。你在家做饭,切葱、热锅、摆盘这类"马上要出结果、又不想让外人看见食材"的活儿,自己在厨房干最快最放心;但要是来了二十个人的宴席,需要吊高汤、上大灶,那就得把活儿交给中央厨房。端云协同就是这套"自家厨房 + 中央厨房"的分工,而不是非此即彼。
什么通常放在端上
- 延迟敏感:语音唤醒词、实时字幕、输入法联想、拍照时的即时检测。这些要求几十毫秒内出结果,走一趟网络就废了。
- 隐私敏感:人脸、声纹、键盘输入、相册内容。数据不出设备,合规压力最小。
- 常驻小模型:参数量较小的模型可以一直驻留内存,热启动,断网也能用。
什么通常交给云
- 需要大参数量、长上下文、多模态生成的复杂请求。
- 端上塞不下、或者需要频繁更新的模型。
- 需要跨设备同步、审计、计费的场景。
三方取舍
| 维度 | 放端上 | 放云上 |
|---|---|---|
| 延迟 | 低且稳定,不受网络抖动影响 | 受网络影响,通常更高 |
| 隐私 | 数据不出设备 | 需上传,依赖加密与合规 |
| 成本 | 耗用户的电和算力,厂商省服务器钱 | 厂商按调用量付费,用户无感 |
| 能力上限 | 受内存与算力限制 | 模型可以很大 |
| 更新迭代 | 跟着 App / 系统更新,慢 | 随时热更新 |
所谓"协同",本质就是在延迟、隐私、成本这三者之间反复调平衡点。
和相邻概念的区别
和纯端侧推理比,协同保留了云端的能力上限,端上搞不定的可以兜底;和纯云端推理比,它在延迟和隐私上占优,也压低了厂商的推理成本。它也不完全等于边缘计算:边缘计算更偏网络拓扑上把算力下沉,协同推理强调的是同一个任务在端和云之间被切分、路由和回退。
对从业者意味着什么
核心工作从"训一个模型"变成"设计一套路由":哪些请求走端、哪些走云、断网了怎么降级、端云结果不一致时以谁为准。配套还要做模型压缩、量化,以及适配各家终端上的推理框架——具体支持哪些能力,以官方页面为准。
对普通人意味着什么
最直接的感受是"飞行模式下也能用一点 AI""打字联想更跟手""敏感内容不用上传"。反过来也要有预期:同一款 App 在不同手机上 AI 体验可能不同,因为端侧算力不一样,弱一些的设备会自动把更多活儿推给云端。
