跳到主内容
快讯直播
AI智模界
AI 词典

端云协同推理:哪些算在手机,哪些交给云

一句话定义:端云协同推理(Hybrid On-Device / Cloud AI 词典:Inference">Inference),是指同一个 AI 任务被拆成两半——一部分在手机、电脑、车机等终端本地跑,另一部分发给云端服务器跑,由系统根据当前情况决定怎么切、怎么路由。

打个厨房的比方。你在家做饭,切葱、热锅、摆盘这类"马上要出结果、又不想让外人看见食材"的活儿,自己在厨房干最快最放心;但要是来了二十个人的宴席,需要吊高汤、上大灶,那就得把活儿交给中央厨房。端云协同就是这套"自家厨房 + 中央厨房"的分工,而不是非此即彼。

什么通常放在端上

  • 延迟敏感:语音唤醒词、实时字幕、输入法联想、拍照时的即时检测。这些要求几十毫秒内出结果,走一趟网络就废了。
  • 隐私敏感:人脸、声纹、键盘输入、相册内容。数据不出设备,合规压力最小。
  • 常驻小模型:参数量较小的模型可以一直驻留内存,热启动,断网也能用。

什么通常交给云

  • 需要大参数量、长上下文、多模态生成的复杂请求。
  • 端上塞不下、或者需要频繁更新的模型。
  • 需要跨设备同步、审计、计费的场景。

三方取舍

维度放端上放云上
延迟低且稳定,不受网络抖动影响受网络影响,通常更高
隐私数据不出设备需上传,依赖加密与合规
成本耗用户的电和算力,厂商省服务器钱厂商按调用量付费,用户无感
能力上限受内存与算力限制模型可以很大
更新迭代跟着 App / 系统更新,慢随时热更新

所谓"协同",本质就是在延迟、隐私、成本这三者之间反复调平衡点。

和相邻概念的区别

和纯端侧推理比,协同保留了云端的能力上限,端上搞不定的可以兜底;和纯云端推理比,它在延迟和隐私上占优,也压低了厂商的推理成本。它也不完全等于边缘计算:边缘计算更偏网络拓扑上把算力下沉,协同推理强调的是同一个任务在端和云之间被切分、路由和回退。

对从业者意味着什么

核心工作从"训一个模型"变成"设计一套路由":哪些请求走端、哪些走云、断网了怎么降级、端云结果不一致时以谁为准。配套还要做模型压缩、量化,以及适配各家终端上的推理框架——具体支持哪些能力,以官方页面为准。

对普通人意味着什么

最直接的感受是"飞行模式下也能用一点 AI""打字联想更跟手""敏感内容不用上传"。反过来也要有预期:同一款 App 在不同手机上 AI 体验可能不同,因为端侧算力不一样,弱一些的设备会自动把更多活儿推给云端。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。