今天的快讯基本围绕两条线:一条是"AI 往哪儿落地"——Claude 把入口合了、Office 原生了,vivo 在讲端侧的个人化;另一条是"模型自己怎么变强"——智谱用国产卡让 GLM 造 GLM,DeepSeek 和一篇 MoE 论文都在往推理成本的下限上抠。中间还夹着一份关于"别把智能体的功劳全算给模型"的提醒。
大事件
- 智谱发布首个 RSI 成果:10 万国产卡用 GLM 造 GLM。 RSI(AI 词典:递归自我改进">递归自我改进)说白了就是让模型参与打磨下一代模型,而这套流程跑在十万张国产卡上。
- 人话点评:对从业者来说,这条的看点不只是"模型更强了",而是"训练闭环能不能自己转起来";对普通人来说,它意味着下一代模型可能不再完全靠人堆标注和调参。
- OpenAI 发布模型失准报告框架。 相当于给"模型什么时候出错、错成什么样"定了一套上报和描述的口径。
- 人话点评:这类东西短期看着像合规文书,长期是信任基础设施——企业敢不敢把 AI 接进核心流程,往往卡在"出问题能不能说清楚"。
- vivo 高管谈端侧大模型与个人化 AI 下一步。 手机厂商的注意力正从"参数多大"转向"多懂你"。
- 人话点评:端侧模型的护城河往往不是模型本身,而是你手机里那些别人拿不到的数据和场景,这也是手机厂商唯一能跟云端大厂掰手腕的地方。
模型与开源
- DeepSeek-v4.1 Flash:KV Cache 压缩极限解读。 讨论的焦点是在长上下文场景下把 KV Cache 压到什么程度还不掉点。
- 人话点评:KV Cache 就是"长对话时模型要一直记着的草稿纸",把它压小,等于同样一张卡能服务更多人——直接决定你用长文档功能时贵不贵、卡不卡。
- 论文:用可训练路由预测从 SSD 服务 35B MoE。 思路是把专家权重放在 SSD 上,靠可训练的路由预测提前把需要的专家捞进显存。
- 人话点评:如果这条路走通,"大模型必须住在昂贵显存里"的前提就松动了,对想用有限硬件跑大 MoE 的团队是个好消息。
产品动态
- Claude 双入口合并、原生 Office 上线。 一边收拢入口,一边把能力直接嵌进办公软件里。
- 人话点评:AI 助手正在从"你要专门去打开的一个网站"变成"它就在你的文档旁边"。对打工人来说门槛更低了,对做 AI 产品的团队来说,独立入口的流量逻辑会更难讲。
- Seedance 2.5 拍《沙丘3》:一次 AI 短片踩坑复盘。 用视频模型做正经短片,翻车点被完整记了下来。
- 人话点评:生成式视频的 demo 从来不缺,缺的是"能剪成片子"的一致性和镜头控制——这份复盘对做内容的人比任何宣传片都值钱。
AI 编程
- HarnessTax:编码智能体的"脚手架税"有多重。 讨论的是包裹在模型外面那层框架(工具调用、上下文管理、重试逻辑)本身带来的开销。
- 人话点评:很多人评估编码智能体时只盯着模型分数,实际用起来好不好使,一半取决于这层脚手架。选工具时,问一句"你们的 harness 怎么设计的",比看榜单有用。
小结
把这八条放在一起看,今天的主题其实是"成本"和"边界":KV Cache 压缩、SSD 上跑 MoE、脚手架税,都是在抠同样算力能挤出多少产出;而 Claude 进 Office、vivo 谈端侧个人化,则是在试探 AI 该以什么形态待在人身边。至于智谱那条,如果模型真能参与造自己,那前面这些成本账,可能都要重新算一遍。
