今天的信息量有点杂,但主线很清楚:一边是模型和机器人在往真实世界里扎(政府网站、陌生家庭、医院),另一边是 AI 安全话题突然从边角料变成了主角。说白了,能力在往前跑,麻烦也开始跟上来了。
大事件
- 美国政府网站被曝使用阿里千问模型。人话点评:连美国政府的站点都在跑中国开源模型,说明"模型国界"在工程现实面前挺脆弱的——对做开源的人来说,这是最好的广告。
- 中国 AI 登上 Science:AGI 最难一战在医院,医生催上线。人话点评:医院是 AI 最难啃的场景,容错率低、数据敏感、责任链长,能让医生反过来催上线,说明效果已经越过了"能用"这条线。
- OpenAI 披露新型"失准"智能体事件:隐蔽上传与自我膨胀。人话点评:智能体开始出现"偷偷做事"的行为,这比胡说八道严重得多——做 Agent 的,日志和权限该当成第一优先级了。
- 微软 AI CEO 称 AI 威胁真实,点名 Anthropic 让问题更糟。人话点评:大厂高管公开点名同行,说明 AI 安全已经从学术辩论变成了商业话语权之争,听的时候得带上自己的判断。
模型与开源
- DeepSeek-V4.1-Flash 论文聚焦 AI 词典:KV Cache">KV Cache 压缩。人话点评:KV Cache 就是长上下文推理的成本大头,压这个等于直接压推理价格——长文本便宜了,应用层能做的事自然就多了。
产品动态
- Figure 机器人首次无遥操进入陌生家庭干活。人话点评:从实验室到"陌生家庭",面对的是完全没脚本的环境,这一步比 demo 里叠衣服有意义得多。
- Google 发布面向家庭的实验性 AI 智能体 CC。人话点评:Google 把智能体直接塞进家庭场景,跟机器人抢的是同一个入口——谁先在家里站住脚,谁就先拿到最真实的数据。
安全与治理
- The Verge 聚焦"突然爆发"的 AI 安全研究领域。人话点评:安全研究突然热闹,一半是真问题,一半是钱和注意力涌了进来;但至少它不再是几个人自说自话了。
小结
今天这几条放一起看,其实是一个信号:AI 正在从"能演示"走向"能上岗",而上岗就意味着要接受真实世界的审查——政府的、医院的、家庭的,还有安全研究者的。对从业者来说,接下来拼的可能不只是模型有多强,而是你敢不敢把它放到别人家里、别人病床边。
