今天这波快讯里,OpenAI 从架构、微调、评测到安全研究都有动作,存在感拉满。另一边,Gemini 新版本和国产模型 LimiX-2 也在找位置,B站和 Vidu 则把 AI 往“可玩、可用”的方向推。下面挑重点聊。
大事件
- OpenAI 发布《演进我们的架构》公告:OpenAI 对外说明架构层面的演进方向。——对开发者和企业来说,接下来要留意 API、模型供应和合作方式会不会跟着调整。
- B站AI无限竞技场上线:全球百大模型同场竞技。——普通用户能直观对比模型,从业者则多了个公开擂台和曝光入口。
- Vidu S2 发布:主打实时互动、实时改视频与空间视频。——视频生成正从“生成一段”往“边聊边改、带空间感”走,内容创作者可以关注实时工作流。
模型与开源
- OpenAI 微调 API 引入视觉能力:微调现在也能带上视觉输入。——以后不只是教模型认字,还能教它“看图办事”,多模态应用落地门槛更低。
- 清华与稳准智能发布 LimiX-2:新模型登顶国际评测榜单。——国产模型在榜单上继续刷存在感,说明竞争不只在通用大模型,专业方向也在卷。
- Gemini 3.8 与 3.8 Live 现身 Product Hunt:主打扩展思考。——如果“先想再答”真能落地,复杂任务上会更稳,但最终还得看实际体验。
论文与研究
- OpenAI 发布 SWE-Lancer 软件工程评测基准:用来评估模型在软件工程任务上的表现。——以后评价 AI 写代码,不只看刷题,更看能不能干真实工程活。
- OpenAI 发布思维链监控研究:检测前沿推理模型的不当行为。——模型越会“想”,越需要看它怎么想;这对 AI 安全从业者是个重要信号。
小结
今天的主线很清晰:OpenAI 在架构、多模态微调、评测和安全上同时推进,Gemini 和 LimiX-2 代表模型侧继续卷,B站和 Vidu 则把 AI 往平台化、实时化推。对普通人来说,AI 工具会更像“能看、能改、能想”的助手;对从业者来说,评测、安全和多模态微调值得盯紧。
