发生了什么
OpenAI 在其官网发布页面宣布推出 AgentKit,并同步带来面向智能体(agents)的新 Evals 与 RFT。三项内容指向同一主题:让智能体从「能跑起来」走向「可衡量、可优化」。
三项内容分别指向什么
- AgentKit:从命名看,这是一套面向智能体开发与编排的工具集合,目标是降低把模型能力组装为可用智能体的工程成本。
- 新 Evals:评估是智能体进入生产前的关键环节。相比单轮问答,智能体涉及多步骤决策、工具调用与状态流转,传统评测方式难以覆盖,新的评估能力正是针对这类场景。
- RFT:RFT 通常指强化微调(Reinforcement Fine-Tuning)。将其与 agents 并列,意味着用反馈信号去优化智能体行为,而不只是在提示词或流程层面做调整。
为什么重要
近来行业重心正从「模型能做什么」转向「智能体能否稳定完成任务」。这一转向的核心障碍往往不在模型能力本身,而在工程化与可验证性:如何搭建、如何评测、如何持续改进。AgentKit、Evals 与 RFT 的组合,恰好对应搭建、度量、优化这三段链路。
对 AI 从业者而言,值得关注的是三者能否形成闭环:开发框架沉淀运行轨迹,评估提供信号,微调把信号转化为能力提升。若闭环成立,智能体的迭代方式将从手工调优进一步转向数据驱动。
具体功能范围、可用性与接入方式,以 OpenAI 官方页面为准。
