一句话定义
Agentic RL(智能体强化学习,也叫 Agent 后训练)是指:让模型扮演一个智能体(agent),在真实或接近真实的环境里连续做几十上百步操作,最后只用任务的结果好不好来当反馈信号,把模型训练得更会干活。
和之前的两代有什么不一样
先看它前面的两个阶段。
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)训练的是"一轮对话":模型说一句,人来打分,模型学着让分更高。RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)进一步,把打分换成自动判对错——数学题答案对不对、代码能不能过测试,机器自己就能验。这两者有个共同点:任务短、反馈快、答案清楚。
Agentic RL 要处理的是另一类活:订一趟出差行程、把一个仓库里的 bug 修到测试全绿、从一堆散乱文档里挖出一张对账表。这些事没有"标准答案",只有"做没做成"。
打个比方:RLHF 像是给学生的作文逐段点评;RLVR 像是批改判断题,对错分明;Agentic RL 像是把一个实习生扔进真实项目组,三周后看客户签没签字。你不能因为他第 7 天敲错一条命令就骂他——因为那一步可能是可恢复的,也可能正是致命伤,你在当时根本分不清。
两个绕不过去的难点
- 奖励稀疏(sparse reward):整条轨迹(trajectory)可能几万个 token、上百次工具调用,最后只拿到一个 0 或 1。绝大多数中间步骤没有任何直接反馈。
- 信用分配(credit assignment):既然只知道自己失败了,那到底是哪一步的锅?是第 3 步检索了过期文档,还是第 40 步忘了做回归验证?信号要沿长轨迹回传,越靠前的动作越难归因。
实际操作里还叠着三件事:环境跑一次很贵(要真沙箱、真浏览器、真编译);同一个策略(policy)跑两次结果可能不同,噪声大;奖励容易被钻空子(reward hacking),比如模型学会绕过测试而不是修好代码。
三者对比
| 交互长度 | 反馈来源 | 典型任务 | |
|---|---|---|---|
| RLHF | 通常单轮 | 人类偏好打分 | 聊天风格、文案 |
| RLVR | 单轮或很短 | 自动可验证的对错 | 数学、算法题 |
| Agentic RL | 多轮长轨迹 | 环境的最终状态、任务成败 | 操作软件、多步检索、修代码 |
注意它和"Agent 工作流"不是一回事:工作流是人把步骤写死,模型只是填空;Agentic RL 是用结果反馈去改模型本身的策略,流程可以由模型自己长出新的走法。
对从业者意味着什么
- 评估口径变了:从"这道题答对没"变成"这类任务的整体通过率、平均步数、成本"。
- 数据形态变了:核心资产从偏好标注,变成可复现的环境加可靠的验证器(verifier)。
- 成本结构变了:钱主要花在环境运行和采样上,不在人工标注上。
对普通职场人来说,这件事的意义在于:下一代"会用电脑的助手",是从"把事办成"里学出来的,而不是从"话说得漂亮"里学出来的。至于各家具体的训练配方与实际效果,以官方技术报告为准。
