一句话定义:轨迹(Trajectory)是智能体(Agent)从接到任务到任务结束之间,按时间顺序完整记录下来的一串"状态—动作—反馈"序列,在工程和训练语境里也常叫 Rollout(把一步一动实际"跑"一遍)。
打个比方:剧照 vs 电影
监督学习(Supervised Learning)像看剧照:给一张图,标一个答案。强化学习(Reinforcement Learning)不行,它得看完整部电影——因为一个动作好不好,往往要看到后面才知道。
比如一个订票智能体,用户说"帮我订下周三去上海最便宜的票"。它依次做了:读日历 → 搜航班 → 比价 → 挑一班 → 填乘机人 → 请求确认 → 下单。中间可能价格刷新了、接口报错了、它重试了一次。这一整串动作,加上每一步看到的环境变化和最后拿到的结果反馈,合起来就是一条轨迹。
轨迹有个很别扭的特点:奖励常常只在结尾出现。票订对了 +1,订错了 −1,但错误可能出在第三步的比价上。到底该给哪一步记功、哪一步记过?这就是"信用分配"(Credit Assignment)问题,也是强化学习算法真正要解决的事。
和相邻概念的区别
| 概念 | 是什么 | 关系 |
|---|---|---|
| 单步 / Transition | 一个四元组:状态、动作、奖励、下一个状态 | 轨迹的最小单元 |
| 轨迹 / Trajectory | 若干单步按时间顺序连成的一整串 | 真正的训练样本 |
| 回合 / Episode | 一次从开始到终止的完整交互,结束会重置环境 | 一条轨迹通常就是一个回合的记录,但"轨迹"更强调数据本身 |
| 经验回放 / Replay Buffer | 把大量轨迹存起来反复抽样 | 轨迹的仓库 |
严格说,Rollout 偏"跑一次、采一批数据"这个动作,Trajectory 偏指采出来的结果数据,实际工作里两者常混用。
为什么值得记住这个词
第一,训练的数据单位变了。 做微调是"输入—输出"对,做强化学习是轨迹。工程上必须把每一步的上下文、动作、工具返回、奖励完整落盘,否则没法复盘、没法复现。
第二,采样是最大的成本项。 一条轨迹动辄几十步模型调用加工具调用。所以"少采样、多复用"(经验回放、重要性采样这类手段)才那么重要。
第三,评测也得分过程看。 只看最终对不对,会掩盖过程里的毛病。不少团队会专门做过程奖励或轨迹级诊断,为的就是定位"是哪一步走歪了"。
对普通职场人也有用:当你让智能体跑长任务、结果翻车时,别只盯最后一步——回头把整条轨迹从头看一遍,问题常常出在中间某次搜索没搜到、某个工具调用参数错了。很多框架都支持查看完整轨迹,具体界面和字段以官方文档为准。
