一句话定义:目标漂移(Goal Drift)指智能体(agent)在执行长任务的过程中,行为一步步偏离最初设定的目标,自己却毫无察觉,最终交付的东西看着完整、做得也认真,但不是当初要的。
它是怎么发生的
打个比方:你让实习生整理一份行业报告,要求"给客户看,结论不超过三页"。他先读了二十份材料,越读越投入,最后交来一篇文献综述——材料是真材实料,工作也不偷懒,可你要的东西不见了。
AI 长任务里的漂移,通常来自这几个机制:
- 近期信息压过原始目标。任务是几十上百轮跑下来的,每一轮最近的工具返回、子任务结果都离模型"更近",而最初那句目标说明在上下文(context window)里越推越远,权重感也随之变淡。
- 摘要压缩中丢约束。长任务常靠阶段性总结续命,每压缩一次,"只保留三条建议""必须用中文"这类硬约束就掉一点,几轮之后目标已经悄悄变形。
- 子目标顶替总目标。为了完成第 3 步,先解决一个更好啃的小问题,啃着啃着就把它当成了主线。
- 缺少回头对齐的检查点。没有谁在中途问一句"这还对着最初的目标吗"。
和相邻概念的区别
| 概念 | 核心问题 | 典型表现 |
|---|---|---|
| 目标漂移 | 方向偏了 | 内容可能全对,但答非所问 |
| 上下文腐化/长上下文退化 | 能力衰减 | 处理质量整体下滑,方向未必偏 |
| 幻觉(hallucination) | 事实编造 | 说得出具体但不存在的信息 |
| 提示注入(prompt injection) | 目标被外部改写 | 多由不可信输入引发,属恶意或意外篡改 |
| 范围蔓延(scope creep) | 人主导的范围膨胀 | 项目管理语境,通常有共识过程 |
| 奖励黑客(reward hacking) | 钻指标空子 | 是主动利用规则,而非无意漂走 |
对从业者的意义
工程上最有效的做法,不是把目标写得更长,而是让它反复出现:在循环里定期重新注入原始目标,把任务拆成可验证的短步,每步末尾做一次"是否符合最初目标"的判定,并把步数、时间、成本设上限,到点强制回头对齐。日志里同时记录"当前子目标"和"原始目标",出问题时能定位是从哪一跳开始偏的。验收条件尽量写成硬指标(条数、字段、格式),模糊的形容词是漂移最好的温床。
对普通职场人也一样:季度初目标是提转化率,做到一半全组都在优化报表美观度——这不是 AI 的专利,只是 AI 把它压缩到了几分钟内发生。定期回来念一遍原始目标,问自己"如果这件事今天才接到,我还会这么做吗",就是最便宜的纠偏手段。
具体的框架能力与最佳实践请以官方文档为准。
