一句话定义:无状态推理(Stateless AI 词典:Inference">Inference)指模型服务端不保存任何对话记录,每一次 API 调用都是一次独立、从零开始的计算——它记不住上一句,是因为根本没人替它记。
一次请求,一个世界
把模型 API 想成一台自动贩卖机。你投币、按键、掉货,交易结束。下次你再来,它完全不记得你买过什么。不是它装傻,而是它的设计里就没有"上次"这个概念。
从形式上看,模型就是一个函数:输入一段文本(prompt),输出一段文本(completion)。同一个输入,得到同一类输出。所谓"多轮对话",其实是客户端在做苦力:每问一句,就把前面所有对话重新拼成一大段文本,再整包发过去。你感觉"它记得我",是因为你自己把历史重发了一遍。
这也解释了一个常见现象:对话里说过"我叫小王",第二轮请求里,这句话已经变成 prompt 的一部分。删掉历史,模型立刻失忆。
容易混淆的几个概念
| 概念 | 状态存在哪 | 说明 |
|---|---|---|
| 无状态推理 | 不存 | 每个请求独立,服务端不留痕 |
| 会话状态 session | 客户端或应用层 | 历史存在你这边,每次重发 |
| 长期记忆 memory | 应用层存储 + 检索 | 把要点存起来,下次按需拼进 prompt |
| KV Cache | 服务端显存,临时 | 只是复用计算提速,不是对话记忆 |
尤其要小心 KV Cache:它是推理加速技术,让重复的前缀不必重算,但语义上模型依然"不知道"你上一轮说过什么,请求一结束,这份缓存随时可以丢弃。
对从业者的意义
1. 成本和延迟随轮次上涨:历史越长,输入 token 越多;若每轮都带上全部历史,n 轮对话的总输入量大致按轮数的平方增长。截断、滚动摘要、检索增强(RAG)本质都在跟这个约束搏斗。
2. 水平扩展很简单:任何一台机器都能处理任何请求,不需要粘性会话(sticky session),这对工程是巨大的礼物。
3. "记忆"是要自己造的产品功能:用户以为的记忆,往往是你写的数据库加拼接逻辑。
对普通人的意义
换设备、换窗口、清空对话就"失忆",是正常行为,不是 bug;长对话变慢、答非所问,多半是历史被截断或塞得太满;想让它记住关键信息,与其反复提醒,不如把要点整理成一段话,每次带上。
各家 API 的上下文长度上限、计费方式和缓存机制不尽相同,具体以官方页面为准。
