一句话定义:多轮对话(Multi-turn)指用户和模型来回交换多次消息的交互方式;轮次管理(Turn Management)则是决定"每一轮到底把哪些内容重新送进模型"的那套规则。
模型其实没有记忆
大模型(LLM)的单次调用是无状态的:你传进去一段文本,它算出下一段文本,然后忘得一干二净。
打个比方:它像一位每次进会议室都会失忆的顾问。桌上只放着你这次递进去的那叠纸,他读完就答。你问第二句时,他完全不记得第一句,所以你必须把之前所有的问答连同新问题重新打印一遍再递进去。
技术上就是你熟悉的那个消息数组:system、user、assistant 按角色交替排列。第 5 轮的请求,内容大致等于"前 4 轮全文 + 这次的新问题"。所谓"它记得我说过什么",其实是你每轮都替它复习了一遍。
越聊越贵的根源
计费按 token 算,而输入 token 每一轮都要重发。于是总消耗不是随轮数线性增长,而是接近"每轮长度之和"的累加:第一轮可能只有几百字,到第二十轮,历史本身就有几千字,你每问一句都在为前面所有的寒暄付费。
一句话总结:贵不是因为这一句难,而是因为这一句背后拖着整段历史。
越聊越慢的根源
延迟分成两段:
- 预填充(prefill):模型先读完整个输入。输入越长,这段时间越长,表现为"首字迟迟不出来"。
- 逐字生成(decode):长度基本只和回答长短有关。
所以长会话的体感往往是:等待变久了,回答速度没变。加上注意力机制(attention)对上下文的处理开销随长度增长得更快,历史越长,每多一个字都更"吃力"。
和相邻概念的区别
| 概念 | 管什么 | 常见手段 |
|---|---|---|
| 轮次管理 | 这一轮发什么、发多少 | 截断、摘要、前缀缓存 |
| AI 词典:上下文窗口">上下文窗口 | 一次最多能装多少 | 换模型、压缩输入 |
| 长期记忆 | 跨会话记住什么 | 向量库、用户画像 |
上下文窗口是"容量上限",长期记忆是"跨会话的存档",轮次管理则是每一次请求的"装箱决策"。
对从业者和普通人的意义
产品侧要主动设三条线:会话长度上限、触发摘要压缩的阈值、以及把稳定不变的内容(系统提示、固定知识)放在最前面,以便命中提示缓存(prompt caching)——多数厂商对重复前缀有折扣,具体规则和价格以官方页面为准。
普通人则可以得到两个实用习惯:该开新会话时就开新会话;把无关的长文粘贴、来回试探的废话说得越少,账单和等待就越短。
一句话收尾:多轮对话的智能感来自历史,成本与延迟也来自历史,轮次管理就是在两者之间做取舍。
