一句话定义:上下文窗口(context window)是大语言模型在一次请求里能同时“看到”和处理的 token 数量上限,包括你给的提示、对话历史、附件文本,以及模型正在生成的回答。
把模型想象成一位坐在工作台前的人。工作台就那么大,你递进去的资料、你们之前的对话记录、它正在写的草稿,都得摊在台面上。台面放满,旧资料就得被推下去,模型就“看不见”了。这个台面大小就是上下文窗口。它不改变模型本身的知识,只决定这次它能参考多少信息。
128K、1M 意味着什么? K 指千,M 指百万,单位是 token。AI 词典:Token">Token 是模型切分文本的小片段,英文里常约 4 个字符算 1 个 token,中文不完全等同字数,不同模型切法不同。粗略说,128K 能一次装下一本几百页的书,1M 能装下多本书或超长代码库。但别只盯上限:有效利用长度往往小于标称上限,且在长上下文中,模型对中间位置的信息可能不如开头结尾敏感。这不是内存条,不是“加钱买 1M 就等于模型变聪明”。
和内存的关系:常有人把上下文窗口叫“模型的内存”,不准确。模型参数像长期记忆,存在硬盘/显存里;上下文窗口像临时工作台,是这次推理时注意力能覆盖的范围。真正吃显存的是 KV cache(键值缓存)——为了让模型不必每生成一个字都重算前面所有 token,系统会把中间结果缓存下来。窗口越大、对话越长,KV cache 越大,对显存和计算的要求越高。所以 1M 上下文不是免费的,服务商通常要限流、压缩或额外收费,具体以官方页面为准。
和相邻概念的区别:
| 概念 | 是什么 | 类比 |
|---|---|---|
| 上下文窗口 | 一次请求能处理的 token 上限 | 工作台面积 |
| 模型参数 | 训练学到的权重 | 长期记忆 |
| KV cache | 推理时缓存的中间结果 | 草稿纸占地方 |
| RAG | 外部检索后填入上下文 | 临时查资料 |
训练数据是模型学过的海量文本,影响它的知识和能力;知识截止指训练数据大致到某个时间点;RAG 是从外部检索资料塞进上下文窗口,相当于临时给工作台递参考书;记忆则常通过把摘要写回上下文来实现。
对从业者:做长文档问答、代码助手、多轮客服时,要管理上下文:分段、摘要、检索、压缩,不要一股脑塞满。对普通人:聊天机器人聊久了“忘事”,往往不是它笨,而是早期内容被挤出窗口;重要信息可以重新贴一遍或让它先总结。窗口大小是能力边界之一,但效果还取决于检索质量、提示和模型本身。
