跳到主内容
快讯直播
AI智模界
AI 词典

上下文窗口:模型一次能“看见”多少字?

一句话定义:上下文窗口(context window)是大语言模型在一次请求里能同时“看到”和处理的 token 数量上限,包括你给的提示、对话历史、附件文本,以及模型正在生成的回答。

把模型想象成一位坐在工作台前的人。工作台就那么大,你递进去的资料、你们之前的对话记录、它正在写的草稿,都得摊在台面上。台面放满,旧资料就得被推下去,模型就“看不见”了。这个台面大小就是上下文窗口。它不改变模型本身的知识,只决定这次它能参考多少信息。

128K、1M 意味着什么? K 指千,M 指百万,单位是 token。AI 词典:Token">Token 是模型切分文本的小片段,英文里常约 4 个字符算 1 个 token,中文不完全等同字数,不同模型切法不同。粗略说,128K 能一次装下一本几百页的书,1M 能装下多本书或超长代码库。但别只盯上限:有效利用长度往往小于标称上限,且在长上下文中,模型对中间位置的信息可能不如开头结尾敏感。这不是内存条,不是“加钱买 1M 就等于模型变聪明”。

和内存的关系:常有人把上下文窗口叫“模型的内存”,不准确。模型参数像长期记忆,存在硬盘/显存里;上下文窗口像临时工作台,是这次推理时注意力能覆盖的范围。真正吃显存的是 KV cache(键值缓存)——为了让模型不必每生成一个字都重算前面所有 token,系统会把中间结果缓存下来。窗口越大、对话越长,KV cache 越大,对显存和计算的要求越高。所以 1M 上下文不是免费的,服务商通常要限流、压缩或额外收费,具体以官方页面为准。

和相邻概念的区别

概念是什么类比
上下文窗口一次请求能处理的 token 上限工作台面积
模型参数训练学到的权重长期记忆
KV cache推理时缓存的中间结果草稿纸占地方
RAG外部检索后填入上下文临时查资料

训练数据是模型学过的海量文本,影响它的知识和能力;知识截止指训练数据大致到某个时间点;RAG 是从外部检索资料塞进上下文窗口,相当于临时给工作台递参考书;记忆则常通过把摘要写回上下文来实现。

对从业者:做长文档问答、代码助手、多轮客服时,要管理上下文:分段、摘要、检索、压缩,不要一股脑塞满。对普通人:聊天机器人聊久了“忘事”,往往不是它笨,而是早期内容被挤出窗口;重要信息可以重新贴一遍或让它先总结。窗口大小是能力边界之一,但效果还取决于检索质量、提示和模型本身。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。