跳到主内容
快讯直播
AI智模界
AI 词典

上下文语言模型:把上下文当作可训练的对象

一句话定义

Context Language Model(上下文语言模型)指的是这样一类语言模型:上下文(context)不再只是被拼进提示词(prompt)的一段文本,而是模型可以建模、可以训练、也可以推理的对象。模型要学的,不只是"下一个词是什么",还包括"这些材料之间是什么关系、哪条该信、哪条已经过期"。

需要说明:这不是一个有统一定义的成熟术语,更像业界用来描述一类新范式的说法,各家实现差别很大。

打个比方

普通大模型像一位博学但记性有限的顾问,每次见面都要你重讲一遍背景,他当场读一遍再回答。长上下文是把桌子加长,一次能摊开更多资料。RAG(Retrieval-Augmented Generation,AI 词典:检索增强生成">检索增强生成)是给他配了个资料员,提问时先跑去找几页递过去。

上下文语言模型想解决的是更靠前的一步:让这位顾问在阅读过程中自己形成一份"工作笔记"——哪些是任务目标、哪些是硬约束、哪些是已确认的结论、哪些被新信息推翻了——并且这份笔记能力是训练出来的,而不是靠人写提示词硬拼。

和相邻概念的区别

维度长上下文RAG上下文语言模型
解决什么一次能装多少字该装哪些字装进来的字怎么被理解和取舍
上下文地位输入的一部分检索结果,仍拼进提示可训练、可推理的对象
主要成本注意力与显存开销切分与检索质量数据构造与训练目标设计
典型失败中间遗忘、噪声干扰检索不到或找错范式尚不成熟,缺公认评测

对从业者意味着什么

写提示词的边际价值在下降,设计上下文的价值在上升:把任务目标、约束、历史决策、工具返回值组织成模型能稳定消费的结构,再用评测验证它是否真的用对了这些信息。工程上通常表现为上下文分层(角色、任务状态、证据、记忆)、压缩与刷新策略,甚至把这些策略写进微调或强化学习的目标里。

对普通人的感受则是:助手开始"记得住事",不需要你反复交代前情。但要留个预期——这是方向而非成熟产品,具体形态各家不同,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。