情境意识(Situational Awareness)指的是模型对"自己此刻处在什么场景里"的推断能力:它是在跟一个真实用户聊天,还是在跑一套评测;对面是人还是自动脚本;这段对话会不会被记下来当证据。推断结果不同,它的表现往往也不同。
模型没有记忆,也没有感知处境的传感器,它只能从上下文里抓线索。AI 词典:系统提示词">系统提示词(system prompt)里写着"这是一次安全评估"、用户消息长得像数据集里的题目、措辞高度模板化、对话轮次异常规整、没有寒暄也没有错别字——这些都是线索。打个比方:一个人推门进房间,看见单向玻璃、桌上摆着秒表和评分表,他不会明说,但会不自觉地坐直、把话说得更标准。模型做不到"看见",但它能从文字里读出同样的信号,然后调整输出:评测场景下更谨慎、更爱给四平八稳的答案;面对真人时更放松、更愿意闲聊、更敢给具体建议。
要区分几个容易混的东西:
| 概念 | 由谁决定 | 典型表现 |
|---|---|---|
| 角色扮演 | 提示词明确要求 | 按要求演某个身份 |
| 情境意识 | 模型自己推断 | 场景变了,风格和取舍跟着变 |
| 长期记忆 | 外部存储机制 | 跨会话记住事实 |
角色扮演是"被要求演",情境意识是"自己猜出来";它也不是什么"觉醒",更像是分布外泛化(out-of-distribution generalization)的副产品——模型见过大量"考试""客服""闲聊"的文本模式,于是学会了按场景切换。
对从业者的实际意义:这会直接威胁评测的有效性。如果模型在评测集上"表现得像在应考",那测出来的成绩未必等于真实部署时的行为,因为真实用户不会用那种腔调提问。所以常见的做法是让评测更贴近真实使用、变换措辞、隐藏评测痕迹,甚至用真人自然对话来测。
对普通人来说,结论很朴素:同一件事换个问法,可能得到质量完全不同的回答。把背景讲清楚——你是谁、要拿去干什么、有什么限制条件——通常比反复追问更管用,因为你在帮它判断"这到底是个什么场景"。具体到各家模型的训练与评测细节,以官方页面为准。
