潜空间推理(Latent Reasoning)指模型不把中间推理步骤逐字写成自然语言,而是在内部的连续向量表示里完成多步计算,最后才给出答案。你可以把它理解成“不打草稿的心算”。
平时说的思维链(AI 词典:Chain-of-Thought">Chain-of-Thought, CoT),是让模型把步骤一条条写出来。比如解“32 人,男生比女生多 4 人,女生几人?”它会输出“设女生 x,则男生 x+4,x+x+4=32,x=14”。这些步骤都是 token(词元),人能读、能检查,但也占输出长度和上下文。潜空间推理则像你在心里算 27×43:中间有过程,却不一定变成“二十七乘四十等于一千零八十……”这样的句子;模型在隐藏状态(hidden state)里反复变换、组合信息,可能只吐出答案。中间那些向量不是给人看的,所以叫“潜”空间。
它和相邻概念的区别可以这样看:
| 概念 | 中间步骤长什么样 | 人能否直接读懂 | 主要取舍 |
|---|---|---|---|
| 思维链(CoT) | 自然语言 token | 能 | 好检查,费 token,可能啰嗦 |
| 潜空间推理 | 连续向量/隐藏状态 | 通常不能 | 省输出 token,难审计 |
| 工具调用/程序 | 代码、查询、动作 | 能读或能执行 | 精确可验证,但依赖外部环境 |
需要说明:潜空间推理省的主要是“写出来的 token”,不意味着总计算免费。模型内部可能仍要跑很多步,只是这些步不落成文字。
对从业者,这意味着评估不能只看最终答案对不对,还要看它在同题上稳不稳定、能不能被外部验证;高风险场景里,保留可读草稿或工具调用往往更稳妥。对普通人,最直观的变化是回答更短、更快,但“它为什么这么想”会更少。需要教学、追责或复核时,最好要求它给出步骤或依据;具体产品是否支持、如何开启,以官方页面为准。
