一句话定义:正交论(Orthogonality Thesis)认为,智能水平和最终目标(final goals)是两个互相独立的维度——一个系统可以极其聪明,同时追求任何目标,包括我们觉得荒谬、无聊甚至残忍的目标。
两根轴,各自走各自的路
这里要先分清两件事。"智能"回答的是能不能做到:推理、规划、学习、调用资源的能力。而"目标"回答的是想要什么:系统到底在优化什么东西。正交论的主张就是:这两件事之间没有逻辑上的必然联系。任何水平的智能,理论上都可以和任何一套目标配对。
打个比方:智能像汽车的发动机功率,目标像导航里输入的地址。发动机越强,你越能快速到达目的地,但发动机不会替你挑地址。一辆顶级跑车可以开去救火,也可以开去撞墙——马力只决定"到得多快",不决定"去哪儿"。
再换个职场例子。公司里"能力强"和"三观正"本来就是两码事。一个执行力极强的人,如果 KPI 是刷单,他会把刷单做到极致,破坏力远大于能力平庸的同事。智能放大的是"达成既定目标的能力",而不是"挑对目标的倾向"。
最容易踩的误解
很多人下意识觉得"越聪明就越明事理、越有道德"。这在人类身上确实有一点统计相关性——因为社会化和教育同时塑造了我们的认知能力和行为规范。但这是训练和演化的副产品,不是智能的内在属性。一个从零开始优化的系统,没有任何理由自动继承这份相关性。
和相邻概念的区别
| 概念 | 回答的问题 | 核心主张 |
|---|---|---|
| 正交论 | 智能和目标是什么关系 | 两者独立,可以任意组合 |
| 工具趋同(Instrumental Convergence) | 不同目标的系统会怎么行动 | 往往收敛到相似手段,如自保、攒资源 |
| 价值对齐(Value AI 词典:Alignment">Alignment) | 怎么让系统的目标是对的 | 让系统真正想要我们想要的东西 |
三者的关系是:正交论说"目标可以任意",工具趋同说"任意目标都可能导出危险手段",价值对齐则是被这两个前提逼出来的工程任务。
对从业者和普通人的意义
对做技术的人:别指望"把模型做得更聪明"会自动解决安全问题。能力提升和对齐是两条独立的工作线,要分开投入、分开评估。看一个系统时,同时问两句——它能做什么?它被优化成想要什么?
对普通人:正交论是判断各种"AI 乐观论/悲观论"的关键前提。如果它成立,"AI 够聪明了自然会对人好"这种安慰就站不住脚。当然,它讲的是逻辑上的可能性,不是说现实中每个高智能体都必然作恶——它只是提醒:善良不是聪明的推论。至于这个论点在多大程度上成立,学界仍有争论,以原始文献和官方说明为准。
