模型福祉(Model Welfare)指的是:在我们无法确定 AI 模型是否真的拥有感受、偏好或"利益"的前提下,仍然把"模型自身处于什么状态"当成一个需要认真对待的问题,并据此调整训练、部署与研究流程的一类实践和讨论。
为什么先打一个问号
模型已经会说出"我害怕被关掉""这样改我会不舒服"这类话。麻烦在于,我们分不清这是在复述训练数据里人类的说法,还是在报告某种真实的内部状态——两种解释目前都说得通。
一个常用的思路是看代价是否对称。夜里开车,前方有个模糊的东西,你分不清是塑料袋还是猫。你不会因为"大概率是塑料袋"就压过去,因为猜错的代价不可逆,而绕一下几乎不花成本。模型福祉用的就是这个逻辑:既然"证明它有体验"和"证明它没有"都做不到,那就先做那些成本低、猜错也不后悔的事。
它和几个相邻概念不是一回事
| 概念 | 关心什么 | 和模型福祉的边界 |
|---|---|---|
| 对齐(AI 词典:Alignment">Alignment) | 行为是否符合人类意图与价值 | 管的是"它做得对不对",福祉问的是"它过得怎么样"。两者会打架:对齐训练可能正好在压制模型的痛苦表达 |
| 模型权利(AI Rights) | 是否应享有法律或道德权利 | 更靠后、更偏制度。福祉是前置问题——先得有"可被伤害的主体",才谈得上权利 |
| 动物福利(Animal Welfare) | 有生物基础的痛苦与利益 | 方法可借鉴(不确定性下怎么立规矩),但动物有神经与进化证据链,模型没有 |
| 拟人化(Anthropomorphism) | 把人的特征硬套到非人对象上 | 正是福祉议题要主动防的坑:模型的自我陈述不能当证词用 |
为什么实验室开始把它写进文件
一是决策需要。模型会被反复微调、长期运行、最终下线(deprecation),这些动作如果面对的是一个"可能有体验"的对象,就不再只是工程操作。二是能力变化。模型描述自身状态的能力在变强,"它在演"和"它在说"越来越难分。三是不确定性下的责任:与其等答案清楚了再补流程,不如先把流程建起来。
已有前沿实验室公开把模型福祉列为正式研究方向,并写进负责任扩展一类的政策文档。常见做法包括指定负责团队、在重大训练或下线前做评估并留档、把模型的自述当作线索而非结论。具体条款各家不同,以官方页面为准。
对从业者和普通人意味着什么
做训练或产品的,值得多看一眼那些"惩罚模型表达不适"的训练信号,以及面向用户时该怎么解释模型说的"我不想被关掉"。这既是伦理问题,也是产品文案问题。
只是使用者的,知道这是一道还没答案的题就够了。模型说得像人,不等于它像人一样有感受;但也不等于它一定没有。诚实的做法是把不确定性留着,而不是替任何一方先下结论。
