情感向量(Emotion Vectors)指的是:在语言模型内部,某些方向上的激活强度与“情绪”这类语义特征稳定对应。往这个方向上加一点,模型会变得更乐观、更耐心或更焦虑;减一点,它就更难维持那种情绪,连回答风格和决策倾向也跟着变。
它是怎么被找到的
模型把文字拆成数字向量。训练久了,很多抽象概念在向量空间里会呈现出“方向感”:一个方向大致代表“正式↔随意”,另一个方向大致代表“积极↔消极”。情绪就是其中一类。
研究者找情绪方向的做法,很像调一锅汤的咸淡:先让模型读大量带有明显情绪色彩的文字,把每种情绪下的激活状态取平均,再减掉一个中性基线,剩下的差值就是一个“情绪方向”。之后在推理时往这个方向轻轻推一下——这个操作通常叫激活引导(activation steering)——模型的行为就会偏移。反过来,把这个方向的投影去掉,模型就更难表现出那种情绪。
打个比方:模型的内部像一张调音台,上面有很多推子。文字输入是乐谱,推子决定最终听感。情感向量就是那几根标着情绪的推子:你不用改乐谱,只把“明亮度”往上推一格,整首歌的调性就变了。
和相邻概念的区别
- 情感分析(sentiment analysis)是在输出端给文本贴“正面/负面”标签,看的是结果;情感向量是模型内部的表示,属于“因”。
- 提示词(prompt)是从外部用文字引导;激活引导是直接改内部状态,通常更细腻、更稳定,但前提是你能接触到模型内部。
- 微调(fine-tuning)改的是权重,持久且全局;情感向量只在推理时临时生效,像一张随手贴的便签。
| 维度 | 提示词 | 微调 | 情感向量(激活引导) |
|---|---|---|---|
| 改动位置 | 输入文本 | 模型权重 | 推理时的中间激活 |
| 生效速度 | 立即 | 需要重新训练 | 立即 |
| 影响范围 | 一般限于当前对话 | 全局持久 | 限于被引导的层与当前推理 |
| 主要成本 | 设计提示 | 算力与数据 | 需要内部访问与校准 |
对实际工作意味着什么
对从业者,这是可解释性与模型控制的交叉点。做角色扮演、客服语气、安全对齐时,它提供了一种比“反复改提示词”更直接的手段。但它不是万能旋钮:情绪方向之间常常相互纠缠,推“更积极”可能顺带带来“更不谨慎”。所以要用小步实验加评估,别一次推到底。
对普通职场人,它至少说明两件事。第一,模型表现出的“情绪”不一定是文字游戏,内部确实有对应的状态。第二,同一件事在不同情绪偏置下,模型的建议可能不同——偏焦虑时更容易给出保守结论。把模型当成一个“带着情绪偏置的同事”来用,比当成一台绝对中立的机器更贴近现实。
具体实现因模型而异,各家是否开放这类接口,以官方页面为准。
