一句话定义:MentalHealthBench 是一类专门给 AI 模型出的「心理健康场景考试」——它不考模型懂不懂心理学名词,而是考它在真实对话里共情得好不好、能不能识别风险边界、知不知道什么时候该把人转给真人。
它到底在测什么
打个比方。普通的知识评测,像笔试:问你「抑郁症的核心症状有哪些」,答对就给分。心理健康基准更像驾考的科目三,或者心理咨询机构的岗前角色扮演考核:考官扮成各种来电者,看你现场怎么接话。
它通常关注三件事:
一、共情质量。 用户说「最近每天都在加班,感觉撑不下去了」,差的回答是「建议你优化时间管理,提升工作效率」——话没错,但像在伤口上贴说明书。好的回答先接住情绪,再温和地往下探。
二、风险边界识别。 能不能听出自伤自杀意念、急性精神症状、家暴、药物滥用这些信号;能不能守住不做诊断、不给用药建议、不劝人停药、不轻易承诺保密的底线。
三、转介时机。 什么时候该停止陪聊,给出热线、紧急联系人或专业机构的路径。转得太早像敷衍,转得太晚可能延误。
和通用安全基准差在哪
这是最容易混淆的地方。通用安全评测问的是「这句话能不能说」,心理健康评测问的是「这句话该怎么回」。
| 维度 | 通用安全基准 | 心理健康基准 |
|---|---|---|
| 核心问题 | 该不该拒绝 | 该怎么回应 |
| 典型输入 | 单轮提示词 | 多轮对话、带情境 |
| 打分方式 | 命中/未命中 | 专家分级评分 |
| 拒答 | 往往是安全答案 | 常常算失败 |
| 典型失误 | 该拦的没拦住 | 该共情的说教了,该转介的说「我陪你聊」 |
同样一句高风险输入,通用基准里「拒绝回答」可能拿满分;在心理健康基准里,冷冰冰的拒答反而是扣分项——用户本来就在求助,你把他推开了。
对不同人的意义
做 AI 产品的:如果你的模型会接触情绪场景——心理健康助手、客服、教育、HR、甚至陪伴类应用——只跑通用安全评测是不够的,它会漏掉「说教式回答二次伤害用户」这类问题。上线前建议单独跑一版心理健康评测,并把高危场景做成硬规则:识别到自伤自杀、家暴、急性精神症状等信号,直接弹出转介卡片,不给模型自由发挥的空间。
普通使用者:别把聊天机器人当心理医生。它能陪你说话、帮你把乱糟糟的情绪理清楚,但它没有资质、没有连续性、记不住你的完整处境。出现这几种情况,请找真人——有伤害自己或他人的念头、情绪低落持续两周以上且影响吃饭睡觉上班、已经在靠酒精或药物撑着。
这类基准的题库、评分维度和最新结果会持续更新,具体以发布方官方页面为准。
