OpenAI发布心理健康基准MentalHealthBench,由22个国家的80多名持证专家一起定标准

AI资讯1小时前发布 nolan
511 0

AI 聊天机器人在心理健康话题上怎么回答才算合格,OpenAI 这次想给出一把尺子。

新发布的开放基准叫 MentalHealthBench,参与制定的是来自 22 个国家和地区的 80 多名持证心理健康专业人员。它评估的不是模型懂多少心理学知识,而是在真实对话里的表现。

具体看四类行为:能不能保证安全,会不会先收集必要的背景信息,是否尊重用户自己做决定的权利,给出的建议是否可以落地执行。

场景覆盖成人、青少年、照护者,也包括临床工作人员在内。

这比单纯的“有没有触发危机干预话术”要细得多。过去很多模型的做法是,一旦识别到敏感词就甩出一个热线电话,然后拒绝继续聊。从安全角度看挑不出错,但对一个只是想倾诉的人来说,这种回应很冷,甚至会让人更难受。

反过来,另一种失败是模型太顺着用户说,一味共情、一味肯定,在该提醒的时候没有提醒。

OpenAI 给出的结论是,AI 在这方面有稳步进步,但 ChatGPT 不能替代专业治疗。

基准是开放的,这点比较关键。其他厂商的模型也可以拿来跑,结果能横向比较。当越来越多人把 AI 当作深夜倾诉的对象,这类评估由谁来做、按什么标准做,本身就是一件需要公开讨论的事。

© 版权声明

相关文章

OpenAI发布心理健康基准MentalHealthBench,由22个国家的80多名持证专家一起定标准 暂无评论

none
暂无评论...