OpenAI 发布心理健康对话安全评测基准

OpenAI News··作者 OpenAI News

关键信息

该基准被描述为开放且由专家参与制定,并侧重真实情境对话,而不是模型的通用能力。不过,这份简短公告没有提供足够的方法细节,因此暂时无法全面判断其评测设计、严谨性、局限性或创新程度。

资讯摘要

OpenAI 推出了 MentalHealthBench,用于评估 AI 在心理健康对话中的表现。该项目由超过 80 名持证心理健康专家参与开发。它重点考察 AI 生成的回答在真实情境对话中是否既有帮助又安全。与不专门审视敏感心理健康互动的通用评测相比,这一重点使该基准更具针对性。

OpenAI 将 MentalHealthBench 描述为开放基准,这可能有助于其在模型评估和安全研究中得到更广泛的使用。不过,目前的公告较为简短,没有充分说明对话场景、评分流程、验证方式或局限性,因此尚不足以全面判断其严谨程度。即便存在这一信息缺口,该项目仍体现了针对高影响应用领域评估 AI 系统的一项专门努力。

资讯正文

MentalHealthBench 是一套由专家意见指导制定的基准,用于评估 AI 在真实的心理健康对话场景中能否给出有帮助且安全的回应。

来源与参考

  1. 原始链接
  2. Introducing MentalHealthBench

收录于 2026-09-24