OpenAI 推出 MentalHealthBench:评估 AI 在心理健康对话中的帮助性与安全性
OpenAI 推出 MentalHealthBench,这是一个由专家提供指导的评测基准,用于评估 AI 在贴近现实的心理健康对话中生成回复的帮助性与安全性。该基准聚焦 AI 能否在相关场景下提供有帮助且安全的回应。
OpenAI 推出 MentalHealthBench,这是一个由专家提供指导的评测基准,用于评估 AI 在贴近现实的心理健康对话中生成回复的帮助性与安全性。该基准聚焦 AI 能否在相关场景下提供有帮助且安全的回应。
AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。
推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。
Import AI 466 汇总了 MirrorCode 长时程编程基准、Anthropic 机器人实验和 OpenAI 模型安全事件。MirrorCode 中,Opus 4.7 曾以 $251 的推理成本完成一项预计人类需 2-17 周的任务;Anthropic 的 Opus 4.7 在 9 minutes and 35 seconds 内完成除一项外的全部机器人任务。
Google Research 提出一套评估 LLM 行为倾向与人类行为对齐程度的框架,覆盖 25 个 LLM 和专业、冲突解决、旅行预订等情境。研究让每个情境由 10 名参与者评估,并将人类偏好分布与模型响应分布进行比较。
推荐理由:研究将经过验证的心理问卷改编为情境判断测试,比较 25 个 LLM 在共识与分歧场景中的行为对齐和置信度。