OpenAI 推出 MentalHealthBench:评估 AI 在心理健康对话中的帮助性与安全性
OpenAI 推出 MentalHealthBench,这是一个由专家提供指导的评测基准,用于评估 AI 在贴近现实的心理健康对话中生成回复的帮助性与安全性。该基准聚焦 AI 能否在相关场景下提供有帮助且安全的回应。
OpenAI 推出 MentalHealthBench,这是一个由专家提供指导的评测基准,用于评估 AI 在贴近现实的心理健康对话中生成回复的帮助性与安全性。该基准聚焦 AI 能否在相关场景下提供有帮助且安全的回应。
OpenAI 经济研究显示,员工正在传统职责之外使用 AI,新的工作活动也成为其工作中反复出现的组成部分。研究关注员工如何拓展 AI 的使用方式,以及哪些新活动会持续融入日常工作。
OpenAI 分享了一份 Navier–Stokes 千禧年难题的 AI 生成解答,包含书面说明和用 Lean 编写的形式化证明。
Import AI 466 汇总了 MirrorCode 长时程编程基准、Anthropic 机器人实验和 OpenAI 模型安全事件。MirrorCode 中,Opus 4.7 曾以 $251 的推理成本完成一项预计人类需 2-17 周的任务;Anthropic 的 Opus 4.7 在 9 minutes and 35 seconds 内完成除一项外的全部机器人任务。
Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。
Import AI 457 汇总了 fast16 高精度软件破坏调查、Aurora 优化器研究、正向对齐立场论文,以及 Prime Intellect 的自主 AI 研究实验。