跳到正文

#论文/研究

今日 0 条
9月17日周四
8月27日周四
  1. Google DeepMind67

    Google DeepMind 试点首个双盲 AI 评测

    Google DeepMind 宣布开展首个针对专有前沿级 AI 模型的双盲评测,以防止模型提前接触测试题目。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护的加密环境中使用机密基准测试 Gemini Flash Lite。

    推荐理由:文章说明加密环境如何把外部评测与模型后续优化隔离开,为理解 benchmark contamination 及其对评测可信度的影响提供了具体机制。

6月16日周二
  1. Google DeepMind74

    Google DeepMind 发布 AI Control Roadmap,构建 AI 智能体分层安全机制

    Google DeepMind 发布 AI Control Roadmap,用分层防御管理内部 AI 智能体,即使模型对齐不完善,也通过权限控制、威胁建模和系统级安全措施降低风险。

    推荐理由:文章将 AI Control Roadmap 拆解为威胁建模、监控与响应机制,并用可量化指标说明如何随智能体能力提升强化安全控制。

7月23日周三