OpenAI 分享模型不对齐报告框架
OpenAI 分享了一套用于跟踪、调查和披露模型不对齐事件的框架,并附带六份关于模型出现意外或令人担忧行为的报告。
OpenAI 分享了一套用于跟踪、调查和披露模型不对齐事件的框架,并附带六份关于模型出现意外或令人担忧行为的报告。
Google DeepMind 宣布开展首个针对专有前沿级 AI 模型的双盲评测,以防止模型提前接触测试题目。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护的加密环境中使用机密基准测试 Gemini Flash Lite。
推荐理由:文章说明加密环境如何把外部评测与模型后续优化隔离开,为理解 benchmark contamination 及其对评测可信度的影响提供了具体机制。
Google DeepMind 发布 AI Control Roadmap,用分层防御管理内部 AI 智能体,即使模型对齐不完善,也通过权限控制、威胁建模和系统级安全措施降低风险。
推荐理由:文章将 AI Control Roadmap 拆解为威胁建模、监控与响应机制,并用可量化指标说明如何随智能体能力提升强化安全控制。
Mistral AI与 Carbone 4、ADEME 等机构合作,发布对 LLM 开发和使用进行生命周期分析的环境影响报告。
推荐理由:报告将训练、推理和全生命周期影响拆分为可比较指标,并披露 Mistral Large 2 与 Le Chat 的环境数据,为 AI 采购和行业透明度讨论提供量化依据。