MIT Technology Review · AI· Arthur Holland Michel·· 3 小时前AI 评分67
AI拒答机制并不可靠,也可能滑向审查工具
We’re putting too much faith in AI’s ability to say no
AI 导读
文章认为,现代 AI 依赖拒答训练、分类器和 probes 阻止危险请求,但这些机制具有概率性,仍可能被越狱绕过。Anthropic 曾表示一种分类器会使聊天机器人的计算成本增加 24%,而过于宽泛的安全边界也可能误拒癌症研究等正当问题。作者据此分析,拒答既难以稳定阻止生物和网络攻击,也可能被公司或政府用于压制合法言论。
来源:MIT Technology Review · AI · technologyreview.com