Microsoft Research· Chad Atalla, Jennifer Neville·· 2 小时前精选AI 评分60
Microsoft Research 访谈:AI 会犯哪些错,失败能教会我们什么
What AI gets wrong and what failure teaches us
AI 导读
Microsoft Research 的 Jennifer Neville 在访谈中解释,传统基准难以覆盖真实工作流,多轮对话和长期任务会暴露模型的意外失败。团队将单轮任务拆为多轮逐步澄清的需求后,发现模型表现显著下降;反复编辑文档的长期工作流也可能因错误累积而丢失语义内容。
推荐理由
将单轮基准改为逐步澄清需求的多轮评估,提供了检验模型在真实交互中可靠性的方法,而不只依赖静态测试成绩。
来源:Microsoft Research · microsoft.com