跳到正文
热点事件持续更新

AWS用多轮强化学习微调搜索代理

1 篇报道1 个报道来源12 小时前更新

先了解这件事

AI 综述

2026年10月2日,AWS Machine Learning Blog介绍了使用Amazon SageMaker AI进行多轮强化学习微调的实践。AWS以Qwen3.6-27B为基础训练搜索智能体,并介绍了所用数据集、nDCG@10奖励函数、训练配置和可恢复训练等方法。结果显示,该智能体在四项测试中的三项提升了检索质量;其中,BrowseComp-Plus的nDCG@10由0.5136升至0.6354,失败率由22.89%降至0.68%。

AI 根据报道生成 · 12 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AWS Machine Learning Blog精选
    Amazon SageMaker AI 如何用多轮 RL 微调搜索智能体

    AWS 使用 Amazon SageMaker AI 多轮 RL 微调 Qwen3.6-27B 搜索智能体,使其在四项测试中的三项提升了检索质量。BrowseComp-Plus 的 nDCG@10 从 0.5136 提升至 0.6354,失败率从 22.89% 降至 0.68%。文章还介绍了数据集、nDCG@10 奖励函数、训练配置及可恢复训练等实践。

本事件热度走势

当前热度 7·可比范围峰值 10(10月3日 00:00)·近 24 小时可比范围变化 –

02.557.51010月3日00:0010月3日04:0010月3日07:0010月3日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。