热点事件持续更新
AWS用多轮强化学习微调搜索代理
1 篇报道1 个报道来源12 小时前更新
先了解这件事
AI 综述
2026年10月2日,AWS Machine Learning Blog介绍了使用Amazon SageMaker AI进行多轮强化学习微调的实践。AWS以Qwen3.6-27B为基础训练搜索智能体,并介绍了所用数据集、nDCG@10奖励函数、训练配置和可恢复训练等方法。结果显示,该智能体在四项测试中的三项提升了检索质量;其中,BrowseComp-Plus的nDCG@10由0.5136升至0.6354,失败率由22.89%降至0.68%。
AI 根据报道生成 · 12 小时前更新
最新进展10月2日 23:44
AWS公布多轮RL微调结果,BrowseComp-Plus检索质量和成功率均提升。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AWS Machine Learning Blog精选Amazon SageMaker AI 如何用多轮 RL 微调搜索智能体
AWS 使用 Amazon SageMaker AI 多轮 RL 微调 Qwen3.6-27B 搜索智能体,使其在四项测试中的三项提升了检索质量。BrowseComp-Plus 的 nDCG@10 从 0.5136 提升至 0.6354,失败率从 22.89% 降至 0.68%。文章还介绍了数据集、nDCG@10 奖励函数、训练配置及可恢复训练等实践。
本事件热度走势
当前热度 7·可比范围峰值 10(10月3日 00:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。