2026 年 10 月 6 日 · 星期二人工智能 · 每日要闻每天 08:00 出刊
AI 日报 · 2026 年 10 月 6 日 · 星期二
MYHOT
第 13 期062026 年 10 月星期二
十月本月 6 期
一二三四五六日
5件大事2个来源4件一手发布1个新模型约 2 分钟读完
头条
Reflection发布开放权重模型Beam
Reflection发布首个前沿开放权重模型Beam,称其以更低推理成本达到中国领先开放模型水平。AWS同期推出智能体技能,并展示了受监管工作负载、RAG应用和多智能体系统评估方案。
模型发布/更新
Reflection 发布 Beam 开放权重模型,主张以更低推理成本对标中国模型
Reflection 发布首个前沿开放权重模型 Beam,称其在高级推理基准上以更低推理成本达到中国领先开放模型水平。
产品发布/更新
Amazon SageMaker AI 发布 aws-ai-ml 智能体技能,支持推理优化与基准测试
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可接入 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体,帮助完成推理优化与基准测试。
技巧与观点
Claude Code 与 Amazon Bedrock 如何支持 AWS GovCloud (US) 的受监管工作负载
AWS Machine Learning Blog介绍如何在 AWS GovCloud (US) 的 Amazon Bedrock 上配置 Claude Code,为受监管工作负载提供 AI 辅助开发流程。
如何用 LangChain 与 Amazon Bedrock Knowledge Bases 实现智能体检索
AWS 展示了如何用 LangChain 和 Amazon Bedrock Knowledge Bases 构建 RAG 应用,对比标准单次检索与智能体检索。示例中的比较问题包含 6 个子意图,标准检索返回 5 个片段时覆盖 4 个,返回 10 个时覆盖全部但存在冗余;智能体检索通过拆分子查询、评估证据并按需再次搜索处理复杂问题。
如何用 Amazon Bedrock AgentCore 评估多智能体系统的可解释性与有用性
AWS 展示了如何用 Amazon Bedrock AgentCore Evaluations 分层评估多智能体系统的有用性、业务正确性与可解释性。供应链示例使用 Strands Agents SDK,由编排智能体协调 4 个专业子智能体,结合内置评估器、业务规则自定义评估器和 6 个独立可解释性评估器,分别检查决策依据、证据引用、约束与权衡等维度。