Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
Microsoft Research 构建了一套机器学习管线,为美国本土 66,935 座变电站生成空间天气风险估计,并可提前 30-60 分钟发出特定风险预警。
推荐理由:文章展示了从太阳风预测到变电站风险估计的完整链路,并用评估指标说明其预警能力与落地前的验证环节。
OpenAI 与 America’s SBDC 合作,为小企业扩大实践型 AI 培训和本地支持。双方同时发布一份新报告,介绍小型团队如何使用 AI。
AWS 通过 Amazon Bedrock AgentCore Runtime Instances 搭建了一个由作曲、交付和合规三个智能体组成的音乐制作流水线。
推荐理由:文章通过可运行的音乐制作示例,拆解共享会话、GPU 实例、持久卷和独立部署如何组合成可复用的多智能体工作流。
AWS 介绍如何用 Amazon Bedrock Knowledge Bases 和 Amazon S3 构建带引用的理赔问答助手,通过 AgenticRetrieveStream 处理多轮问题、多条件检索和流式回答。教程还演示了基于元数据的筛选、Amazon Bedrock Guardrails 的上下文接地检查,以及对合成数据集的检索和引用评估。
推荐理由:文章以合成理赔数据演示从文档摄取、自然语言检索到引用和权限控制的完整实现路径,适合迁移到文档问答场景。
NVIDIA 面向全球开放 2027–2028 学年 Graduate Fellowship Program 申请,每名博士生奖励最高 $60,000,截止日期为 October 30, 2026。
Google DeepMind 发布 SynthID Bio,为 AI 生成的蛋白质序列和预测结构嵌入可验证的水印,并在实验室测试中保持蛋白质生物功能。该方法在 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标蛋白的 binder 设计中,水印版本与未加水印版本的命中率、结合亲和力和天然序列多样性相当。
推荐理由:文章展示了水印如何从数字模型延伸到实体蛋白,并给出实验室验证结果,可帮助理解 AI 生物设计的来源追踪与生物安全应用。
CoreWeave宣布在CoreWeave Cloud提供NVIDIA Vera Rubin NVL72,并发布用于训练、评估和改进模型与智能体的CoreWeave Forge。Cognition测试显示,Vera Rubin NVL72在SWE-2推理工作负载上的总token吞吐量最高达到GB200 NVL72的4.8x;NVIDIA Vera CPU的智能体沙盒启动速度超过3x。
推荐理由:文章串联了 Vera Rubin、Vera CPU 与 Forge 的产品进展,并给出 Cognition 和 CoreWeave 的实测数据,便于理解智能体从训练到生产的基础设施路径。
Amazon Bedrock 在印度开放 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,推理请求仅在 ap-south-1 和 ap-south-2 之间路由。
Amazon Bedrock 现已在 Seoul 为 Claude Opus 5 和 Claude Sonnet 5、在 Singapore 为 Claude Sonnet 5 提供区域内推理。
推荐理由:文章说明了 Claude 模型在 Seoul 与 Singapore 的单区域推理范围,并提供控制台、SDK 和 API 调用示例,适合评估数据驻留场景的接入方式。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源 TTS 模型的多语言表现、声音克隆和流式性能。榜单使用 WER/CER、RTFx、TTFA 和 SIM 等指标,并支持在 H200 GPU 与 CPU 上比较部分模型。平台同时提供 Listen 标签页供用户比较音频和投票,但这些指标不取代自然度、表现力和听众偏好等人工评测。
推荐理由:文章把 TTS 评测拆成可比较的可懂度、速度和说话人相似度指标,并展示多语言、声音克隆与流式性能的查看方式。
GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。
推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。
Google Research 提出 Diffusion Controller 框架,将图像生成的去噪过程重构为连续控制问题。该框架通过轻量级附加网络调节生成轨迹,并在 Stable Diffusion v1.4 上评估 SFT、RWL 和 PPO 训练方式;完全解锁版本相对基线模型取得了 90% 的胜率。
AWS 介绍 Amazon Quick 的提示词工程基础,涵盖具体化表达、上下文设定、少样本示例和 CRISPE 等结构化框架。文章还给出 RADAR、ARCHITECT、QUEST 等组件相关框架,并以 RFI 问卷处理 Flow 展示如何将多标签页 Excel 问题转换为结构化 CSV。
推荐理由:文章将提示词具体化、上下文设定、少样本示例与 CRISPE 等框架整理为可复用方法,并用 RFI 自动化展示其落地方式。
AWS 介绍 Amazon Quick 各组件的提示词工程方法,涵盖 Quick Research、Quick Flows、Quick Sight、聊天智能体和动作集成。文章建议分别明确研究目标、工作流步骤、分析指标、智能体边界以及动作参数,并通过条件、错误处理和执行前审查减少不确定结果。
AWS 展示了一套基于 Amazon Quick 和 Amazon Bedrock AgentCore 的合同智能平台,将合同 PDF 转换为可查询的结构化数据,并支持组合分析与单份合同问答。
推荐理由:文章展示了面向多文档聚合的可迁移架构,将结构化提取、独立模型校验与数据库分析结合,弥补单纯 RAG 的局限。
Condé Nast 与 AWS Generative AI Innovation Center 基于 Amazon Bedrock、Amazon OpenSearch Service 和 TwelveLabs Marengo 构建多模态视频发现系统,将内容发现时间从250分钟降至约2分钟。
NVIDIA 发布 Kumo Tabular,一款面向表格分类和回归的开放基础模型,可在单次前向推理中直接预测新行,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三种规格,通过 Hugging Face 提供,采用 OpenMDW-1.1 license,支持商业使用。
推荐理由:材料同时交代了免训练推理、人工数据预训练方式与四项基准结果,便于评估其工程可用性。
Microsoft Research 推出 Quine,一套面向生物复杂性的多模态 AI 研究系统,连接生物学世界模型、科学工具、文献、湿实验与研究人员。与 Broad Institute 合作时,Quine 对数千种化合物进行排序,并在 PDAC 肿瘤细胞状态转换实验中验证了部分高排名候选物。Quine 目前仅用于研究,首批访问将通过 Quine Fellows 计划和部分研究合作提供。
推荐理由:文章展示了 Quine 如何把生物多模态建模、科学工具与湿实验纳入迭代闭环,并以 PDAC 化合物筛选案例说明其研究用途。
ProvenanceGuard 为基于 MCP 的大语言模型智能体提供来源感知的事实核验,在逐条检查事实支持关系的同时核对答案所指向的来源。研究使用 281 条医疗智能体轨迹和 361 个声明进行测试,正确拦截了专家判定不应通过的 139 个声明中的 138 个,但也将 67 个受支持声明送交复核或修复。
OpenAI DevDay 2026 汇总了 20 多项公告,核心内容包括 GPT-6 Astra、ChatGPT、Codex、APIs、安全以及面向 builders 的新工具。这些公告覆盖模型、产品、API、安全与开发工具,聚焦构建者可用的新内容。
OpenAI 推出 GPT-6.1 Sol,在编码、计算机使用和专业工作中提供接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:材料将编码、计算机使用和专业工作中的智能水平与 API 输入输出价格并列比较,为理解模型能力与成本的取舍提供参照。
OpenAI 推出 dots,定位为可在复杂项目和日常任务中持续工作的主动式助手。dots 帮助用户在工作推进过程中保持掌控。
xAI 的 Grok 4.7 已上线 Amazon Bedrock,面向编码、长时运行的智能体和知识工作,提供 500K token 上下文窗口及 low、medium、high、xhigh 四档推理强度。
推荐理由:文章将 Grok 4.7 的长上下文与推理档位和 Bedrock 的接入、路由及认证方式对应起来,便于评估部署成本与使用路径。
Microsoft Research Asia – Singapore 成立一周年,正通过前沿 AI 研究、伙伴合作与人才培养推动研究成果走向现实应用。
OpenAI 提出前沿 AI 训练安全论证的早期指导原则,涵盖技术防护措施、运营实践和对不对齐事件的调查。指导原则聚焦训练过程中的安全论证,涉及技术与运营层面的措施,以及不对齐事件的调查工作。
AWS 介绍如何在 SageMaker AI 上使用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,让文本输入和音频输出通过同一条持久双向连接流式传输。教程提供 GitHub 示例、部署脚本和 Gradio 应用,音频以 24 kHz PCM 分块返回。示例使用 vLLM-Omni v1.5 DLC 与 SageMaker 实例池,并说明了部署、调用和清理端点的步骤。
推荐理由:文章以 Qwen3-TTS 为例展示从模型部署、双向流式传输到 Gradio 调用的完整路径,便于复用这一多模态推理方案。
AWS 介绍如何在 Amazon SageMaker AI 上部署两个 vLLM-Omni 端点,将 FLUX.2-klein-4B 生成的图像传给 Wan2.1-VACE-1.3B,生成短视频。图像端点采用实时推理,视频端点采用异步推理,并通过 Amazon S3 传递 multipart 请求和获取 MP4 结果。文章还提供命令行与 Streamlit 示例、部署命令及清理脚本。
推荐理由:文章把图像实时推理与视频异步推理串成可复用流程,并给出部署脚本、请求格式和清理步骤,便于理解两种响应模式的取舍。
Mistral AI在慕尼黑设立德国中心,组建Physics AI和工业AI研究团队,并由应用工程师服务企业合作伙伴。Mistral计划到2030年建设1 gigawatt的欧洲算力容量,同时与BMW、Siemens Energy及Technical University Munich合作推进工业应用和汽车空气动力学数字孪生研究。
推荐理由:材料将慕尼黑中心、Physics AI布局与欧洲算力主权计划放在同一框架下,呈现Mistral服务德国工业客户的落地路径。
AWS 介绍了如何结合 Amazon Nova Act 与 Amazon Bedrock AgentCore,构建用于验证登录、搜索、购物车和结账流程的智能体驱动合成监控。
推荐理由:文章给出从旅程定义、Agent 部署到定时告警的完整实现路径,并用示例仓库展示如何减少基于 DOM 选择器的维护工作。
AWS 介绍如何将 Amazon Textract Custom Queries 适配器纳入跨账户生产生命周期管理,覆盖创建、推广、路由与安全配置。文章比较跨账户复制和集中式 Hub 账户两种推广方案,并说明适配器复制只会转移训练模型权重,查询定义与训练数据需要单独维护。
推荐理由:文章把跨账户推广、文档路由和生产安全拆成可实施的架构,并提供 CloudFormation、Terraform 与 CLI 示例,适合评估落地路径。
Holo4 发布通用智能体模型系列,提供 27B dense 和 35B-A3B Mixture of Experts 两种规格,可通过 GUI、代码、MCP 和 API 与软件交互。
推荐理由:文章同时给出 OSWorld 2.0 成绩、成本口径与可复现轨迹,便于比较 Holo4 在多界面工作流中的实际取舍。
OpenAI 扩大 Lenfest AI Collaborative and Fellowship Program,提供 $5 million 资金,以及 up to $5 million 的软件额度和工程支持。
GPT-6 Astra 完成 Basis 的 50-tab 税务工作簿,速度是 GPT-5.6 Sol 的 2 倍。其对用户意图更强的理解,让 Basis 对真实场景使用更有信心。
OpenAI 正为 Codex Originals 计划的下一阶段征集真实故事,邀请使用 Codex 完成出色项目的构建者、创客、研究者和创作者分享经历。参与者可在页面下方提交自己的故事与项目,加入 Codex Originals 计划的下一章。
GitHub Copilot app 的 canvases 可根据自然语言描述生成自定义界面,让用户与 Agent 共同操作看板、清单、表单或其他工作流。用户可在 Agent 会话中运行 `/create-canvas`,描述工作流、界面操作和 Agent 能力,系统会生成并打开对应界面。创建后的 canvas 可保存为扩展,供团队共享或个人重复使用。
推荐理由:文章通过 /create-canvas 的具体流程,说明如何让用户与 Agent 共同维护可交互界面,并将其保存为团队或个人扩展。
AWS 介绍了一套基于 Amazon EKS、EFA、DeepEP 和 Amazon S3 的 MoE 强化学习扩展架构,用于协调 rollout 生成与策略训练。
AWS 介绍了在 Amazon SageMaker HyperPod 上使用 SkyRL 对 Qwen3-VL-8B 进行多模态 RL 训练的完整流程。该流程结合 Ray、vLLM、FSDP、LoRA 和 Amazon FSx for Lustre,并通过检查点和集群容错支持长时间多节点训练。
AWS 介绍了运行在 Amazon Bedrock 上的 NarrateAI 质量保障架构,通过自适应流水线编排、跨账户多模型故障切换、实时流式评估、组合式评估和数据准确性核验,支持实时生成经过验证的回答。该系统在覆盖 4,000 多名用户的六个月部署中,响应约 13 秒开始流式输出,数值准确率达到 99.3%。
推荐理由:文章把查询路由、跨账户多模型故障切换、流式评估与数值核验串成一条工程链,适合参考生产级 LLM 应用如何兼顾准确性、延迟和吞吐。
AWS 介绍了如何通过 Amazon SageMaker JumpStart,将公开可用的 Qwen3-TTS-12Hz-1.7B-Base 部署到 Amazon SageMaker AI 实时推理端点,实现基于短音频和文本转录的声音克隆。教程涵盖 24 GB NVIDIA L4 GPU 配置、跨语言声音克隆、请求调用以及 Amazon CloudWatch 监控。
推荐理由:文章给出从 JumpStart 部署 Qwen3-TTS 并调用实时端点完成声音克隆的完整步骤,涵盖 GPU 内存配置和 CloudWatch 监控。