Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近 GPT-6.1 Astra,API 价格为每百万输入 token $2、输出 token $10。
推荐理由:文章集中比较了 GPT-6.1 Sol 与 Astra、GPT-6 Sol 及 Claude 模型的价格和基准表现,呈现成本效率与安全表现之间的取舍。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和专业工作上的智能水平接近 GPT-6 Astra,标准输入和输出 token 价格为后者的 1/5。
推荐理由:文章将 GPT-6.1 Sol 与 GPT-6 Astra 的能力、价格和可用范围放在一起,便于判断这次更新的实际取舍。
GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。
推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。
OpenAI 推出 GPT-6.1 Sol,在编码、计算机使用和专业工作中提供接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:材料将编码、计算机使用和专业工作中的智能水平与 API 输入输出价格并列比较,为理解模型能力与成本的取舍提供参照。
xAI 的 Grok 4.7 已上线 Amazon Bedrock,面向编码、长时运行的智能体和知识工作,提供 500K token 上下文窗口及 low、medium、high、xhigh 四档推理强度。
推荐理由:文章将 Grok 4.7 的长上下文与推理档位和 Bedrock 的接入、路由及认证方式对应起来,便于评估部署成本与使用路径。
Anthropic 今天发布 Claude Sonnet 5.5,称其运行速度提升 30%+,多数任务的成本最多降低 30%,定价与 Sonnet 5 相同。Simon Willison 指出,该模型现已用于 claude.ai 免费层,并实测其生成了效果不错的 WebGL 三维鹈鹕骑自行车页面;他认为这一免费服务比使用 Luna 5.6 的 ChatGPT 免费层能力更强。
推荐理由:同一绘图任务中,更高思考档位耗尽预算却未产出结果,而较低档位完成了输出,为选择推理预算提供了具体对照。
Anthropic 发布 Claude Opus 5.5,作为 Claude 5.5 family 首个模型并成为 Claude Code 与 Claude app 的默认模型。
推荐理由:文章把 Claude Opus 5.5 的基准表现、默认设置与 token 成本放在一起,并与 GPT-6 Sol、Luna 对照,便于理解降价和用量变化的关系。
OpenAI 发布 GPT-6 Astra,称其为面向企业最强大的模型,具备高级推理、计算机使用以及更强的写作和设计判断能力。
推荐理由:摘要列出 GPT-6 Astra 在推理、计算机使用、写作和设计判断方面的能力侧重,可帮助读者快速了解其面向企业工作的定位。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与智能体工作流,后者面向网络安全。
推荐理由:文章同时给出 Gemini 3.8 Flash 在长程编码与多步推理上的基准表现,以及 Cyber 版本的漏洞发现、修复和使用门槛,便于比较两种定位。
IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。
推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。
Google DeepMind 发布 Gemini 3.7 Flash,称其在编码、知识工作和 Web 开发流程上较 Gemini 3.6 Flash 有明显提升。
推荐理由:Gemini 3.7 Flash 的基准对比、价格和接入方式较为完整,便于判断其在编码与智能体工作流中的升级幅度和适用场景。
Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。
推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调、用于快速发现、验证和修复软件漏洞的轻量网络安全模型。
推荐理由:原文结合 CyberGym、Big Sleep 和生产扫描结果,展示了轻量模型在漏洞发现与修复任务中的性能和规模化使用方式。
Mistral AI 发布 Leanstral 1.5,这是一款采用 Apache-2.0 许可、119B 总参数且仅 6B active parameters 的模型,面向 Lean 4 形式化验证。
推荐理由:文章同时给出形式化数学基准、成本对比和真实代码验证案例,便于评估 Lean 4 证明智能体从题目求解到仓库级任务的实际能力。
Mistral AI 发布 Mistral Medium 3.5 public preview,这是一款 128B dense open-weight 模型,成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:文章同时交代模型规格、编码基准与部署方式,并说明它如何支撑云端并行编码和多步骤工作流。
Google DeepMind 发布 Gemini 3.5 系列并首先推出 Gemini 3.5 Flash,定位为面向智能体和编码的高速模型。
推荐理由:文章同时交代 Gemini 3.5 Flash 在智能体、编码和多模态基准上的具体表现,以及面向个人、开发者和企业的开放入口,便于理解其应用范围。
Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。
推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库中的代码与证明任务,并以 Apache 2.0 许可开放模型权重。
推荐理由:以真实形式化仓库中的证明任务比较模型表现与运行成本,为评估代码智能体在证明工程中的性价比提供了具体参照。
Mistral AI 发布 Devstral 2(123B)和 Devstral Small 2(24B)编码模型,以及开源命令行智能体 Mistral Vibe CLI。
推荐理由:文章同时给出两种参数规模、SWE-bench Verified 成绩与部署方式,便于比较开放模型在编码智能体中的性能和落地门槛。
Mistral AI 与 All Hands AI 发布 Devstral Medium,并升级 Devstral Small 1.1,面向智能体编码场景。
推荐理由:原文同时给出 Devstral Small 1.1 与 Medium 的 SWE-Bench Verified 成绩、授权方式、价格和部署选项,便于比较开放模型与 API 模型的使用路径。
Mistral AI 发布专用于代码的嵌入模型 Codestral Embed,面向代码检索和语义理解。该模型可输出不同维度和精度的嵌入,256 维、int8 精度下的检索表现优于文中列出的竞争模型。
Mistral AI 与 All Hands AI 联合推出面向软件工程任务的 Devstral,并以 Apache 2.0 许可证发布。
推荐理由:原文同时给出 Devstral 的 SWE-Bench Verified 成绩、部署方式与 API 价格,便于比较其工程能力和使用门槛。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、较低成本和简化部署的企业级模型。模型在基准测试中达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并支持四个 GPU 及以上的自托管环境。
推荐理由:原文将 Mistral Medium 3 与 Claude Sonnet 3.7、Llama 4 Maverick 等模型放在性能和成本维度比较,并说明了企业部署与定制路径。