Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。
推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。
OpenAI DevDay 2026 汇总了 20 多项公告,核心内容包括 GPT-6 Astra、ChatGPT、Codex、APIs、安全以及面向 builders 的新工具。这些公告覆盖模型、产品、API、安全与开发工具,聚焦构建者可用的新内容。
OpenAI 推出 GPT-6.1 Sol,在编码、计算机使用和专业工作中提供接近 Astra 的智能水平。其 API 输入和输出 token 价格均为 Astra 标准价格的五分之一。
推荐理由:材料将编码、计算机使用和专业工作中的智能水平与 API 输入输出价格并列比较,为理解模型能力与成本的取舍提供参照。
xAI 的 Grok 4.7 已上线 Amazon Bedrock,面向编码、长时运行的智能体和知识工作,提供 500K token 上下文窗口及 low、medium、high、xhigh 四档推理强度。
推荐理由:文章将 Grok 4.7 的长上下文与推理档位和 Bedrock 的接入、路由及认证方式对应起来,便于评估部署成本与使用路径。
OpenAI 正为 Codex Originals 计划的下一阶段征集真实故事,邀请使用 Codex 完成出色项目的构建者、创客、研究者和创作者分享经历。参与者可在页面下方提交自己的故事与项目,加入 Codex Originals 计划的下一章。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,加快现代车队管理业务的构建、运营与销售,销售额提升 60%,并节省 75+ 小时。相关 AI 工具覆盖业务构建、运营和销售环节。
GitHub Copilot 应用中的 canvas 是运行在应用内、无浏览器界面的 full-stack app,可与 Agent 双向通信,让用户为具体任务生成定制界面。文章以 Connect 4、Winget、SQLite 和开发工作流为例,展示 canvas 如何支持游戏交互、本地包管理、数据库操作和流程自动化。
推荐理由:文章通过 Connect 4、Winget、SQLite 和开发流程案例,说明 GitHub Copilot canvas 如何把智能体交互转成可操作的任务界面。
基于 GitHub Security Lab Taskflow Agent 构建的 Fuzzing Taskflow,可为 C/C++ 项目自动完成入口识别、构建分析、harness 编写、AFL++ 运行、覆盖率改进、崩溃分诊和漏洞报告生成。
推荐理由:文章具体拆解了 Fuzzing Taskflow 如何把 C/C++ 模糊测试中的 harness 编写、覆盖率反馈和崩溃分诊交给 LLM agent,并说明运行时的安全边界。
GitHub 在 GitHub Copilot app 中重建了 Pull Request 视图,使包含 2,200 个文件、超过一百万行变更和 400 多条行内评论的超大 PR 仍能打开和滚动。新架构将代码行与动态评论分开处理,通过惰性测量、滚动锚定、缓存和自动化性能探针,减少评论高度变化带来的跳动与空白。
推荐理由:文章拆解了 GitHub Copilot 如何用双重几何、惰性测量和自动化探针,让超大 Pull Request 的滚动与评论渲染保持稳定。
Airbnb 正扩大工程团队对 GPT-6 Astra 与 OpenAI 前沿模型的访问,帮助团队解决 bug、设计系统并更快交付。此次扩展聚焦工程场景,覆盖问题修复、系统设计和产品交付。
GitHub Podcast 最新一期拆解五个 AI 热点观点,认为 AI 生成的代码仍需审查,Skills 与 MCP、RAG 并非互相替代。代码审查应按风险分配精力,开发者仍需理解并对结果负责。MCP 负责连接工具和数据,Skills 提供流程与专业知识,RAG 用于检索模型训练数据之外的相关信息。
GitHub Copilot 团队使用 GitHub Copilot app 和 Copilot CLI,将 Copilot agent runtime 从 TypeScript 重写为超过 800,000 行生产 Rust,主要代码由 AI agents 编写,历经 128 个 pull requests,并在数月内由一名开发者主导完成。
推荐理由:文章以 GitHub Copilot runtime 的 Rust 重写为案例,梳理渐进式迁移、跨语言互操作和人机协作中的具体做法。
ChatGPT Work 和 Codex analytics 帮助团队了解 AI 的使用情况与支出,并将 AI 采用情况与业务成果建立联系。相关分析还能识别团队的培训需求。
GitHub 日本和韩国市场的营销负责人使用 GitHub Copilot,将活动策划、报名筛选和会后跟进串成由 GitHub Issue 触发的自动化流程。GitHub Actions 负责创建落地页、生成 UTM 链接、处理名单和更新项目看板,GitHub Copilot skills 则以 SKILL.md 描述灵活的会后步骤。
推荐理由:文章给出一套从 Issue 表单、标签和 Actions 到 SKILL.md 的营销自动化实践,展示如何在保留人工审批的同时减少跨工具重复操作。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可运行的能力,旨在帮助工程师减少代码审查、交付更多软件。
GitHub Copilot app 将 diff、terminal 和 browser 作为内置面板,让用户在同一处审查 Agent 的代码变更、运行项目命令并预览网站效果。用户可以通过 Pick & Polish 工具选择界面元素并让 Agent 调整,确认功能可用后直接接受变更并创建 pull request。
推荐理由:文章把审查代码变更、运行命令和浏览器预览串成一套流程,帮助读者在接受 Agent 生成的代码前完成验证。
Mistral AI 协助一家欧洲能源运营商将40,000行 Fortran 77 迁移到 C++,目标系统是没有测试套件和集中式文档的物理密集型储层模拟器。团队先建立数值对齐测试框架并整理代码文档,再按模块组织规划、实现、测试和审查流程,由人工审核 PR;首个 sprint 覆盖了300,000行代码中的40,000行。
推荐理由:文章把复杂遗留代码迁移拆成文档整理、数值对齐和分模块协作三步,呈现了 AI 智能体在人工审核下落地的具体路径。
OpenAI 发布 GPT-6 Astra,称其为面向企业最强大的模型,具备高级推理、计算机使用以及更强的写作和设计判断能力。
推荐理由:摘要列出 GPT-6 Astra 在推理、计算机使用、写作和设计判断方面的能力侧重,可帮助读者快速了解其面向企业工作的定位。
MIT 研究者借助 GPT-5.6 Sol 与 Codex,自主运行量子计算实验、分析实验结果并校准 qubits。该应用将模型能力用于量子计算实验流程。
1Password 工程师使用 Codex 快速构建新功能和内部工具,将工程生产力提升 21%,并达到生产就绪状态。整个过程中,他们仍遵循严格的安全策略。
GitHub Copilot 推出 Project HydraFusion 研究预览,可在运行时从多个提供商的模型中选择并编排执行流程。HydraFusion目前支持 Single、Cascade 和 Critique 三种模式,并通过 Copilot CLI 的 /experimental 向所有 GitHub Copilot 计划用户开放。
推荐理由:GitHub Copilot 将多模型选择、评审与升级纳入运行时流程,并用三项 agentic coding 基准展示质量与成本之间的具体权衡。
GitHub Copilot app 支持通过彼此独立的 Agent session 同时运行多个任务,任务之间不会互相干扰。每个 session 使用独立的 Git worktree 并保留自己的上下文,用户可在 sessions view 中查看进度和结果。文章以添加 funded sort、进行无障碍检查和运行测试为例,展示并行处理方式。
推荐理由:文章以 Git worktrees 和独立上下文为主线,说明如何在 GitHub Copilot app 中并行安排开发、无障碍检查与测试任务。
作者用 TRL 和 OpenEnv 复现水彩画代码训练方法,通过 GRPO 训练 Qwen3.5-35B-A3B,让模型编写调用 p5.brush 的 JavaScript,并向个人审美偏好靠拢。
推荐理由:将通用审美评分与人工筛选参考图的对比奖励分开实验,展示了减少劣质输出与贴近个人画风是两种不同的训练目标。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与智能体工作流,后者面向网络安全。
推荐理由:文章同时给出 Gemini 3.8 Flash 在长程编码与多步推理上的基准表现,以及 Cyber 版本的漏洞发现、修复和使用门槛,便于比较两种定位。
IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。
推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。
Gradio 的 gr.Workflow 将 AI 流程表示为带类型节点的图,提供可拖放画布,让每个节点都能运行并查看中间结果。同一张工作流图还可作为 REST API,并通过一条命令部署到 Hugging Face Spaces。
推荐理由:文章通过图像编辑、媒体工作室、数据集分析和 ZeroGPU 动画示例,展示 gr.Workflow 如何把可视化调试、API 调用与部署整合到同一张工作流图中。
Google DeepMind 发布 Gemini 3.7 Flash,称其在编码、知识工作和 Web 开发流程上较 Gemini 3.6 Flash 有明显提升。
推荐理由:Gemini 3.7 Flash 的基准对比、价格和接入方式较为完整,便于判断其在编码与智能体工作流中的升级幅度和适用场景。
IBM Research 将 K-Search 扩展为支持 MLX 的后端,并通过结构化 CUDA-to-MLX 翻译层,把 CUDA 内核优化经验迁移到 Apple Silicon。
推荐理由:文章展示了如何把 CUDA 内核中的优化经验结构化迁移到 MLX,并以 Attention 和 Mamba SSM 实测说明翻译层对 Apple Silicon 性能的影响。
Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。
推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调、用于快速发现、验证和修复软件漏洞的轻量网络安全模型。
推荐理由:原文结合 CyberGym、Big Sleep 和生产扫描结果,展示了轻量模型在漏洞发现与修复任务中的性能和规模化使用方式。
Mistral AI 发布 Leanstral 1.5,这是一款采用 Apache-2.0 许可、119B 总参数且仅 6B active parameters 的模型,面向 Lean 4 形式化验证。
推荐理由:文章同时给出形式化数学基准、成本对比和真实代码验证案例,便于评估 Lean 4 证明智能体从题目求解到仓库级任务的实际能力。
ScarfBench 是一个用于评估 AI 智能体执行企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus。基准包含 34 个应用、204 个迁移任务和约 151K 行代码,要求应用完成构建、部署并通过行为验证;当前最强智能体的行为成功率仍低于 10%。
推荐理由:ScarfBench把企业 Java 框架迁移拆成构建、部署和行为验证,揭示编码智能体在可编译代码之外仍受配置与运行环境依赖影响。
Mistral 发布 Vibe,将 Le Chat 的工作能力与编码能力整合为一个可处理长时、多步骤任务的 AI 智能体。Work Mode 支持跨企业工具执行研究、数据分析和文档撰写,Code Mode 则可连接 GitHub,在网页、VS Code 和 CLI 中完成编码任务并生成 pull request。
推荐理由:文章同时梳理了 Vibe 的工作与编码模式、连接器和部署方案,并列出套餐与 Le Chat 迁移安排,便于判断其适用场景。
Mistral AI 发布 Mistral Medium 3.5 public preview,这是一款 128B dense open-weight 模型,成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:文章同时交代模型规格、编码基准与部署方式,并说明它如何支撑云端并行编码和多步骤工作流。
Google Research 发布由 Gemini 驱动的 Empirical Research Assistance(ERA),并开始通过 Gemini for Science 逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery。
推荐理由:文章把 ERA 的研究结果、科学问题案例与开放路径放在一起,便于了解它如何从代码优化系统走向可供科研人员试用的工具。
Google DeepMind 发布 Gemini 3.5 系列并首先推出 Gemini 3.5 Flash,定位为面向智能体和编码的高速模型。
推荐理由:文章同时交代 Gemini 3.5 Flash 在智能体、编码和多模态基准上的具体表现,以及面向个人、开发者和企业的开放入口,便于理解其应用范围。
Google DeepMind 发布报告称,Gemini 驱动的编码智能体 AlphaEvolve 已从试点工具扩展为 Google 基础设施的核心组件,并用于商业场景。
推荐理由:文章集中展示 AlphaEvolve 在科研、基础设施和商业场景中的应用,用具体指标说明算法优化能力如何迁移到不同领域。
Google Research在 ICLR 论文中提出 ReasoningBank,从智能体的成功与失败经验中提炼结构化推理记忆,并通过 MaTTS 支持测试时自我演化。
推荐理由:文章展示了如何把成功与失败轨迹提炼为可复用的推理记忆,并用 WebArena 与 SWE-Bench-Verified 结果说明其效果与效率变化。
Mistral AI 介绍 Spaces CLI,它可通过 `spaces init`、`spaces dev` 等命令搭建多服务项目,并生成配置文件与 Dockerfiles。为支持编码智能体,Spaces 为交互输入提供 flag 等价方式,使用插件注册表返回结构化数据,并在项目初始化时生成 context.json 和 AGENTS.md;文中示例从提示到部署耗时不到 10 分钟。
推荐理由:文章将交互输入、显式状态和结构化上下文落到 CLI 设计中,给面向智能体的开发工具提供了可复用的实现思路。