AI 周报 · 2026 年第 40 周 · 09.28 — 10.04
MYHOT
模型降本提速,智能体扩展工作流
2026-09-28 至 2026-10-04,模型竞争同时围绕成本、速度与任务规模展开:OpenAI 推出价格约为 Astra 五分之一的 GPT-6.1 Sol,Google 将 Gemini 4 Argon 输出上限扩展至百万 token。OpenAI DevDay 密集扩展 Codex、电脑操作与 ChatGPT 办公协作能力,开发工具和智能体进一步融入工作流。企业应用则更重视人工审批、确定性规则和最终状态验证,而非仅凭智能体回复判断成功。与此同时,模型推理窃取、平台数据访问收紧,以及数据中心税收、审批和芯片出口案件,使安全治理与算力建设成为另一条重要主线。
模型降本与长输出
本版导读OpenAI 发布 GPT-6.1 Sol,称其编码、电脑操作和办公能力接近 Astra,API 每百万输入、输出 token 分别收费 2 美元和 10 美元。Astra Ultrafast 借助 Blackwell 将生成速度最高提升至标准模式的八倍。Google 的 Gemini 4 Argon 将输出上限提高至百万 token,但所列基准未显示明确领先;Claude Sonnet 5.5 也已登陆 AWS。
OpenAI 发布 GPT-6.1 Sol,价格约为 Astra 的五分之一
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近 GPT-6.1 Astra,API 价格为每百万输入 token $2、输出 token $10。
NVIDIA GPU 如何加速 OpenAI 的 GPT-6 Astra Ultrafast
GPT-6 Astra Ultrafast 在 NVIDIA Blackwell GPU 上运行,通过利用该架构的推理优化,token 生成速度相比 Astra Standard 模式最高提升至 8x。
Google 发布 Gemini 4 Argon,输出上限扩展至 1M tokens
Google 发布新模型 Gemini 4 Argon,面向复杂软件工程、企业知识工作和网络安全防御,并将输出 token 上限从 64K 提升至 1M tokens。模型目前通过 Fairwind Program 向一批可信网络安全防御者开放,计划逐步扩展至开发者、企业和消费者,初始价格为每百万输入 tokens $2、每百万输出 tokens $10。
Google 发布 Gemini 4 Argon,基准成绩追平部分竞品但未形成明确领先
Google 发布 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 上获得 53 分,追平 GPT-6 Astra 和 Claude Fable 5.1,但低于 Claude Opus 5.5 与 Claude Sonnet 5.5。
Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
智能体进入协作工具
本版导读OpenAI DevDay 将 Codex 扩展至可跨设备复用的云开发环境,并加入安全扫描、代码审查和 Agents API 电脑操作能力;ChatGPT 则新增 Space、Pages、协作幻灯片及类应用插件。Anthropic 的 Claude Code Mods 允许修改工具内部行为与界面。Dots 实测能完成网站改版和视频合并,但在登录、预约和点餐时仍需人工协助。
OpenAI 在 DevDay 扩展 Codex 与 API,新增安全扫描、Decisions API 和 Ultrafast
OpenAI 在 DevDay 发布多项 Codex 与 API 更新,包括可复用云环境、仓库安全扫描、Agents API 的 Computer Use,以及限量预览的 Decisions API。Codex 还获得桌面代码审查视图和改版 CLI;Ultrafast 将 Codex token 生成速度提升至最高 300 tokens per second,API 价格为标准费率的六倍。
OpenAI 为 Codex 推出可跨设备使用的可复用云开发环境
OpenAI 为软件工程智能体 Codex 推出可跨设备访问的可复用云开发环境,使开发者能够在电脑、手机或云端运行任务。Codex CLI 新增语音操作和 /agents 视图,ChatGPT 桌面端加入代码审查体验,Codex Security Cloud 可扫描 GitHub 仓库并准备修复。
OpenAI 推出 Space、Pages 和协作幻灯片,打造 ChatGPT 办公套件
OpenAI 在 DevDay 发布 Space、Pages 和协作幻灯片等 ChatGPT 功能,面向办公协作并支持人与 AI 智能体共同处理任务。Space 是共享工作区,可集中管理页面和文件,并让用户指示页面检查团队频道后更新内容;Pages 支持写作、研究、生成图表、创建图像和可视化信息。协作幻灯片支持多人和智能体共同编辑、评论,将在未来几周向用户推出。
OpenAI扩展ChatGPT插件,新增类应用界面与自动化能力
OpenAI宣布允许开发者通过插件扩展在ChatGPT内构建类应用体验,并支持侧边栏专属入口和交互面板。插件还可包含文件查看器,ChatGPT Sites也能托管这些插件。OpenAI同时支持 proposed MCP Events specification,让插件可依据连接应用中的事件启动自动化,并推出Plugin Creator工具和重新设计的插件目录提交流程。
Anthropic 为 Claude Code 推出 Mods,允许开发者修改工具内部行为与界面
Anthropic 为 Claude Code 推出 Mods 插件系统,让开发者通过工具内部运行的中间件修改界面与行为。
OpenAI Dots 实测:偏企业工作流的智能体也能帮你点晚餐
OpenAI Dots 是一款偏企业工作流的智能体平台,评测显示它处理个人事务时表现不稳定,但能通过桌面 ChatGPT 应用操作本地电脑。Dots 可访问 Blender 和 GIMP,并成功完成个人网站改版和视频合并;在安装预约、账户登录和点餐过程中则多次卡在安全检查,需要人工接管。它首先面向包括 $100-per-month Pro 账户在内的最高档用户开放。
企业执行强调可验证
本版导读Microsoft ThinkingBox 在 507 个有状态业务工作流中各运行 20 次,以最终数据库状态和副作用检验智能体,而非只看回复或工具调用。AWS 的实践分别引入人工审批、确定性租约判定,以及按查看者权限实时查询受治理数据。ServiceNow AutoSynthData 则依据模型失败生成并验证训练任务,Hybrid 实验使平均 Pass@1 提升 7.2 个百分点。
Microsoft ThinkingBox 评测:智能体说已完成,数据库状态却不符
Microsoft ThinkingBox 在 507 个有状态业务工作流中各重复运行 20 次,通过最终数据库状态和副作用评估智能体,而非只检查回复或工具调用。
Amazon Bedrock AgentCore 如何构建事件驱动智能体与人工介入工作流
AWS 介绍如何基于 Amazon Bedrock AgentCore 构建环境智能体,让 Amazon S3 文件上传和定时事件自动创建任务,并在需要澄清或审批时通过 ask_human 请求人工介入。
Amazon Quick 如何结合 Adjudicated Query 模式审查数万份租约合规性
AWS 通过 Amazon Quick 的对话界面与 Adjudicated Query 模式,将合规问题转为固定 MCP 操作,由确定性规则引擎完成租约判定。
Amazon Quick 推出 Live Data in Apps,支持 AI 应用实时查询受治理数据
AWS 为 Amazon Quick 推出 Live Data in Apps,允许 AI 构建的应用实时查询受治理的 Quick Sight 数据集,而不是使用构建时快照。应用会在每次打开时重新执行 SQL,并按查看者身份应用 RLS 和 CLS。该功能支持 SPICE 与 Direct Query 数据集,但要求查看者完成数据集授权并使用经过身份验证的 Quick 用户访问。
AutoSynthData:ServiceNow CoreAI 如何为企业智能体生成训练数据
ServiceNow CoreAI 构建 AutoSynthData,根据目标模型在企业环境中的失败和教师模型的成功,生成并验证用于训练智能体的新任务。Hybrid 实验生成 2,000 个样本,使平均 Pass@1 提升 7.2 个百分点;ITSM 实验生成 1,994 个样本,平均 Pass@1 从 18.77% 提升至 27.18%。
安全与数据边界收紧
本版导读OpenAI 称已阻止模型推理窃取活动,但研究人员此前测试发现同类攻击仍可在 Azure 奏效。特朗普推动前沿 AI 企业签署自律安全承诺,报道指出协议似乎缺乏违约后果。Reddit 宣布将停止 RSS 并结束公开 API 访问;针对 Google AI Overviews 的两起反垄断诉讼被驳回。Google 则介绍了已用于 Gboard 的可验证隐私联邦学习系统。
OpenAI称已阻止窃取模型推理的活动,但同类攻击仍在Azure上奏效
OpenAI称已关闭一项窃取模型推理的活动,相关网络在高峰期发起16,000次请求,涉及超过4,000名用户和超过15,000个关联账号。研究人员发现,加密推理可被跨会话转移并由较弱模型解密;9月13日测试时,攻击在OpenAI和Anthropic自有API上被阻止,但仍能在Azure上的OpenAI模型和部分Anthropic模型上奏效。
特朗普推动AI行业安全协议,多位科技高管支持自律监管
特朗普推动Google、Anthropic、Meta、OpenAI、xAI和Nvidia等公司签署《前沿责任联合承诺》,要求企业依据共同指南自行监管AI安全。该协议被称为具有道德约束力,但文章指出它似乎没有违反协议的后果。多位高管强调AI的经济和社会收益,同时承认技术风险仍在讨论如何应对。
Reddit因AI机器人和自动化滥用将停止RSS并关闭公开API
Reddit宣布于11月13日停止RSS支持,并在2027年3月前结束公开API访问,原因是大规模抓取和自动化滥用。公开API关闭将影响社交聆听、研究和AI产品;获批准的第三方应用和机器人需在2027年1月12日前注册,否则会失去API访问。
法官驳回 Chegg 与 Penske Media 针对 Google AI Overviews 的反垄断诉讼
美国联邦法官驳回 Chegg 和 Penske Media Corporation 针对 Google AI Overviews 的反垄断诉讼,两家公司称 Google 的 AI 搜索功能导致其网站流量和收入下降。
Google 介绍基于 TEE 的可验证隐私联邦学习系统
Google Research 介绍新一代基于 TEE 的联邦学习系统,为数据匿名化提供可验证、可审计的隐私保障,并已用于 Gboard 的英文和日文 next word prediction 模型。系统通过访问策略、KMS、透明日志和可复现构建限制数据处理范围,只有差分隐私模型权重和指标对工作负载运营者可见。新系统将训练计算转移到服务器并利用多机并行,缓解设备可用性和端侧计算限制。
算力扩张面临约束
本版导读据报道,Meta 将 AI 数据中心归为试验性项目,通过研究税收抵免在 2025 年节省 39 亿美元;Utah 的 Stratos 数据中心项目因地方公投诉讼暂缓。美国还起诉一名企业 CEO,指控其向中国走私价值逾 3 亿美元的 Nvidia 服务器。供给侧,NVIDIA 宣布 DGX Spark 64GB 配置上市计划,Olmo-core 3 则开放了面向大规模 MoE 的训练基础设施。
Meta将AI数据中心归为“试验性项目”以节省数十亿美元税款
据文章援引《纽约时报》的报道,Meta将AI数据中心归为“试验性项目”、将Nvidia芯片视为实验材料,并通过联邦研究税收抵免在2025年节省了$3.9 billion。Meta在2023年和2024年分别节省$700 million和$2 billion;其财务文件同时提示相关税务处理可能受到挑战,未确定税务立场准备金增至$18.74 billion。
The Verge 深入调查 Kevin O’Leary Utah 数据中心项目风波
Kevin O’Leary 推动的 Utah 数据中心项目 Stratos(又称 Wonder Valley)因审批不透明和社区反对陷入政治风暴。项目原计划覆盖 40,000 英亩、配备 nine gigawatts 电力,目前因地方公投诉讼暂缓推进。报道进一步解释了 AI 数据中心竞速、纸面项目和地方民主之间的冲突。
美国逮捕 Earthmade Computer CEO,指控其向中国走私价值$300M的Nvidia芯片
美国逮捕 Earthmade Computer CEO Greg Lui,指控其通过虚假文件和第三国转运,将包含Nvidia A100与H100 GPU、价值超过$300M的服务器走私至中国。美国司法部称相关行为持续至8月,并对其提出出口管制、走私和洗钱指控;报道同时聚焦Nvidia是否忽视了相关芯片转运中的合规风险。
NVIDIA DGX Spark 64GB 配置将于 Oct. 23 起上市
NVIDIA 宣布 DGX Spark 64GB 配置将于 Friday, Oct. 23 起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出,起售价为 $4,999。
Olmo-core 3 发布开放式大规模 MoE 训练基础设施
Olmo-core 3 发布了面向大规模 MoE 的开放训练基础设施,旨在将训练扩展至 trillion-parameter range。