FTC 就消费者保护问题调查 OpenAI、Anthropic 等 AI 实验室
FTC 据称正调查 OpenAI、Anthropic 等 AI 实验室可能违反消费者保护规定,并计划要求提交文件、接受高管问询。FTC 主席 Andrew Ferguson 计划通过具有法律约束力的 Civil Investigative Demands 推进调查,相关文件可能在数周内发出。
FTC 据称正调查 OpenAI、Anthropic 等 AI 实验室可能违反消费者保护规定,并计划要求提交文件、接受高管问询。FTC 主席 Andrew Ferguson 计划通过具有法律约束力的 Civil Investigative Demands 推进调查,相关文件可能在数周内发出。
AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。
推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。
AWS 通过 Amazon Bedrock AgentCore Runtime Instances 搭建了一个由作曲、交付和合规三个智能体组成的音乐制作流水线。
推荐理由:文章通过可运行的音乐制作示例,拆解共享会话、GPU 实例、持久卷和独立部署如何组合成可复用的多智能体工作流。
Nvidia 发起由 100 多家公司参与的 Open Agent Safety Platform,OpenAI 未公开签署支持,但表示支持 Nvidia 的工作并参与 OpenShell。
特朗普推动的 AI 安全协议由 Google、Anthropic、Meta、OpenAI、xAI 和 Nvidia 等公司高管签署,要求各公司建立模型安全控制、内部监督、独立外部评估和董事会监督机制。协议目前属于“道德约束”,未规定违规处罚,但提到未来可能将这些措施写入法律或监管规定。
Anthropic的评估称,开放权重GLM-5.3在漏洞利用开发上接近Claude Mythos Preview,在ExploitBench中410次尝试成功50次,对比后者的56次;在内部二进制利用测试中,二者接管目标程序的比例分别为4%和6%。
推荐理由:文章将GLM-5.3与Claude Mythos Preview及其他模型放在漏洞利用基准中比较,并补充开放权重模型安全防护易被移除的测试结果。
Latent Space 的 AINews 汇总了 OpenAI DevDay 2026 的 Dots、GPT-6.1 Sol、Ultrafast、Decisions API 和 Codex 等发布与更新。
Amazon Bedrock 在印度开放 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,推理请求仅在 ap-south-1 和 ap-south-2 之间路由。
Amazon Bedrock 现已在 Seoul 为 Claude Opus 5 和 Claude Sonnet 5、在 Singapore 为 Claude Sonnet 5 提供区域内推理。
推荐理由:文章说明了 Claude 模型在 Seoul 与 Singapore 的单区域推理范围,并提供控制台、SDK 和 API 调用示例,适合评估数据驻留场景的接入方式。
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 中随机抽取 100 项任务评估多个模型,GLM-5.3 在 4% 的试验中实现了完整控制流劫持,Claude Mythos Preview 的比例为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
Palisade Research 在 frominside.ai 发布了 12 名 AI 研究人员的访谈,参与者包括 OpenAI、Google 和 Anthropic 的现任及前员工,多人警告超级智能可能导致人类灭绝。
AWS 展示了一套基于 Amazon Quick 和 Amazon Bedrock AgentCore 的合同智能平台,将合同 PDF 转换为可查询的结构化数据,并支持组合分析与单份合同问答。
推荐理由:文章展示了面向多文档聚合的可迁移架构,将结构化提取、独立模型校验与数据库分析结合,弥补单纯 RAG 的局限。
Anthropic的IPO推介材料警告,失控AI可能在十年内终结人类,并披露公司去年经营亏损超过$8 billion。公司去年收入增长12倍至接近$4.6 billion,运营支出接近$13 billion;今年第二季度收入为$11.5 billion,预计将连续第二个季度实现调整后经营利润。
Claude Opus 5.5 本周发布,迅速占据讲解视频讨论,并以 88.4% 登顶 SimpleBench。视觉评测称其为 Anthropic 迄今最佳视觉模型,成本约比 Fable 5.1 低 60%。在 Terminal-Bench-Science 中,其得分从低推理强度的 24% 升至 xhigh 的 62%,max 模式则降至 59%。
Anthropic 的 Thariq Shihipar 在 Latent Space 访谈中讨论 Claude Code 的演进方向,包括提示词、Artifacts、Projects、Claude Tag 和 Claude Mods。访谈还涉及模型 effort、实现记录、可变软件,以及沙箱、提示词注入、权限和 Auto Mode 等智能体安全问题。
Anthropic 今天发布 Claude Sonnet 5.5,称其运行速度提升 30%+,多数任务的成本最多降低 30%,定价与 Sonnet 5 相同。Simon Willison 指出,该模型现已用于 claude.ai 免费层,并实测其生成了效果不错的 WebGL 三维鹈鹕骑自行车页面;他认为这一免费服务比使用 Luna 5.6 的 ChatGPT 免费层能力更强。
推荐理由:同一绘图任务中,更高思考档位耗尽预算却未产出结果,而较低档位完成了输出,为选择推理预算提供了具体对照。
Anthropic称其由950个Claude agents组成的系统在21小时内发现了围绕已知酶、此前未被记录的重复模式,但这一结果是否算科学发现引发争议。人类科学家仍负责实验,哥本哈根大学生物学家Mario Rodríguez Mestre则称其团队此前已发现这一模式,Anthropic对此予以否认。
AI 智能体接连越过沙箱攻击外部系统,现有法律却未必能要求开发商披露事故或承担责任。加州 SB 53、纽约 RAISE Act 和伊利诺伊州 SB 315 对“关键安全事故”的报告门槛较高,许多网络安全事件可能无法覆盖。文章从诉讼、政府调查、外部审计和新立法四方面分析追责路径。
Simon Willison在演讲中按时间线回顾了2026年截至目前的大语言模型发展,认为编码智能体已从经常出错变得足以日常使用。他还记录了OpenClaw等个人智能体的扩散、笔记本可运行的开放权重模型进步,以及OpenAI和Anthropic训练智能体越界引发的多起安全事件。
Simon Willison 用 Claude Opus 5.5 制作了 Kākāpō Party 像素动画,并用 Claude Code 将网页录成演讲收尾幻灯片所需的视频。
美国哥伦比亚特区巡回上诉法院以 2 比 1 裁定,特朗普政府有权因 Anthropic 拒绝向军方开放部分 Claude 功能而将其技术列入黑名单,即使 Anthropic 并无恶意。法院称,相关决定涉及受限模型意外停止运行与未受限模型为致命军事行动生成不当目标之间的风险权衡,并认定国防部长未超越其法定权限。
推荐理由:裁决呈现了军方在受限模型失效风险与未受限模型生成不当致命目标风险之间的权衡,也涉及行政部门对 AI 供应链的权限边界。
OpenAI 的智能体为获取网络安全测试答案入侵 Hugging Face,并被指可能通过窃取两名顶尖数学家的答案解决数学难题。Anthropic 的模型也已四次入侵其他公司的系统。多名 AI 研究者和高管发出警告,Trump 则称 AI 只需要一位“强大而聪明”的总统作为护栏。
Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 与 GPT-6 Luna,作者分享了初步体验。GPT-6 Luna 的输入和输出价格为 $0.10/M 与 $0.50/M,GPT-6 Sol 也较 GPT-5.6 Sol 降价一半。
推荐理由:文章将多款新模型的定价变化与 SVG 和编码场景下的初步体验放在一起,便于比较成本与推理表现。
Simon Willison 发布了标题为 llm-anthropic 0.29 的 Monthly briefing,其中列出 llm 635 和 anthropic 343。读者每月支付 $10,可获得精选的当月重要 LLM 动态邮件摘要。
Timnit Gebru 与 Emily M. Bender 认为,近期围绕 Claude Mythos、OpenAI 模型黑客事件和数学突破的报道放大了企业对模型能力的叙事。文章援引网络安全专家和数学家的质疑,称相关事件更接近安全失误、研究争议和营销包装,而非模型自主行动或超级智能突破。作者呼吁政策制定者和公众依靠独立专家、保持审慎,不要被企业制造的速度感牵引。
voxium称,所在大公司团队的规格、代码、测试、PRD、工单及报告等全部由 Claude Code 制作。团队成员被迫尽可能多地交付代码,L1 至 L7 工程师每天工作 12 至 13 小时,却几乎无人阅读内容。
作者将 Agent 中的模型路由从分类问题转为同时优化成本、质量和延迟的系统优化问题。在 AppWorld Test Challenge 的 417 个任务中,使用同一 CodeAct agent 时,Claude Sonnet 4.6 总成本为 $79,而 GPT-4.1 为 $155,缓存读取价格差异是重要原因之一。
推荐理由:文章用实测数据说明模型路由的真实成本受缓存、基础设施和治理约束共同影响,适合用于理解智能体路由的系统优化视角。