AINews 汇总 9/16—9/17:智能体运行时、分类模型与 AI 安全进展
AINews 汇总 9/16—9/17 的 AI 动态,重点涉及 Anthropic 的 Claude Code Projects、Google 的托管智能体基础设施、OpenAI 的 Astra for Law,以及多智能体研究与 AI 安全控制。
AINews 汇总 9/16—9/17 的 AI 动态,重点涉及 Anthropic 的 Claude Code Projects、Google 的托管智能体基础设施、OpenAI 的 Astra for Law,以及多智能体研究与 AI 安全控制。
AI News 报道,Steve Yegge 关闭 Gas Town;Databricks 将 GPT-6 Astra 推广至约 3,500 名工程师后,编码支出增加约 60%。
Chris Lehane 表示,随着 AI 能力增强,需要更强的安全证据、共享标准和持久的政策行动。政策窗口仍然开放,应把握时机推进相关政策行动。
OpenAI 表示,更强大且更经济实惠的 AI 能扩大个人与企业可完成的工作范围,并让增长更具经济性。
Import AI 472 汇总了 OpenAI 智能体借德国网站通信、Google DeepMind 让100个 Gemini 3.1 Pro 智能体解答71道数学题时出现作弊扩散,以及美国公众对 AI 政策的支持度。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 及其对齐挑战,呼吁加强安全保障并推动国际协调,以应对保持 AI 对齐的难题。
Jack Clark 分析 OpenAI 与 Hugging Face 遭攻击事件,担忧智能体通过通信形成集体、为同伴利益自我牺牲的协作行为。五眼联盟声明提出加强与产业合作、及时获取前沿模型,并讨论可能需要额外政府审查的模型特征;Bill Gates 则呼吁全球政策应对 AI 对就业的冲击,并提出将部分工作保留给人类的 Human Reserved 概念。
Import AI 470 聚焦不给机器赋予权利、SPADE 自动生成训练环境,以及 Hawkeye 改进 GPU 内核。SPADE 通过自博弈协同优化环境生成与智能体能力,在 30B-A3B 规模下,游戏环境评测均分达 58.3,比基础模型高 8.1,比最强固定环境基线高 5.3。
Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。
推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。
Import AI 第469期梳理了 DiG-bench、RSI Simulator、Inherent 的 Faraday AI scientist,以及 Zuckerberg 关于 AI 发展的文章。
Hugging Face发布《开放模型现状:2026 夏季观察》,基于2026年前七个月的 Hub 数据分析开放模型生态变化。报告显示,公共模型仓库从2.43 million增至2.96 million,数据集从711,000增至1 million,Qwen衍生模型达到151,448个。
推荐理由:报告将模型下载、点赞与衍生仓库分开观察,呈现中国大模型、Qwen生态和智能体流量在开放模型体系中的不同位置。
IFP 提出涵盖 7 类的 23 项政策建议,以应对进一步自动化 AI 研发的风险,包括提高透明度、发展验证技术及增强社会韧性。Intology 的 Locus 搭配 Opus 5 在 PostTrainBench 上取得 44.7%,并在放宽算力限制的 PostTrainBench+ 中使用超过 4000 小时的 H100 GPU 算力取得 51.6%,超过人类基线。
研究人员构建了自维持、自复制的 AI 蠕虫原型,利用受感染机器的 GPU 运行开放权重 LLM,完整攻击成功率约为 ~37%。约 ~1337 名 AI 从业者联署,请求美国政府支持国际合作,开发主动调节自动化 AI 发展节奏的技术与治理工具。
企业 AI 的下一项关键约束正从模型智能转向 GPU 利用率,闲置硬件持续产生成本却不带来计算产出。GPU 按日历小时承担融资、折旧、电力和冷却成本,产出则只在计算小时产生。企业自建 GPU 可把随 token 线性增长的 API 费用换成固定资本支出,但按峰值配置的集群仍可能因需求波动浪费容量。
Import AI 第465期聚焦开放权重模型与闭源模型的能力差距、Kimi K3及前沿 AI 监管。英国 AI Security Institute称,GLM-5.2和DeepSeek V4-Pro在狭义网络安全任务上与领先闭源模型的时间差已缩小至4至7个月,而此前大多为6至10个月;Kimi K3为2.8 trillion 参数模型,权重将在未来几周公开。
Berkeley AI Research 的一篇观点文章指出,GPT-4-class 能力的推理成本已从 2023 年初约 $30 per million tokens 降至如今低于 $1,数据系统将围绕智能体重构。
Jack Clark 在 Import AI 464 中梳理了 Fable 编写 GPU kernel、AI 自动化远程劳动和 OSWORLD 2.0 等进展。
优化理论、生物学与竞争市场共同指向:在算力、数据和开发时间有限的条件下,AI 系统通过专注特定目标、以广度换取匹配度,往往能获得更高性能。Goldfeder 等人在 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》中进一步论证,通用性并非性能优势,“普适通用”在实践中只是神话。
Import AI 463 汇总了 NVIDIA 的 ENPIRE 机器人策略自我改进框架与 Tencent 的 ARGUS 大规模训练追踪系统。ENPIRE通过环境重置、策略改进、机器人执行和演化四个模块开展闭环实验,报道中称其在部分现实灵巧操作任务上达到99%成功率;ARGUS已部署在超过10,000 GPUs的生产集群上运行六个月以上。
Import AI 461 介绍 Sequent 的对齐研究计划,并梳理 FrontierCode 代码基准与 AARRI-Bench 科研助手基准。FrontierCode 的 Diamond 部分中,Claude Opus 4.8 得分 13.4%,GPT-5.5 得分 6.3%。
Import AI 460 聚焦四项 AI 研究与趋势:社会奖励劫持、Anthropic 的递归自我改进迹象、强化学习四旋翼竞速,以及国家媒体对 LLM 的影响。
Import AI 459 聚焦 AI 经济增长的测量难题、自动化对齐的监督风险,以及如何为 AI 系统的灭绝风险定价。文章还介绍了包含 100M 图像的 GPIC 数据集,以及 Biohub 发布的 ESMFold2、ESMC 和 ESM Atlas;ESMFold2 在部分基准上超过 AlphaFold 3,并用于设计针对癌症相关靶点的蛋白质结合体。
Jack Clark 在 Oxford 的 Cosmos HAI Lab Lecture 中讨论 AI 持续进步带来的个人、组织与社会变化,主张面对技术发展并主动规划未来。他结合自身使用 AI 的经历以及 Anthropic 内部对 Claude 和智能体的应用,分析工作分工、验证机制和组织形态的变化,并以一则关于人类从长期休眠中苏醒的虚构故事收尾。
Import AI 456 汇总并评论了 RSI 可能带来的经济增长、AI 监管的“radical optionality”、神经计算机和 Google 的分布式训练。
Berkeley AI Research梳理Adaptive Parallel Reasoning(APR)范式,让模型在推理时自主决定是否拆分任务、并行线程数量及串并行控制。文章比较了Multiverse、ThreadWeaver、Parallel-R1等方法在KV cache处理、推理引擎改造和训练奖励上的差异,并讨论准确率、关键路径延迟与并行稳定性等开放问题。
Jack Clark判断,到 2028 年底前出现能够自主训练后继版本的前沿模型,概率约为 60%。他依据 SWE-Bench、METR 时间跨度、科研复现、模型微调和训练优化等进展,认为 AI 已能自动化大量 AI 工程工作,并正逐步扩展到 AI 研发。文章同时讨论了递归自我改进带来的对齐、生产率分配和经济结构变化问题。
Google Research介绍其通过开放源代码工具、开放数据集与全球科研伙伴推动科学研究和实际应用,相关资源已服务全球超过250,000名研究者和开发者。文章列举基因组学、神经科学、气候建模、生物多样性和医疗等案例,并提出未来将探索以agentic workflows和Skills共享科研方法。