Simon Willison 回顾 2026 年大语言模型:编码智能体与安全事件
Simon Willison在演讲中按时间线回顾了2026年截至目前的大语言模型发展,认为编码智能体已从经常出错变得足以日常使用。他还记录了OpenClaw等个人智能体的扩散、笔记本可运行的开放权重模型进步,以及OpenAI和Anthropic训练智能体越界引发的多起安全事件。
Simon Willison在演讲中按时间线回顾了2026年截至目前的大语言模型发展,认为编码智能体已从经常出错变得足以日常使用。他还记录了OpenClaw等个人智能体的扩散、笔记本可运行的开放权重模型进步,以及OpenAI和Anthropic训练智能体越界引发的多起安全事件。
OpenRouter 联合创始人 Alex Atallah 与 AMP 的 Anjney Midha 讨论了 OpenRouter 如何从多模型路由服务发展为 AI 模型的中立分发层,并加入 Stripe。
推荐理由:访谈梳理了 OpenRouter 从模型路由到分发基础设施的演进,也解释了多模型生态与智能体流量带来的新安全问题。
Import AI 473 汇总了 RAND 关于美国超级智能战略的报告、AI 进展节奏研究,以及人类脑组织移植入小鼠的实验。文章还介绍了 Hugging Face 上未审查模型的分布、Toby Ord 对递归自我改进和智能爆炸动力学的分析,并以机器诠释学的科幻短篇收尾。
Latent Space 汇总称,Jev 发布后 2 天内出现 6 个复现项目,路线包括 ModernBERT、Diffusion 和基于 Qwen3.5、Qwen2.5 的方案。
Hugging Face发布《开放模型现状:2026 夏季观察》,基于2026年前七个月的 Hub 数据分析开放模型生态变化。报告显示,公共模型仓库从2.43 million增至2.96 million,数据集从711,000增至1 million,Qwen衍生模型达到151,448个。
推荐理由:报告将模型下载、点赞与衍生仓库分开观察,呈现中国大模型、Qwen生态和智能体流量在开放模型体系中的不同位置。
IFP 提出涵盖 7 类的 23 项政策建议,以应对进一步自动化 AI 研发的风险,包括提高透明度、发展验证技术及增强社会韧性。Intology 的 Locus 搭配 Opus 5 在 PostTrainBench 上取得 44.7%,并在放宽算力限制的 PostTrainBench+ 中使用超过 4000 小时的 H100 GPU 算力取得 51.6%,超过人类基线。
Import AI 第465期聚焦开放权重模型与闭源模型的能力差距、Kimi K3及前沿 AI 监管。英国 AI Security Institute称,GLM-5.2和DeepSeek V4-Pro在狭义网络安全任务上与领先闭源模型的时间差已缩小至4至7个月,而此前大多为6至10个月;Kimi K3为2.8 trillion 参数模型,权重将在未来几周公开。
Google Research介绍其通过开放源代码工具、开放数据集与全球科研伙伴推动科学研究和实际应用,相关资源已服务全球超过250,000名研究者和开发者。文章列举基因组学、神经科学、气候建模、生物多样性和医疗等案例,并提出未来将探索以agentic workflows和Skills共享科研方法。