跳到正文

现象与趋势

正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。

最新精选

第 1–9 条 · 共 9 条
9月30日周三
  1. The Decoder83

    Anthropic称开放权重GLM-5.3在漏洞利用开发上接近Claude Mythos Preview

    Anthropic的评估称,开放权重GLM-5.3在漏洞利用开发上接近Claude Mythos Preview,在ExploitBench中410次尝试成功50次,对比后者的56次;在内部二进制利用测试中,二者接管目标程序的比例分别为4%和6%。

    推荐理由:文章将GLM-5.3与Claude Mythos Preview及其他模型放在漏洞利用基准中比较,并补充开放权重模型安全防护易被移除的测试结果。

9月25日周五
  1. Latent Space76

    Runway 的 WorldPrompt 与实时世界模型工程

    Runway 在 GWM Worlds 2 研究预览中推出 WorldPrompt,可固定模拟环境的部分要素并创建带时间戳的事件,也支持实时提示动作。GWM Worlds 2 能以 720p、24 fps 视频和 48,000 Hz 音频生成交互世界,其实时化依赖自回归生成与蒸馏。文章还讨论了误差累积、长时记忆、因果性和无结构状态等限制,以及世界模型在游戏、机器人和智能体测试中的用途。

    推荐理由:文章结合 WorldPrompt 的控制方式与实时生成的工程难题,梳理世界模型在游戏、机器人和智能体测试中的应用路径。

9月22日周二
  1. NVIDIA Blog63

    NVIDIA为何强调物理 AI 规模化部署需要全层级安全

    NVIDIA指出,物理 AI 从研究走向大规模部署后,自动驾驶汽车和机器人需要在硬件、软件、AI 行为、运行环境及整个部署生命周期中持续满足安全要求。NVIDIA介绍了覆盖 AV 与机器人的 NVIDIA Halos 全栈安全系统,以及仿真、合成数据、运行时监控和第三方评估等安全基础设施。

    推荐理由:文章把物理 AI 的安全拆解到硬件、软件、AI 行为、运行环境和部署生命周期,并以 NVIDIA Halos 展示 AV 与机器人场景的工程化路径。

9月21日周一
  1. MIT Technology Review · AI77

    MIT Technology Review调查美国边境“虚拟墙”并提出四项改进建议

    MIT Technology Review调查发现,美国边境“虚拟墙”监控塔附近有人员未被探测或及时发现并死亡,现有数据不足以完整评估系统效果。调查分析了近600座监控塔,估计已有超过1,050人死于其附近,而政府称目前运行约800座。文章建议美国海关与边境保护局审计相关死亡、改进死亡数据追踪、记录监控技术促成的抓捕,并调查可能属于监控失效的死亡案件。

    推荐理由:文章以对近600座边境监控塔及相关死亡记录的调查为基础,梳理数据追踪、设备审计和死亡复盘中的缺口,并提出四项改进方向。

8月21日周五
  1. Google DeepMind65

    Google DeepMind 携手 Fenris Creations 推进 EVE 宇宙 AI 游戏研究

    Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。

    推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。

8月14日周五
  1. Hugging Face Blog81

    Hugging Face《开放模型现状:2026 夏季观察》分析开放模型生态变化

    Hugging Face发布《开放模型现状:2026 夏季观察》,基于2026年前七个月的 Hub 数据分析开放模型生态变化。报告显示,公共模型仓库从2.43 million增至2.96 million,数据集从711,000增至1 million,Qwen衍生模型达到151,448个。

    推荐理由:报告将模型下载、点赞与衍生仓库分开观察,呈现中国大模型、Qwen生态和智能体流量在开放模型体系中的不同位置。

8月13日周四
7月16日周四
  1. Hugging Face Blog63

    Agent 中的模型路由看似简单,直到它变得复杂

    作者将 Agent 中的模型路由从分类问题转为同时优化成本、质量和延迟的系统优化问题。在 AppWorld Test Challenge 的 417 个任务中,使用同一 CodeAct agent 时,Claude Sonnet 4.6 总成本为 $79,而 GPT-4.1 为 $155,缓存读取价格差异是重要原因之一。

    推荐理由:文章用实测数据说明模型路由的真实成本受缓存、基础设施和治理约束共同影响,适合用于理解智能体路由的系统优化视角。

3月18日周三
  1. Google Research64

    Google Research 在 The Check Up 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。

    推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。