跳到正文

#推理

今日 1 条
今天10月1日周四
9月30日周三
  1. NVIDIA Blog74

    CoreWeave 提供 NVIDIA Vera Rubin NVL72 并发布 CoreWeave Forge

    CoreWeave宣布在CoreWeave Cloud提供NVIDIA Vera Rubin NVL72,并发布用于训练、评估和改进模型与智能体的CoreWeave Forge。Cognition测试显示,Vera Rubin NVL72在SWE-2推理工作负载上的总token吞吐量最高达到GB200 NVL72的4.8x;NVIDIA Vera CPU的智能体沙盒启动速度超过3x。

    推荐理由:文章串联了 Vera Rubin、Vera CPU 与 Forge 的产品进展,并给出 Cognition 和 CoreWeave 的实测数据,便于理解智能体从训练到生产的基础设施路径。

  2. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。

    推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。

9月29日周二
  1. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,一款面向表格分类和回归的开放基础模型,可在单次前向推理中直接预测新行,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三种规格,通过 Hugging Face 提供,采用 OpenMDW-1.1 license,支持商业使用。

    推荐理由:材料同时交代了免训练推理、人工数据预训练方式与四项基准结果,便于评估其工程可用性。

  2. Latent Space49

    Opus 5.5 擅长制作讲解视频

    Claude Opus 5.5 本周发布,迅速占据讲解视频讨论,并以 88.4% 登顶 SimpleBench。视觉评测称其为 Anthropic 迄今最佳视觉模型,成本约比 Fable 5.1 低 60%。在 Terminal-Bench-Science 中,其得分从低推理强度的 24% 升至 xhigh 的 62%,max 模式则降至 59%。

  3. Simon Willison79

    Anthropic 发布 Claude Sonnet 5.5,并用于 claude.ai 免费层

    Anthropic 今天发布 Claude Sonnet 5.5,称其运行速度提升 30%+,多数任务的成本最多降低 30%,定价与 Sonnet 5 相同。Simon Willison 指出,该模型现已用于 claude.ai 免费层,并实测其生成了效果不错的 WebGL 三维鹈鹕骑自行车页面;他认为这一免费服务比使用 Luna 5.6 的 ChatGPT 免费层能力更强。

    推荐理由:同一绘图任务中,更高思考档位耗尽预算却未产出结果,而较低档位完成了输出,为选择推理预算提供了具体对照。

9月28日周一
9月26日周六
9月25日周五
  1. Latent Space76

    Runway 的 WorldPrompt 与实时世界模型工程

    Runway 在 GWM Worlds 2 研究预览中推出 WorldPrompt,可固定模拟环境的部分要素并创建带时间戳的事件,也支持实时提示动作。GWM Worlds 2 能以 720p、24 fps 视频和 48,000 Hz 音频生成交互世界,其实时化依赖自回归生成与蒸馏。文章还讨论了误差累积、长时记忆、因果性和无结构状态等限制,以及世界模型在游戏、机器人和智能体测试中的用途。

    推荐理由:文章结合 WorldPrompt 的控制方式与实时生成的工程难题,梳理世界模型在游戏、机器人和智能体测试中的应用路径。

9月24日周四
9月23日周三
  1. Simon Willison87

    Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布,模型价格战升级

    Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 与 GPT-6 Luna,作者分享了初步体验。GPT-6 Luna 的输入和输出价格为 $0.10/M 与 $0.50/M,GPT-6 Sol 也较 GPT-5.6 Sol 降价一半。

    推荐理由:文章将多款新模型的定价变化与 SVG 和编码场景下的初步体验放在一起,便于比较成本与推理表现。

9月22日周二
  1. Simon Willison80

    TypeSafe AI 发布 Jev 决策模型,输出概率化分类结果

    TypeSafe AI 发布 Jev,这是一个将文本或半结构化数据作为输入、输出分类概率、选择分布和数值评分的决策模型。Jev 仅按输入计费,价格为 $0.042 per million tokens,支持并行处理多个问题,适用于分类、排序和搜索重排。

    推荐理由:文章把 Jev 放进决策模型框架,梳理其输入输出、成本与适用任务,也提醒分类结果的黑箱偏差需要通过结构化评测检验。

9月16日周三
  1. NVIDIA Blog67

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐量最高达 GB300 NVL72 的 3.7x

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中首次提交预览结果,在 Qwen3-VL 上的吞吐量最高达到 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上最高达到 2.5x。

    推荐理由:文章将 Vera Rubin NVL72 的模型吞吐、GB300 NVL72 的跨机架扩展效率与软件优化增益放在同一组 MLPerf 结果中,便于比较推理基础设施的长期经济性。

  2. Google Research58

    Retrieve-for-Train 用离线强化学习加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。

9月9日周三
9月7日周一
9月5日周六
  1. GitHub Blog · AI & ML80

    GitHub Copilot 发布 Project HydraFusion 研究预览,支持运行时多模型编排

    GitHub Copilot 推出 Project HydraFusion 研究预览,可在运行时从多个提供商的模型中选择并编排执行流程。HydraFusion目前支持 Single、Cascade 和 Critique 三种模式,并通过 Copilot CLI 的 /experimental 向所有 GitHub Copilot 计划用户开放。

    推荐理由:GitHub Copilot 将多模型选择、评审与升级纳入运行时流程,并用三项 agentic coding 基准展示质量与成本之间的具体权衡。

9月3日周四
9月2日周三
  1. Hugging Face Blog68

    BenchMIRT:LLM 基准测试实际上在测量什么?

    AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。

    推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。

8月25日周二
  1. Hugging Face Blog80

    Granite 4.2 推理模型家族如何构建

    IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。

    推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。

8月24日周一
8月21日周五
8月17日周一
8月14日周五
8月12日周三
  1. Microsoft Research65

    Microsoft Research 发布 CARE-X 胸部 X 光 VLM 研究模型

    Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。

    推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。

8月11日周二
  1. Hugging Face Blog68

    ALTK-Evolve 以更少 tokens 交付智能体记忆,对比 ACE

    ALTK-Evolve 与 ACE 都让智能体从自身轨迹学习可复用经验,但前者按任务和模型能力选择交付 guideline,后者每步注入完整 playbook。

    推荐理由:文章在同一 AppWorld 与基础 ReAct 智能体上比较两种记忆交付方式,展示按模型能力调节上下文如何兼顾任务成绩与 tokens 成本。

8月3日周一
7月28日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Robotics 2,支持全身控制与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。

    推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。

7月15日周三
7月8日周三
  1. Mistral AI63

    Mistral AI 发布 8B 具身导航模型 Robostral Navigate

    Mistral AI 发布 8B 模型 Robostral Navigate,仅使用单个 RGB 摄像头和自然语言指令控制机器人自主导航。该模型在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:文章将单 RGB 摄像头导航的基准表现、训练数据规模与 prefix-caching 方法放在一起,便于理解其技术取舍。

7月2日周四
6月30日周二
  1. Hugging Face Blog49

    为什么 AI 系统的专业化不可避免

    优化理论、生物学与竞争市场共同指向:在算力、数据和开发时间有限的条件下,AI 系统通过专注特定目标、以广度换取匹配度,往往能获得更高性能。Goldfeder 等人在 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》中进一步论证,通用性并非性能优势,“普适通用”在实践中只是神话。

6月27日周六