Retrieve-for-Train 用离线强化学习加速复杂 AI 搜索
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。
AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。
推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩为 60B 参数并量化至 MXFP4,在 9 项基准中的 7 项超过同架构 BF16 检查点。
Google Research 介绍一项关于 LLM 事实性的研究,提出 knowledge profiling 和 WikiProfile,用于区分事实是否被编码及能否被召回。
推荐理由:文章用 WikiProfile 区分事实编码与召回,数据显示前沿模型的瓶颈更多在已存知识的访问,而非知识缺失。
Google Research 发布 AMIE(Video),该系统基于 Gemini 和 Project Astra,可实时进行音视频临床会诊,感知非语言线索、引导虚拟体格检查并开展临床推理。
推荐理由:文章将 AMIE(Video)的异步多智能体架构、随机视频研究结果与模拟场景限制放在一起,便于理解其能力边界。
Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。
推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹学习可复用经验,但前者按任务和模型能力选择交付 guideline,后者每步注入完整 playbook。
推荐理由:文章在同一 AppWorld 与基础 ReAct 智能体上比较两种记忆交付方式,展示按模型能力调节上下文如何兼顾任务成绩与 tokens 成本。
Google Research 研究发现,开启 reasoning trace 可帮助 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 找回关闭推理时难以恢复的单跳事实。
推荐理由:文章通过受控实验拆解推理提升单跳事实召回的两种机制,并将中间事实的可靠性与最终答案准确率联系起来。
Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。
Import AI 457 汇总了 fast16 高精度软件破坏调查、Aurora 优化器研究、正向对齐立场论文,以及 Prime Intellect 的自主 AI 研究实验。
Google Research在 ICLR 论文中提出 ReasoningBank,从智能体的成功与失败经验中提炼结构化推理记忆,并通过 MaTTS 支持测试时自我演化。
推荐理由:文章展示了如何把成功与失败轨迹提炼为可复用的推理记忆,并用 WebArena 与 SWE-Bench-Verified 结果说明其效果与效率变化。
Google Research在发表于 Transactions on Machine Learning Research 的论文中提出 Simula,用推理优先的方法从第一性原理构建合成数据集。
推荐理由:文章将合成数据生成重构为机制设计问题,拆分覆盖、多样性、复杂度与质量,给出可控且可评估的数据构建路径。
Google Research 与康奈尔大学、哈佛大学合作评测大语言模型回答高温超导研究问题的能力,NotebookLM 和定制 RAG 系统整体表现领先。专家组以 67 个问题测试了 6 个系统,结果显示,使用经过筛选的文献库的系统优于依赖开放网络来源的系统,后者更容易混淆已确立的理论与高度推测性的理论。