跳到正文

#推理

今日 0 条
9月16日周三
  1. Google Research58

    Retrieve-for-Train 用离线强化学习加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。

9月2日周三
  1. Hugging Face Blog68

    BenchMIRT:LLM 基准测试实际上在测量什么?

    AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。

    推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。

8月25日周二
8月12日周三
  1. Microsoft Research65

    Microsoft Research 发布 CARE-X 胸部 X 光 VLM 研究模型

    Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。

    推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。

8月11日周二
  1. Hugging Face Blog68

    ALTK-Evolve 以更少 tokens 交付智能体记忆,对比 ACE

    ALTK-Evolve 与 ACE 都让智能体从自身轨迹学习可复用经验,但前者按任务和模型能力选择交付 guideline,后者每步注入完整 playbook。

    推荐理由:文章在同一 AppWorld 与基础 ReAct 智能体上比较两种记忆交付方式,展示按模型能力调节上下文如何兼顾任务成绩与 tokens 成本。

6月25日周四
6月22日周一
  1. Import AI64

    Import AI 462:AI 超越人类说服力,迈向自维持 AI 与 ASI

    Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。

5月18日周一
4月22日周三
4月16日周四
3月17日周二
  1. Google Research58

    Google Research 评测大语言模型回答高温超导研究问题的能力

    Google Research 与康奈尔大学、哈佛大学合作评测大语言模型回答高温超导研究问题的能力,NotebookLM 和定制 RAG 系统整体表现领先。专家组以 67 个问题测试了 6 个系统,结果显示,使用经过筛选的文献库的系统优于依赖开放网络来源的系统,后者更容易混淆已确立的理论与高度推测性的理论。