跳到正文

#论文/研究

今日 1 条
今天10月1日周四
9月30日周三
9月29日周二
  1. Hugging Face Blog57

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 为基于 MCP 的大语言模型智能体提供来源感知的事实核验,在逐条检查事实支持关系的同时核对答案所指向的来源。研究使用 281 条医疗智能体轨迹和 361 个声明进行测试,正确拦截了专家判定不应通过的 139 个声明中的 138 个,但也将 67 个受支持声明送交复核或修复。

9月25日周五
  1. Google Research71

    Google Research 探索自动化连贯长视频生成

    Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。

    推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。

9月24日周四
  1. Microsoft Research72

    Microsoft Research:物理 AI 机器人推理卸载可提升性能与续航

    Microsoft Research 的研究显示,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可提升移动操作任务的成功率、模型运行能力和电池续航。

    推荐理由:文章以移动操作机器人工作负载为对象,比较板载、边缘与云端 GPU,呈现推理基础设施对任务成功率、续航和模型部署的具体影响。

9月23日周三
9月22日周二
9月19日周六
9月18日周五
  1. Google Research65

    Google Research 探索用生成式 UI 让教师创建互动学习内容

    Google Research 分享一项研究实验,利用为教育优化的生成式 UI,让教师按课程目标动态创建定制的互动学习模拟。研究团队同时发布了30多个英文 STEM 学习互动内容,覆盖物理、化学、生物和数学,并由教师审核。对12名美国教师的初步研究中,互动内容质量平均评分为8分(满分10分),Google 还将通过试点项目继续收集学校反馈。

    推荐理由:文章将生成式 UI、分级挑战和分层指导纳入教师主导的流程,并结合教师审核与试点数据,呈现定制化 STEM 练习的实现路径。

9月17日周四
9月16日周三
  1. Google Research58

    Retrieve-for-Train 用离线强化学习加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。

9月11日周五
  1. Google Research60

    Google Research 提出 ToolGrad:用文本“梯度”高效生成工具调用数据集

    Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的工具调用链,再标注对应用户查询,迭代构建更复杂的工具调用数据。基于 ToolBench 的 16k+ APIs,ToolGrad 以更低成本和更高通过率生成数据;使用 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 上取得 83.1 分。

    推荐理由:文章清楚拆解了从工具链生成、执行筛选到查询更新的流程,并用 BFCL 结果展示该方案的训练效果与成本取舍。

9月8日周二
9月4日周五
  1. Google Research82

    Google Research 发布完整雄性果蝇脑及中枢神经系统连接组图谱

    Google Research 与 HHMI Janelia 等合作发布了雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过166,000个神经元和125 million个突触连接,按神经元数量计算为目前最大的脑图谱。该成果发表于 Cell,图谱经过 HHMI Janelia 人类专家标注和校验。研究人员可通过开源工具 Neuroglancer 查看、探索和下载这份数据。

    推荐理由:文章展示了 AI 连接组学如何把电子显微镜切片重建为可验证的细胞级图谱,并说明雌雄连接组可用于研究神经差异和行为机制。

9月2日周三
  1. Hugging Face Blog68

    BenchMIRT:LLM 基准测试实际上在测量什么?

    AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。

    推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。

8月28日周五
  1. Google Research69

    Google Research 推出 planetary prediction engine,自动完成地理空间建模

    Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。

8月27日周四
  1. Google DeepMind67

    Google DeepMind 试点首个双盲 AI 评测

    Google DeepMind 宣布开展首个针对专有前沿级 AI 模型的双盲评测,以防止模型提前接触测试题目。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护的加密环境中使用机密基准测试 Gemini Flash Lite。

    推荐理由:文章说明加密环境如何把外部评测与模型后续优化隔离开,为理解 benchmark contamination 及其对评测可信度的影响提供了具体机制。

  2. Google Research49

    GlucoFM:用于连续血糖监测的基础模型

    GlucoFM 是一种用于连续血糖监测(CGM)的自监督基础模型,以双流设计分离较慢的血糖趋势与短期偏差,并保留时段和缺失信息。在四个队列、七项临床预测任务的14项队列—任务评估中,其平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高5.8个百分点,并在糖尿病风险和β细胞功能障碍评估中全部领先。

8月26日周三
8月25日周二
8月22日周六
  1. Google Research63

    Google Research 介绍用于筛选可穿戴设备生物标志物候选的 AI 工具

    Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下,通过假设生成、统计分析、模型训练、对抗验证和文献推理筛选候选生物标志物的多智能体系统。

    推荐理由:文章展示了如何将确定性统计计算、生成式推理与对抗验证组成闭环,在人工监督下筛选可解释的可穿戴设备生物标志物候选。

8月21日周五
  1. Google Research55

    Google Research 如何用移动数据让语言模型更深入理解地点

    Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合移动模式与地点文本表示结合,以建模地点的动态功能。在洛杉矶和休斯顿的未见地点测试中,该框架使访问意图预测相对提升最高达 81.9%,价格水平分类提升 75.1%,繁忙程度估计准确率提升 24.7%。ME-POIs 面向地点和商家的群体性聚合特征,不用于个人个性化推断。

8月17日周一
  1. Google Research63

    Google Research 提出 PhotoScan 用智能手机图像估计心脏代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。

    推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。

8月13日周四
  1. Microsoft Research66

    MindTopo 基准揭示 VLM 的拓扑空间推理能力

    Microsoft Research 团队提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现普遍优于需要通过连续动作维持或改变拓扑关系的规划任务。错误通常出现在规划阶段,模型会丢失结构关系或提出违反环境物理约束的动作。

    推荐理由:MindTopo 将静态拓扑识别与交互规划放在同一基准中比较,帮助定位多模态模型从感知到行动的能力断点。

8月12日周三
  1. Microsoft Research65

    Microsoft Research 发布 CARE-X 胸部 X 光 VLM 研究模型

    Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。

    推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。

8月11日周二
  1. Hugging Face Blog68

    ALTK-Evolve 以更少 tokens 交付智能体记忆,对比 ACE

    ALTK-Evolve 与 ACE 都让智能体从自身轨迹学习可复用经验,但前者按任务和模型能力选择交付 guideline,后者每步注入完整 playbook。

    推荐理由:文章在同一 AppWorld 与基础 ReAct 智能体上比较两种记忆交付方式,展示按模型能力调节上下文如何兼顾任务成绩与 tokens 成本。

8月10日周一
7月31日周五
7月29日周三
7月26日周日
  1. Berkeley AI Research58

    ABBEL 通过信念状态提升 LLM 长程交互效率

    Berkeley AI Research 提出 ABBEL,通过周期性更新并监督自然语言信念状态,让智能体在长程交互中用信念替代完整历史作为工作上下文。在 CollabBench 协作编码中,重构式信念评分将与完整上下文模型的性能差距缩小约50%,训练步数从100降至50,同时峰值上下文 token 长度低于完整上下文设置。

7月23日周四
  1. Google Research71

    Google Research 展示让量子计算机从错误中学习的强化学习控制

    Google Research 在 Nature 发表研究,展示一种强化学习框架,可利用量子错误检测事件持续调节控制参数,在计算不中断的情况下抵抗漂移。该方法在 Willow 超导处理器上使逻辑稳定性提升 3.5 倍,并在人工校准后进一步将逻辑错误率降低 20%;模拟显示所需训练迭代次数与系统规模无关。

    推荐理由:文章把量子纠错产生的错误检测事件转为强化学习信号,展示了连续校准如何在不中断计算的情况下抑制硬件漂移。

7月16日周四
  1. Google Research54

    Google Research 论文解释扩散模型的创造力来自 score smoothing

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。

7月15日周三
  1. Hugging Face Blog66

    Real World VoiceEQ 发布,用人类评价衡量语音 AI 的真实交互质量

    Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。

    推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。