ProvenanceGuard:面向 MCP 智能体的来源感知事实核验
ProvenanceGuard 为基于 MCP 的大语言模型智能体提供来源感知的事实核验,在逐条检查事实支持关系的同时核对答案所指向的来源。研究使用 281 条医疗智能体轨迹和 361 个声明进行测试,正确拦截了专家判定不应通过的 139 个声明中的 138 个,但也将 67 个受支持声明送交复核或修复。
ProvenanceGuard 为基于 MCP 的大语言模型智能体提供来源感知的事实核验,在逐条检查事实支持关系的同时核对答案所指向的来源。研究使用 281 条医疗智能体轨迹和 361 个声明进行测试,正确拦截了专家判定不应通过的 139 个声明中的 138 个,但也将 67 个受支持声明送交复核或修复。
Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。
推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。
Google Research 分享一项研究实验,利用为教育优化的生成式 UI,让教师按课程目标动态创建定制的互动学习模拟。研究团队同时发布了30多个英文 STEM 学习互动内容,覆盖物理、化学、生物和数学,并由教师审核。对12名美国教师的初步研究中,互动内容质量平均评分为8分(满分10分),Google 还将通过试点项目继续收集学校反馈。
推荐理由:文章将生成式 UI、分级挑战和分层指导纳入教师主导的流程,并结合教师审核与试点数据,呈现定制化 STEM 练习的实现路径。
ALTK-Evolve 新增 Consistency Analyzer 和 consistency guidelines,用于诊断并降低 ReAct agent 重复执行同一任务时的 consistency gap。
推荐理由:文章把平均成功率与重复运行可靠性拆开衡量,并给出无需端到端重放任务的诊断与修复流程,便于评估生产智能体的稳定性。
Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的工具调用链,再标注对应用户查询,迭代构建更复杂的工具调用数据。基于 ToolBench 的 16k+ APIs,ToolGrad 以更低成本和更高通过率生成数据;使用 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 上取得 83.1 分。
推荐理由:文章清楚拆解了从工具链生成、执行筛选到查询更新的流程,并用 BFCL 结果展示该方案的训练效果与成本取舍。
Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。
推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。
Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下,通过假设生成、统计分析、模型训练、对抗验证和文献推理筛选候选生物标志物的多智能体系统。
推荐理由:文章展示了如何将确定性统计计算、生成式推理与对抗验证组成闭环,在人工监督下筛选可解释的可穿戴设备生物标志物候选。
ALTK-Evolve 在 AppWorld 的八模型评测显示,智能体记忆的合适剂量取决于模型能力:强模型适合完整指南集,较弱模型适合固定核心加按任务检索,已饱和模型未见可测增益。
推荐理由:文章用 AppWorld 上八个模型的对比,说明智能体记忆应按模型能力校准,并展示完整指南集与精选检索在效果和 token 成本上的差异。
Hugging Face组织的社区挑战在19天内复现了2,226篇ICML 2026论文,发布6,816份Trackio logbook并判定35,908条科学主张。
推荐理由:这篇复盘以大规模复现数据呈现智能体审查论文的能力边界,并具体说明人类如何通过设定环境和校验关键假设提升结果可靠性。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹学习可复用经验,但前者按任务和模型能力选择交付 guideline,后者每步注入完整 playbook。
推荐理由:文章在同一 AppWorld 与基础 ReAct 智能体上比较两种记忆交付方式,展示按模型能力调节上下文如何兼顾任务成绩与 tokens 成本。
Google Research提出 Chain-of-Evidence(CoE)框架,并以 Science One Framework 实现可验证的自主科学研究流程。
推荐理由:文章把证据链设计与四项自动化审计结合起来,展示了自主研究系统如何同时检验引用、代码、方法描述和实验结果。
Import AI 466 汇总了 MirrorCode 长时程编程基准、Anthropic 机器人实验和 OpenAI 模型安全事件。MirrorCode 中,Opus 4.7 曾以 $251 的推理成本完成一项预计人类需 2-17 周的任务;Anthropic 的 Opus 4.7 在 9 minutes and 35 seconds 内完成除一项外的全部机器人任务。
Berkeley AI Research 提出 ABBEL,通过周期性更新并监督自然语言信念状态,让智能体在长程交互中用信念替代完整历史作为工作上下文。在 CollabBench 协作编码中,重构式信念评分将与完整上下文模型的性能差距缩小约50%,训练步数从100降至50,同时峰值上下文 token 长度低于完整上下文设置。
Google Research 在一项 n=13,917 的随机研究中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体进行症状访谈并生成 DDx。
推荐理由:研究将真实对话、临床专家比较与 Fitbit 生理信号结合,呈现 SymptomAI 在日常症状评估中的表现及研究边界。
Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。
Import AI 457 汇总了 fast16 高精度软件破坏调查、Aurora 优化器研究、正向对齐立场论文,以及 Prime Intellect 的自主 AI 研究实验。
Google DeepMind 的 Co-Scientist 从既有药物文献中提出三种候选药物,其中两种在活体人类肝细胞测试中阻断了肝纤维化并促进肝细胞再生。研究团队还测试了自己选出的两种药物,但未观察到抗纤维化效果;Co-Scientist 的突出候选是抗癌药 vorinostat,其实验中阻断了 91% 的相关损伤反应。
推荐理由:这项研究展示了 Co-Scientist 如何从既有药物文献中提出候选,再通过人类肝细胞实验筛选抗肝纤维化药物。
Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。
推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。
Google Research在 ICLR 论文中提出 ReasoningBank,从智能体的成功与失败经验中提炼结构化推理记忆,并通过 MaTTS 支持测试时自我演化。
推荐理由:文章展示了如何把成功与失败轨迹提炼为可复用的推理记忆,并用 WebArena 与 SWE-Bench-Verified 结果说明其效果与效率变化。
Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。
推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。
Google Research 推出 PaperVizAgent 和 ScholarPeer 两个 AI 智能体,分别用于生成学术图表和自动评审论文。PaperVizAgent 由五个专用智能体协作,在 0-100 评分中获 60.2 分,超过人类基线 50.0 及 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any。
Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。
推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。