Google Research 探索自动化连贯长视频生成
Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。
推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。
Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。
推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。
Google Research 与 NASA JPL 介绍 MAPL-EMIT,利用深度学习分析 NASA EMIT 高光谱数据,自动检测、增强量预测并定位全球甲烷羽流。
推荐理由:文章展示了物理模拟与视觉 Transformer 如何结合 EMIT 数据识别甲烷羽流,并以 84% 召回率和公开数据、模型与推理库说明其可复用性。
Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。
推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。
AgentHands 是 Google Research 提出的研究原型,将 LLM 的语言响应转换为与 TTS 同步的 XR 空间手势,支持智能体在用户环境中进行具身对话。
Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。
推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。
Microsoft Research 团队提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现普遍优于需要通过连续动作维持或改变拓扑关系的规划任务。错误通常出现在规划阶段,模型会丢失结构关系或提出违反环境物理约束的动作。
推荐理由:MindTopo 将静态拓扑识别与交互规划放在同一基准中比较,帮助定位多模态模型从感知到行动的能力断点。
Google Research 发布 AMIE(Video),该系统基于 Gemini 和 Project Astra,可实时进行音视频临床会诊,感知非语言线索、引导虚拟体格检查并开展临床推理。
推荐理由:文章将 AMIE(Video)的异步多智能体架构、随机视频研究结果与模拟场景限制放在一起,便于理解其能力边界。
Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。
推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。
Google Research 在一项 n=13,917 的随机研究中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体进行症状访谈并生成 DDx。
推荐理由:研究将真实对话、临床专家比较与 Fitbit 生理信号结合,呈现 SymptomAI 在日常症状评估中的表现及研究边界。
Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。
推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。
Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。
推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。
Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。
推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。
Google Research 推出 PaperVizAgent 和 ScholarPeer 两个 AI 智能体,分别用于生成学术图表和自动评审论文。PaperVizAgent 由五个专用智能体协作,在 0-100 评分中获 60.2 分,超过人类基线 50.0 及 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any。
Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。
Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。
推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。
Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。
推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。