跳到正文

#多模态

今日 0 条
9月25日周五
  1. Google Research71

    Google Research 探索自动化连贯长视频生成

    Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。

    推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。

9月16日周三
  1. Google Research58

    Retrieve-for-Train 用离线强化学习加速复杂 AI 搜索

    Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。

9月2日周三
8月28日周五
  1. Google Research69

    Google Research 推出 planetary prediction engine,自动完成地理空间建模

    Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。

8月26日周三
8月17日周一
  1. Google Research63

    Google Research 提出 PhotoScan 用智能手机图像估计心脏代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。

    推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。

8月13日周四
  1. Microsoft Research66

    MindTopo 基准揭示 VLM 的拓扑空间推理能力

    Microsoft Research 团队提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现普遍优于需要通过连续动作维持或改变拓扑关系的规划任务。错误通常出现在规划阶段,模型会丢失结构关系或提出违反环境物理约束的动作。

    推荐理由:MindTopo 将静态拓扑识别与交互规划放在同一基准中比较,帮助定位多模态模型从感知到行动的能力断点。

8月12日周三
  1. Microsoft Research65

    Microsoft Research 发布 CARE-X 胸部 X 光 VLM 研究模型

    Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。

    推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。

7月23日周四
6月13日周六
  1. Google Research67

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。

    推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。

6月5日周五
  1. Google Research77

    Google Research 介绍 PHRM:用智能手机摄像头被动监测心率

    Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。

    推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。

4月30日周四
  1. Google DeepMind73

    Google DeepMind 启动 AI co-clinician 医疗智能体研究计划

    Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。

    推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。

4月9日周四
3月25日周三
  1. Google Research50

    S2Vec 如何学习城市的空间语言

    Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。

3月18日周三
  1. Google Research64

    Google Research 在 The Check Up 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。

    推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。

  2. Google Research81

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。

    推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。