跳到正文

#多模态

今日 0 条
6月5日周五
  1. Google Research77

    Google Research 介绍 PHRM:用智能手机摄像头被动监测心率

    Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。

    推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。

5月29日周五
  1. Google Research60

    Google Research 在 I/O 2026 展示多项 AI 研究进展

    Google Research 在 I/O 2026 集中介绍了 Gemini for Science、AI 医疗研究、端侧平台、极端天气预测、Gemini 能力改进和量子计算等方向的进展。文章还介绍了 Google Antigravity 2.0 的多智能体开发工作流、Gemma V4 上线一个月下载量超过 100 million,以及 MedGemma 下载量超过 5M。

    推荐理由:文章集中梳理 Google Research 在科学发现、医疗、开发者工具和量子计算等方向的 I/O 研究进展,呈现研究成果如何进入具体产品与实验。

5月18日周一
  1. Google DeepMind87

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。

    推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。

5月17日周日
5月16日周六
  1. Google DeepMind60

    Google DeepMind与新加坡政府启动国家AI合作伙伴关系

    Google DeepMind与新加坡政府启动新的国家AI合作伙伴关系,并在新加坡推出医疗、生命科学、教育、科研、可持续发展和AI安全项目。合作方预计通过加速研发,到2040年创造额外S$ 3.3 billion(US$2.5 billion)的经济价值。

    推荐理由:文章梳理了Google DeepMind与新加坡政府合作落地的医疗、教育、科研和安全项目,呈现国家级AI应用的具体路径。

5月2日周六
4月30日周四
  1. Google DeepMind73

    Google DeepMind 启动 AI co-clinician 医疗智能体研究计划

    Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。

    推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。

4月23日周四
  1. Google Research77

    Google Photos 在 Auto frame 中提供基于 3D 场景重构的自动改视角功能

    Google Research 宣布,Google Photos 已在 Auto frame 中提供自动重构照片视角的功能。该功能先估计 3D 点图和相机参数,再用生成式 latent diffusion model 补全新视角下原本未拍到的区域,并自动调整人像构图、缓解广角自拍的透视畸变。符合条件的含人物照片可在 Auto frame 候选中获取重构后的第二个版本。

    推荐理由:Google Photos 的 Auto frame 将 3D 场景重建与生成式修补结合,用于自动调整人像视角,呈现生成式编辑从裁剪到视角重构的变化。

4月9日周四
4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。

    推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。

3月25日周三
  1. Google Research73

    Google 发布 Vibe Coding XR,用 Gemini 和 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks,将自然语言直接转化为 physics-aware Android XR 应用,生成时间可低于 60 seconds。

    推荐理由:文章展示了 Gemini 与 XR Blocks 如何把自然语言转成 physics-aware Android XR 应用,并介绍 VCXR60、Pro Mode 和 11 次迭代带来的评测线索。

  2. Google Research50

    S2Vec 如何学习城市的空间语言

    Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。

3月18日周三
  1. Google Research64

    Google Research 在 The Check Up 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。

    推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。

  2. Google Research81

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。

    推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。

  3. Mistral AI49

    Mistral AI 推出 Forge,助力企业训练基于专有知识的 AI 模型

    Mistral AI 推出 Forge,帮助企业利用专有文档、代码库、结构化数据和运营记录,训练理解内部知识与工作流的前沿级 AI 模型。Forge 支持预训练、后训练、强化学习,以及 dense、MoE 架构和多模态输入,并允许模型在企业自有基础设施中受内部政策治理。其以 AI 智能体为先,支持 Mistral Vibe 微调模型、寻找超参数、调度任务和生成合成数据。

3月17日周二
  1. Mistral AI81

    Mistral Small 4 发布,统一推理、多模态与智能体编码能力

    Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。

    推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。

  2. Mistral AI67

    Mistral AI 发布 Mistral Small 4 并加入 NVIDIA Nemotron Coalition

    Mistral AI 发布 Mistral Small 4,并作为创始成员加入 NVIDIA Nemotron Coalition。Mistral AI 与 NVIDIA 计划结合模型架构、计算资源、开发工具和合成数据管线,共同开发开放的前沿 AI 模型。联盟首项计划是在 NVIDIA DGX Cloud 上训练基础模型,为即将推出的 NVIDIA Nemotron 4 家族提供开放基础。

    推荐理由:材料把 Mistral AI 的模型发布与 NVIDIA Nemotron Coalition 的合作安排放在一起,交代了开放模型共建的参与方式和后续方向。

12月17日周三
  1. Mistral AI68

    Mistral AI 发布 Mistral OCR 3

    Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上相较 Mistral OCR 2 的整体胜率为 74%。

    推荐理由:原文同时给出跨文档类型的对比结果、API 与可视化入口及按页计价,便于评估 OCR 接入企业流程的成本与适用场景。

12月3日周三
  1. Mistral AI84

    Mistral 3 发布,包含 Mistral Large 3 与 Ministral 3 系列模型

    Mistral AI 发布 Mistral 3,包含 14B、8B、3B 三个小型 dense 模型,以及采用稀疏 MoE、拥有 41B active 和 675B total 参数的 Mistral Large 3,全部采用 Apache 2.0 许可。

    推荐理由:这次发布同时覆盖端侧小模型与大规模 MoE 模型,并给出开源许可、部署格式和多家平台入口,便于比较不同规模模型的使用路径。

8月1日周五
7月15日周二
  1. Mistral AI83

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。

    推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。

5月7日周三
  1. Mistral AI78

    Mistral Medium 3 发布,主打低成本企业级性能

    Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、较低成本和简化部署的企业级模型。模型在基准测试中达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并支持四个 GPU 及以上的自托管环境。

    推荐理由:原文将 Mistral Medium 3 与 Claude Sonnet 3.7、Llama 4 Maverick 等模型放在性能和成本维度比较,并说明了企业部署与定制路径。

3月17日周一
3月7日周五
  1. Mistral AI76

    Mistral AI 发布 Mistral OCR 文档理解模型与 API

    Mistral AI 发布 Mistral OCR,一款可处理图片和 PDF 的 OCR API,能提取文本、图片、表格和公式并保持交错顺序。API mistral-ocr-latest 已在 la Plateforme 提供,定价为 1000 pages / $,batch inference 下每美元处理页数约翻倍。

    推荐理由:Mistral OCR 将复杂文档中的文本、图片、表格和公式统一提取,并支持结构化输出与自托管,适合评估多模态文档进入 RAG 和智能体流程的方式。