Google Research 推进 AMIE,迈向专家级音视频临床会诊
Google Research 发布 AMIE(Video),该系统基于 Gemini 和 Project Astra,可实时进行音视频临床会诊,感知非语言线索、引导虚拟体格检查并开展临床推理。
推荐理由:文章将 AMIE(Video)的异步多智能体架构、随机视频研究结果与模拟场景限制放在一起,便于理解其能力边界。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google Research 发布 AMIE(Video),该系统基于 Gemini 和 Project Astra,可实时进行音视频临床会诊,感知非语言线索、引导虚拟体格检查并开展临床推理。
推荐理由:文章将 AMIE(Video)的异步多智能体架构、随机视频研究结果与模拟场景限制放在一起,便于理解其能力边界。
Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。
推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。
Meta 发布 Muse Glimmer 30B,这是一款面向本地智能体场景的开源多模态模型,采用 Apache 2.0 许可,并支持图像、视频和多模态工具调用。模型已获得 transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持,还提供 DFlash speculative decoding 和微调示例。
推荐理由:文章既交代 Muse Glimmer 的 30B 架构与开源许可,也提供本地部署、推理加速和智能体接入的可复用路径。
Mistral AI 发布 Shieldstral,一款以 Apache 2.0 开放权重的 3B 多模态安全分类器,可在推理时接受自然语言审核规则,无需重新训练。
推荐理由:将审核规则放在推理时输入的自然语言问题中,使同一模型可适应不同产品的安全边界,而不必为每套规则重新训练。
Google DeepMind 发布 Gemini Robotics ER 2,这是面向机器人的高层具身推理与任务编排模型,可将执行交给 VLA 模型并调用工具。
推荐理由:原文结合视频进度理解、工具编排和多机器人协作,展示了 Gemini Robotics ER 2 面向真实机器人任务的能力变化与开发入口。
Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。
推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。
Google Research 在一项 n=13,917 的随机研究中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体进行症状访谈并生成 DDx。
推荐理由:研究将真实对话、临床专家比较与 Fitbit 生理信号结合,呈现 SymptomAI 在日常症状评估中的表现及研究边界。
Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。
推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。
Thinking Machines 发布开放模型 Inkling 及 Inkling-Small,支持文本、图像和音频输入,并具备 Agent 能力与 1M context。
推荐理由:文章同时拆解了 Inkling 的 MoE、混合注意力与多模态输入架构,并给出不同量化版本的显存需求和部署路径,便于评估落地成本。
Google Research 介绍 SensorFM,这一模型使用来自 5 million 名参与者的超过 1 trillion minutes 多模态可穿戴传感器数据进行预训练。
推荐理由:文章将可穿戴数据的规模化预训练、缺失感知学习与智能体适配串联起来,展示了通用表示跨健康任务迁移的路径。
Hugging Face 发布 LeRobot v0.6.0,新增世界模型策略、奖励模型、六个仿真基准和 lerobot-rollout 部署 CLI。数据集支持深度、VLM 自动语言标注和自定义视频编码,数据加载最高提速约 2x;训练新增 FSDP 与 HF Jobs 云训练。
推荐理由:LeRobot v0.6.0 将世界模型策略、奖励模型、统一评测和部署采集串成闭环,并补充数据处理与云训练能力,便于理解机器人学习工作流的变化。
Hugging Face 与 Cerebras 展示了将 Gemma 4 31B 用于实时语音到语音系统的方案。该开放管线依次使用 Nvidia 的 Parakeet 进行语音识别、在 Cerebras 上运行 Gemma 4 VLM 推理,并通过 Qwen3TTS 生成语音。相关架构已用于 Reachy Mini 机器人,配套代码仓库为 huggingface/speech-to-speech。
推荐理由:文章拆解了实时语音到语音管线的模块构成与协作方式,开发者可据此了解低延迟架构的实现路径和代码入口。
Google DeepMind 发布 Nano Banana 2 Lite 图像模型,并面向开发者开放 Gemini Omni Flash 视频生成与对话式编辑模型。
推荐理由:文章同时给出图像与视频模型的定位、价格和限制,便于开发者比较生成速度、成本与可用范围。
Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。
推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。
Google DeepMind 发布 Gemma 4 12B,这是一款面向笔记本本地运行的统一无编码器多模态模型,支持原生音频输入,并提供多步推理和智能体工作流能力。该模型在标准基准上的表现接近 26B MoE 模型,支持使用 16GB 内存本地运行,并以 Apache 2.0 许可证发布。
推荐理由:文章从架构、资源占用和本地部署入口三个层面,说明 Gemma 4 12B 如何将多模态智能带到消费级笔记本。
Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。
推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。
Google Research 在 I/O 2026 集中介绍了 Gemini for Science、AI 医疗研究、端侧平台、极端天气预测、Gemini 能力改进和量子计算等方向的进展。文章还介绍了 Google Antigravity 2.0 的多智能体开发工作流、Gemma V4 上线一个月下载量超过 100 million,以及 MedGemma 下载量超过 5M。
推荐理由:文章集中梳理 Google Research 在科学发现、医疗、开发者工具和量子计算等方向的 I/O 研究进展,呈现研究成果如何进入具体产品与实验。
Google DeepMind 在 Project Genie 中推出由 Google Street View 提供真实地点 grounding 的新能力,让用户基于美国地点创建带有不同风格和角色的想象世界。
推荐理由:文章展示了 Genie 如何把 Street View 真实地点接入可交互生成环境,并交代美国可用范围、全球开放对象与实验性限制。
Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。
推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。
Google DeepMind 扩展 Search、Gemini、Chrome、Pixel 和 Cloud 中的内容透明度与验证工具,并推出 AI Content Detection API。
推荐理由:文章梳理了 SynthID 与 C2PA 在 Google 产品和行业伙伴中的扩展路径,并给出 AI Content Detection API 的落地场景。