跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 56 条
8月12日周三
  1. Microsoft Research65

    Microsoft Research 发布 CARE-X 胸部 X 光 VLM 研究模型

    Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。

    推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。

8月10日周一
  1. Hugging Face Blog88

    Meta 发布 Muse Glimmer 30B 开源多模态模型

    Meta 发布 Muse Glimmer 30B,这是一款面向本地智能体场景的开源多模态模型,采用 Apache 2.0 许可,并支持图像、视频和多模态工具调用。模型已获得 transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持,还提供 DFlash speculative decoding 和微调示例。

    推荐理由:文章既交代 Muse Glimmer 的 30B 架构与开源许可,也提供本地部署、推理加速和智能体接入的可复用路径。

8月4日周二
7月30日周四
7月28日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Robotics 2,支持全身控制与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。

    推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。

7月23日周四
7月21日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。

    推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。

7月15日周三
7月9日周四
7月7日周二
  1. Hugging Face Blog80

    Hugging Face 发布 LeRobot v0.6.0,完善机器人学习闭环

    Hugging Face 发布 LeRobot v0.6.0,新增世界模型策略、奖励模型、六个仿真基准和 lerobot-rollout 部署 CLI。数据集支持深度、VLM 自动语言标注和自定义视频编码,数据加载最高提速约 2x;训练新增 FSDP 与 HF Jobs 云训练。

    推荐理由:LeRobot v0.6.0 将世界模型策略、奖励模型、统一评测和部署采集串成闭环,并补充数据处理与云训练能力,便于理解机器人学习工作流的变化。

7月1日周三
  1. Hugging Face Blog69

    Hugging Face 与 Cerebras 将 Gemma 4 用于实时语音 AI

    Hugging Face 与 Cerebras 展示了将 Gemma 4 31B 用于实时语音到语音系统的方案。该开放管线依次使用 Nvidia 的 Parakeet 进行语音识别、在 Cerebras 上运行 Gemma 4 VLM 推理,并通过 Qwen3TTS 生成语音。相关架构已用于 Reachy Mini 机器人,配套代码仓库为 huggingface/speech-to-speech。

    推荐理由:文章拆解了实时语音到语音管线的模块构成与协作方式,开发者可据此了解低延迟架构的实现路径和代码入口。

6月13日周六
  1. Google Research67

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。

    推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。

6月9日周二
  1. Google DeepMind81

    Google DeepMind 发布 Gemma 4 12B 统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款面向笔记本本地运行的统一无编码器多模态模型,支持原生音频输入,并提供多步推理和智能体工作流能力。该模型在标准基准上的表现接近 26B MoE 模型,支持使用 16GB 内存本地运行,并以 Apache 2.0 许可证发布。

    推荐理由:文章从架构、资源占用和本地部署入口三个层面,说明 Gemma 4 12B 如何将多模态智能带到消费级笔记本。

6月5日周五
  1. Google Research77

    Google Research 介绍 PHRM:用智能手机摄像头被动监测心率

    Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。

    推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。

5月29日周五
  1. Google Research60

    Google Research 在 I/O 2026 展示多项 AI 研究进展

    Google Research 在 I/O 2026 集中介绍了 Gemini for Science、AI 医疗研究、端侧平台、极端天气预测、Gemini 能力改进和量子计算等方向的进展。文章还介绍了 Google Antigravity 2.0 的多智能体开发工作流、Gemma V4 上线一个月下载量超过 100 million,以及 MedGemma 下载量超过 5M。

    推荐理由:文章集中梳理 Google Research 在科学发现、医疗、开发者工具和量子计算等方向的 I/O 研究进展,呈现研究成果如何进入具体产品与实验。

5月18日周一
  1. Google DeepMind87

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。

    推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。

5月17日周日