跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–20 条 · 共 55 条
9月29日周二
  1. Microsoft Research63

    Microsoft Research 推出 Quine 生物学 AI 研究系统

    Microsoft Research 推出 Quine,一套面向生物复杂性的多模态 AI 研究系统,连接生物学世界模型、科学工具、文献、湿实验与研究人员。与 Broad Institute 合作时,Quine 对数千种化合物进行排序,并在 PDAC 肿瘤细胞状态转换实验中验证了部分高排名候选物。Quine 目前仅用于研究,首批访问将通过 Quine Fellows 计划和部分研究合作提供。

    推荐理由:文章展示了 Quine 如何把生物多模态建模、科学工具与湿实验纳入迭代闭环,并以 PDAC 化合物筛选案例说明其研究用途。

  2. AWS Machine Learning Blog64

    AWS 在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用 第 1 部分

    AWS 介绍如何在 SageMaker AI 上使用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,让文本输入和音频输出通过同一条持久双向连接流式传输。教程提供 GitHub 示例、部署脚本和 Gradio 应用,音频以 24 kHz PCM 分块返回。示例使用 vLLM-Omni v1.5 DLC 与 SageMaker 实例池,并说明了部署、调用和清理端点的步骤。

    推荐理由:文章以 Qwen3-TTS 为例展示从模型部署、双向流式传输到 Gradio 调用的完整路径,便于复用这一多模态推理方案。

  3. AWS Machine Learning Blog62

    教程:AWS 在 SageMaker AI 上用 vLLM-Omni 生成图像并将其动画化为视频

    AWS 介绍如何在 Amazon SageMaker AI 上部署两个 vLLM-Omni 端点,将 FLUX.2-klein-4B 生成的图像传给 Wan2.1-VACE-1.3B,生成短视频。图像端点采用实时推理,视频端点采用异步推理,并通过 Amazon S3 传递 multipart 请求和获取 MP4 结果。文章还提供命令行与 Streamlit 示例、部署命令及清理脚本。

    推荐理由:文章把图像实时推理与视频异步推理串成可复用流程,并给出部署脚本、请求格式和清理步骤,便于理解两种响应模式的取舍。

9月25日周五
  1. Latent Space76

    Runway 的 WorldPrompt 与实时世界模型工程

    Runway 在 GWM Worlds 2 研究预览中推出 WorldPrompt,可固定模拟环境的部分要素并创建带时间戳的事件,也支持实时提示动作。GWM Worlds 2 能以 720p、24 fps 视频和 48,000 Hz 音频生成交互世界,其实时化依赖自回归生成与蒸馏。文章还讨论了误差累积、长时记忆、因果性和无结构状态等限制,以及世界模型在游戏、机器人和智能体测试中的用途。

    推荐理由:文章结合 WorldPrompt 的控制方式与实时生成的工程难题,梳理世界模型在游戏、机器人和智能体测试中的应用路径。

  2. Google Research71

    Google Research 探索自动化连贯长视频生成

    Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。

    推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。

  3. Google DeepMind71

    Gemini 3.8 Live with Live Avatar 发布

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为企业对话式 AI 加入近实时视频生成、语音和动态视觉形象。

    推荐理由:文章集中说明 Live Avatar 的多模态交互、异步工具调用和 97 种语言支持,并交代 Gemini Enterprise 的使用入口与定制头像限制。

9月24日周四
9月16日周三
9月10日周四
  1. Hugging Face Blog81

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111 的大部分功能

    Hugging Face 构建了 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能。该工作流包含 73 个节点和 11 条媒体处理管线,覆盖文生图、图生图、检测、放大、背景移除和图生视频等任务。画布输出可自动成为 REST endpoint 和 MCP 工具,用户还能复制 Space 后替换模型、删除节点或重新连接流程。

    推荐理由:文章通过一个可复制和改造的案例,展示 Gradio Workflow 如何把多模型、多模态流程连接为可在浏览器和 MCP 中调用的工作流。

9月3日周四
  1. Hugging Face Blog68

    H Company 发布 NeoMME 多模态多语言编码器

    H Company 发布 NeoMME 多模态多语言编码器,提供 260M 和 800M 两种规模,并从头训练单一双向 Transformer 处理文本与原始图像块。

    推荐理由:文章系统说明了 NeoMME 的单 Transformer 架构、检索性能与压缩方案,便于评估多模态文档检索在速度、质量和存储之间的取舍。

9月2日周三
8月28日周五
  1. Google Research69

    Google Research 推出 planetary prediction engine,自动完成地理空间建模

    Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。

8月18日周二
8月17日周一
  1. Google Research63

    Google Research 提出 PhotoScan 用智能手机图像估计心脏代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。

    推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。

8月13日周四
  1. Microsoft Research66

    MindTopo 基准揭示 VLM 的拓扑空间推理能力

    Microsoft Research 团队提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现普遍优于需要通过连续动作维持或改变拓扑关系的规划任务。错误通常出现在规划阶段,模型会丢失结构关系或提出违反环境物理约束的动作。

    推荐理由:MindTopo 将静态拓扑识别与交互规划放在同一基准中比较,帮助定位多模态模型从感知到行动的能力断点。

8月12日周三