LFM2.5-VL-DSpark 加速 LFM2.5-VL-3B 视觉语言模型推理
Liquid AI 发布面向 LFM2.5-VL-3B 的实验性 DSpark draft model,通过 speculative decoding 加速视觉语言模型推理。
推荐理由:原文量化了视觉语言模型引入 DSpark 后的解码与端到端加速,并说明额外参数和视觉预填充对整体收益的影响。
Liquid AI 发布面向 LFM2.5-VL-3B 的实验性 DSpark draft model,通过 speculative decoding 加速视觉语言模型推理。
推荐理由:原文量化了视觉语言模型引入 DSpark 后的解码与端到端加速,并说明额外参数和视觉预填充对整体收益的影响。
Xiaomi 发布 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两个开放权重的原生全模态模型,并公布技术报告、RL 环境和训练代码。
推荐理由:文章不仅介绍 MiMo-V2.6 的模型规模与价格,还梳理其 RL 训练环境和代码开放计划,便于理解其训练路线与开源范围。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本对话和高复杂度任务。
推荐理由:文章同时给出两款模型的定位、语音智能体基准表现与开发者入口,便于比较能力重点和落地路径。
Google DeepMind 和 Google Research 发布 WeatherNext 3,通过实时卫星数据每小时生成高分辨率全球天气预报,最高支持 5-kilometer 分辨率。
推荐理由:WeatherNext 3 将实时卫星观测、小时级高分辨率预测与可再生能源变量结合,呈现 AI 天气模型走向本地化应用的路径。
H Company 发布 NeoMME 多模态多语言编码器,提供 260M 和 800M 两种规模,并从头训练单一双向 Transformer 处理文本与原始图像块。
推荐理由:文章系统说明了 NeoMME 的单 Transformer 架构、检索性能与压缩方案,便于评估多模态文档检索在速度、质量和存储之间的取舍。
Google DeepMind 发布手语转文字模型 SL2T,并将其用于 Gboard 和 Live Transcribe 的手语转文字输入,首批支持 ASL 到英语,搭载于 Pixel 11。
推荐理由:文章从模型架构、隐私处理和真实使用限制三方面展开,帮助理解手语翻译落地到手机时的技术取舍。
Meta 发布 Muse Glimmer 30B,这是一款面向本地智能体场景的开源多模态模型,采用 Apache 2.0 许可,并支持图像、视频和多模态工具调用。模型已获得 transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持,还提供 DFlash speculative decoding 和微调示例。
推荐理由:文章既交代 Muse Glimmer 的 30B 架构与开源许可,也提供本地部署、推理加速和智能体接入的可复用路径。
Mistral AI 发布 Shieldstral,一款以 Apache 2.0 开放权重的 3B 多模态安全分类器,可在推理时接受自然语言审核规则,无需重新训练。
推荐理由:将审核规则放在推理时输入的自然语言问题中,使同一模型可适应不同产品的安全边界,而不必为每套规则重新训练。
Google DeepMind 发布 Gemini Robotics ER 2,这是面向机器人的高层具身推理与任务编排模型,可将执行交给 VLA 模型并调用工具。
推荐理由:原文结合视频进度理解、工具编排和多机器人协作,展示了 Gemini Robotics ER 2 面向真实机器人任务的能力变化与开发入口。
Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。
推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。
Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。
推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。
DharmaOCR 在巴西葡萄牙语 OCR 基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章将优势归因于面向巴西葡萄牙语的监督微调,以及用于降低重复和不连贯输出的 DPO 训练。
Thinking Machines 发布开放模型 Inkling 及 Inkling-Small,支持文本、图像和音频输入,并具备 Agent 能力与 1M context。
推荐理由:文章同时拆解了 Inkling 的 MoE、混合注意力与多模态输入架构,并给出不同量化版本的显存需求和部署路径,便于评估落地成本。
Google Research 介绍 SensorFM,这一模型使用来自 5 million 名参与者的超过 1 trillion minutes 多模态可穿戴传感器数据进行预训练。
推荐理由:文章将可穿戴数据的规模化预训练、缺失感知学习与智能体适配串联起来,展示了通用表示跨健康任务迁移的路径。
Google DeepMind 发布 Nano Banana 2 Lite 图像模型,并面向开发者开放 Gemini Omni Flash 视频生成与对话式编辑模型。
推荐理由:文章同时给出图像与视频模型的定位、价格和限制,便于开发者比较生成速度、成本与可用范围。
Google DeepMind 发布 Gemma 4 12B,这是一款面向笔记本本地运行的统一无编码器多模态模型,支持原生音频输入,并提供多步推理和智能体工作流能力。该模型在标准基准上的表现接近 26B MoE 模型,支持使用 16GB 内存本地运行,并以 Apache 2.0 许可证发布。
推荐理由:文章从架构、资源占用和本地部署入口三个层面,说明 Gemma 4 12B 如何将多模态智能带到消费级笔记本。
Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。
推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。
Google DeepMind 发布 Gemini 3.5 系列并首先推出 Gemini 3.5 Flash,定位为面向智能体和编码的高速模型。
推荐理由:文章同时交代 Gemini 3.5 Flash 在智能体、编码和多模态基准上的具体表现,以及面向个人、开发者和企业的开放入口,便于理解其应用范围。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。
推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。
Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。
推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。
Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上相较 Mistral OCR 2 的整体胜率为 74%。
推荐理由:原文同时给出跨文档类型的对比结果、API 与可视化入口及按页计价,便于评估 OCR 接入企业流程的成本与适用场景。
Mistral AI 发布 Mistral 3,包含 14B、8B、3B 三个小型 dense 模型,以及采用稀疏 MoE、拥有 41B active 和 675B total 参数的 Mistral Large 3,全部采用 Apache 2.0 许可。
推荐理由:这次发布同时覆盖端侧小模型与大规模 MoE 模型,并给出开源许可、部署格式和多家平台入口,便于比较不同规模模型的使用路径。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。
推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、较低成本和简化部署的企业级模型。模型在基准测试中达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并支持四个 GPU 及以上的自托管环境。
推荐理由:原文将 Mistral Medium 3 与 Claude Sonnet 3.7、Llama 4 Maverick 等模型放在性能和成本维度比较,并说明了企业部署与定制路径。
Mistral AI 发布 Mistral Small 3.1,改进文本性能和多模态理解,将上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second。
推荐理由:这次更新同时覆盖文本、多模态和长上下文,并提供 Apache 2.0 许可与基础模型,便于评估其在端侧和定制场景中的适用性。