LFM2.5-VL-DSpark 加速 LFM2.5-VL-3B 视觉语言模型推理
Liquid AI 发布面向 LFM2.5-VL-3B 的实验性 DSpark draft model,通过 speculative decoding 加速视觉语言模型推理。
推荐理由:原文量化了视觉语言模型引入 DSpark 后的解码与端到端加速,并说明额外参数和视觉预填充对整体收益的影响。
Liquid AI 发布面向 LFM2.5-VL-3B 的实验性 DSpark draft model,通过 speculative decoding 加速视觉语言模型推理。
推荐理由:原文量化了视觉语言模型引入 DSpark 后的解码与端到端加速,并说明额外参数和视觉预填充对整体收益的影响。
Liquid AI 发布 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,通过 speculative decoding 提升推理吞吐。
推荐理由:文章同时给出 H100 与 M4 Max 的吞吐对比、function-calling 延迟变化及 llama.cpp 和 SGLang 接入方式,便于评估 DSpark 在云端与端侧部署中的收益。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。
推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。
Mistral AI 发布 Mistral 3,包含 14B、8B、3B 三个小型 dense 模型,以及采用稀疏 MoE、拥有 41B active 和 675B total 参数的 Mistral Large 3,全部采用 Apache 2.0 许可。
推荐理由:这次发布同时覆盖端侧小模型与大规模 MoE 模型,并给出开源许可、部署格式和多家平台入口,便于比较不同规模模型的使用路径。
Mistral AI 发布 Mistral Small 3.1,改进文本性能和多模态理解,将上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second。
推荐理由:这次更新同时覆盖文本、多模态和长上下文,并提供 Apache 2.0 许可与基础模型,便于评估其在端侧和定制场景中的适用性。