跳到正文

#模型发布

今日 1 条
7月21日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。

    推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。

7月17日周五
7月15日周三
7月8日周三
  1. Mistral AI63

    Mistral AI 发布 8B 具身导航模型 Robostral Navigate

    Mistral AI 发布 8B 模型 Robostral Navigate,仅使用单个 RGB 摄像头和自然语言指令控制机器人自主导航。该模型在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。

    推荐理由:文章将单 RGB 摄像头导航的基准表现、训练数据规模与 prefix-caching 方法放在一起,便于理解其技术取舍。

7月2日周四
7月1日周三
6月30日周二
  1. Google Research70

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,这一面向表格数据分类和回归的基础模型可通过单次前向传播生成预测,无需手动训练、超参数调优或复杂特征工程。TabFM 采用交替行列注意力、行压缩和 Transformer,并基于数亿个合成数据集训练。

    推荐理由:文章解释了 TabFM 如何用交替行列注意力、行压缩和合成数据训练,将表格分类与回归转为零样本推理,并给出 BigQuery 使用入口。

6月23日周二
  1. Mistral AI71

    Mistral AI 发布 Mistral OCR 4 文档解析模型

    Mistral AI 发布 Mistral OCR 4,支持 170 languages,并可返回 bounding boxes、区块类型和逐词 confidence scores。

    推荐理由:文章同时呈现了 Mistral OCR 4 的结构化解析能力、部署方式与成本,便于比较其在企业文档流程中的适用场景。

6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma 文本扩散模型,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散和并行生成,在专用 GPU 上实现最高 4 倍的文本生成速度。该 26B MoE 模型推理时激活 3.8B 参数,量化后可适配 18GB VRAM,并以 Apache 2.0 许可发布。DiffusionGemma 面向本地、低并发的交互式工作流,但整体输出质量低于标准 Gemma 4。

    推荐理由:文章具体说明了 DiffusionGemma 在本地低并发推理中的速度优势,也交代了输出质量与标准 Gemma 4 的取舍。

6月9日周二
  1. Google DeepMind81

    Google DeepMind 发布 Gemma 4 12B 统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款面向笔记本本地运行的统一无编码器多模态模型,支持原生音频输入,并提供多步推理和智能体工作流能力。该模型在标准基准上的表现接近 26B MoE 模型,支持使用 16GB 内存本地运行,并以 Apache 2.0 许可证发布。

    推荐理由:文章从架构、资源占用和本地部署入口三个层面,说明 Gemma 4 12B 如何将多模态智能带到消费级笔记本。

5月22日周五
5月18日周一
  1. Google DeepMind87

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。

    推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。

5月16日周六
  1. Google DeepMind68

    WeatherNext 如何帮助美国国家飓风中心提前预测 Melissa 飓风登陆牙买加

    Google DeepMind 的 WeatherNext 帮助美国国家飓风中心提前 5 天预测 Melissa 飓风将以 Category 5 强度登陆牙买加。WeatherNext 可运行 50 个不同的情景,在登陆前 5 天以 80% 置信度预测这一结果,提前 3 天时置信度接近 100%。

    推荐理由:文章展示了 WeatherNext 如何通过 50 个情景集合同时预测飓风路径与强度,并为牙买加疏散和资源调度争取提前量。

4月16日周四
4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,升级空间与物理推理、多视角理解和任务成功检测能力。模型新增仪表读数能力,可通过工具调用、agentic vision 和代码执行解读压力表等设备。

    推荐理由:文章集中展示了 Gemini Robotics-ER 1.6 在多视角成功检测、仪表读数和安全约束上的改进,并说明开发者如何调用该模型。

4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。

    推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。

3月24日周二
  1. Mistral AI75

    Mistral AI 发布 Voxtral TTS 多语言语音生成模型

    Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。

    推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。

3月17日周二
  1. Mistral AI81

    Mistral Small 4 发布,统一推理、多模态与智能体编码能力

    Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。

    推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。

  2. Mistral AI67

    Mistral AI 发布 Mistral Small 4 并加入 NVIDIA Nemotron Coalition

    Mistral AI 发布 Mistral Small 4,并作为创始成员加入 NVIDIA Nemotron Coalition。Mistral AI 与 NVIDIA 计划结合模型架构、计算资源、开发工具和合成数据管线,共同开发开放的前沿 AI 模型。联盟首项计划是在 NVIDIA DGX Cloud 上训练基础模型,为即将推出的 NVIDIA Nemotron 4 家族提供开放基础。

    推荐理由:材料把 Mistral AI 的模型发布与 NVIDIA Nemotron Coalition 的合作安排放在一起,交代了开放模型共建的参与方式和后续方向。

2月5日周四
12月17日周三
  1. Mistral AI68

    Mistral AI 发布 Mistral OCR 3

    Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上相较 Mistral OCR 2 的整体胜率为 74%。

    推荐理由:原文同时给出跨文档类型的对比结果、API 与可视化入口及按页计价,便于评估 OCR 接入企业流程的成本与适用场景。

12月9日周二
12月3日周三
  1. Mistral AI84

    Mistral 3 发布,包含 Mistral Large 3 与 Ministral 3 系列模型

    Mistral AI 发布 Mistral 3,包含 14B、8B、3B 三个小型 dense 模型,以及采用稀疏 MoE、拥有 41B active 和 675B total 参数的 Mistral Large 3,全部采用 Apache 2.0 许可。

    推荐理由:这次发布同时覆盖端侧小模型与大规模 MoE 模型,并给出开源许可、部署格式和多家平台入口,便于比较不同规模模型的使用路径。

7月30日周三
7月15日周二
  1. Mistral AI83

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。

    推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。

7月11日周五
6月10日周二
  1. Mistral AI78

    Mistral AI 发布推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,提供 24B 参数的开源权重版本 Magistral Small,以及面向企业的 Magistral Medium。

    推荐理由:文章同时介绍了 Magistral Small 与 Medium 的定位、评测成绩和部署方式,便于比较开放权重与企业版本的使用路径。

5月28日周三
5月21日周三
5月7日周三
  1. Mistral AI78

    Mistral Medium 3 发布,主打低成本企业级性能

    Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、较低成本和简化部署的企业级模型。模型在基准测试中达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并支持四个 GPU 及以上的自托管环境。

    推荐理由:原文将 Mistral Medium 3 与 Claude Sonnet 3.7、Llama 4 Maverick 等模型放在性能和成本维度比较,并说明了企业部署与定制路径。

3月17日周一
3月7日周五
  1. Mistral AI76

    Mistral AI 发布 Mistral OCR 文档理解模型与 API

    Mistral AI 发布 Mistral OCR,一款可处理图片和 PDF 的 OCR API,能提取文本、图片、表格和公式并保持交错顺序。API mistral-ocr-latest 已在 la Plateforme 提供,定价为 1000 pages / $,batch inference 下每美元处理页数约翻倍。

    推荐理由:Mistral OCR 将复杂文档中的文本、图片、表格和公式统一提取,并支持结构化输出与自托管,适合评估多模态文档进入 RAG 和智能体流程的方式。