跳到正文

#开源生态

今日 0 条
9月29日周二
  1. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,一款面向表格分类和回归的开放基础模型,可在单次前向推理中直接预测新行,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三种规格,通过 Hugging Face 提供,采用 OpenMDW-1.1 license,支持商业使用。

    推荐理由:材料同时交代了免训练推理、人工数据预训练方式与四项基准结果,便于评估其工程可用性。

9月28日周一
9月22日周二
9月16日周三
9月1日周二
8月25日周二
  1. Hugging Face Blog80

    Granite 4.2 推理模型家族如何构建

    IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。

    推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。

8月21日周五
8月11日周二
  1. Hugging Face Blog74

    NVIDIA Magpie TTS 多语言模型发布,支持 12 种语言与低延迟部署

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,模型规模为 364M parameters,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。

    推荐理由:文章将开放权重、12 种语言支持、NIM 部署和延迟数据放在同一框架中,便于评估多语言语音智能体的落地路径。

8月10日周一
  1. Hugging Face Blog88

    Meta 发布 Muse Glimmer 30B 开源多模态模型

    Meta 发布 Muse Glimmer 30B,这是一款面向本地智能体场景的开源多模态模型,采用 Apache 2.0 许可,并支持图像、视频和多模态工具调用。模型已获得 transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持,还提供 DFlash speculative decoding 和微调示例。

    推荐理由:文章既交代 Muse Glimmer 的 30B 架构与开源许可,也提供本地部署、推理加速和智能体接入的可复用路径。

8月6日周四
  1. Google DeepMind87

    Google DeepMind 开源 WeatherNext,飓风预测平均提前获得一天优势

    Google DeepMind 发布并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini,WeatherNext Cyclones 在飓风路径、强度和风场结构预测上平均获得超过 24 小时的提前量。

    推荐理由:原文同时给出 WeatherNext 的预测增益、训练数据规模和开源范围,便于了解 AI 气象模型如何支持更早的飓风风险研判。

7月27日周一
  1. Hugging Face Blog77

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一款由动作条件驱动、面向手术机器人的实时生成式模拟器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,针对 dVRK 桌面缝合进行训练,在单张 NVIDIA RTX PRO 6000 上可达约 160 frames per second。

    推荐理由:文章展示了从世界模型蒸馏到实时闭环模拟的技术路径,并给出手术机器人策略训练与评估的具体应用方向。

7月16日周四
7月15日周三
7月2日周四
6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma 文本扩散模型,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散和并行生成,在专用 GPU 上实现最高 4 倍的文本生成速度。该 26B MoE 模型推理时激活 3.8B 参数,量化后可适配 18GB VRAM,并以 Apache 2.0 许可发布。DiffusionGemma 面向本地、低并发的交互式工作流,但整体输出质量低于标准 Gemma 4。

    推荐理由:文章具体说明了 DiffusionGemma 在本地低并发推理中的速度优势,也交代了输出质量与标准 Gemma 4 的取舍。

3月17日周二
  1. Mistral AI81

    Mistral Small 4 发布,统一推理、多模态与智能体编码能力

    Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。

    推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。

2月5日周四
12月9日周二
12月3日周三
  1. Mistral AI84

    Mistral 3 发布,包含 Mistral Large 3 与 Ministral 3 系列模型

    Mistral AI 发布 Mistral 3,包含 14B、8B、3B 三个小型 dense 模型,以及采用稀疏 MoE、拥有 41B active 和 675B total 参数的 Mistral Large 3,全部采用 Apache 2.0 许可。

    推荐理由:这次发布同时覆盖端侧小模型与大规模 MoE 模型,并给出开源许可、部署格式和多家平台入口,便于比较不同规模模型的使用路径。

7月11日周五
6月10日周二
  1. Mistral AI78

    Mistral AI 发布推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,提供 24B 参数的开源权重版本 Magistral Small,以及面向企业的 Magistral Medium。

    推荐理由:文章同时介绍了 Magistral Small 与 Medium 的定位、评测成绩和部署方式,便于比较开放权重与企业版本的使用路径。

5月21日周三
3月17日周一