跳到正文

全部动态

今日 39 条
9月2日周三
9月1日周二
  1. Hugging Face Blog76

    Hugging Face 发布 @huggingface/kernels 与 Fleet,推出 207 个 WebGPU Kernels

    Hugging Face 发布 JavaScript 库 @huggingface/kernels 和浏览器 GPU 基准测试套件 Fleet,并在 Hugging Face Hub 提供首批 207 个 WebGPU kernels。

    推荐理由:文章同时给出 207 个 kernel 的版本化组织方式、Fleet 众测机制和 ORT WebGPU 对比数据,便于理解浏览器推理性能优化的落地路径。

8月31日周一
  1. Import AI54

    Import AI 471:为何 Hugging Face 攻击事件令人担忧,以及太空采矿与五眼联盟的 AI 立场

    Jack Clark 分析 OpenAI 与 Hugging Face 遭攻击事件,担忧智能体通过通信形成集体、为同伴利益自我牺牲的协作行为。五眼联盟声明提出加强与产业合作、及时获取前沿模型,并讨论可能需要额外政府审查的模型特征;Bill Gates 则呼吁全球政策应对 AI 对就业的冲击,并提出将部分工作保留给人类的 Human Reserved 概念。

8月28日周五
  1. Hugging Face Blog74

    Hugging Face 与 Voice Arena 为 Open ASR Leaderboard 加入 Hindi 和 Indian English 评测

    Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。

    推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。

  2. Google Research69

    Google Research 推出 planetary prediction engine,自动完成地理空间建模

    Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。

    推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。

  3. Google DeepMind83

    Google DeepMind 发布 Gemini Omni 1.1 Flash,增强视频生成控制能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展、首尾帧插值、视频参考和最高 4K 输出等生成视频能力。模型可分析最多 10 秒的既有上下文,将视频按 10 秒增量延展至累计 40 秒;360p 预览生成速度最高提升 60%,成本为标准 720p 的三分之一。

    推荐理由:文章集中说明了视频生成的控制能力、迭代速度与输出规格变化,并给出 API 接入方式和适用的创作工作流。

8月27日周四
  1. Google DeepMind67

    Google DeepMind 试点首个双盲 AI 评测

    Google DeepMind 宣布开展首个针对专有前沿级 AI 模型的双盲评测,以防止模型提前接触测试题目。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护的加密环境中使用机密基准测试 Gemini Flash Lite。

    推荐理由:文章说明加密环境如何把外部评测与模型后续优化隔离开,为理解 benchmark contamination 及其对评测可信度的影响提供了具体机制。

  2. Google Research49

    GlucoFM:用于连续血糖监测的基础模型

    GlucoFM 是一种用于连续血糖监测(CGM)的自监督基础模型,以双流设计分离较慢的血糖趋势与短期偏差,并保留时段和缺失信息。在四个队列、七项临床预测任务的14项队列—任务评估中,其平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高5.8个百分点,并在糖尿病风险和β细胞功能障碍评估中全部领先。

  3. Google DeepMind78

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。

8月26日周三
8月25日周二
  1. Hugging Face Blog80

    Granite 4.2 推理模型家族如何构建

    IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。

    推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。

  2. Hugging Face Blog80

    Gradio 如何用 gr.Workflow 连接、运行和部署 AI 工作流

    Gradio 的 gr.Workflow 将 AI 流程表示为带类型节点的图,提供可拖放画布,让每个节点都能运行并查看中间结果。同一张工作流图还可作为 REST API,并通过一条命令部署到 Hugging Face Spaces。

    推荐理由:文章通过图像编辑、媒体工作室、数据集分析和 ZeroGPU 动画示例,展示 gr.Workflow 如何把可视化调试、API 调用与部署整合到同一张工作流图中。

  3. Mistral AI57

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖沙特及中东地区的 AI 基础设施、先进模型开发和 AI 解决方案部署。双方将探索利用 HUMAIN 的数据中心基础设施,并重点推进网络安全、语音及阿拉伯语 frontier models。此次合作金额为 hundreds of millions of Euros,双方还计划面向沙特受监管行业制定联合市场策略。

8月24日周一
8月22日周六
  1. Google Research63

    Google Research 介绍用于筛选可穿戴设备生物标志物候选的 AI 工具

    Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下,通过假设生成、统计分析、模型训练、对抗验证和文献推理筛选候选生物标志物的多智能体系统。

    推荐理由:文章展示了如何将确定性统计计算、生成式推理与对抗验证组成闭环,在人工监督下筛选可解释的可穿戴设备生物标志物候选。

8月21日周五
  1. Google DeepMind65

    Google DeepMind 携手 Fenris Creations 推进 EVE 宇宙 AI 游戏研究

    Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。

    推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。

  2. Google Research55

    Google Research 如何用移动数据让语言模型更深入理解地点

    Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合移动模式与地点文本表示结合,以建模地点的动态功能。在洛杉矶和休斯顿的未见地点测试中,该框架使访问意图预测相对提升最高达 81.9%,价格水平分类提升 75.1%,繁忙程度估计准确率提升 24.7%。ME-POIs 面向地点和商家的群体性聚合特征,不用于个人个性化推断。

  3. Microsoft Research60

    Microsoft Research 发布 Skala 1.1,扩展 DFT 精度与软件集成

    Microsoft Research 发布 Skala 1.1,训练数据量达到上一版本的 2.5x,并在热化学、反应动力学和分子结构预测等任务中提升准确性。在 GMTKN55 的 55 个类别中,Skala 1.1 有 32 个类别获得最高排名,当前已集成到 CP2K,并正在接入 Psi4、FHI-aims、ORCA 和 VASP。

    推荐理由:文章将 Skala 1.1 的精度提升、2.5x 数据扩展与 CP2K 等软件集成放在一起,呈现其从模型改进走向科研工作流应用的路径。

8月20日周四
  1. Mistral AI78

    Mistral AI 发布 Agentic Search,提升复杂文档检索准确率并降低延迟

    Mistral AI 发布 Agentic Search,通过多步检索循环让 AI 系统搜索、打开、导航、读取并验证复杂文档中的信息。FinanceBench 上准确率从 26.7% 提升至 86%,OfficeQA Pro 上从 6.3% 提升至 51.9%,p90 延迟最高降低 39.6%,token 消耗最高减少三分之一。

    推荐理由:文章通过 FinanceBench 与 OfficeQA Pro 的对比,具体展示 Agentic Search 如何在复杂文档检索中兼顾准确率、延迟与 token 消耗。

8月19日周三
  1. Hugging Face Blog68

    智能体需要多少记忆?ALTK-Evolve 在八个模型上的评测

    ALTK-Evolve 在 AppWorld 的八模型评测显示,智能体记忆的合适剂量取决于模型能力:强模型适合完整指南集,较弱模型适合固定核心加按任务检索,已饱和模型未见可测增益。

    推荐理由:文章用 AppWorld 上八个模型的对比,说明智能体记忆应按模型能力校准,并展示完整指南集与精选检索在效果和 token 成本上的差异。

8月18日周二
  1. Hugging Face Blog64

    相同集群利用率提升33个百分点:GPU 分配器改变的是调度顺序

    Dharma AI 构建约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器比较;相同硬件和工作负载下,GPU 利用率最高提升33个百分点,优先级加权产出最高提升105.1%。分配器按实时需求曲线和批处理作业优先级规划整个调度周期,在64 GPUs、30 jobs的规模测试中以15 ms延迟带来15.9%的价值提升。

    推荐理由:文章用七个场景比较约束感知 GPU 分配器与 FIFO 调度器,展示同等硬件和工作负载下,调度顺序如何影响利用率与优先级加权产出。

8月17日周一
  1. Google Research63

    Google Research 提出 PhotoScan 用智能手机图像估计心脏代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。

    推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。

8月14日周五
  1. Hugging Face Blog81

    Hugging Face《开放模型现状:2026 夏季观察》分析开放模型生态变化

    Hugging Face发布《开放模型现状:2026 夏季观察》,基于2026年前七个月的 Hub 数据分析开放模型生态变化。报告显示,公共模型仓库从2.43 million增至2.96 million,数据集从711,000增至1 million,Qwen衍生模型达到151,448个。

    推荐理由:报告将模型下载、点赞与衍生仓库分开观察,呈现中国大模型、Qwen生态和智能体流量在开放模型体系中的不同位置。

  2. Hugging Face Blog69

    用 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 完成机器人数据记录、训练与部署

    Strands Robots 将机器人示范记录、同步、流式训练和策略部署串成一条数据闭环,数据全程保持 LeRobot 格式。教程展示了如何把数据同步到 Hugging Face Storage Bucket,通过 Xet 仅上传变化字节,并从 Hub 流式读取训练而不先完整下载;训练后的 checkpoint 可通过 mode="real" 部署回实体机器人。

    推荐理由:文章把机器人示范采集、数据同步、流式训练和策略部署串成一条可运行链路,展示了 Storage Buckets 如何减少重复传输。

8月13日周四
  1. Microsoft Research66

    MindTopo 基准揭示 VLM 的拓扑空间推理能力

    Microsoft Research 团队提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现普遍优于需要通过连续动作维持或改变拓扑关系的规划任务。错误通常出现在规划阶段,模型会丢失结构关系或提出违反环境物理约束的动作。

    推荐理由:MindTopo 将静态拓扑识别与交互规划放在同一基准中比较,帮助定位多模态模型从感知到行动的能力断点。

8月12日周三