跳到正文

全部动态

今日 6 条
8月27日周四
  1. Google Research49

    GlucoFM:用于连续血糖监测的基础模型

    GlucoFM 是一种用于连续血糖监测(CGM)的自监督基础模型,以双流设计分离较慢的血糖趋势与短期偏差,并保留时段和缺失信息。在四个队列、七项临床预测任务的14项队列—任务评估中,其平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高5.8个百分点,并在糖尿病风险和β细胞功能障碍评估中全部领先。

  2. Google DeepMind78

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。

8月26日周三
8月25日周二
  1. Hugging Face Blog80

    Granite 4.2 推理模型家族如何构建

    IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。

    推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。

  2. Hugging Face Blog80

    Gradio 如何用 gr.Workflow 连接、运行和部署 AI 工作流

    Gradio 的 gr.Workflow 将 AI 流程表示为带类型节点的图,提供可拖放画布,让每个节点都能运行并查看中间结果。同一张工作流图还可作为 REST API,并通过一条命令部署到 Hugging Face Spaces。

    推荐理由:文章通过图像编辑、媒体工作室、数据集分析和 ZeroGPU 动画示例,展示 gr.Workflow 如何把可视化调试、API 调用与部署整合到同一张工作流图中。

  3. Mistral AI57

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖沙特及中东地区的 AI 基础设施、先进模型开发和 AI 解决方案部署。双方将探索利用 HUMAIN 的数据中心基础设施,并重点推进网络安全、语音及阿拉伯语 frontier models。此次合作金额为 hundreds of millions of Euros,双方还计划面向沙特受监管行业制定联合市场策略。

8月22日周六
  1. Google Research63

    Google Research 介绍用于筛选可穿戴设备生物标志物候选的 AI 工具

    Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下,通过假设生成、统计分析、模型训练、对抗验证和文献推理筛选候选生物标志物的多智能体系统。

    推荐理由:文章展示了如何将确定性统计计算、生成式推理与对抗验证组成闭环,在人工监督下筛选可解释的可穿戴设备生物标志物候选。

8月21日周五
  1. Google DeepMind65

    Google DeepMind 携手 Fenris Creations 推进 EVE 宇宙 AI 游戏研究

    Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。

    推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。

  2. Google Research55

    Google Research 如何用移动数据让语言模型更深入理解地点

    Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合移动模式与地点文本表示结合,以建模地点的动态功能。在洛杉矶和休斯顿的未见地点测试中,该框架使访问意图预测相对提升最高达 81.9%,价格水平分类提升 75.1%,繁忙程度估计准确率提升 24.7%。ME-POIs 面向地点和商家的群体性聚合特征,不用于个人个性化推断。

  3. Microsoft Research60

    Microsoft Research 发布 Skala 1.1,扩展 DFT 精度与软件集成

    Microsoft Research 发布 Skala 1.1,训练数据量达到上一版本的 2.5x,并在热化学、反应动力学和分子结构预测等任务中提升准确性。在 GMTKN55 的 55 个类别中,Skala 1.1 有 32 个类别获得最高排名,当前已集成到 CP2K,并正在接入 Psi4、FHI-aims、ORCA 和 VASP。

    推荐理由:文章将 Skala 1.1 的精度提升、2.5x 数据扩展与 CP2K 等软件集成放在一起,呈现其从模型改进走向科研工作流应用的路径。

8月20日周四
  1. Mistral AI78

    Mistral AI 发布 Agentic Search,提升复杂文档检索准确率并降低延迟

    Mistral AI 发布 Agentic Search,通过多步检索循环让 AI 系统搜索、打开、导航、读取并验证复杂文档中的信息。FinanceBench 上准确率从 26.7% 提升至 86%,OfficeQA Pro 上从 6.3% 提升至 51.9%,p90 延迟最高降低 39.6%,token 消耗最高减少三分之一。

    推荐理由:文章通过 FinanceBench 与 OfficeQA Pro 的对比,具体展示 Agentic Search 如何在复杂文档检索中兼顾准确率、延迟与 token 消耗。

8月19日周三
  1. Hugging Face Blog68

    智能体需要多少记忆?ALTK-Evolve 在八个模型上的评测

    ALTK-Evolve 在 AppWorld 的八模型评测显示,智能体记忆的合适剂量取决于模型能力:强模型适合完整指南集,较弱模型适合固定核心加按任务检索,已饱和模型未见可测增益。

    推荐理由:文章用 AppWorld 上八个模型的对比,说明智能体记忆应按模型能力校准,并展示完整指南集与精选检索在效果和 token 成本上的差异。

8月18日周二
  1. Hugging Face Blog64

    相同集群利用率提升33个百分点:GPU 分配器改变的是调度顺序

    Dharma AI 构建约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器比较;相同硬件和工作负载下,GPU 利用率最高提升33个百分点,优先级加权产出最高提升105.1%。分配器按实时需求曲线和批处理作业优先级规划整个调度周期,在64 GPUs、30 jobs的规模测试中以15 ms延迟带来15.9%的价值提升。

    推荐理由:文章用七个场景比较约束感知 GPU 分配器与 FIFO 调度器,展示同等硬件和工作负载下,调度顺序如何影响利用率与优先级加权产出。

8月17日周一
  1. Google Research63

    Google Research 提出 PhotoScan 用智能手机图像估计心脏代谢风险

    Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。

    推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。

8月14日周五
  1. Hugging Face Blog81

    Hugging Face《开放模型现状:2026 夏季观察》分析开放模型生态变化

    Hugging Face发布《开放模型现状:2026 夏季观察》,基于2026年前七个月的 Hub 数据分析开放模型生态变化。报告显示,公共模型仓库从2.43 million增至2.96 million,数据集从711,000增至1 million,Qwen衍生模型达到151,448个。

    推荐理由:报告将模型下载、点赞与衍生仓库分开观察,呈现中国大模型、Qwen生态和智能体流量在开放模型体系中的不同位置。

  2. Hugging Face Blog69

    用 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 完成机器人数据记录、训练与部署

    Strands Robots 将机器人示范记录、同步、流式训练和策略部署串成一条数据闭环,数据全程保持 LeRobot 格式。教程展示了如何把数据同步到 Hugging Face Storage Bucket,通过 Xet 仅上传变化字节,并从 Hub 流式读取训练而不先完整下载;训练后的 checkpoint 可通过 mode="real" 部署回实体机器人。

    推荐理由:文章把机器人示范采集、数据同步、流式训练和策略部署串成一条可运行链路,展示了 Storage Buckets 如何减少重复传输。

8月13日周四
  1. Microsoft Research66

    MindTopo 基准揭示 VLM 的拓扑空间推理能力

    Microsoft Research 团队提出 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和打结五类拓扑关系的理解。基准同时测试静态场景推理与交互规划,结果显示模型在静态识别上的表现普遍优于需要通过连续动作维持或改变拓扑关系的规划任务。错误通常出现在规划阶段,模型会丢失结构关系或提出违反环境物理约束的动作。

    推荐理由:MindTopo 将静态拓扑识别与交互规划放在同一基准中比较,帮助定位多模态模型从感知到行动的能力断点。

8月12日周三
  1. Microsoft Research65

    Microsoft Research 发布 CARE-X 胸部 X 光 VLM 研究模型

    Microsoft Research 介绍 CARE-X,一款结合报告生成、结构化预测、辅助监督和 DAPO 强化学习的胸部 X 光 VLM。CARE-X 在多项报告生成、问答、定位和分类任务上进行评估;独立实验还将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,在五类测量依赖条件上的平均 F1 提升 43.6 个百分点。

    推荐理由:文章展示了如何将生成、结构化预测与确定性测量工具结合,用于提升胸部 X 光任务中的定位、分类和定量判断能力。

8月11日周二
  1. Hugging Face Blog68

    ALTK-Evolve 以更少 tokens 交付智能体记忆,对比 ACE

    ALTK-Evolve 与 ACE 都让智能体从自身轨迹学习可复用经验,但前者按任务和模型能力选择交付 guideline,后者每步注入完整 playbook。

    推荐理由:文章在同一 AppWorld 与基础 ReAct 智能体上比较两种记忆交付方式,展示按模型能力调节上下文如何兼顾任务成绩与 tokens 成本。

  2. Mistral AI75

    Mistral推出区域推理端点、优先级服务并接入第三方开放模型

    Mistral推出一般可用的 Regional Endpoints,支持客户选择在欧洲或美国运行推理,并在公开预览中提供带 uptime SLA 和自定义速率限制的 Priority Tier。平台还将接入第三方开放模型,首个为 Z.ai 的 GLM-5.2;同时,Mistral在欧洲组建长期算力联盟,通过 European Compute Units 提供多年基础设施访问。

    推荐理由:文章把区域合规、服务可靠性和模型选择放在同一平台框架中,具体呈现了企业获得统一基础设施的路径。

  3. Hugging Face Blog74

    NVIDIA Magpie TTS 多语言模型发布,支持 12 种语言与低延迟部署

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,模型规模为 364M parameters,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。

    推荐理由:文章将开放权重、12 种语言支持、NIM 部署和延迟数据放在同一框架中,便于评估多语言语音智能体的落地路径。

8月10日周一
  1. Hugging Face Blog88

    Meta 发布 Muse Glimmer 30B 开源多模态模型

    Meta 发布 Muse Glimmer 30B,这是一款面向本地智能体场景的开源多模态模型,采用 Apache 2.0 许可,并支持图像、视频和多模态工具调用。模型已获得 transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持,还提供 DFlash speculative decoding 和微调示例。

    推荐理由:文章既交代 Muse Glimmer 的 30B 架构与开源许可,也提供本地部署、推理加速和智能体接入的可复用路径。

8月6日周四
  1. Google DeepMind87

    Google DeepMind 开源 WeatherNext,飓风预测平均提前获得一天优势

    Google DeepMind 发布并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini,WeatherNext Cyclones 在飓风路径、强度和风场结构预测上平均获得超过 24 小时的提前量。

    推荐理由:原文同时给出 WeatherNext 的预测增益、训练数据规模和开源范围,便于了解 AI 气象模型如何支持更早的飓风风险研判。

8月4日周二
  1. Microsoft Research84

    Microsoft Research 发布 Orchard 开源智能体框架

    Microsoft Research 发布 Orchard 开源框架,以 Orchard Env 这一 Kubernetes 环境服务支持智能体训练、数据生成和评估,并可在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练。

    推荐理由:文章展示了统一环境服务如何复用训练与评估基础设施,并用三个领域配方和具体基准结果呈现小型开放权重模型的实践路径。

7月31日周五