跳到正文

全部动态

今日 6 条
7月1日周三
  1. Hugging Face Blog70

    ScarfBench:面向企业 Java 框架迁移的 AI 智能体基准

    ScarfBench 是一个用于评估 AI 智能体执行企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus。基准包含 34 个应用、204 个迁移任务和约 151K 行代码,要求应用完成构建、部署并通过行为验证;当前最强智能体的行为成功率仍低于 10%。

    推荐理由:ScarfBench把企业 Java 框架迁移拆成构建、部署和行为验证,揭示编码智能体在可编译代码之外仍受配置与运行环境依赖影响。

  2. Google Research74

    Google Research 将 Heat Resilience 屋顶反射率数据扩展至全球 50+ 城市

    Google Research 发布覆盖全球 50+ 城市的建筑级屋顶反射率数据,并上线 Heat Resilience Earth Engine App。该方法融合 Sentinel-2 与 30-cm 卫星影像,生成建筑级反照率地图,在 Boulder 数据验证中的 RMSE 为 0.04。

    推荐理由:文章展示了 Google Research 如何把多源遥感数据转化为建筑级屋顶反射率信息,支持城市规划者定位降温改造对象。

6月30日周二
  1. Hugging Face Blog49

    为什么 AI 系统的专业化不可避免

    优化理论、生物学与竞争市场共同指向:在算力、数据和开发时间有限的条件下,AI 系统通过专注特定目标、以广度换取匹配度,往往能获得更高性能。Goldfeder 等人在 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》中进一步论证,通用性并非性能优势,“普适通用”在实践中只是神话。

  2. Google Research70

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,这一面向表格数据分类和回归的基础模型可通过单次前向传播生成预测,无需手动训练、超参数调优或复杂特征工程。TabFM 采用交替行列注意力、行压缩和 Transformer,并基于数亿个合成数据集训练。

    推荐理由:文章解释了 TabFM 如何用交替行列注意力、行压缩和合成数据训练,将表格分类与回归转为零样本推理,并给出 BigQuery 使用入口。

6月27日周六
6月25日周四
  1. Google Research53

    Google Research 论文提出线性弹性缓存,降低 Spanner 缓存成本

    Google Research 在 CIDR 2025 论文中提出线性弹性缓存,将页面淘汰建模为 ski rental 问题,并根据实时负载动态调整缓存大小。在 Spanner 生产服务器的测试中,内存使用减少 15.5%,缓存未命中增加 5.5%,TCO 降低约 5%,实际 I/O 成本仅增加 0.5%。该方法使用轻量级决策树预测页面 TTL,缓存物理空间不足时仍由 LRU 管理。

  2. Google DeepMind81

    Google DeepMind 将 computer use 内置于 Gemini 3.5 Flash

    Google DeepMind 将 computer use 内置到 Gemini 3.5 Flash,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端和桌面环境运行的智能体。该能力面向持续软件测试和专业应用中的知识工作等长流程自动化任务,并提供用户确认、间接提示注入识别后自动停止等可选企业安全机制。

    推荐理由:原文既说明了 computer use 从独立模型转为 Gemini 3.5 Flash 内置工具,也给出企业安全防护与接入方式。

6月24日周三
  1. Mistral AI76

    Mistral AI 为 Connectors 带来更多连接器控制能力

    Mistral AI 为 Connectors 新增工作区与组织级管理、带权限范围的 API keys、多账户连接器和 Connectors Debugger。Connectors in Vibe Code 已 GA,Connectors in Workflows 处于 Public Preview;目录现有超过 60 个集成,并支持自定义 MCP 连接器。

    推荐理由:这次更新集中说明了企业智能体接入外部系统所需的授权边界、自动化身份和故障定位能力,并列出各项功能的可用状态。

6月23日周二
  1. Mistral AI71

    Mistral AI 发布 Mistral OCR 4 文档解析模型

    Mistral AI 发布 Mistral OCR 4,支持 170 languages,并可返回 bounding boxes、区块类型和逐词 confidence scores。

    推荐理由:文章同时呈现了 Mistral OCR 4 的结构化解析能力、部署方式与成本,便于比较其在企业文档流程中的适用场景。

6月17日周三
  1. Google DeepMind53

    Google DeepMind与英国政府合作开发基于Gemini的规划工具原型,目标将申请处理时间减半

    Google DeepMind与英国政府合作开发基于Gemini的AI规划工具原型,目标将房主规划申请的处理时间缩短50%。工具可整理申请数据、匹配相关政策、汇总反馈并起草评估报告,规划官员仍保留逐行审核和最终批准或拒绝的权力。英国政府计划在早期试验后,于2027年向全国所有地方议会提供该工具。

  2. Google Research62

    Google Earth AI 将 Farmscapes 2020 转为自然恢复矢量数据

    Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率地图转化为包含树篱、石墙和小型林地的可操作清单。该框架使用在 300 million 全球卫星图像上预训练的 Remote Sensing Foundations Vision Transformer,并结合亚米级影像和 1-meter LiDAR 数据识别复杂农田景观。

    推荐理由:文章展示了如何将高分辨率卫星影像与 LiDAR 数据转化为可用于生态恢复和碳核算的精细化地理数据。

6月16日周二
  1. Google DeepMind74

    Google DeepMind 发布 AI Control Roadmap,构建 AI 智能体分层安全机制

    Google DeepMind 发布 AI Control Roadmap,用分层防御管理内部 AI 智能体,即使模型对齐不完善,也通过权限控制、威胁建模和系统级安全措施降低风险。

    推荐理由:文章将 AI Control Roadmap 拆解为威胁建模、监控与响应机制,并用可量化指标说明如何随智能体能力提升强化安全控制。

6月13日周六
  1. Google Research67

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。

    推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。

6月11日周四
  1. Google Research64

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用相对三样本检验审计差分隐私与机器遗忘。该框架在 SVT3 隐私违规检测中仅用几千个样本,而 DP-Auditorium 需要数百万个样本才能达到相近的检测率。对所评估的近似机器遗忘方法,只有 random label technique 通过了测试,作者同时说明实验使用了简化实现。

    推荐理由:文章把机器遗忘审计从直接比较两模型改为相对三样本检验,并展示其在隐私审计中减少样本需求、识别局部偏移的具体效果。

  2. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma 文本扩散模型,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散和并行生成,在专用 GPU 上实现最高 4 倍的文本生成速度。该 26B MoE 模型推理时激活 3.8B 参数,量化后可适配 18GB VRAM,并以 Apache 2.0 许可发布。DiffusionGemma 面向本地、低并发的交互式工作流,但整体输出质量低于标准 Gemma 4。

    推荐理由:文章具体说明了 DiffusionGemma 在本地低并发推理中的速度优势,也交代了输出质量与标准 Gemma 4 的取舍。

6月10日周三
6月9日周二
  1. Google DeepMind81

    Google DeepMind 发布 Gemma 4 12B 统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款面向笔记本本地运行的统一无编码器多模态模型,支持原生音频输入,并提供多步推理和智能体工作流能力。该模型在标准基准上的表现接近 26B MoE 模型,支持使用 16GB 内存本地运行,并以 Apache 2.0 许可证发布。

    推荐理由:文章从架构、资源占用和本地部署入口三个层面,说明 Gemma 4 12B 如何将多模态智能带到消费级笔记本。

6月8日周一
  1. Google DeepMind74

    Google DeepMind 衡量 AI 辅助学习在塞拉利昂试验中的影响

    Google DeepMind 报告了在塞拉利昂开展的预注册试验,使用 Guided Learning 的学生数学成绩较对照组提高 +0.258 个标准差,八周内约相当于 1.2 至 1.7 年的典型学习进步。

    推荐理由:这项预注册试验同时呈现了学习成绩、互动方式与教师角色的变化,为评估 AI 如何在教师主导课堂中支持学习提供了具体证据。

6月5日周五
  1. Google Research77

    Google Research 介绍 PHRM:用智能手机摄像头被动监测心率

    Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。

    推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。

6月4日周四
  1. Google Research74

    Google Research 开源 Flood Hub 水文建模框架

    Google Research 将用于 Flood Hub 的水文建模框架开源至 GitHub,供气象水文机构训练和本地化微调 AI 洪水预报模型。框架以 Python 和 PyTorch 实现,包含 LSTM 架构、训练流水线、交互式教程,并支持使用 Caravan 历史河流数据及地方数据。

    推荐理由:原文同时交代了框架、训练数据、教程和实际接入案例,读者可据此了解 AI 洪水预报如何进入地方业务流程。

5月29日周五
  1. Google Research60

    Google Research 在 I/O 2026 展示多项 AI 研究进展

    Google Research 在 I/O 2026 集中介绍了 Gemini for Science、AI 医疗研究、端侧平台、极端天气预测、Gemini 能力改进和量子计算等方向的进展。文章还介绍了 Google Antigravity 2.0 的多智能体开发工作流、Gemma V4 上线一个月下载量超过 100 million,以及 MedGemma 下载量超过 5M。

    推荐理由:文章集中梳理 Google Research 在科学发现、医疗、开发者工具和量子计算等方向的 I/O 研究进展,呈现研究成果如何进入具体产品与实验。

5月28日周四
  1. Mistral AI84

    Mistral 发布 Vibe,统一工作与编码智能体

    Mistral 发布 Vibe,将 Le Chat 的工作能力与编码能力整合为一个可处理长时、多步骤任务的 AI 智能体。Work Mode 支持跨企业工具执行研究、数据分析和文档撰写,Code Mode 则可连接 GitHub,在网页、VS Code 和 CLI 中完成编码任务并生成 pull request。

    推荐理由:文章同时梳理了 Vibe 的工作与编码模式、连接器和部署方案,并列出套餐与 Le Chat 迁移安排,便于判断其适用场景。

  2. Mistral AI70

    Mistral AI 发布开源 Search Toolkit 公测版

    Mistral AI 发布 Search Toolkit public preview,这是一个用于构建 AI 应用生产级搜索流水线的开源框架,统一了数据摄取、检索和评估接口。它支持 BM25、基于嵌入向量的密集检索与混合检索,并提供 recall、precision、MRR 和 NDCG 等评估指标,可部署在云端、本地或边缘基础设施上。

    推荐理由:Search Toolkit 将数据摄取、检索与评估置于统一接口下,并提供 BM25、向量和混合检索,便于团队在自有数据上比较检索质量。

  3. Google Research63

    Google Research 推出基于零信任聚合的私有分析方案

    Google Research 推出一种基于零信任原则的私有分析方案,将单消息加密聚合与 TEE 结合,以减少对单一实体的信任依赖。该方案采用基于格的协议,确保服务器只能获得匿名聚合结果,原始数据不会在服务器内存中暴露或重建。Android SafetyCore 将使用这套方案评估安全工具效果,同时让用户内容留在设备端。

    推荐理由:文章解释了单消息加密聚合如何与 TEE 形成多层防护,并以 Android SafetyCore 说明其在端侧模型分析中的应用。

5月27日周三
  1. Mistral AI47

    Mistral:塑造行业的 Physics AI 研究

    Mistral 收购 Emmi AI 后,将其研究并入自身,持续推进面向工业工程的 Physics AI 基础研究与企业解决方案。相关成果覆盖 CFD、空气动力学、汽车、航空航天与核聚变等领域,包括 AB-UPT、NeuralDEM、UPT 和 GyroSwin。最新数据集包含约 30,000 个 3D 翼型样本,AB-UPT 可在单块 GPU 上处理 9M 表面单元和 140M 体积单元。

5月23日周六
  1. Mistral AI66

    Mistral AI 达成收购 Physics AI 公司 Emmi AI 的协议

    Mistral AI 已达成收购 Emmi AI 的协议,以增强模型理解和建模物理的能力,并让 AI 智能体使用现有工程工具。Emmi AI 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队,双方将推进实时仿真、数字孪生及面向工程师的智能体。

    推荐理由:这项收购串联了 Physics AI、工程工具与智能体能力,呈现 Mistral AI 面向工业研发和制造扩展产品布局的具体路径。

5月22日周五
  1. Mistral AI79

    Mistral AI 在 Studio 推出 Connectors,支持内置与自定义 MCP

    Mistral AI 在 Studio 推出 Connectors,内置连接器和自定义 MCP 现可通过 API/SDK 用于模型与智能体调用。Connectors 还支持直接工具调用、人工审批,以及连接器的创建、修改、查询和删除。

    推荐理由:原文展示了 Connectors 如何把 MCP 集成、工具调用和人工审批纳入 Studio,开发者可据此理解企业智能体接入外部系统的实现路径。

5月20日周三
  1. Google Research72

    Google Research 发布 ERA 并逐步开放 Computational Discovery

    Google Research 发布由 Gemini 驱动的 Empirical Research Assistance(ERA),并开始通过 Gemini for Science 逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery。

    推荐理由:文章把 ERA 的研究结果、科学问题案例与开放路径放在一起,便于了解它如何从代码优化系统走向可供科研人员试用的工具。

5月19日周二
5月18日周一