跳到正文

#论文/研究

今日 1 条
7月23日周四
  1. Google Research71

    Google Research 展示让量子计算机从错误中学习的强化学习控制

    Google Research 在 Nature 发表研究,展示一种强化学习框架,可利用量子错误检测事件持续调节控制参数,在计算不中断的情况下抵抗漂移。该方法在 Willow 超导处理器上使逻辑稳定性提升 3.5 倍,并在人工校准后进一步将逻辑错误率降低 20%;模拟显示所需训练迭代次数与系统规模无关。

    推荐理由:文章把量子纠错产生的错误检测事件转为强化学习信号,展示了连续校准如何在不中断计算的情况下抑制硬件漂移。

7月16日周四
  1. Google Research54

    Google Research 论文解释扩散模型的创造力来自 score smoothing

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。

7月15日周三
  1. Hugging Face Blog66

    Real World VoiceEQ 发布,用人类评价衡量语音 AI 的真实交互质量

    Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。

    推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。

7月9日周四
7月8日周三
  1. Google Research71

    Google Research 研究导航路由干预如何缓解城市交通拥堵

    Google Research 在10座美国城市开展为期6个月的实验,通过Google Maps将少于2%的行程引导至通行时间相近的替代路线。研究显示,目标路段驾驶速度中位数提升约2%,受影响路段整体提升约0.35%,并可使每座城市每年潜在减少数千吨 CO2e 排放。

    推荐理由:研究在10座美国城市开展为期6个月的路由干预实验,量化少量改道如何带来全网速度与排放变化。

7月1日周三
  1. Hugging Face Blog70

    ScarfBench:面向企业 Java 框架迁移的 AI 智能体基准

    ScarfBench 是一个用于评估 AI 智能体执行企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus。基准包含 34 个应用、204 个迁移任务和约 151K 行代码,要求应用完成构建、部署并通过行为验证;当前最强智能体的行为成功率仍低于 10%。

    推荐理由:ScarfBench把企业 Java 框架迁移拆成构建、部署和行为验证,揭示编码智能体在可编译代码之外仍受配置与运行环境依赖影响。

6月27日周六
6月25日周四
  1. Google Research53

    Google Research 论文提出线性弹性缓存,降低 Spanner 缓存成本

    Google Research 在 CIDR 2025 论文中提出线性弹性缓存,将页面淘汰建模为 ski rental 问题,并根据实时负载动态调整缓存大小。在 Spanner 生产服务器的测试中,内存使用减少 15.5%,缓存未命中增加 5.5%,TCO 降低约 5%,实际 I/O 成本仅增加 0.5%。该方法使用轻量级决策树预测页面 TTL,缓存物理空间不足时仍由 LRU 管理。

6月17日周三
  1. Google Research62

    Google Earth AI 将 Farmscapes 2020 转为自然恢复矢量数据

    Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率地图转化为包含树篱、石墙和小型林地的可操作清单。该框架使用在 300 million 全球卫星图像上预训练的 Remote Sensing Foundations Vision Transformer,并结合亚米级影像和 1-meter LiDAR 数据识别复杂农田景观。

    推荐理由:文章展示了如何将高分辨率卫星影像与 LiDAR 数据转化为可用于生态恢复和碳核算的精细化地理数据。

6月16日周二
  1. Google DeepMind74

    Google DeepMind 发布 AI Control Roadmap,构建 AI 智能体分层安全机制

    Google DeepMind 发布 AI Control Roadmap,用分层防御管理内部 AI 智能体,即使模型对齐不完善,也通过权限控制、威胁建模和系统级安全措施降低风险。

    推荐理由:文章将 AI Control Roadmap 拆解为威胁建模、监控与响应机制,并用可量化指标说明如何随智能体能力提升强化安全控制。

6月13日周六
  1. Google Research67

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。

    推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。

6月11日周四
  1. Google Research64

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用相对三样本检验审计差分隐私与机器遗忘。该框架在 SVT3 隐私违规检测中仅用几千个样本,而 DP-Auditorium 需要数百万个样本才能达到相近的检测率。对所评估的近似机器遗忘方法,只有 random label technique 通过了测试,作者同时说明实验使用了简化实现。

    推荐理由:文章把机器遗忘审计从直接比较两模型改为相对三样本检验,并展示其在隐私审计中减少样本需求、识别局部偏移的具体效果。

6月8日周一
  1. Google DeepMind74

    Google DeepMind 衡量 AI 辅助学习在塞拉利昂试验中的影响

    Google DeepMind 报告了在塞拉利昂开展的预注册试验,使用 Guided Learning 的学生数学成绩较对照组提高 +0.258 个标准差,八周内约相当于 1.2 至 1.7 年的典型学习进步。

    推荐理由:这项预注册试验同时呈现了学习成绩、互动方式与教师角色的变化,为评估 AI 如何在教师主导课堂中支持学习提供了具体证据。

6月5日周五
  1. Google Research77

    Google Research 介绍 PHRM:用智能手机摄像头被动监测心率

    Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。

    推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。

5月29日周五
  1. Google Research60

    Google Research 在 I/O 2026 展示多项 AI 研究进展

    Google Research 在 I/O 2026 集中介绍了 Gemini for Science、AI 医疗研究、端侧平台、极端天气预测、Gemini 能力改进和量子计算等方向的进展。文章还介绍了 Google Antigravity 2.0 的多智能体开发工作流、Gemma V4 上线一个月下载量超过 100 million,以及 MedGemma 下载量超过 5M。

    推荐理由:文章集中梳理 Google Research 在科学发现、医疗、开发者工具和量子计算等方向的 I/O 研究进展,呈现研究成果如何进入具体产品与实验。

5月28日周四
  1. Google Research63

    Google Research 推出基于零信任聚合的私有分析方案

    Google Research 推出一种基于零信任原则的私有分析方案,将单消息加密聚合与 TEE 结合,以减少对单一实体的信任依赖。该方案采用基于格的协议,确保服务器只能获得匿名聚合结果,原始数据不会在服务器内存中暴露或重建。Android SafetyCore 将使用这套方案评估安全工具效果,同时让用户内容留在设备端。

    推荐理由:文章解释了单消息加密聚合如何与 TEE 形成多层防护,并以 Android SafetyCore 说明其在端侧模型分析中的应用。

5月16日周六
  1. Google DeepMind66

    Google DeepMind Co-Scientist 筛出可再利用药物对抗肝纤维化

    Google DeepMind 的 Co-Scientist 从既有药物文献中提出三种候选药物,其中两种在活体人类肝细胞测试中阻断了肝纤维化并促进肝细胞再生。研究团队还测试了自己选出的两种药物,但未观察到抗纤维化效果;Co-Scientist 的突出候选是抗癌药 vorinostat,其实验中阻断了 91% 的相关损伤反应。

    推荐理由:这项研究展示了 Co-Scientist 如何从既有药物文献中提出候选,再通过人类肝细胞实验筛选抗肝纤维化药物。

4月30日周四
4月22日周三
4月20日周一
4月16日周四
4月14日周二
  1. Google Research64

    Google 推出 Vantage 研究实验评估未来技能

    Google 推出 Vantage 研究实验,利用生成式 AI 在模拟对话中评估批判性思维、协作和创造性思维等未来技能。Vantage 通过 Executive LLM 动态引导 AI 头像制造冲突等挑战,再由 AI Evaluator 按评估量表分析对话并生成技能反馈。

    推荐理由:文章拆解了 Vantage 如何用 Executive LLM 和 AI Evaluator 评估协作技能,并介绍其与纽约大学专家评分的对照结果。

4月9日周四
  1. Google Research64

    ConvApparel:Google Research 评估并缩小用户模拟器的真实性差距

    Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。

    推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。

4月3日周五
  1. Google Research67

    Google Research 评估 LLM 行为倾向与人类行为的对齐

    Google Research 提出一套评估 LLM 行为倾向与人类行为对齐程度的框架,覆盖 25 个 LLM 和专业、冲突解决、旅行预订等情境。研究让每个情境由 10 名参与者评估,并将人类偏好分布与模型响应分布进行比较。

    推荐理由:研究将经过验证的心理问卷改编为情境判断测试,比较 25 个 LLM 在共识与分歧场景中的行为对齐和置信度。

4月1日周三
  1. Google Research60

    Google Research 研究 AI 基准中每项需要多少名评测者

    Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。

    推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。

3月25日周三
  1. Google Research50

    S2Vec 如何学习城市的空间语言

    Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。

3月18日周三
  1. Google Research81

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。

    推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。

3月17日周二
  1. Google Research58

    Google Research 评测大语言模型回答高温超导研究问题的能力

    Google Research 与康奈尔大学、哈佛大学合作评测大语言模型回答高温超导研究问题的能力,NotebookLM 和定制 RAG 系统整体表现领先。专家组以 67 个问题测试了 6 个系统,结果显示,使用经过筛选的文献库的系统优于依赖开放网络来源的系统,后者更容易混淆已确立的理论与高度推测性的理论。

3月13日周五
3月12日周四
  1. Google Research72

    Google Research 在真实临床研究中探索 AMIE 对话式诊断 AI 的可行性

    Google Research 与 Beth Israel Deaconess Medical Center 开展一项前瞻性、单中心可行性研究,在门诊就诊前由 AMIE 与患者进行病史采集,并由医生实时监督。

    推荐理由:研究把 AMIE 带入真实门诊流程,呈现其在医生监督下开展病史采集、生成摘要及评估诊断表现的实证结果。

1月10日周六
  1. Berkeley AI Research55

    信息驱动的成像系统设计

    Berkeley AI Research提出一种基于互信息的框架,可直接从带噪测量中评估和优化成像系统的信息量。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四类应用中预测了下游任务表现;其IDEAL方法通过信息估计优化成像参数,达到与端到端方法相当的效果,同时减少内存和计算需求,无需任务专用的解码器设计。

11月1日周六
9月1日周一
  1. Berkeley AI Research59

    word2vec 究竟学到了什么?理论显示其特征学习近似 PCA

    一篇新论文为 word2vec 的学习过程建立了闭式理论,指出在特定近似条件下,其训练可化为无权最小二乘矩阵分解,最终学习到的表示对应目标矩阵的主成分。理论显示,模型从小初始化开始,会按离散步骤逐个学习正交线性概念并增加嵌入矩阵的秩;在类比补全基准上,近似模型达到 66% 准确率,原始 word2vec 为 68%。

7月23日周三