跳到正文

全部动态

今日 2 条
7月26日周日
  1. Berkeley AI Research58

    ABBEL 通过信念状态提升 LLM 长程交互效率

    Berkeley AI Research 提出 ABBEL,通过周期性更新并监督自然语言信念状态,让智能体在长程交互中用信念替代完整历史作为工作上下文。在 CollabBench 协作编码中,重构式信念评分将与完整上下文模型的性能差距缩小约50%,训练步数从100降至50,同时峰值上下文 token 长度低于完整上下文设置。

7月23日周四
  1. Google Research71

    Google Research 展示让量子计算机从错误中学习的强化学习控制

    Google Research 在 Nature 发表研究,展示一种强化学习框架,可利用量子错误检测事件持续调节控制参数,在计算不中断的情况下抵抗漂移。该方法在 Willow 超导处理器上使逻辑稳定性提升 3.5 倍,并在人工校准后进一步将逻辑错误率降低 20%;模拟显示所需训练迭代次数与系统规模无关。

    推荐理由:文章把量子纠错产生的错误检测事件转为强化学习信号,展示了连续校准如何在不中断计算的情况下抑制硬件漂移。

7月16日周四
  1. Google Research54

    Google Research 论文解释扩散模型的创造力来自 score smoothing

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。

7月15日周三
  1. Hugging Face Blog66

    Real World VoiceEQ 发布,用人类评价衡量语音 AI 的真实交互质量

    Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。

    推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。

7月8日周三
  1. Google Research71

    Google Research 研究导航路由干预如何缓解城市交通拥堵

    Google Research 在10座美国城市开展为期6个月的实验,通过Google Maps将少于2%的行程引导至通行时间相近的替代路线。研究显示,目标路段驾驶速度中位数提升约2%,受影响路段整体提升约0.35%,并可使每座城市每年潜在减少数千吨 CO2e 排放。

    推荐理由:研究在10座美国城市开展为期6个月的路由干预实验,量化少量改道如何带来全网速度与排放变化。

7月1日周三
  1. Hugging Face Blog70

    ScarfBench:面向企业 Java 框架迁移的 AI 智能体基准

    ScarfBench 是一个用于评估 AI 智能体执行企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus。基准包含 34 个应用、204 个迁移任务和约 151K 行代码,要求应用完成构建、部署并通过行为验证;当前最强智能体的行为成功率仍低于 10%。

    推荐理由:ScarfBench把企业 Java 框架迁移拆成构建、部署和行为验证,揭示编码智能体在可编译代码之外仍受配置与运行环境依赖影响。

6月25日周四
  1. Google Research53

    Google Research 论文提出线性弹性缓存,降低 Spanner 缓存成本

    Google Research 在 CIDR 2025 论文中提出线性弹性缓存,将页面淘汰建模为 ski rental 问题,并根据实时负载动态调整缓存大小。在 Spanner 生产服务器的测试中,内存使用减少 15.5%,缓存未命中增加 5.5%,TCO 降低约 5%,实际 I/O 成本仅增加 0.5%。该方法使用轻量级决策树预测页面 TTL,缓存物理空间不足时仍由 LRU 管理。

6月22日周一
  1. Import AI64

    Import AI 462:AI 超越人类说服力,迈向自维持 AI 与 ASI

    Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。

6月17日周三
  1. Google Research62

    Google Earth AI 将 Farmscapes 2020 转为自然恢复矢量数据

    Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率地图转化为包含树篱、石墙和小型林地的可操作清单。该框架使用在 300 million 全球卫星图像上预训练的 Remote Sensing Foundations Vision Transformer,并结合亚米级影像和 1-meter LiDAR 数据识别复杂农田景观。

    推荐理由:文章展示了如何将高分辨率卫星影像与 LiDAR 数据转化为可用于生态恢复和碳核算的精细化地理数据。

6月13日周六
  1. Google Research67

    Google Research 研究 AI 如何帮助用户理解皮肤状况

    Google Research 分享多项关于 AI 辅助理解皮肤状况的研究,发现 AI 工具将条件名称猜测准确率从标准搜索的 8% 提高到 23%。在 2,345 名参与者的研究中,AI 对后续医疗步骤判断没有显著改善;另一项涉及 110 名参与者的真实场景研究显示,参与者命名条件的能力提高 260%,临床医生认为应用预测与自身评估一致的比例为 86%。

    推荐理由:研究同时考察了皮肤状况识别和后续决策,呈现视觉匹配能带来的帮助及医疗建议场景中的局限。

6月11日周四
  1. Google Research64

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用相对三样本检验审计差分隐私与机器遗忘。该框架在 SVT3 隐私违规检测中仅用几千个样本,而 DP-Auditorium 需要数百万个样本才能达到相近的检测率。对所评估的近似机器遗忘方法,只有 random label technique 通过了测试,作者同时说明实验使用了简化实现。

    推荐理由:文章把机器遗忘审计从直接比较两模型改为相对三样本检验,并展示其在隐私审计中减少样本需求、识别局部偏移的具体效果。

6月8日周一
  1. Google DeepMind74

    Google DeepMind 衡量 AI 辅助学习在塞拉利昂试验中的影响

    Google DeepMind 报告了在塞拉利昂开展的预注册试验,使用 Guided Learning 的学生数学成绩较对照组提高 +0.258 个标准差,八周内约相当于 1.2 至 1.7 年的典型学习进步。

    推荐理由:这项预注册试验同时呈现了学习成绩、互动方式与教师角色的变化,为评估 AI 如何在教师主导课堂中支持学习提供了具体证据。

6月5日周五
  1. Google Research77

    Google Research 介绍 PHRM:用智能手机摄像头被动监测心率

    Google Research 在 Nature 论文中介绍 PHRM,利用前置摄像头在人脸解锁后采集 8 秒面部视频,在日常手机使用中被动估计心率和每日静息心率。真实场景验证中,心率 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm;团队同时开放研究数据集和预训练 PHRM-mini 模型,合格研究者可申请访问。

    推荐理由:论文展示了 PHRM 如何在日常手机使用中估计心率与静息心率,并以跨肤色数据和真实场景验证其准确性。

5月19日周二
5月18日周一
5月16日周六
  1. Google DeepMind67

    Google DeepMind Co-Scientist 加速 MASH 肝病机制发现

    Google DeepMind 的 Co-Scientist 被爱丁堡大学团队用于梳理 MASH 相关文献、筛选关键机制并提出联合疗法候选。在 resmetirom 仅对部分患者有效的问题上,系统提出 NLRP3 炎症小体连接炎症与代谢的假设,该假设随后得到实验验证。

    推荐理由:文章展示 Co-Scientist 如何从肝脏生物学与药理学文献中筛选机制和联合疗法假设,并连接到已获实验验证的 MASH 研究问题。

  2. Google DeepMind66

    Google DeepMind Co-Scientist 筛出可再利用药物对抗肝纤维化

    Google DeepMind 的 Co-Scientist 从既有药物文献中提出三种候选药物,其中两种在活体人类肝细胞测试中阻断了肝纤维化并促进肝细胞再生。研究团队还测试了自己选出的两种药物,但未观察到抗纤维化效果;Co-Scientist 的突出候选是抗癌药 vorinostat,其实验中阻断了 91% 的相关损伤反应。

    推荐理由:这项研究展示了 Co-Scientist 如何从既有药物文献中提出候选,再通过人类肝细胞实验筛选抗肝纤维化药物。

4月30日周四
  1. Google DeepMind73

    Google DeepMind 启动 AI co-clinician 医疗智能体研究计划

    Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。

    推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。

4月22日周三
4月20日周一
4月16日周四
4月14日周二
  1. Google Research64

    Google 推出 Vantage 研究实验评估未来技能

    Google 推出 Vantage 研究实验,利用生成式 AI 在模拟对话中评估批判性思维、协作和创造性思维等未来技能。Vantage 通过 Executive LLM 动态引导 AI 头像制造冲突等挑战,再由 AI Evaluator 按评估量表分析对话并生成技能反馈。

    推荐理由:文章拆解了 Vantage 如何用 Executive LLM 和 AI Evaluator 评估协作技能,并介绍其与纽约大学专家评分的对照结果。

4月9日周四
  1. Google Research64

    ConvApparel:Google Research 评估并缩小用户模拟器的真实性差距

    Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。

    推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。

4月3日周五
  1. Google Research67

    Google Research 评估 LLM 行为倾向与人类行为的对齐

    Google Research 提出一套评估 LLM 行为倾向与人类行为对齐程度的框架,覆盖 25 个 LLM 和专业、冲突解决、旅行预订等情境。研究让每个情境由 10 名参与者评估,并将人类偏好分布与模型响应分布进行比较。

    推荐理由:研究将经过验证的心理问卷改编为情境判断测试,比较 25 个 LLM 在共识与分歧场景中的行为对齐和置信度。

4月1日周三
  1. Google Research60

    Google Research 研究 AI 基准中每项需要多少名评测者

    Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。

    推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。

3月25日周三
  1. Google Research50

    S2Vec 如何学习城市的空间语言

    Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。

3月18日周三
  1. Google Research64

    Google Research 在 The Check Up 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。

    推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。

  2. Google Research81

    Google Research 研究 AI 如何改进乳腺癌筛查流程

    Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。

    推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。

3月17日周二
  1. Google Research58

    Google Research 评测大语言模型回答高温超导研究问题的能力

    Google Research 与康奈尔大学、哈佛大学合作评测大语言模型回答高温超导研究问题的能力,NotebookLM 和定制 RAG 系统整体表现领先。专家组以 67 个问题测试了 6 个系统,结果显示,使用经过筛选的文献库的系统优于依赖开放网络来源的系统,后者更容易混淆已确立的理论与高度推测性的理论。

3月13日周五
3月12日周四
  1. Google Research79

    Google Research 推出 Groundsource,构建2.6 million条城市山洪历史记录

    Google Research 推出 Groundsource,利用Gemini从80种语言的新闻报道中提取并核验山洪事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。该开放数据集可用于城市山洪建模与预测,Google还在Flood Hub中推出最长提前24小时的近全球城市山洪预报。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度。

    推荐理由:Groundsource展示了如何用Gemini把分散的新闻报道整理为可验证的灾害历史数据,并连接到山洪预测等实际应用。

  2. Google Research72

    Google Research 在真实临床研究中探索 AMIE 对话式诊断 AI 的可行性

    Google Research 与 Beth Israel Deaconess Medical Center 开展一项前瞻性、单中心可行性研究,在门诊就诊前由 AMIE 与患者进行病史采集,并由医生实时监督。

    推荐理由:研究把 AMIE 带入真实门诊流程,呈现其在医生监督下开展病史采集、生成摘要及评估诊断表现的实证结果。

1月10日周六
  1. Berkeley AI Research55

    信息驱动的成像系统设计

    Berkeley AI Research提出一种基于互信息的框架,可直接从带噪测量中评估和优化成像系统的信息量。该方法在彩色摄影、射电天文学、无透镜成像和显微镜四类应用中预测了下游任务表现;其IDEAL方法通过信息估计优化成像参数,达到与端到端方法相当的效果,同时减少内存和计算需求,无需任务专用的解码器设计。

11月1日周六