Google Research:全球合作与开放资源推动科学影响力
Google Research介绍其通过开放源代码工具、开放数据集与全球科研伙伴推动科学研究和实际应用,相关资源已服务全球超过250,000名研究者和开发者。文章列举基因组学、神经科学、气候建模、生物多样性和医疗等案例,并提出未来将探索以agentic workflows和Skills共享科研方法。
Google Research介绍其通过开放源代码工具、开放数据集与全球科研伙伴推动科学研究和实际应用,相关资源已服务全球超过250,000名研究者和开发者。文章列举基因组学、神经科学、气候建模、生物多样性和医疗等案例,并提出未来将探索以agentic workflows和Skills共享科研方法。
Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。
推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。
Google Research介绍了 Empirical Research Assistance(ERA)在流行病预测、宇宙学、气候监测和神经科学中的四类应用。
推荐理由:文章以流行病预测、宇宙学、气候监测和神经科学四个案例,展示 ERA 如何把计算建模用于不同类型的科学问题。
Mistral AI 发布 Workflows 公测版,将企业 AI 流程的持久执行、可观测性和容错能力整合到 Studio 中。开发者可用 Python 编写工作流,业务团队从 Le Chat 触发;v3.0 Python SDK 已公开,可通过 `uv add mistralai-workflows` 安装。
推荐理由:原文展示了 Workflows 如何把持久执行、可观测性和人工审批整合进企业 AI 流程,并给出 Python SDK 的接入方式。
Google DeepMind 与韩国科学技术部(MSIT)宣布建立合作,将在首尔办公室设立 AI Campus,支持韩国科研机构使用 AI for Science 模型开展研究。合作将探索 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 在生命科学、能源、天气与气候等领域的应用,并推进人才培养和 AI 安全研究。
Google Research 宣布,Google Photos 已在 Auto frame 中提供自动重构照片视角的功能。该功能先估计 3D 点图和相机参数,再用生成式 latent diffusion model 补全新视角下原本未拍到的区域,并自动调整人像构图、缓解广角自拍的透视畸变。符合条件的含人物照片可在 Auto frame 候选中获取重构后的第二个版本。
推荐理由:Google Photos 的 Auto frame 将 3D 场景重建与生成式修补结合,用于自动调整人像视角,呈现生成式编辑从裁剪到视角重构的变化。
Google DeepMind 发布新论文,介绍 Decoupled DiLoCo 如何通过异步连接多个计算“岛”提升跨数据中心训练的弹性。
推荐理由:文章展示了 Decoupled DiLoCo 如何在跨区域训练中降低带宽依赖、隔离硬件故障,并兼容不同代际芯片,为分布式预训练提供基础设施思路。
Google Research在 ICLR 论文中提出 ReasoningBank,从智能体的成功与失败经验中提炼结构化推理记忆,并通过 MaTTS 支持测试时自我演化。
推荐理由:文章展示了如何把成功与失败轨迹提炼为可复用的推理记忆,并用 WebArena 与 SWE-Bench-Verified 结果说明其效果与效率变化。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助全球企业负责任地规模化采用前沿 AI,推进智能体转型。
Berkeley AI Research 介绍了 GRASP,一种通过虚拟状态并行优化、状态噪声探索和梯度重塑来改进世界模型长时域规划的方法。GRASP 保留动作梯度,避开脆弱的状态梯度,并通过周期性同步回到真实轨迹优化。
Google Research在发表于 Transactions on Machine Learning Research 的论文中提出 Simula,用推理优先的方法从第一性原理构建合成数据集。
推荐理由:文章将合成数据生成重构为机制设计问题,拆分覆盖、多样性、复杂度与质量,给出可控且可评估的数据构建路径。
Google Research 的新论文提出 MoGen,通过 PointInfinity point cloud flow matching 将随机 3D 点云逐步生成神经元形状,并用于增强 PATHFINDER 训练。
Google DeepMind 发布 Gemini 3.1 Flash TTS,提升语音质量、可控性和表现力。
推荐理由:Gemini 3.1 Flash TTS 将音频标签、多人对话和多语言支持结合起来,展示了开发者控制语音风格与表达的具体方式。
Google 推出 Vantage 研究实验,利用生成式 AI 在模拟对话中评估批判性思维、协作和创造性思维等未来技能。Vantage 通过 Executive LLM 动态引导 AI 头像制造冲突等挑战,再由 AI Evaluator 按评估量表分析对话并生成技能反馈。
推荐理由:文章拆解了 Vantage 如何用 Executive LLM 和 AI Evaluator 评估协作技能,并介绍其与纽约大学专家评分的对照结果。
Google DeepMind 发布 Gemini Robotics-ER 1.6,升级空间与物理推理、多视角理解和任务成功检测能力。模型新增仪表读数能力,可通过工具调用、agentic vision 和代码执行解读压力表等设备。
推荐理由:文章集中展示了 Gemini Robotics-ER 1.6 在多视角成功检测、仪表读数和安全约束上的改进,并说明开发者如何调用该模型。
Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。
推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。
Google Research 推出 PaperVizAgent 和 ScholarPeer 两个 AI 智能体,分别用于生成学术图表和自动评审论文。PaperVizAgent 由五个专用智能体协作,在 0-100 评分中获 60.2 分,超过人类基线 50.0 及 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any。
Google Research 提出一套评估 LLM 行为倾向与人类行为对齐程度的框架,覆盖 25 个 LLM 和专业、冲突解决、旅行预订等情境。研究让每个情境由 10 名参与者评估,并将人类偏好分布与模型响应分布进行比较。
推荐理由:研究将经过验证的心理问卷改编为情境判断测试,比较 25 个 LLM 在共识与分歧场景中的行为对齐和置信度。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。
推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。
Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。
推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。
Mistral AI 介绍 Spaces CLI,它可通过 `spaces init`、`spaces dev` 等命令搭建多服务项目,并生成配置文件与 Dockerfiles。为支持编码智能体,Spaces 为交互输入提供 flag 等价方式,使用插件注册表返回结构化数据,并在项目初始化时生成 context.json 和 AGENTS.md;文中示例从提示到部署耗时不到 10 分钟。
推荐理由:文章将交互输入、显式状态和结构化上下文落到 CLI 设计中,给面向智能体的开发工具提供了可复用的实现思路。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks,将自然语言直接转化为 physics-aware Android XR 应用,生成时间可低于 60 seconds。
推荐理由:文章展示了 Gemini 与 XR Blocks 如何把自然语言转成 physics-aware Android XR 应用,并介绍 VCXR60、Pro Mode 和 11 次迭代带来的评测线索。
Google Research 发布 TurboQuant、QJL 和 PolarQuant,用于压缩 KV cache 与高维向量搜索数据。
Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。
Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。
推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。
Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。
推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。
Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。
推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。
Mistral AI 推出 Forge,帮助企业利用专有文档、代码库、结构化数据和运营记录,训练理解内部知识与工作流的前沿级 AI 模型。Forge 支持预训练、后训练、强化学习,以及 dense、MoE 架构和多模态输入,并允许模型在企业自有基础设施中受内部政策治理。其以 AI 智能体为先,支持 Mistral Vibe 微调模型、寻找超参数、调度任务和生成合成数据。
Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。
推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。
Mistral AI 发布 Mistral Small 4,并作为创始成员加入 NVIDIA Nemotron Coalition。Mistral AI 与 NVIDIA 计划结合模型架构、计算资源、开发工具和合成数据管线,共同开发开放的前沿 AI 模型。联盟首项计划是在 NVIDIA DGX Cloud 上训练基础模型,为即将推出的 NVIDIA Nemotron 4 家族提供开放基础。
推荐理由:材料把 Mistral AI 的模型发布与 NVIDIA Nemotron Coalition 的合作安排放在一起,交代了开放模型共建的参与方式和后续方向。
Google Research 与康奈尔大学、哈佛大学合作评测大语言模型回答高温超导研究问题的能力,NotebookLM 和定制 RAG 系统整体表现领先。专家组以 67 个问题测试了 6 个系统,结果显示,使用经过筛选的文献库的系统优于依赖开放网络来源的系统,后者更容易混淆已确立的理论与高度推测性的理论。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库中的代码与证明任务,并以 Apache 2.0 许可开放模型权重。
推荐理由:以真实形式化仓库中的证明任务比较模型表现与运行成本,为评估代码智能体在证明工程中的性价比提供了具体参照。
Berkeley AI Research介绍 SPEX 和 ProxySPEX,用稀疏性、低阶性与层级结构,在大规模消融中定位影响 LLM 行为的关键交互。ProxySPEX 在保持 SPEX 性能的同时约减少 10x 消融,并被用于特征归因、训练数据归因和注意力头归因。两套算法已集成到 SHAP-IQ 仓库。
Google 宣布在 Flood Hub 推出城市突发洪水预报,可提前最多 24 小时预测风险,将覆盖范围从河流洪水扩展至城市突发洪水。团队使用 Gemini 从公开新闻中提取洪灾发生地点和时间,构建 Groundsource 数据集,用于训练和评估结合天气、地理及城市化特征的 LSTM 模型。
推荐理由:利用新闻报道重建历史洪灾样本,为缺乏传感器记录的地区提供了训练数据,也展示了非结构化资料转化为预测依据的方法。
Google Research 推出 Groundsource,利用Gemini从80种语言的新闻报道中提取并核验山洪事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。该开放数据集可用于城市山洪建模与预测,Google还在Flood Hub中推出最长提前24小时的近全球城市山洪预报。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度。
推荐理由:Groundsource展示了如何用Gemini把分散的新闻报道整理为可验证的灾害历史数据,并连接到山洪预测等实际应用。
Google Research 与 Beth Israel Deaconess Medical Center 开展一项前瞻性、单中心可行性研究,在门诊就诊前由 AMIE 与患者进行病史采集,并由医生实时监督。
推荐理由:研究把 AMIE 带入真实门诊流程,呈现其在医生监督下开展病史采集、生成摘要及评估诊断表现的实证结果。
Mistral AI 基于开源编码助手 Vibe 构建了一个自动生成和改进 Rails RSpec 测试的智能体,可读取源文件、执行测试并通过 RuboCop 和 SimpleCov 自我校正。该智能体处理了 275 个源文件,测试通过率和平均代码覆盖率均为 100%,RuboCop 违规数为 0,LLM-as-a-judge 得分为 0.74。
推荐理由:文章拆解了用 AGENTS.md、分类技能和自定义工具约束智能体生成测试的做法,并给出真实代码库中的量化结果。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime。
推荐理由:文章同时交代批量与实时语音转写模型的延迟、语言支持、价格和部署方式,便于评估不同语音应用的接入选择。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。Mistral Vibe 2.0 面向 Le Chat Pro 和 Team 计划开放,支持按量付费或 BYOK;Devstral 2 转为付费 API 访问,输入价格为 $0.40/M tokens,输出价格为 $2.00/M tokens。
推荐理由:Mistral Vibe 2.0 将子智能体、澄清选项和斜杠命令技能纳入终端编码工作流,适合了解智能体可配置性的开发者参考。
Mistral AI 定位了 vLLM 在启用 graph compilation 和 NIXL 的 Prefill/Decode disaggregated serving 中出现的内存泄漏,根因是 UCX 的 mmap hook 机制导致匿名内存持续增长。
推荐理由:文章以真实的 vLLM 生产前测试故障为例,串联 Heaptrack、pmap、BPFtrace 和 GDB 的定位过程,并给出 UCX 配置层面的修复路径。