Google Research 推出 planetary prediction engine,自动完成地理空间建模
Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。
推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。
Google Research 发布实验性 planetary prediction engine(PPE),可根据自然语言查询自主完成地理空间数据发现、清理、特征工程、模型训练与评估。
推荐理由:文章展示了 PPE 如何把地理空间数据发现、特征工程和模型评估串成自主流程,并用多个公共健康与人道主义任务给出量化对比。
Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展、首尾帧插值、视频参考和最高 4K 输出等生成视频能力。模型可分析最多 10 秒的既有上下文,将视频按 10 秒增量延展至累计 40 秒;360p 预览生成速度最高提升 60%,成本为标准 720p 的三分之一。
推荐理由:文章集中说明了视频生成的控制能力、迭代速度与输出规格变化,并给出 API 接入方式和适用的创作工作流。
Google DeepMind 宣布开展首个针对专有前沿级 AI 模型的双盲评测,以防止模型提前接触测试题目。该项目与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护的加密环境中使用机密基准测试 Gemini Flash Lite。
推荐理由:文章说明加密环境如何把外部评测与模型后续优化隔离开,为理解 benchmark contamination 及其对评测可信度的影响提供了具体机制。
GlucoFM 是一种用于连续血糖监测(CGM)的自监督基础模型,以双流设计分离较慢的血糖趋势与短期偏差,并保留时段和缺失信息。在四个队列、七项临床预测任务的14项队列—任务评估中,其平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高5.8个百分点,并在糖尿病风险和β细胞功能障碍评估中全部领先。
Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。
推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。
AgentHands 是 Google Research 提出的研究原型,将 LLM 的语言响应转换为与 TTS 同步的 XR 空间手势,支持智能体在用户环境中进行具身对话。
Google Research 介绍 Biomarker Discovery Framework,这是一个在人工监督下,通过假设生成、统计分析、模型训练、对抗验证和文献推理筛选候选生物标志物的多智能体系统。
推荐理由:文章展示了如何将确定性统计计算、生成式推理与对抗验证组成闭环,在人工监督下筛选可解释的可穿戴设备生物标志物候选。
Google DeepMind 与 Fenris Creations 合作,利用 EVE Online、EVE Vanguard 和 EVE Frontier 研究持续学习、记忆、长程规划及复杂多智能体互动。研究将从独立的 EVE Online 离线实例开始,再推进至 EVE Frontier;只有在能力成熟后,才会考虑用于 EVE Online 和 EVE Vanguard。
推荐理由:文章串联了 Google DeepMind 从游戏智能体到 EVE 宇宙研究的路线,呈现持续学习与长期规划等能力如何进入开放环境。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合移动模式与地点文本表示结合,以建模地点的动态功能。在洛杉矶和休斯顿的未见地点测试中,该框架使访问意图预测相对提升最高达 81.9%,价格水平分类提升 75.1%,繁忙程度估计准确率提升 24.7%。ME-POIs 面向地点和商家的群体性聚合特征,不用于个人个性化推断。
Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。
推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。
Google DeepMind 发布 Gemini 3.7 Flash,称其在编码、知识工作和 Web 开发流程上较 Gemini 3.6 Flash 有明显提升。
推荐理由:Gemini 3.7 Flash 的基准对比、价格和接入方式较为完整,便于判断其在编码与智能体工作流中的升级幅度和适用场景。
Google DeepMind 发布手语转文字模型 SL2T,并将其用于 Gboard 和 Live Transcribe 的手语转文字输入,首批支持 ASL 到英语,搭载于 Pixel 11。
推荐理由:文章从模型架构、隐私处理和真实使用限制三方面展开,帮助理解手语翻译落地到手机时的技术取舍。
Google Research 介绍一项关于 LLM 事实性的研究,提出 knowledge profiling 和 WikiProfile,用于区分事实是否被编码及能否被召回。
推荐理由:文章用 WikiProfile 区分事实编码与召回,数据显示前沿模型的瓶颈更多在已存知识的访问,而非知识缺失。
Google Research 发布 AMIE(Video),该系统基于 Gemini 和 Project Astra,可实时进行音视频临床会诊,感知非语言线索、引导虚拟体格检查并开展临床推理。
推荐理由:文章将 AMIE(Video)的异步多智能体架构、随机视频研究结果与模拟场景限制放在一起,便于理解其能力边界。
Google DeepMind 发布并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini,WeatherNext Cyclones 在飓风路径、强度和风场结构预测上平均获得超过 24 小时的提前量。
推荐理由:原文同时给出 WeatherNext 的预测增益、训练数据规模和开源范围,便于了解 AI 气象模型如何支持更早的飓风风险研判。
Google Research提出 Chain-of-Evidence(CoE)框架,并以 Science One Framework 实现可验证的自主科学研究流程。
推荐理由:文章把证据链设计与四项自动化审计结合起来,展示了自主研究系统如何同时检验引用、代码、方法描述和实验结果。
Google DeepMind 发布 Gemini Robotics ER 2,这是面向机器人的高层具身推理与任务编排模型,可将执行交给 VLA 模型并调用工具。
推荐理由:原文结合视频进度理解、工具编排和多机器人协作,展示了 Gemini Robotics ER 2 面向真实机器人任务的能力变化与开发入口。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并将其上线 Google Flow Music。该模型改进了旋律结构、歌词质量、提示词遵循、歌声表现与发音,还支持更方便地控制输出的节奏和时长。
Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。
推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。
Google Research 在一项 n=13,917 的随机研究中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体进行症状访谈并生成 DDx。
推荐理由:研究将真实对话、临床专家比较与 Fitbit 生理信号结合,呈现 SymptomAI 在日常症状评估中的表现及研究边界。
Google Research 在 Nature 发表研究,展示一种强化学习框架,可利用量子错误检测事件持续调节控制参数,在计算不中断的情况下抵抗漂移。该方法在 Willow 超导处理器上使逻辑稳定性提升 3.5 倍,并在人工校准后进一步将逻辑错误率降低 20%;模拟显示所需训练迭代次数与系统规模无关。
推荐理由:文章把量子纠错产生的错误检测事件转为强化学习信号,展示了连续校准如何在不中断计算的情况下抑制硬件漂移。
Google 宣布承诺 $40M 的 AI tokens 和云 credits,为 DOE Genesis Mission 研究人员提供 AI for science 工具支持。
推荐理由:文章具体说明了 Google 如何以 $40M AI tokens 和云 credits 支持 DOE 科研,并给出 AlphaEvolve 与 Gemini 在实验室中的应用数据。
Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。
推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。
Import AI 第465期聚焦开放权重模型与闭源模型的能力差距、Kimi K3及前沿 AI 监管。英国 AI Security Institute称,GLM-5.2和DeepSeek V4-Pro在狭义网络安全任务上与领先闭源模型的时间差已缩小至4至7个月,而此前大多为6至10个月;Kimi K3为2.8 trillion 参数模型,权重将在未来几周公开。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调、用于快速发现、验证和修复软件漏洞的轻量网络安全模型。
推荐理由:原文结合 CyberGym、Big Sleep 和生产扫描结果,展示了轻量模型在漏洞发现与修复任务中的性能和规模化使用方式。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,围绕预防、检测和响应使用 AI 应对生物安全风险。过去 12 个月,双方推进了超过 15 项与政府机构、生物安全组织和研究团体的合作。
推荐理由:文章按预防、检测和响应梳理 AI 参与生物安全的路径,并列出模型安全评估、病原体监测和药物设计等合作实例。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。
Google DeepMind 启动 ATL Saathi 试点,为印度 Atal Tinkering Labs 教师提供 Gemini 驱动的 24/7 规划与培训助手。该应用整合 NotebookLM 中的 12 个核心课程模块,支持 AI 摘要、信息图、视频概览、互动测验和项目生成,并计划先覆盖 100 所试点学校,支持 8 种语言。
推荐理由:原文具体展示了 ATL Saathi 如何结合课程微学习、项目生成和多语言支持,为 AI 教育助手提供了清晰的应用案例。
Google Research 介绍 SensorFM,这一模型使用来自 5 million 名参与者的超过 1 trillion minutes 多模态可穿戴传感器数据进行预训练。
推荐理由:文章将可穿戴数据的规模化预训练、缺失感知学习与智能体适配串联起来,展示了通用表示跨健康任务迁移的路径。
Google Research 在10座美国城市开展为期6个月的实验,通过Google Maps将少于2%的行程引导至通行时间相近的替代路线。研究显示,目标路段驾驶速度中位数提升约2%,受影响路段整体提升约0.35%,并可使每座城市每年潜在减少数千吨 CO2e 排放。
推荐理由:研究在10座美国城市开展为期6个月的路由干预实验,量化少量改道如何带来全网速度与排放变化。
Google DeepMind 与 A24 宣布开展以研究为核心的合作,围绕多个项目共同开发面向创作者的新工作流和技术。Google 还对 A24 进行了投资;合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创意里程碑将随协作推进而演变。
Hugging Face 与 Cerebras 展示了将 Gemma 4 31B 用于实时语音到语音系统的方案。该开放管线依次使用 Nvidia 的 Parakeet 进行语音识别、在 Cerebras 上运行 Gemma 4 VLM 推理,并通过 Qwen3TTS 生成语音。相关架构已用于 Reachy Mini 机器人,配套代码仓库为 huggingface/speech-to-speech。
推荐理由:文章拆解了实时语音到语音管线的模块构成与协作方式,开发者可据此了解低延迟架构的实现路径和代码入口。
Google Research 发布覆盖全球 50+ 城市的建筑级屋顶反射率数据,并上线 Heat Resilience Earth Engine App。该方法融合 Sentinel-2 与 30-cm 卫星影像,生成建筑级反照率地图,在 Boulder 数据验证中的 RMSE 为 0.04。
推荐理由:文章展示了 Google Research 如何把多源遥感数据转化为建筑级屋顶反射率信息,支持城市规划者定位降温改造对象。
Google DeepMind 发布 Nano Banana 2 Lite 图像模型,并面向开发者开放 Gemini Omni Flash 视频生成与对话式编辑模型。
推荐理由:文章同时给出图像与视频模型的定位、价格和限制,便于开发者比较生成速度、成本与可用范围。
Google Research 发布 TabFM,这一面向表格数据分类和回归的基础模型可通过单次前向传播生成预测,无需手动训练、超参数调优或复杂特征工程。TabFM 采用交替行列注意力、行压缩和 Transformer,并基于数亿个合成数据集训练。
推荐理由:文章解释了 TabFM 如何用交替行列注意力、行压缩和合成数据训练,将表格分类与回归转为零样本推理,并给出 BigQuery 使用入口。
Google Research 将 Multi-Token Prediction(MTP)改造到冻结的 Gemini Nano v3 模型上,并部署至 Pixel 9 和 10 系列。
推荐理由:文章展示了如何在不改变 Gemini Nano v3 基础能力的前提下,通过冻结主干和零拷贝 MTP 降低移动端推理开销。
Google Research 在 CIDR 2025 论文中提出线性弹性缓存,将页面淘汰建模为 ski rental 问题,并根据实时负载动态调整缓存大小。在 Spanner 生产服务器的测试中,内存使用减少 15.5%,缓存未命中增加 5.5%,TCO 降低约 5%,实际 I/O 成本仅增加 0.5%。该方法使用轻量级决策树预测页面 TTL,缓存物理空间不足时仍由 LRU 管理。
Google Research 研究发现,开启 reasoning trace 可帮助 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 找回关闭推理时难以恢复的单跳事实。
推荐理由:文章通过受控实验拆解推理提升单跳事实召回的两种机制,并将中间事实的可靠性与最终答案准确率联系起来。
Google DeepMind 将 computer use 内置到 Gemini 3.5 Flash,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端和桌面环境运行的智能体。该能力面向持续软件测试和专业应用中的知识工作等长流程自动化任务,并提供用户确认、间接提示注入识别后自动停止等可选企业安全机制。
推荐理由:原文既说明了 computer use 从独立模型转为 Gemini 3.5 Flash 内置工具,也给出企业安全防护与接入方式。
Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。