Google DeepMind 发布 Gemini Omni Flash 视频生成模型
Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。
推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。
Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。
推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上的三款科学实验工具和 Google Antigravity 中的 Science Skills。三款工具分别用于假设生成、计算发现和文献分析,并将逐步开放注册。Science Skills 集成超过 30 个生命科学数据库和工具,可支持结构生物信息学与基因组分析等工作流。
推荐理由:原文同时梳理了三类实验工具、Science Skills及其科研应用场景,便于了解Google如何把智能体能力接入假设生成、计算实验和文献分析。
Google DeepMind 扩展 Search、Gemini、Chrome、Pixel 和 Cloud 中的内容透明度与验证工具,并推出 AI Content Detection API。
推荐理由:文章梳理了 SynthID 与 C2PA 在 Google 产品和行业伙伴中的扩展路径,并给出 AI Content Detection API 的落地场景。
Google DeepMind与新加坡政府启动新的国家AI合作伙伴关系,并在新加坡推出医疗、生命科学、教育、科研、可持续发展和AI安全项目。合作方预计通过加速研发,到2040年创造额外S$ 3.3 billion(US$2.5 billion)的经济价值。
推荐理由:文章梳理了Google DeepMind与新加坡政府合作落地的医疗、教育、科研和安全项目,呈现国家级AI应用的具体路径。
剑桥大学 Clare Bryant 教授使用 Co-Scientist 研究动物传播给人类的病原体如何引发严重疾病。Co-Scientist 从研究方案中生成并排序假设,帮助团队锁定此前未关注的蛋白及相关氨基酸突变;原本可能需要 two to three years 的实验工作,团队预计六个月内完成。
推荐理由:这项案例展示了 Co-Scientist 如何从研究问题生成并排序假设,再将候选蛋白逐步收敛到可实验验证的具体氨基酸。
Calico Life Sciences 使用 Co-Scientist 汇总衰老生物学研究,提出关于代谢调控整合应激反应(ISR)的新假设。团队与 Co-Scientist 共同完善实验设计,并根据新结果持续调整研究,实验最终获得了对 ISR 在健康与疾病中作用具有重要意义的新发现,计划发表相关结果。
Google DeepMind 的 Co-Scientist 被爱丁堡大学团队用于梳理 MASH 相关文献、筛选关键机制并提出联合疗法候选。在 resmetirom 仅对部分患者有效的问题上,系统提出 NLRP3 炎症小体连接炎症与代谢的假设,该假设随后得到实验验证。
推荐理由:文章展示 Co-Scientist 如何从肝脏生物学与药理学文献中筛选机制和联合疗法假设,并连接到已获实验验证的 MASH 研究问题。
Co-Scientist 正帮助 MIT 的 Ritu Raman 与 Boston Children’s Hospital 的 Ryan Flynn 联合不同研究工具,探索 ALS 的新研究路径。它将庞杂且相互矛盾的文献梳理为可检验假设,并按可行性和潜在风险—收益排序方向;两人进一步寻找可用于靶向 ALS 的新型 RNA 机制及潜在 RNA 药物。
Google DeepMind 的 Co-Scientist 从既有药物文献中提出三种候选药物,其中两种在活体人类肝细胞测试中阻断了肝纤维化并促进肝细胞再生。研究团队还测试了自己选出的两种药物,但未观察到抗纤维化效果;Co-Scientist 的突出候选是抗癌药 vorinostat,其实验中阻断了 91% 的相关损伤反应。
推荐理由:这项研究展示了 Co-Scientist 如何从既有药物文献中提出候选,再通过人类肝细胞实验筛选抗肝纤维化药物。
Google DeepMind 的 WeatherNext 帮助美国国家飓风中心提前 5 天预测 Melissa 飓风将以 Category 5 强度登陆牙买加。WeatherNext 可运行 50 个不同的情景,在登陆前 5 天以 80% 置信度预测这一结果,提前 3 天时置信度接近 100%。
推荐理由:文章展示了 WeatherNext 如何通过 50 个情景集合同时预测飓风路径与强度,并为牙买加疏散和资源调度争取提前量。
Google DeepMind 发布 Gemini 3.5 系列并首先推出 Gemini 3.5 Flash,定位为面向智能体和编码的高速模型。
推荐理由:文章同时交代 Gemini 3.5 Flash 在智能体、编码和多模态基准上的具体表现,以及面向个人、开发者和企业的开放入口,便于理解其应用范围。
Google DeepMind 发布基于 Gemini 的 Co-Scientist 多智能体系统,可迭代生成、辩论和演化复杂科学问题的研究假设。系统通过生成、反思、排名、演化和元评审等智能体协作,并结合 web search、ChEMBL、UniProt 及 AlphaFold 等工具探索研究方向。
推荐理由:文章拆解了 Co-Scientist 的多智能体协作与假设竞赛机制,并展示其在多项生命科学研究中的应用。
Berkeley AI Research梳理Adaptive Parallel Reasoning(APR)范式,让模型在推理时自主决定是否拆分任务、并行线程数量及串并行控制。文章比较了Multiverse、ThreadWeaver、Parallel-R1等方法在KV cache处理、推理引擎改造和训练奖励上的差异,并讨论准确率、关键路径延迟与并行稳定性等开放问题。
Google DeepMind 发布报告称,Gemini 驱动的编码智能体 AlphaEvolve 已从试点工具扩展为 Google 基础设施的核心组件,并用于商业场景。
推荐理由:文章集中展示 AlphaEvolve 在科研、基础设施和商业场景中的应用,用具体指标说明算法优化能力如何迁移到不同领域。
Google Research介绍其通过开放源代码工具、开放数据集与全球科研伙伴推动科学研究和实际应用,相关资源已服务全球超过250,000名研究者和开发者。文章列举基因组学、神经科学、气候建模、生物多样性和医疗等案例,并提出未来将探索以agentic workflows和Skills共享科研方法。
Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。
推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。
Google Research介绍了 Empirical Research Assistance(ERA)在流行病预测、宇宙学、气候监测和神经科学中的四类应用。
推荐理由:文章以流行病预测、宇宙学、气候监测和神经科学四个案例,展示 ERA 如何把计算建模用于不同类型的科学问题。
Mistral AI 发布 Workflows 公测版,将企业 AI 流程的持久执行、可观测性和容错能力整合到 Studio 中。开发者可用 Python 编写工作流,业务团队从 Le Chat 触发;v3.0 Python SDK 已公开,可通过 `uv add mistralai-workflows` 安装。
推荐理由:原文展示了 Workflows 如何把持久执行、可观测性和人工审批整合进企业 AI 流程,并给出 Python SDK 的接入方式。
Google DeepMind 与韩国科学技术部(MSIT)宣布建立合作,将在首尔办公室设立 AI Campus,支持韩国科研机构使用 AI for Science 模型开展研究。合作将探索 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 在生命科学、能源、天气与气候等领域的应用,并推进人才培养和 AI 安全研究。
Google Research 宣布,Google Photos 已在 Auto frame 中提供自动重构照片视角的功能。该功能先估计 3D 点图和相机参数,再用生成式 latent diffusion model 补全新视角下原本未拍到的区域,并自动调整人像构图、缓解广角自拍的透视畸变。符合条件的含人物照片可在 Auto frame 候选中获取重构后的第二个版本。
推荐理由:Google Photos 的 Auto frame 将 3D 场景重建与生成式修补结合,用于自动调整人像视角,呈现生成式编辑从裁剪到视角重构的变化。
Google DeepMind 发布新论文,介绍 Decoupled DiLoCo 如何通过异步连接多个计算“岛”提升跨数据中心训练的弹性。
推荐理由:文章展示了 Decoupled DiLoCo 如何在跨区域训练中降低带宽依赖、隔离硬件故障,并兼容不同代际芯片,为分布式预训练提供基础设施思路。
Google Research在 ICLR 论文中提出 ReasoningBank,从智能体的成功与失败经验中提炼结构化推理记忆,并通过 MaTTS 支持测试时自我演化。
推荐理由:文章展示了如何把成功与失败轨迹提炼为可复用的推理记忆,并用 WebArena 与 SWE-Bench-Verified 结果说明其效果与效率变化。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助全球企业负责任地规模化采用前沿 AI,推进智能体转型。
Berkeley AI Research 介绍了 GRASP,一种通过虚拟状态并行优化、状态噪声探索和梯度重塑来改进世界模型长时域规划的方法。GRASP 保留动作梯度,避开脆弱的状态梯度,并通过周期性同步回到真实轨迹优化。
Google Research在发表于 Transactions on Machine Learning Research 的论文中提出 Simula,用推理优先的方法从第一性原理构建合成数据集。
推荐理由:文章将合成数据生成重构为机制设计问题,拆分覆盖、多样性、复杂度与质量,给出可控且可评估的数据构建路径。
Google Research 的新论文提出 MoGen,通过 PointInfinity point cloud flow matching 将随机 3D 点云逐步生成神经元形状,并用于增强 PATHFINDER 训练。
Google DeepMind 发布 Gemini 3.1 Flash TTS,提升语音质量、可控性和表现力。
推荐理由:Gemini 3.1 Flash TTS 将音频标签、多人对话和多语言支持结合起来,展示了开发者控制语音风格与表达的具体方式。
Google 推出 Vantage 研究实验,利用生成式 AI 在模拟对话中评估批判性思维、协作和创造性思维等未来技能。Vantage 通过 Executive LLM 动态引导 AI 头像制造冲突等挑战,再由 AI Evaluator 按评估量表分析对话并生成技能反馈。
推荐理由:文章拆解了 Vantage 如何用 Executive LLM 和 AI Evaluator 评估协作技能,并介绍其与纽约大学专家评分的对照结果。
Google DeepMind 发布 Gemini Robotics-ER 1.6,升级空间与物理推理、多视角理解和任务成功检测能力。模型新增仪表读数能力,可通过工具调用、agentic vision 和代码执行解读压力表等设备。
推荐理由:文章集中展示了 Gemini Robotics-ER 1.6 在多视角成功检测、仪表读数和安全约束上的改进,并说明开发者如何调用该模型。
Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。
推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。
Google Research 推出 PaperVizAgent 和 ScholarPeer 两个 AI 智能体,分别用于生成学术图表和自动评审论文。PaperVizAgent 由五个专用智能体协作,在 0-100 评分中获 60.2 分,超过人类基线 50.0 及 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any。
Google Research 提出一套评估 LLM 行为倾向与人类行为对齐程度的框架,覆盖 25 个 LLM 和专业、冲突解决、旅行预订等情境。研究让每个情境由 10 名参与者评估,并将人类偏好分布与模型响应分布进行比较。
推荐理由:研究将经过验证的心理问卷改编为情境判断测试,比较 25 个 LLM 在共识与分歧场景中的行为对齐和置信度。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。
推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。
Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。
推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。
Mistral AI 介绍 Spaces CLI,它可通过 `spaces init`、`spaces dev` 等命令搭建多服务项目,并生成配置文件与 Dockerfiles。为支持编码智能体,Spaces 为交互输入提供 flag 等价方式,使用插件注册表返回结构化数据,并在项目初始化时生成 context.json 和 AGENTS.md;文中示例从提示到部署耗时不到 10 分钟。
推荐理由:文章将交互输入、显式状态和结构化上下文落到 CLI 设计中,给面向智能体的开发工具提供了可复用的实现思路。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks,将自然语言直接转化为 physics-aware Android XR 应用,生成时间可低于 60 seconds。
推荐理由:文章展示了 Gemini 与 XR Blocks 如何把自然语言转成 physics-aware Android XR 应用,并介绍 VCXR60、Pro Mode 和 11 次迭代带来的评测线索。
Google Research 发布 TurboQuant、QJL 和 PolarQuant,用于压缩 KV cache 与高维向量搜索数据。
Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。
Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。
推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。
Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。
推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。