跳到正文

#Google

今日 0 条
9月23日周三
9月16日周三
9月3日周四
9月1日周二
8月28日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini Omni 1.1 Flash,增强视频生成控制能力

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展、首尾帧插值、视频参考和最高 4K 输出等生成视频能力。模型可分析最多 10 秒的既有上下文,将视频按 10 秒增量延展至累计 40 秒;360p 预览生成速度最高提升 60%,成本为标准 720p 的三分之一。

    推荐理由:文章集中说明了视频生成的控制能力、迭代速度与输出规格变化,并给出 API 接入方式和适用的创作工作流。

8月27日周四
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。

8月14日周五
8月12日周三
8月6日周四
  1. Google DeepMind87

    Google DeepMind 开源 WeatherNext,飓风预测平均提前获得一天优势

    Google DeepMind 发布并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini,WeatherNext Cyclones 在飓风路径、强度和风场结构预测上平均获得超过 24 小时的提前量。

    推荐理由:原文同时给出 WeatherNext 的预测增益、训练数据规模和开源范围,便于了解 AI 气象模型如何支持更早的飓风风险研判。

7月30日周四
7月28日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Robotics 2,支持全身控制与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。

    推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。

7月21日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。

    推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。

7月17日周五
7月9日周四
7月1日周三
6月30日周二
  1. Google Research70

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,这一面向表格数据分类和回归的基础模型可通过单次前向传播生成预测,无需手动训练、超参数调优或复杂特征工程。TabFM 采用交替行列注意力、行压缩和 Transformer,并基于数亿个合成数据集训练。

    推荐理由:文章解释了 TabFM 如何用交替行列注意力、行压缩和合成数据训练,将表格分类与回归转为零样本推理,并给出 BigQuery 使用入口。

6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma 文本扩散模型,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散和并行生成,在专用 GPU 上实现最高 4 倍的文本生成速度。该 26B MoE 模型推理时激活 3.8B 参数,量化后可适配 18GB VRAM,并以 Apache 2.0 许可发布。DiffusionGemma 面向本地、低并发的交互式工作流,但整体输出质量低于标准 Gemma 4。

    推荐理由:文章具体说明了 DiffusionGemma 在本地低并发推理中的速度优势,也交代了输出质量与标准 Gemma 4 的取舍。

6月9日周二
  1. Google DeepMind81

    Google DeepMind 发布 Gemma 4 12B 统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款面向笔记本本地运行的统一无编码器多模态模型,支持原生音频输入,并提供多步推理和智能体工作流能力。该模型在标准基准上的表现接近 26B MoE 模型,支持使用 16GB 内存本地运行,并以 Apache 2.0 许可证发布。

    推荐理由:文章从架构、资源占用和本地部署入口三个层面,说明 Gemma 4 12B 如何将多模态智能带到消费级笔记本。

5月18日周一
  1. Google DeepMind87

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Gemini Omni Flash,可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的视频,并通过对话进行连续编辑。

    推荐理由:原文同时交代了 Gemini Omni Flash 的视频生成与对话编辑能力,以及订阅用户、YouTube Shorts 和开发者 API 的开放路径,便于理解其落地范围。

5月16日周六
  1. Google DeepMind68

    WeatherNext 如何帮助美国国家飓风中心提前预测 Melissa 飓风登陆牙买加

    Google DeepMind 的 WeatherNext 帮助美国国家飓风中心提前 5 天预测 Melissa 飓风将以 Category 5 强度登陆牙买加。WeatherNext 可运行 50 个不同的情景,在登陆前 5 天以 80% 置信度预测这一结果,提前 3 天时置信度接近 100%。

    推荐理由:文章展示了 WeatherNext 如何通过 50 个情景集合同时预测飓风路径与强度,并为牙买加疏散和资源调度争取提前量。

4月16日周四
4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,升级空间与物理推理、多视角理解和任务成功检测能力。模型新增仪表读数能力,可通过工具调用、agentic vision 和代码执行解读压力表等设备。

    推荐理由:文章集中展示了 Gemini Robotics-ER 1.6 在多视角成功检测、仪表读数和安全约束上的改进,并说明开发者如何调用该模型。

4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。

    推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。