Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本对话和高复杂度任务。
推荐理由:文章同时给出两款模型的定位、语音智能体基准表现与开发者入口,便于比较能力重点和落地路径。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本对话和高复杂度任务。
推荐理由:文章同时给出两款模型的定位、语音智能体基准表现与开发者入口,便于比较能力重点和落地路径。
GPT‑Live‑1 被引入 API,支持自然的全双工语音对话,并强化指令遵循。该模型还支持自定义声音和电话支持。
推荐理由:材料概括了 GPT‑Live‑1 在 API 中的语音能力变化,并列出自定义声音与电话支持等集成信息。
OpenAI 发布 GPT-6 Astra,称其为面向企业最强大的模型,具备高级推理、计算机使用以及更强的写作和设计判断能力。
推荐理由:摘要列出 GPT-6 Astra 在推理、计算机使用、写作和设计判断方面的能力侧重,可帮助读者快速了解其面向企业工作的定位。
Google DeepMind 和 Google Research 发布 WeatherNext 3,通过实时卫星数据每小时生成高分辨率全球天气预报,最高支持 5-kilometer 分辨率。
推荐理由:WeatherNext 3 将实时卫星观测、小时级高分辨率预测与可再生能源变量结合,呈现 AI 天气模型走向本地化应用的路径。
H Company 发布 NeoMME 多模态多语言编码器,提供 260M 和 800M 两种规模,并从头训练单一双向 Transformer 处理文本与原始图像块。
推荐理由:文章系统说明了 NeoMME 的单 Transformer 架构、检索性能与压缩方案,便于评估多模态文档检索在速度、质量和存储之间的取舍。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与智能体工作流,后者面向网络安全。
推荐理由:文章同时给出 Gemini 3.8 Flash 在长程编码与多步推理上的基准表现,以及 Cyber 版本的漏洞发现、修复和使用门槛,便于比较两种定位。
Google Research 发布 TimesFM-3,这是一款原生支持多变量预测的时间序列基础模型,拥有 330 million 参数,并在超过 1 trillion 个时间点的数据上预训练。
推荐理由:TimesFM-3 将多变量预测、已知未来协变量与单次前向推理结合,并在三个公开基准上比较点预测和概率预测表现。
Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展、首尾帧插值、视频参考和最高 4K 输出等生成视频能力。模型可分析最多 10 秒的既有上下文,将视频按 10 秒增量延展至累计 40 秒;360p 预览生成速度最高提升 60%,成本为标准 720p 的三分之一。
推荐理由:文章集中说明了视频生成的控制能力、迭代速度与输出规格变化,并给出 API 接入方式和适用的创作工作流。
Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。
推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。
IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。
推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。
Liquid AI 发布 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,通过 speculative decoding 提升推理吞吐。
推荐理由:文章同时给出 H100 与 M4 Max 的吞吐对比、function-calling 延迟变化及 llama.cpp 和 SGLang 接入方式,便于评估 DSpark 在云端与端侧部署中的收益。
Microsoft Research 发布 Skala 1.1,训练数据量达到上一版本的 2.5x,并在热化学、反应动力学和分子结构预测等任务中提升准确性。在 GMTKN55 的 55 个类别中,Skala 1.1 有 32 个类别获得最高排名,当前已集成到 CP2K,并正在接入 Psi4、FHI-aims、ORCA 和 VASP。
推荐理由:文章将 Skala 1.1 的精度提升、2.5x 数据扩展与 CP2K 等软件集成放在一起,呈现其从模型改进走向科研工作流应用的路径。
Google DeepMind 发布 Gemini 3.7 Flash,称其在编码、知识工作和 Web 开发流程上较 Gemini 3.6 Flash 有明显提升。
推荐理由:Gemini 3.7 Flash 的基准对比、价格和接入方式较为完整,便于判断其在编码与智能体工作流中的升级幅度和适用场景。
Google DeepMind 发布手语转文字模型 SL2T,并将其用于 Gboard 和 Live Transcribe 的手语转文字输入,首批支持 ASL 到英语,搭载于 Pixel 11。
推荐理由:文章从模型架构、隐私处理和真实使用限制三方面展开,帮助理解手语翻译落地到手机时的技术取舍。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,模型规模为 364M parameters,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。
推荐理由:文章将开放权重、12 种语言支持、NIM 部署和延迟数据放在同一框架中,便于评估多语言语音智能体的落地路径。
Meta 发布 Muse Glimmer 30B,这是一款面向本地智能体场景的开源多模态模型,采用 Apache 2.0 许可,并支持图像、视频和多模态工具调用。模型已获得 transformers、llama.cpp、vLLM 和 Inference Endpoints 的 day-0 支持,还提供 DFlash speculative decoding 和微调示例。
推荐理由:文章既交代 Muse Glimmer 的 30B 架构与开源许可,也提供本地部署、推理加速和智能体接入的可复用路径。
Google DeepMind 发布并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini,WeatherNext Cyclones 在飓风路径、强度和风场结构预测上平均获得超过 24 小时的提前量。
推荐理由:原文同时给出 WeatherNext 的预测增益、训练数据规模和开源范围,便于了解 AI 气象模型如何支持更早的飓风风险研判。
Mistral AI 发布 Shieldstral,一款以 Apache 2.0 开放权重的 3B 多模态安全分类器,可在推理时接受自然语言审核规则,无需重新训练。
推荐理由:将审核规则放在推理时输入的自然语言问题中,使同一模型可适应不同产品的安全边界,而不必为每套规则重新训练。
Google DeepMind 发布 Gemini Robotics ER 2,这是面向机器人的高层具身推理与任务编排模型,可将执行交给 VLA 模型并调用工具。
推荐理由:原文结合视频进度理解、工具编排和多机器人协作,展示了 Gemini Robotics ER 2 面向真实机器人任务的能力变化与开发入口。
Google DeepMind 发布 Gemini Robotics 2,通过 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2,支持人形机器人全身控制、灵巧操作、多步骤推理与多机器人协作。
推荐理由:原文系统梳理了 Gemini Robotics 2 的三类模型分工、机器人适配方式与安全机制,便于理解其从单机控制走向协作任务的技术路径。