Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向创意语音设计与高吞吐、成本高效的语音生成。
推荐理由:原文同时交代了两款模型的定位、语音定制与逐句导演能力,以及开发者和普通用户的使用入口,便于评估其应用范围。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向创意语音设计与高吞吐、成本高效的语音生成。
推荐理由:原文同时交代了两款模型的定位、语音定制与逐句导演能力,以及开发者和普通用户的使用入口,便于评估其应用范围。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本对话和高复杂度任务。
推荐理由:文章同时给出两款模型的定位、语音智能体基准表现与开发者入口,便于比较能力重点和落地路径。
GPT‑Live‑1 被引入 API,支持自然的全双工语音对话,并强化指令遵循。该模型还支持自定义声音和电话支持。
推荐理由:材料概括了 GPT‑Live‑1 在 API 中的语音能力变化,并列出自定义声音与电话支持等集成信息。
Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。
推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,模型规模为 364M parameters,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。
推荐理由:文章将开放权重、12 种语言支持、NIM 部署和延迟数据放在同一框架中,便于评估多语言语音智能体的落地路径。
Google DeepMind 发布 Gemini 3.5 Live Translate,支持在70+种语言之间进行接近实时的语音到语音翻译,并保留说话者的语调、节奏和音高。
推荐理由:Gemini 3.5 Live Translate展示了连续语音翻译在延迟、语调保留和多语言覆盖之间的具体取舍,并给出开发者与用户入口。
Google DeepMind 发布 Gemini 3.1 Flash TTS,提升语音质量、可控性和表现力。
推荐理由:Gemini 3.1 Flash TTS 将音频标签、多人对话和多语言支持结合起来,展示了开发者控制语音风格与表达的具体方式。
Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。
推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime。
推荐理由:文章同时交代批量与实时语音转写模型的延迟、语言支持、价格和部署方式,便于评估不同语音应用的接入选择。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。
推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。