跳到正文

#语音

今日 0 条
9月30日周三
  1. Hugging Face Blog68

    Hugging Face 推出 Open TTS Leaderboard,评估多语言 TTS 与声音克隆

    Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源 TTS 模型的多语言表现、声音克隆和流式性能。榜单使用 WER/CER、RTFx、TTFA 和 SIM 等指标,并支持在 H200 GPU 与 CPU 上比较部分模型。平台同时提供 Listen 标签页供用户比较音频和投票,但这些指标不取代自然度、表现力和听众偏好等人工评测。

    推荐理由:文章把 TTS 评测拆成可比较的可懂度、速度和说话人相似度指标,并展示多语言、声音克隆与流式性能的查看方式。

9月26日周六
  1. AWS Machine Learning Blog66

    AWS 教程:在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时声音克隆

    AWS 介绍了如何通过 Amazon SageMaker JumpStart,将公开可用的 Qwen3-TTS-12Hz-1.7B-Base 部署到 Amazon SageMaker AI 实时推理端点,实现基于短音频和文本转录的声音克隆。教程涵盖 24 GB NVIDIA L4 GPU 配置、跨语言声音克隆、请求调用以及 Amazon CloudWatch 监控。

    推荐理由:文章给出从 JumpStart 部署 Qwen3-TTS 并调用实时端点完成声音克隆的完整步骤,涵盖 GPU 内存配置和 CloudWatch 监控。

9月25日周五
  1. Google DeepMind71

    Gemini 3.8 Live with Live Avatar 发布

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为企业对话式 AI 加入近实时视频生成、语音和动态视觉形象。

    推荐理由:文章集中说明 Live Avatar 的多模态交互、异步工具调用和 97 种语言支持,并交代 Gemini Enterprise 的使用入口与定制头像限制。

9月24日周四
9月23日周三
9月16日周三
9月10日周四
8月28日周五
  1. Hugging Face Blog74

    Hugging Face 与 Voice Arena 为 Open ASR Leaderboard 加入 Hindi 和 Indian English 评测

    Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。

    推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。

8月27日周四
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。

8月25日周二
  1. Mistral AI57

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖沙特及中东地区的 AI 基础设施、先进模型开发和 AI 解决方案部署。双方将探索利用 HUMAIN 的数据中心基础设施,并重点推进网络安全、语音及阿拉伯语 frontier models。此次合作金额为 hundreds of millions of Euros,双方还计划面向沙特受监管行业制定联合市场策略。

8月21日周五
8月12日周三
8月11日周二
  1. Hugging Face Blog74

    NVIDIA Magpie TTS 多语言模型发布,支持 12 种语言与低延迟部署

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,模型规模为 364M parameters,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。

    推荐理由:文章将开放权重、12 种语言支持、NIM 部署和延迟数据放在同一框架中,便于评估多语言语音智能体的落地路径。

7月15日周三
  1. Hugging Face Blog66

    Real World VoiceEQ 发布,用人类评价衡量语音 AI 的真实交互质量

    Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。

    推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。

7月1日周三
  1. Hugging Face Blog69

    Hugging Face 与 Cerebras 将 Gemma 4 用于实时语音 AI

    Hugging Face 与 Cerebras 展示了将 Gemma 4 31B 用于实时语音到语音系统的方案。该开放管线依次使用 Nvidia 的 Parakeet 进行语音识别、在 Cerebras 上运行 Gemma 4 VLM 推理,并通过 Qwen3TTS 生成语音。相关架构已用于 Reachy Mini 机器人,配套代码仓库为 huggingface/speech-to-speech。

    推荐理由:文章拆解了实时语音到语音管线的模块构成与协作方式,开发者可据此了解低延迟架构的实现路径和代码入口。

6月9日周二
4月16日周四
3月24日周二
  1. Mistral AI75

    Mistral AI 发布 Voxtral TTS 多语言语音生成模型

    Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。

    推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。

2月5日周四
7月17日周四
  1. Mistral AI77

    Mistral AI 为 Le Chat 发布 Deep Research、语音模式等多项功能

    Mistral AI 为 Le Chat 发布 Deep Research(Preview)、语音模式、Projects、多语言推理和高级图像编辑等功能。Deep Research agent 可规划问题、搜索资料并生成带引用的结构化报告,语音模式由 Voxtral 驱动,Think mode 由 Magistral 驱动。

    推荐理由:Le Chat此次更新覆盖研究、语音、项目管理和图像编辑,展示了多种交互能力如何集中到同一助手中。

7月15日周二
  1. Mistral AI83

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。

    推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。