跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

18条精选相关主题多模态AI 视频产品更新

最新精选

第 1–18 条 · 共 18 条
9月30日周三
  1. Hugging Face Blog68

    Hugging Face 推出 Open TTS Leaderboard,评估多语言 TTS 与声音克隆

    Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源 TTS 模型的多语言表现、声音克隆和流式性能。榜单使用 WER/CER、RTFx、TTFA 和 SIM 等指标,并支持在 H200 GPU 与 CPU 上比较部分模型。平台同时提供 Listen 标签页供用户比较音频和投票,但这些指标不取代自然度、表现力和听众偏好等人工评测。

    推荐理由:文章把 TTS 评测拆成可比较的可懂度、速度和说话人相似度指标,并展示多语言、声音克隆与流式性能的查看方式。

9月26日周六
  1. AWS Machine Learning Blog66

    AWS 教程:在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时声音克隆

    AWS 介绍了如何通过 Amazon SageMaker JumpStart,将公开可用的 Qwen3-TTS-12Hz-1.7B-Base 部署到 Amazon SageMaker AI 实时推理端点,实现基于短音频和文本转录的声音克隆。教程涵盖 24 GB NVIDIA L4 GPU 配置、跨语言声音克隆、请求调用以及 Amazon CloudWatch 监控。

    推荐理由:文章给出从 JumpStart 部署 Qwen3-TTS 并调用实时端点完成声音克隆的完整步骤,涵盖 GPU 内存配置和 CloudWatch 监控。

9月25日周五
  1. Google DeepMind71

    Gemini 3.8 Live with Live Avatar 发布

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为企业对话式 AI 加入近实时视频生成、语音和动态视觉形象。

    推荐理由:文章集中说明 Live Avatar 的多模态交互、异步工具调用和 97 种语言支持,并交代 Gemini Enterprise 的使用入口与定制头像限制。

9月23日周三
9月16日周三
8月28日周五
  1. Hugging Face Blog74

    Hugging Face 与 Voice Arena 为 Open ASR Leaderboard 加入 Hindi 和 Indian English 评测

    Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。

    推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。

8月27日周四
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持实时双向流式转写和预录音处理,面向语音智能体、实时字幕与通话分析等场景。模型可自动处理自我修正、填充词和格式化文本,支持超过 85 种语言,并提供最多三位说话人的识别与时间戳。

    推荐理由:Gemini 3.5 Transcribe同时覆盖实时流式与预录音处理,并给出WER、延迟和语言支持等指标,便于开发者评估接入场景。

8月21日周五
8月12日周三
8月11日周二
  1. Hugging Face Blog74

    NVIDIA Magpie TTS 多语言模型发布,支持 12 种语言与低延迟部署

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,模型规模为 364M parameters,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。

    推荐理由:文章将开放权重、12 种语言支持、NIM 部署和延迟数据放在同一框架中,便于评估多语言语音智能体的落地路径。

7月15日周三
  1. Hugging Face Blog66

    Real World VoiceEQ 发布,用人类评价衡量语音 AI 的真实交互质量

    Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。

    推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。

7月1日周三
  1. Hugging Face Blog69

    Hugging Face 与 Cerebras 将 Gemma 4 用于实时语音 AI

    Hugging Face 与 Cerebras 展示了将 Gemma 4 31B 用于实时语音到语音系统的方案。该开放管线依次使用 Nvidia 的 Parakeet 进行语音识别、在 Cerebras 上运行 Gemma 4 VLM 推理,并通过 Qwen3TTS 生成语音。相关架构已用于 Reachy Mini 机器人,配套代码仓库为 huggingface/speech-to-speech。

    推荐理由:文章拆解了实时语音到语音管线的模块构成与协作方式,开发者可据此了解低延迟架构的实现路径和代码入口。

6月9日周二
4月16日周四
3月24日周二
  1. Mistral AI75

    Mistral AI 发布 Voxtral TTS 多语言语音生成模型

    Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。

    推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。

2月5日周四
7月17日周四
  1. Mistral AI77

    Mistral AI 为 Le Chat 发布 Deep Research、语音模式等多项功能

    Mistral AI 为 Le Chat 发布 Deep Research(Preview)、语音模式、Projects、多语言推理和高级图像编辑等功能。Deep Research agent 可规划问题、搜索资料并生成带引用的结构化报告,语音模式由 Voxtral 驱动,Think mode 由 Magistral 驱动。

    推荐理由:Le Chat此次更新覆盖研究、语音、项目管理和图像编辑,展示了多种交互能力如何集中到同一助手中。

7月15日周二
  1. Mistral AI83

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。

    推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。