跳到正文

#语音

今日 0 条
9月30日周三
  1. Hugging Face Blog51

    Hugging Face 发布 Open TTS Leaderboard 支持多语言与声音克隆评测

    Hugging Face 推出 Open TTS Leaderboard,采用 WER、CER、RTFx 和 TTFA 等客观指标对开源文本转语音模型进行标准化评估。该榜单覆盖多语言及声音克隆能力,旨在解决现有竞技场式评测难以跟上模型发布速度且开源模型代表性不足的问题。用户可通过 Listen 标签页试听生成音频并投票反馈,同时可在 Streaming 标签页查看不同硬件下的首音频延迟表现。

9月29日周二
9月25日周五
  1. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar 实时视觉化身功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。

    推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。

9月23日周三
9月16日周三
8月28日周五
8月27日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中达到流式 4.0% 和非流式 2.6% 的平均词错率,支持超过 85 种语言自动检测与转录,并具备处理自我纠正、去除填充词及自定义词汇的能力。

    推荐理由:原文给出了新模型的流式与非流式词错率数据及多语言支持范围,开发者可据此评估其在实时语音交互场景中的落地可行性。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 发布语音识别基准优化测量研究

    Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。

    推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie Multilingual TTS:支持12种语言的开源低延迟语音合成模型

    NVIDIA 发布 Magpie Multilingual TTS,这是一个364M参数的开源权重多语言文本转语音模型,最新支持包括阿拉伯语、韩语和巴西葡萄牙语在内的12种语言。

    推荐理由:原文给出了 Magpie TTS 新增语言、低延迟实测数据及开源权重部署细节,为构建可控的多语言语音智能体提供了具体参考。

7月15日周三
7月1日周三
6月24日周三
  1. Hugging Face Blog42

    Hugging Face 与 Treble Technologies 推出首个开源远场 ASR 基准 FFASR Leaderboard

    Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。

6月9日周二
5月27日周三
5月7日周四
5月6日周三
5月4日周一
4月16日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash TTS 支持细粒度音频标签控制

    Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,即日起在 Gemini API、Google AI Studio 和 Vertex AI 预览版中向开发者和企业开放。

    推荐理由:新模型引入自然语言音频标签以精细控制语调节奏,并在 Artificial Analysis 榜单取得高分,适合评估其在多语言场景下的表现力与成本平衡。

3月26日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提供更自然、低延迟的实时对话体验。

    推荐理由:原文给出了新语音模型在复杂任务基准上的具体得分及多语言实时对话能力的扩展,读者可据此评估其在构建高可靠性语音智能体时的实际性能提升。

3月24日周二
  1. Hugging Face Blog48

    Hugging Face 发布语音智能体评估框架 EVA

    Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。

  2. Mistral AI73

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 推出首个文本转语音模型 Voxtral TTS,参数量为 4B,支持英语、法语等 9 种语言的情感化语音生成。该模型具备极低延迟(70ms)和零样本跨语言声音适应能力,在人类评估中自然度优于 ElevenLabs Flash v2.5。

    推荐理由:原文给出了多语言情感表达、低延迟指标及与竞品的对比评测,读者可据此评估其在企业级语音智能体工作流中的实际落地能力。

3月7日周六
2月5日周四
1月14日周三
  1. Google Research65

    Google 发布 MedGemma 1.5 4B 与 MedASR 开源医疗模型

    Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。

    推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。

12月13日周六
12月4日周四
11月21日周五
11月19日周三
  1. Google Research80

    Google Research 发布端到端实时语音到语音翻译模型

    Google Research 推出了一种创新的端到端语音到语音翻译(S2ST)模型,实现了仅2秒延迟的实时翻译,并能保留原始说话人的声音特征。该模型基于 AudioLM 框架和 SpectroStream 编解码技术,通过可扩展的时间同步数据获取管道进行训练,解决了传统级联系统延迟高、错误累积和缺乏个性化的问题。

    推荐理由:Google Research 发布了端到端实时语音到语音翻译模型,将延迟降至2秒并保留原声,已在 Google Meet 和 Pixel 10 中部署。

10月28日周二
7月15日周二
  1. Mistral AI82

    Mistral AI 发布开源语音理解模型 Voxtral

    Mistral AI 发布开源语音理解模型 Voxtral,包含适用于生产环境的 24B 版本和适用于本地/边缘部署的 3B 版本(Voxtral Mini),均采用 Apache 2.0 许可证。

    推荐理由:原文给出了两种参数规模的开源语音理解模型及其在转录和语义理解上的基准表现,读者可以据此评估其在本地部署或生产环境中的成本与能力平衡。

6月3日周二
5月13日周二
4月9日周三
2月27日周四
2月25日周二
  1. Hugging Face Blog78

    Hugging Face 发布 FastRTC:面向 Python 的实时通信库

    Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时通信库,旨在简化实时音频和视频 AI 应用的构建。它内置了自动语音检测、轮次管理以及基于 Gradio 的 UI,支持 WebRTC 和 WebSocket,并可一键部署为 FastAPI 应用或获取免费电话号码进行通话测试。

    推荐理由:该库通过封装 WebRTC 和自动语音检测,让 Python 开发者能低门槛构建实时音视频 AI 应用,并支持快速部署与电话接入。

12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

5月1日周三
2月27日周二
  1. Hugging Face Blog40

    Hugging Face 推出 TTS Arena:基于社区投票的文本转语音模型基准测试

    Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。

1月19日周五
12月20日周三
  1. Hugging Face Blog65

    Hugging Face 演示通过推测解码实现 Whisper 推理 2 倍加速

    Hugging Face 博客展示如何利用推测解码(Speculative Decoding)将 Whisper 模型的推理速度提升约 2 倍,同时保证输出结果与原模型完全一致。文章详细给出了使用 Distil-Whisper 或 Whisper tiny 作为辅助模型的技术实现代码、英语及多语言场景下的基准测试结果,并说明了选择辅助模型和控制批次大小等优化策略。

    推荐理由:原文提供了在 Hugging Face Transformers 中利用辅助模型实现 Whisper 推理加速的具体代码与基准测试数据,展示了无损提速的工程落地路径。