跳到正文

#语音

今日 0 条
10月22日周二
10月1日周二
  1. OpenAI News78

    OpenAI 发布 Realtime API

    OpenAI 发布 Realtime API,允许开发者在应用程序中构建快速的语音到语音交互体验。

    推荐理由:OpenAI 推出 Realtime API,开发者可借此在应用中构建快速的语音到语音交互体验。

6月8日周六
5月20日周一
5月1日周三
3月29日周五
2月27日周二
  1. Hugging Face Blog40

    Hugging Face 推出 TTS Arena:基于社区投票的文本转语音模型基准测试

    Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。

1月19日周五
12月20日周三
  1. Hugging Face Blog65

    Hugging Face 演示通过推测解码实现 Whisper 推理 2 倍加速

    Hugging Face 博客展示如何利用推测解码(Speculative Decoding)将 Whisper 模型的推理速度提升约 2 倍,同时保证输出结果与原模型完全一致。文章详细给出了使用 Distil-Whisper 或 Whisper tiny 作为辅助模型的技术实现代码、英语及多语言场景下的基准测试结果,并说明了选择辅助模型和控制批次大小等优化策略。

    推荐理由:原文提供了在 Hugging Face Transformers 中利用辅助模型实现 Whisper 推理加速的具体代码与基准测试数据,展示了无损提速的工程落地路径。

8月30日周三
  1. Hugging Face Blog62

    Hugging Face 发布 AudioLDM 2 在 Diffusers 中的推理加速教程

    Hugging Face 发布教程展示如何在 🧨 Diffusers 库中优化 AudioLDM 2 模型的推理速度,将生成 10 秒音频的时间从约 30 秒缩短至不到 1 秒。

    推荐理由:原文通过逐步演示代码优化技巧,展示了如何将 AudioLDM 2 的推理时间缩短十倍以上,为开发者提供了可直接复用的性能调优方法。

8月9日周三
6月19日周一
6月15日周四
6月2日周五
2月8日周三
  1. Hugging Face Blog45

    SpeechT5 登陆 Hugging Face Transformers,支持语音合成、识别与转换

    Microsoft Research Asia 开发的 SpeechT5 模型现已在 🤗 Transformers 中可用。该模型基于统一模态编码器-解码器架构,通过预训练实现文本到语音(TTS)、自动语音识别(ASR)及语音到语音(S2S)转换。开发者可通过加载 `microsoft/speecht5_tts` 检查点及 speaker embeddings 快速集成多任务语音处理能力。

12月15日周四
  1. Hugging Face Blog37

    Hugging Face 🤗 Datasets 音频数据集加载与处理指南

    Hugging Face 开源库 🤗 Datasets 支持通过 `load_dataset` 函数一行代码下载并预处理音频数据。该工具集成 Hub 上77个语音识别及28个音频分类数据集,提供流式模式与实时预览功能。以 GigaSpeech 为例,用户可轻松加载从10小时到10,000小时的多种配置,自动完成数据解压、切分及特征提取。

11月3日周四
  1. Hugging Face Blog60

    Hugging Face 发布使用 Transformers 微调 Whisper 进行多语言语音识别教程

    Hugging Face 博客发布指南,演示如何使用 🤗 Transformers 库对 OpenAI 的 Whisper 模型进行微调,以适配任意多语言自动语音识别(ASR)数据集。

    推荐理由:提供了基于 Hugging Face Transformers 微调 Whisper 进行多语言 ASR 的完整代码流程,展示了仅用少量数据即可显著提升识别性能的方法。

9月21日周三
  1. OpenAI News82

    OpenAI 开源语音识别模型 Whisper

    OpenAI 训练并开源了名为 Whisper 的神经网络模型。该模型在英语语音识别任务中展现出接近人类水平的鲁棒性和准确性。

    推荐理由:原文宣布开源 Whisper 模型,指出其在英语语音识别上接近人类水平的鲁棒性和准确性。

2月1日周二
1月12日周三
  1. Hugging Face Blog42

    🤗 Transformers 集成 pyctcdecode 实现 Wav2Vec2 与 n-gram 语言模型联合解码

    🤗 Transformers 现已支持通过 Kensho Technologies 的 pyctcdecode 库,将微调后的 Wav2Vec2 模型与 n-gram 语言模型结合进行音频解码。该功能解决了此前缺乏简单用户界面以利用外部语言模型提升转录准确性的问题,特别适用于仅使用少量标注数据(如 10 分钟)训练的场景。

11月15日周一
  1. Hugging Face Blog40

    使用 🤗 Transformers 微调 XLS-R 进行低资源 ASR

    Hugging Face 发布教程,演示如何使用 🤗 Transformers 微调 XLS-R(Wav2Vec2-XLS-R-300M)进行低资源自动语音识别。该模型基于近50万小时128种语言数据预训练,参数规模达3亿至20亿。教程以 Common Voice 数据集为例,采用 CTC 算法和 WER 指标评估,展示了从数据准备到 Hub 上传的完整流程。

3月12日周五