跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

25条精选相关主题多模态AI 视频产品更新

最新精选

第 21–25 条 · 共 25 条
10月1日周二
  1. OpenAI News78

    OpenAI 发布 Realtime API

    OpenAI 发布 Realtime API,允许开发者在应用程序中构建快速的语音到语音交互体验。

    推荐理由:OpenAI 推出 Realtime API,开发者可借此在应用中构建快速的语音到语音交互体验。

12月20日周三
  1. Hugging Face Blog65

    Hugging Face 演示通过推测解码实现 Whisper 推理 2 倍加速

    Hugging Face 博客展示如何利用推测解码(Speculative Decoding)将 Whisper 模型的推理速度提升约 2 倍,同时保证输出结果与原模型完全一致。文章详细给出了使用 Distil-Whisper 或 Whisper tiny 作为辅助模型的技术实现代码、英语及多语言场景下的基准测试结果,并说明了选择辅助模型和控制批次大小等优化策略。

    推荐理由:原文提供了在 Hugging Face Transformers 中利用辅助模型实现 Whisper 推理加速的具体代码与基准测试数据,展示了无损提速的工程落地路径。

8月30日周三
  1. Hugging Face Blog62

    Hugging Face 发布 AudioLDM 2 在 Diffusers 中的推理加速教程

    Hugging Face 发布教程展示如何在 🧨 Diffusers 库中优化 AudioLDM 2 模型的推理速度,将生成 10 秒音频的时间从约 30 秒缩短至不到 1 秒。

    推荐理由:原文通过逐步演示代码优化技巧,展示了如何将 AudioLDM 2 的推理时间缩短十倍以上,为开发者提供了可直接复用的性能调优方法。

11月3日周四
  1. Hugging Face Blog60

    Hugging Face 发布使用 Transformers 微调 Whisper 进行多语言语音识别教程

    Hugging Face 博客发布指南,演示如何使用 🤗 Transformers 库对 OpenAI 的 Whisper 模型进行微调,以适配任意多语言自动语音识别(ASR)数据集。

    推荐理由:提供了基于 Hugging Face Transformers 微调 Whisper 进行多语言 ASR 的完整代码流程,展示了仅用少量数据即可显著提升识别性能的方法。

9月21日周三
  1. OpenAI News82

    OpenAI 开源语音识别模型 Whisper

    OpenAI 训练并开源了名为 Whisper 的神经网络模型。该模型在英语语音识别任务中展现出接近人类水平的鲁棒性和准确性。

    推荐理由:原文宣布开源 Whisper 模型,指出其在英语语音识别上接近人类水平的鲁棒性和准确性。