Hugging Face Blog·· 2022-02-01AI 评分47
Hugging Face 详解 Wav2Vec2 在长音频文件上的自动语音识别方案
Making automatic speech recognition work on large files with Wav2Vec2 in 🤗 Transformers
AI 导读
Hugging Face 介绍利用 CTC 架构的 stride 分块技术,解决 Wav2Vec2 处理长音频时的内存溢出问题。通过 `chunk_length_s` 和 `stride_length_s` 参数实现重叠推理并丢弃边缘 logits,可在有限硬件上对任意长度文件或实时流进行高质量 ASR。
来源:Hugging Face Blog · huggingface.co