ElevenLabs 估值翻倍至 220 亿美元
ElevenLabs 允许员工以 220 亿美元估值套现部分股权,较今年 2 月融资时的 110 亿美元估值翻倍。此次交易由 Wellington 和 T. Rowe Price 联合领投,涉及 3 亿美元要约收购。这家成立四年的语音 AI 初创公司借此加入欧洲最具价值初创企业行列。
ElevenLabs 允许员工以 220 亿美元估值套现部分股权,较今年 2 月融资时的 110 亿美元估值翻倍。此次交易由 Wellington 和 T. Rowe Price 联合领投,涉及 3 亿美元要约收购。这家成立四年的语音 AI 初创公司借此加入欧洲最具价值初创企业行列。
Hugging Face 推出 Open TTS Leaderboard,采用 WER、CER、RTFx 和 TTFA 等客观指标对开源文本转语音模型进行标准化评估。该榜单覆盖多语言及声音克隆能力,旨在解决现有竞技场式评测难以跟上模型发布速度且开源模型代表性不足的问题。用户可通过 Listen 标签页试听生成音频并投票反馈,同时可在 Streaming 标签页查看不同硬件下的首音频延迟表现。
本教程演示如何利用 AWS vLLM-Omni Deep Learning Container (DLC) 在 Amazon SageMaker AI 上部署 Qwen3-TTS,实现文本输入与音频输出的双向流式传输。通过 Gradio 应用可体验该工作流,支持在生成完整响应前开始播放语音,适用于实时语音代理等场景。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。
推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。
Simon Willison 发布了 Gemini 3.8 TTS Playground,这是一个用于测试 Google 最新文本转语音 API 的交互式网页工具。该工具支持单声旁白和多说话人对话生成,允许用户通过 30 秒音频样本创建自定义声音,并需使用用户自己的 Gemini API key 运行。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新文本转语音模型,旨在将语音生成从静态预设转变为动态创意工具。
推荐理由:原文展示了从静态预设到动态创意工作室的转变,提供了角色定制、逐行导演及多语言支持的具体能力与基准表现。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款最新实时对话模型,旨在提升语音智能体的近实时推理能力。
推荐理由:原文详细列出了两款新语音模型在多项基准测试中的具体得分及并行推理能力,为开发者评估实时语音智能体的性能与成本提供了直接依据。
Voice Arena 与 Hugging Face 合作在 Open ASR Leaderboard 中引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,首次覆盖印地语和印度英语。
推荐理由:新增印地语和印度英语评测集,通过记录说话人属性揭示模型在不同人群中的性能差异,为评估语音识别公平性提供新基准。
Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中达到流式 4.0% 和非流式 2.6% 的平均词错率,支持超过 85 种语言自动检测与转录,并具备处理自我纠正、去除填充词及自定义词汇的能力。
推荐理由:原文给出了新模型的流式与非流式词错率数据及多语言支持范围,开发者可据此评估其在实时语音交互场景中的落地可行性。
Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。
推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。
NVIDIA 发布 Magpie Multilingual TTS,这是一个364M参数的开源权重多语言文本转语音模型,最新支持包括阿拉伯语、韩语和巴西葡萄牙语在内的12种语言。
推荐理由:原文给出了 Magpie TTS 新增语言、低延迟实测数据及开源权重部署细节,为构建可控的多语言语音智能体提供了具体参考。
Hugging Face 推出 Real World VoiceEQ 基准,旨在评估语音 AI 在真实对话中的“人类质量”,涵盖语气、情感和背景语境等转录文本无法体现的信息。
Hugging Face 和 Cerebras 联合演示了基于 Gemma 4 的实时语音到语音(Speech-to-Speech)AI 系统,旨在解决语音交互中的高延迟痛点。
推荐理由:展示了开源级联语音架构与高速推理结合后的低延迟表现,为实时交互应用提供了可复用的技术栈参考。
Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持自动检测 70 多种语言并生成保留说话人语调、节奏和音高的自然翻译语音。
推荐理由:该模型支持70多种语言的近实时语音到语音翻译,并已在开发者API、企业会议及消费级应用中开放体验。
Hugging Face 发布了让 Reachy Mini 机器人完全在本地运行语音对话的技术指南,通过 speech-to-speech 库实现 VAD、STT、LLM 和 TTS 的全链路本地处理。
推荐理由:原文提供了 Reachy Mini 机器人本地化语音交互的完整部署指南,读者可据此实现无云端依赖的隐私对话。
Hugging Face 联合 Appen Inc. 和 DataoceanAI 在 Open ASR Leaderboard 中新增覆盖多口音的高质量私有 ASR 数据集,旨在防止基准测试优化(benchmaxxing)及测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过切换开关查看私有数据影响。
Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,即日起在 Gemini API、Google AI Studio 和 Vertex AI 预览版中向开发者和企业开放。
推荐理由:新模型引入自然语言音频标签以精细控制语调节奏,并在 Artificial Analysis 榜单取得高分,适合评估其在多语言场景下的表现力与成本平衡。
Google DeepMind 发布 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提供更自然、低延迟的实时对话体验。
推荐理由:原文给出了新语音模型在复杂任务基准上的具体得分及多语言实时对话能力的扩展,读者可据此评估其在构建高可靠性语音智能体时的实际性能提升。
Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。
Mistral AI 推出首个文本转语音模型 Voxtral TTS,参数量为 4B,支持英语、法语等 9 种语言的情感化语音生成。该模型具备极低延迟(70ms)和零样本跨语言声音适应能力,在人类评估中自然度优于 ElevenLabs Flash v2.5。
推荐理由:原文给出了多语言情感表达、低延迟指标及与竞品的对比评测,读者可据此评估其在企业级语音智能体工作流中的实际落地能力。
Google Research 推出 WAXAL,包含约1846小时ASR转录数据和565小时TTS高保真录音,覆盖27种撒哈拉以南非洲语言。该数据集采用 CC-BY-4.0 许可开源,由非洲学术与社区组织主导采集,旨在支持超1亿使用者的语音技术研发。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量处理的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime。
推荐理由:官方发布了具备超低延迟和说话人分离能力的新一代语音转文字模型,其中实时版以 Apache 2.0 协议开源,提供了具体的性能基准和定价信息。
Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。
推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型,旨在优化实时语音代理的自然对话与复杂任务处理能力。
推荐理由:官方更新了 Gemini 2.5 Flash Native Audio 模型,显著提升了实时语音代理在复杂工作流处理、指令遵循及多轮对话中的表现。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
Google Research 推出了一种创新的端到端语音到语音翻译(S2ST)模型,实现了仅2秒延迟的实时翻译,并能保留原始说话人的声音特征。该模型基于 AudioLM 框架和 SpectroStream 编解码技术,通过可扩展的时间同步数据获取管道进行训练,解决了传统级联系统延迟高、错误累积和缺乏个性化的问题。
推荐理由:Google Research 发布了端到端实时语音到语音翻译模型,将延迟降至2秒并保留原声,已在 Google Meet 和 Pixel 10 中部署。
Mistral AI 发布开源语音理解模型 Voxtral,包含适用于生产环境的 24B 版本和适用于本地/边缘部署的 3B 版本(Voxtral Mini),均采用 Apache 2.0 许可证。
推荐理由:原文给出了两种参数规模的开源语音理解模型及其在转录和语义理解上的基准表现,读者可以据此评估其在本地部署或生产环境中的成本与能力平衡。
Arm 推出基于 Stable Audio Open 模型的实时 AI 声音生成应用,利用 Arm CPU 实现纯端侧推理,无需 GPU 或云端。该工具通过 PyTorch 优化多线程执行,能在数秒内根据提示词生成 .wav 文件并直接导入 Ableton Live,兼顾隐私与创作效率。
Hugging Face 在 Inference Endpoints 上推出基于 vLLM 的 OpenAI Whisper 优化部署,性能提升高达 8x。该方案针对 NVIDIA L4/L40s GPU 进行 torch.compile、CUDA graphs 及 float8 KV cache 等底层优化,在保持转录质量的同时显著降低延迟。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者通过 Hugging Face token 直接接入企业级 WebRTC 基础设施。该集成在 FastRTC v0.0.20+ 版本可用,每月免费提供 10GB 数据流量,旨在解决 AI 应用部署中 TURN 服务器维护难题并支持低延迟实时音视频流。
Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。
Hugging Face 演示如何使用 🤗 Transformers 微调 Wav2Vec2-BERT(580M 参数)以优化低资源自动语音识别。该模型在蒙古语数据集上达到与 Whisper-large-v3 相似的词错误率,但推理速度快 10-30 倍且资源效率提升 2.5 倍。
Hugging Face 发布教程,演示如何利用 Optimum 和 Accelerate 库优化基于 🤗 Transformers 的 Bark 文本转语音模型。该方案通过少量代码即可降低内存占用并提升推理速度,文中提供了针对 Bark small 检查点的基准测试结果及 Google Colab 示例。