Google DeepMind 推出 Gemini 3.8 Live with Live Avatar 实时视觉化身功能
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。
推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。
推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新文本转语音模型,旨在将语音生成从静态预设转变为动态创意工具。
推荐理由:原文展示了从静态预设到动态创意工作室的转变,提供了角色定制、逐行导演及多语言支持的具体能力与基准表现。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款最新实时对话模型,旨在提升语音智能体的近实时推理能力。
推荐理由:原文详细列出了两款新语音模型在多项基准测试中的具体得分及并行推理能力,为开发者评估实时语音智能体的性能与成本提供了直接依据。