Gemini 3.8 Live:语音代理工作时,不必让对话停下来
Google 面向 Gemini API 和 AI Studio 发布两款语音到语音模型,加入后台工具调用和可配置的推理能力。
60 秒版本
Google 的 Gemini 3.8 Live 让语音代理在后台执行工具和推理时继续对话。
要点
- 异步函数调用旨在避免工具等待变成死寂。
- Google 强调视觉上下文、字母数字信息处理和超过 97 种语言。
- 排行榜、价格和能力数字主要是厂商声明。
- 真正的考验是任务可靠性:工具选择正确、结果说明清楚、失败后能恢复。
结论. 这是语音代理架构的一次有意义更新,但对话更流畅不代表代理一定会做出正确动作。
发布了什么代理工作时,对话不用停
Google 通过 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,目标是让开发者构建实时、以语音为主的产品。
核心变化是异步函数调用:代理可以继续输出语音,同时在后台执行 API 或工具调用。理论上,预约助手可以在检查日历时自然回应,而不是停在一段等待音里。
为什么重要停顿也是产品体验的一部分
语音代理不仅要说对,还要在合适的时间说。长时间沉默会让系统像卡住,过早说话又可能在工具尚未完成时做出承诺。后台调用可以缓解这个矛盾,但不能保证最终动作正确。
它不只是一个麦克风
- 视觉上下文让实时对话可以参考用户展示的内容。
- Google 强调对确认码、理赔编号和技术数据等字母数字信息的处理。
- Extended Thinking 增加可配置的推理,用于复杂的多步请求。
- Google 列出的集成伙伴包括 LiveKit、Agora、LangChain 和 Vercel。
先看清楚证据对话更顺,不等于动作更安全
Google 表示 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音排行榜上排名第一。这个结果只描述一种评测设置,不能证明普遍准确、低延迟、安全调用工具,或能在嘈杂环境下稳定工作。
结论有意思的是架构变化
Gemini 3.8 Live 针对的是语音界面中对话和动作之间的尴尬空隙。如果开发者能让后台工作听起来更自然,同时不隐藏不确定性,语音代理会更好用。但这次发布证明的是新的 API 形态和一组产品承诺,还不是可靠自主行动的证明。
升级的重点不是代理说得更多,而是系统工作时,对话仍能继续。
主源Google DeepMind: Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe·Google News RSS: independent coverage of Gemini 3.8 Live·TechRepublic: Google Launches Gemini 3.8 Live Models That Can Reason While They Talk·ExtremeTech: Google Launches New Voice AI Models for Building Real-Time Conversational Apps·Google Gemini API Live API documentation