# Gemini 3.8 Live：语音代理工作时，不必让对话停下来

> Google 面向 Gemini API 和 AI Studio 发布两款语音到语音模型，加入后台工具调用和可配置的推理能力。

_Source: Google DeepMind's developer announcement, independently cross-checked against TechRepublic, ExtremeTech, Unite.AI and 9to5Google coverage; leaderboard, language-count, pricing and capability figures remain primarily Google-reported. · 2026-09-19 · 5 min read · Verified against primary sources_

Canonical: https://iyu.app/zh/e/gemini-3-8-live-voice-agents

## 60 秒版本

Google 的 Gemini 3.8 Live 让语音代理在后台执行工具和推理时继续对话。

**要点**

- 异步函数调用旨在避免工具等待变成死寂。
- Google 强调视觉上下文、字母数字信息处理和超过 97 种语言。
- 排行榜、价格和能力数字主要是厂商声明。
- 真正的考验是任务可靠性：工具选择正确、结果说明清楚、失败后能恢复。

**结论.** 这是语音代理架构的一次有意义更新，但对话更流畅不代表代理一定会做出正确动作。

## 全文

> **⚑ Caveat:** 排行榜名次、语言数量、功能和价格主要来自 Google 的厂商声明，不能直接当作真实环境中的独立可靠性证据。


### 发布了什么 — 代理工作时，对话不用停

Google 通过 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking，目标是让开发者构建实时、以语音为主的产品。

核心变化是异步函数调用：代理可以继续输出语音，同时在后台执行 API 或工具调用。理论上，预约助手可以在检查日历时自然回应，而不是停在一段等待音里。

- **97+** — Google 声称覆盖的语言数量
- **$0.005** — 公开列出的每分钟音频输入价格
- **$0.018** — 公开列出的每分钟音频输出价格


### 为什么重要 — 停顿也是产品体验的一部分

语音代理不仅要说对，还要在合适的时间说。长时间沉默会让系统像卡住，过早说话又可能在工具尚未完成时做出承诺。后台调用可以缓解这个矛盾，但不能保证最终动作正确。


#### 它不只是一个麦克风

- 视觉上下文让实时对话可以参考用户展示的内容。
- Google 强调对确认码、理赔编号和技术数据等字母数字信息的处理。
- Extended Thinking 增加可配置的推理，用于复杂的多步请求。
- Google 列出的集成伙伴包括 LiveKit、Agora、LangChain 和 Vercel。


### 先看清楚证据 — 对话更顺，不等于动作更安全

Google 表示 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音排行榜上排名第一。这个结果只描述一种评测设置，不能证明普遍准确、低延迟、安全调用工具，或能在嘈杂环境下稳定工作。

> **i** 真正有用的证据是任务是否完成：代理是否理解请求、调用了正确工具、说明实际结果，并在工具失败时恢复？单个排行榜无法回答全部问题。


### 结论 — 有意思的是架构变化

Gemini 3.8 Live 针对的是语音界面中对话和动作之间的尴尬空隙。如果开发者能让后台工作听起来更自然，同时不隐藏不确定性，语音代理会更好用。但这次发布证明的是新的 API 形态和一组产品承诺，还不是可靠自主行动的证明。

> 升级的重点不是代理说得更多，而是系统工作时，对话仍能继续。


## Primary sources

- [Google DeepMind: Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe](https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/)
- [Google News RSS: independent coverage of Gemini 3.8 Live](https://news.google.com/rss/search?q=%22Gemini+3.8%22+Google+AI&hl=en-US&gl=US&ceid=US:en)
- [TechRepublic: Google Launches Gemini 3.8 Live Models That Can Reason While They Talk](https://www.techrepublic.com/article/google-gemini-3-8-live-voice-ai/)
- [ExtremeTech: Google Launches New Voice AI Models for Building Real-Time Conversational Apps](https://www.extremetech.com/ai/google-launches-new-voice-ai-models-for-building-real-time-conversational-apps)
- [Google Gemini API Live API documentation](https://ai.google.dev/gemini-api/docs/live)

---
_Published by iyu (https://iyu.app) — the day's AI news, checked against primary sources and rewritten in plain language. Free to quote with attribution and a link to the canonical URL._
