Gemini 3.8 Live、音声エージェントが作業中も会話を止めない

GoogleがGemini APIとAI Studio向けに2つの音声対話モデルを公開し、バックグラウンドのツール呼び出しと設定可能な推論を加えた。

✓ 検証済み 出典 Google DeepMind's developer announcement, independently cross-checked against TechRepublic, ExtremeTech, Unite.AI and 9to5Google coverage; leaderboard, language-count, pricing and capability figures remain primarily Google-reported. ⚑ 音声AI

60秒でわかる

GoogleのGemini 3.8 Liveは、ツールと推論をバックグラウンドで動かしながら音声エージェントが会話を続けるモデルだ。

要点

  • 非同期の関数呼び出しで、ツール待ちの沈黙を減らす。
  • Googleは視覚的な文脈、英数字の処理、97以上の言語を強調している。
  • ランキング、価格、能力の数字は主にベンダーの発表だ。
  • 本当の試験は、正しいツール選択、明確な報告、失敗からの復旧を含むタスク信頼性になる。

結論. 音声エージェントの設計としては意味のある更新だが、滑らかな会話は正しい操作の証拠ではない。

何が出たかエージェントが作業中も会話を続ける

GoogleはGemini APIとGoogle AI Studioを通じて、Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを公開した。リアルタイムで音声を中心に使う製品を開発者が作るためのモデルだ。

中心となる変更は非同期の関数呼び出し。エージェントは音声を返し続けながら、APIやツールをバックグラウンドで実行できる。予約アシスタントなら、カレンダーの確認中も会話を自然に保てる。

97+Googleが示す対応言語数
$0.005公表された音声入力の1分あたり価格
$0.018公表された音声出力の1分あたり価格

なぜ重要か沈黙も製品体験の一部

音声エージェントは内容だけでなく、話すタイミングでも評価される。長い沈黙は停止したように感じさせ、早すぎる返答はツールが終わる前に約束してしまう。バックグラウンド処理はこの緊張を和らげるが、操作の正しさまでは保証しない。

マイクだけではない

  • 視覚的な文脈を加え、ユーザーが見せるものを会話に反映できる。
  • 確認コードや請求番号など、英数字の扱いをGoogleは強調している。
  • Extended Thinking版は複雑な多段階の依頼に向けた推論を設定できる。
  • 統合パートナーとしてLiveKit、Agora、LangChain、Vercelなどが挙げられている。

主張を読み分ける会話が滑らかでも、操作が安全とは限らない

GoogleはGemini 3.8 Live Extended ThinkingがArtificial Analysisの音声から音声へのランキングで首位だったと説明する。これは一つの評価条件の結果であり、一般的な正確さ、低遅延、安全なツール利用、雑音下での頑健性を証明するものではない。

結論面白いのはアーキテクチャの変化

Gemini 3.8 Liveは、音声での会話と操作の間にある気まずい待ち時間を狙う。処理中も不確実性を隠さず自然に応答できれば、音声エージェントは使いやすくなる。ただし今回の発表は新しいAPIと製品上の主張を示したもので、信頼できる自律行動の証明ではない。

重要なのはエージェントがより多く話すことではない。システムが作業中も会話が続くことだ。