2026年9月15日、Google は2つの新しいモデル、Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking を発表しました。これらは、低遅延とリアルタイム性に最適化された、ライブ対話のための最も先進的なモデルとして位置付けられています。
Gemini 3.1 Flash Live などの従来モデルとの主な違いは、interleaved reasoning と非同期関数呼び出しのサポートにあります。モデルは推論を行いながら同時に音声を生成することができ、ツールは会話を中断することなくバックグラウンドで実行されます。
これは、入力と出力がリアルタイムのオーディオとテキストであるネイティブ・オーディオ・アーキテクチャによって実現されています。near real-time での視覚的コンテキスト、97 言語間の自動切り替え、セッション・コンテンツの更新がサポートされています。価格は、オーディオ入力1分あたり $0.005、出力1分あたり $0.018 です。
Extended Thinking はベンチマークで首位に立っています。Artificial Analysis Speech to Speech Quality Index で 82.6 点、τ-Voice で 68.6%、Sierra’s τ-Voice-banking で 35.1%、Big Bench Audio で 97.7% を記録しました。標準バージョンは Speech Agent Arena で2位となり、EVA-Bench でも強力な結果を示しています。
ベンチマークの評価手法は agentic task completion と音声の質に焦点を当てていますが、held-out テストの詳細や zero-shot シナリオとの比較が常に公開されているわけではありません。そのため、特定の enterprise タスク以外での実際の汎用性については疑問が残ります。
この状況は、OpenAI の GPT-Live や xAI の Grok Voice Think Fast のアプローチとは異なります。Google は単なる応答速度だけでなく、タスクの並列実行と視覚的な grounding を重視しています。以前のモデルでは reasoning のために一時停止が必要なことが多く、対話の自然さが損なわれていました。
新しい機能は、モデルが会話の流れを維持しながら複雑なマルチステップの操作を実行できる production-grade の音声エージェントへの道を開きます。これは、Search Live、Gemini Live、Workspace との統合において特に顕著です。
独立した検証や、現実世界のノイズやアクセントがある条件下で、結果がどの程度安定しているかは依然として不明です。コミュニティは、エッジケースでの latency をテストし、open-source の代替案と比較することになるでしょう。
重要な転換点は、反応的な音声インターフェースから、reasoning が自然なコミュニケーションを妨げない truly agentic なインターフェースへの移行です。

