Gemini 3.8 Live:交错推理与异步工具调用如何改变 Google 的语音智能体

编辑者: Svitlana Velhush

2026 年 15 月,Google 发布了两款新模型——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。它们被定位为面向实时对话的最先进模型,针对低延迟和实时场景进行了优化。

与前代产品(如 Gemini 3.1 Flash Live)的主要区别在于支持交错推理和异步函数调用。模型可以在推理的同时生成语音,而工具则在后台执行,不会打断对话。

这得益于原生音频架构,其输入和输出均为实时的音频与文本。它支持近实时的视觉上下文、在 97 种语言之间自动切换以及会话内容更新。价格为每分钟音频输入 $0.005、每分钟输出 $0.018。

Extended Thinking 在各项基准测试中领先:Artificial Analysis Speech to Speech Quality Index 上获得 82.6 分,τ-Voice 上获得 68.6% 分,Sierra’s τ-Voice-banking 上获得 35.1% 分,Big Bench Audio 上获得 97.7% 分。基础版本在 Speech Agent Arena 中排名第二,并在 EVA-Bench 上表现强劲。

基准测试方法聚焦于智能体任务完成度和语音质量,但并不总是披露留出测试的细节或与零样本场景的对比。这为模型在特定企业任务之外的真实泛化能力留下了疑问。

在这一格局中,它与 OpenAI 的 GPT-Live 和 xAI 的 Grok Voice Think Fast 路线有所不同。Google 强调任务的并行执行和视觉 grounding,而不仅仅是响应速度。此前的模型往往需要暂停以进行推理,这破坏了对话的自然性。

新能力为生产级语音智能体开辟了道路,模型可以在保持对话流畅的同时执行复杂的多步操作。这在 Search Live、Gemini Live 和 Workspace 的集成中尤为明显。

目前仍不清楚这些结果在独立验证以及真实噪声或口音条件下有多稳健。社区很可能会在边缘案例中测试延迟,并与开源替代方案进行比较。

关键转变在于从反应式语音界面迈向真正的智能体式界面,在那里推理不会妨碍自然的交流。

3 查看

来源

  • Google launches Gemini 3.8 Live models

评论

阅读更多关于此主题的文章:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。