Gemini 3.8 Live: bagaimana interleaved reasoning dan pemanggilan alat asinkron mengubah agen suara Google

Diedit oleh: Svitlana Velhush

Pada 15 September 2026, Google memperkenalkan dua model baru — Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking. Keduanya diposisikan sebagai model paling canggih untuk dialog langsung, yang dioptimalkan untuk latensi rendah dan waktu nyata.

Perbedaan utama dari pendahulunya, seperti Gemini 3.1 Flash Live, terletak pada dukungan interleaved reasoning dan pemanggilan fungsi asinkron. Model dapat bernalar dan sekaligus menghasilkan ucapan, sementara alat dijalankan di latar belakang tanpa mengganggu percakapan.

Hal ini dicapai berkat arsitektur audio native, di mana masukan dan keluaran berupa audio dan teks secara waktu nyata. Konteks visual dalam near real-time, peralihan otomatis antara 97 bahasa, dan pembaruan konten sesi didukung. Harganya adalah $0.005 per menit masukan audio dan $0.018 per menit keluaran.

Extended Thinking memimpin dalam tolok ukur: 82.6 poin pada Artificial Analysis Speech to Speech Quality Index, 68.6% pada τ-Voice, 35.1% pada Sierra’s τ-Voice-banking, dan 97.7% pada Big Bench Audio. Versi dasar menempati posisi kedua di Speech Agent Arena dan menunjukkan hasil yang kuat pada EVA-Bench.

Metodologi tolok ukur berfokus pada agentic task completion dan kualitas ucapan, tetapi tidak selalu mengungkap detail uji held-out atau perbandingan dengan skenario zero-shot. Hal ini menyisakan pertanyaan tentang generalisasi nyata di luar tugas enterprise tertentu.

Dalam lanskap ini, hal tersebut berbeda dari pendekatan OpenAI dengan GPT-Live dan xAI dengan Grok Voice Think Fast. Google menekankan pelaksanaan tugas secara paralel dan visual grounding, bukan hanya kecepatan respons. Model-model sebelumnya sering memerlukan jeda untuk reasoning, yang mengganggu kealamian dialog.

Kemampuan baru ini membuka jalan menuju agen suara tingkat produksi, di mana model dapat menjalankan operasi bertahap yang kompleks sambil mempertahankan alur percakapan. Hal ini terutama terlihat dalam integrasi dengan Search Live, Gemini Live, dan Workspace.

Masih belum jelas seberapa stabil hasilnya dalam verifikasi independen dan dalam kondisi kebisingan atau aksen nyata. Komunitas kemungkinan akan menguji latensi dalam kasus tepi dan membandingkannya dengan alternatif sumber terbuka.

Pergeseran utamanya adalah transisi dari antarmuka suara reaktif ke yang benar-benar agentic, di mana reasoning tidak menghalangi komunikasi alami.

3 Tampilan

Sumber-sumber

  • Google launches Gemini 3.8 Live models

Komentar

Baca lebih banyak artikel tentang topik ini:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
Apakah Anda menemukan kesalahan atau ketidakakuratan?Kami akan mempertimbangkan komentar Anda sesegera mungkin.