Gemini 3.8 Live: interleaved reasoning ve asenkron araç çağrıları Google'ın sesli ajanlarını nasıl değiştiriyor

Düzenleyen: Svitlana Velhush

15 Eylül 2026 tarihinde Google iki yeni model tanıttı — Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Bu modeller, düşük gecikme ve gerçek zamanlı iletişim için optimize edilmiş, canlı diyalog için en gelişmiş modeller olarak konumlandırılıyor.

Gemini 3.1 Flash Live gibi önceki modellerden temel farkı, interleaved reasoning ve asenkron fonksiyon çağrıları desteğidir. Model aynı anda hem akıl yürütüp hem konuşma üretebiliyor, araçlar ise konuşmayı kesmeden arka planda çalışıyor.

Bu, girdi ve çıktının gerçek zamanlı ses ve metin olduğu yerleşik bir ses mimarisi sayesinde sağlanıyor. Neredeyse gerçek zamanlı görsel bağlam, 97 diller arasında otomatik geçiş ve oturum içeriği güncellemeleri destekleniyor. Fiyat, ses girişi dakikası başına $0.005 ve çıktı dakikası başına $0.018.

Extended Thinking, kıyaslama testlerinde önde gidiyor: Artificial Analysis Speech to Speech Quality Index'te 82.6 puan, τ-Voice'ta 68.6%, Sierra'nın τ-Voice-banking testinde 35.1% ve Big Bench Audio'da 97.7%. Temel sürüm, Speech Agent Arena'da ikinci sırada yer alıyor ve EVA-Bench'te güçlü sonuçlar gösteriyor.

Kıyaslama metodolojisi, ajan tabanlı görev tamamlama ve konuşma kalitesine odaklanıyor, ancak held-out testlerin ayrıntılarını veya zero-shot senaryolarla karşılaştırmayı her zaman ortaya koymuyor. Bu da belirli kurumsal görevlerin ötesinde gerçek genelleme konusunda soru işaretleri bırakıyor.

Bu, genel tabloda OpenAI'ın GPT-Live ve xAI'ın Grok Voice Think Fast yaklaşımlarından farklılaşıyor. Google, yalnızca yanıt hızına değil, görevlerin paralel yürütülmesine ve görsel grounding'e vurgu yapıyor. Önceki modeller sıklıkla akıl yürütme için duraklamalar gerektiriyordu ve bu da diyaloğun doğallığını bozuyordu.

Yeni yetenekler, modelin konuşma akışını koruyarak karmaşık çok adımlı işlemleri gerçekleştirebildiği üretim düzeyinde sesli ajanlara giden yolu açıyor. Bu, özellikle Search Live, Gemini Live ve Workspace entegrasyonlarında belirginleşiyor.

Sonuçların bağımsız doğrulamada ve gerçek gürültü veya aksan koşullarında ne kadar dayanıklı olduğu belirsizliğini koruyor. Topluluk muhtemelen uç durumlarda gecikmeyi test edecek ve açık kaynak alternatiflerle karşılaştıracak.

Kilit değişim, tepkisel sesli arayüzlerden, akıl yürütmenin doğal iletişime engel olmadığı gerçek anlamda ajan tabanlı arayüzlere geçiştir.

3 Görüntülenme

Kaynaklar

  • Google launches Gemini 3.8 Live models

Yorumlar

Bu konuyla ilgili daha fazla makale okuyun:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
Bir hata veya yanlışlık buldunuz mu?Yorumlarınızı en kısa sürede değerlendireceğiz.