15 Eylül 2026 tarihinde Google iki yeni model tanıttı — Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Bu modeller, düşük gecikme ve gerçek zamanlı iletişim için optimize edilmiş, canlı diyalog için en gelişmiş modeller olarak konumlandırılıyor.
Gemini 3.1 Flash Live gibi önceki modellerden temel farkı, interleaved reasoning ve asenkron fonksiyon çağrıları desteğidir. Model aynı anda hem akıl yürütüp hem konuşma üretebiliyor, araçlar ise konuşmayı kesmeden arka planda çalışıyor.
Bu, girdi ve çıktının gerçek zamanlı ses ve metin olduğu yerleşik bir ses mimarisi sayesinde sağlanıyor. Neredeyse gerçek zamanlı görsel bağlam, 97 diller arasında otomatik geçiş ve oturum içeriği güncellemeleri destekleniyor. Fiyat, ses girişi dakikası başına $0.005 ve çıktı dakikası başına $0.018.
Extended Thinking, kıyaslama testlerinde önde gidiyor: Artificial Analysis Speech to Speech Quality Index'te 82.6 puan, τ-Voice'ta 68.6%, Sierra'nın τ-Voice-banking testinde 35.1% ve Big Bench Audio'da 97.7%. Temel sürüm, Speech Agent Arena'da ikinci sırada yer alıyor ve EVA-Bench'te güçlü sonuçlar gösteriyor.
Kıyaslama metodolojisi, ajan tabanlı görev tamamlama ve konuşma kalitesine odaklanıyor, ancak held-out testlerin ayrıntılarını veya zero-shot senaryolarla karşılaştırmayı her zaman ortaya koymuyor. Bu da belirli kurumsal görevlerin ötesinde gerçek genelleme konusunda soru işaretleri bırakıyor.
Bu, genel tabloda OpenAI'ın GPT-Live ve xAI'ın Grok Voice Think Fast yaklaşımlarından farklılaşıyor. Google, yalnızca yanıt hızına değil, görevlerin paralel yürütülmesine ve görsel grounding'e vurgu yapıyor. Önceki modeller sıklıkla akıl yürütme için duraklamalar gerektiriyordu ve bu da diyaloğun doğallığını bozuyordu.
Yeni yetenekler, modelin konuşma akışını koruyarak karmaşık çok adımlı işlemleri gerçekleştirebildiği üretim düzeyinde sesli ajanlara giden yolu açıyor. Bu, özellikle Search Live, Gemini Live ve Workspace entegrasyonlarında belirginleşiyor.
Sonuçların bağımsız doğrulamada ve gerçek gürültü veya aksan koşullarında ne kadar dayanıklı olduğu belirsizliğini koruyor. Topluluk muhtemelen uç durumlarda gecikmeyi test edecek ve açık kaynak alternatiflerle karşılaştıracak.
Kilit değişim, tepkisel sesli arayüzlerden, akıl yürütmenin doğal iletişime engel olmadığı gerçek anlamda ajan tabanlı arayüzlere geçiştir.

