15 सितंबर 2026 में Google ने दो नए मॉडल पेश किए — Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking। इन्हें लाइव संवाद के लिए सबसे उन्नत मॉडल के रूप में प्रस्तुत किया गया है, जो कम विलंबता और वास्तविक समय के लिए अनुकूलित हैं।
Gemini 3.1 Flash Live जैसे पूर्ववर्तियों से मुख्य अंतर interleaved reasoning और अतुल्यकालिक फ़ंक्शन कॉल्स का समर्थन है। मॉडल तर्क कर सकता है और साथ ही भाषण उत्पन्न कर सकता है, जबकि टूल्स बातचीत को बाधित किए बिना पृष्ठभूमि में निष्पादित होते हैं।
यह मूल ऑडियो आर्किटेक्चर के माध्यम से हासिल किया जाता है, जहाँ इनपुट और आउटपुट वास्तविक समय में ऑडियो और टेक्स्ट हैं। लगभग वास्तविक समय में दृश्य संदर्भ, 97 भाषाओं के बीच स्वचालित स्विचिंग और सत्र सामग्री के अपडेट समर्थित हैं। कीमत ऑडियो इनपुट के प्रति मिनट $0.005 और आउटपुट के प्रति मिनट $0.018 है।
Extended Thinking बेंचमार्क में अग्रणी है: Artificial Analysis Speech to Speech Quality Index पर 82.6 अंक, τ-Voice पर 68.6%, Sierra’s τ-Voice-banking पर 35.1% और Big Bench Audio पर 97.7%। बेस वर्ज़न Speech Agent Arena में दूसरे स्थान पर है और EVA-Bench पर मज़बूत परिणाम दिखाता है।
बेंचमार्क की कार्यप्रणाली agentic task completion और भाषण की गुणवत्ता पर केंद्रित है, लेकिन held-out परीक्षणों के विवरण या zero-shot परिदृश्यों के साथ तुलना हमेशा नहीं बताती। यह विशिष्ट enterprise कार्यों से परे वास्तविक सामान्यीकरण के बारे में सवाल छोड़ता है।
इस परिदृश्य में यह GPT-Live के साथ OpenAI और Grok Voice Think Fast के साथ xAI के दृष्टिकोणों से भिन्न है। Google केवल प्रतिक्रिया की गति पर नहीं, बल्कि समानांतर कार्य निष्पादन और दृश्य आधार पर ज़ोर देता है। पिछले मॉडलों को अक्सर तर्क के लिए विराम की आवश्यकता होती थी, जिससे संवाद की सहजता भंग होती थी।
नई क्षमताएँ प्रोडक्शन-ग्रेड वॉइस एजेंट्स का मार्ग खोलती हैं, जहाँ मॉडल बातचीत का प्रवाह बनाए रखते हुए जटिल बहु-चरणीय कार्य कर सकता है। यह Search Live, Gemini Live और Workspace के एकीकरणों में विशेष रूप से स्पष्ट है।
यह अस्पष्ट बना हुआ है कि स्वतंत्र सत्यापन और वास्तविक शोर या उच्चारणों की स्थितियों में परिणाम कितने टिकाऊ हैं। समुदाय संभवतः एज-केस में विलंबता का परीक्षण करेगा और open-source विकल्पों से तुलना करेगा।
मुख्य बदलाव प्रतिक्रियात्मक वॉइस इंटरफ़ेस से सच्चे एजेंटिक इंटरफ़ेस की ओर संक्रमण है, जहाँ तर्क स्वाभाविक संवाद में बाधा नहीं डालता।

