Gemini 3.8 Live: interleaved reasoning और अतुल्यकालिक टूल कॉल्स Google के वॉइस एजेंट्स को कैसे बदल रहे हैं

द्वारा संपादित: Svitlana Velhush

15 सितंबर 2026 में Google ने दो नए मॉडल पेश किए — Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking। इन्हें लाइव संवाद के लिए सबसे उन्नत मॉडल के रूप में प्रस्तुत किया गया है, जो कम विलंबता और वास्तविक समय के लिए अनुकूलित हैं।

Gemini 3.1 Flash Live जैसे पूर्ववर्तियों से मुख्य अंतर interleaved reasoning और अतुल्यकालिक फ़ंक्शन कॉल्स का समर्थन है। मॉडल तर्क कर सकता है और साथ ही भाषण उत्पन्न कर सकता है, जबकि टूल्स बातचीत को बाधित किए बिना पृष्ठभूमि में निष्पादित होते हैं।

यह मूल ऑडियो आर्किटेक्चर के माध्यम से हासिल किया जाता है, जहाँ इनपुट और आउटपुट वास्तविक समय में ऑडियो और टेक्स्ट हैं। लगभग वास्तविक समय में दृश्य संदर्भ, 97 भाषाओं के बीच स्वचालित स्विचिंग और सत्र सामग्री के अपडेट समर्थित हैं। कीमत ऑडियो इनपुट के प्रति मिनट $0.005 और आउटपुट के प्रति मिनट $0.018 है।

Extended Thinking बेंचमार्क में अग्रणी है: Artificial Analysis Speech to Speech Quality Index पर 82.6 अंक, τ-Voice पर 68.6%, Sierra’s τ-Voice-banking पर 35.1% और Big Bench Audio पर 97.7%। बेस वर्ज़न Speech Agent Arena में दूसरे स्थान पर है और EVA-Bench पर मज़बूत परिणाम दिखाता है।

बेंचमार्क की कार्यप्रणाली agentic task completion और भाषण की गुणवत्ता पर केंद्रित है, लेकिन held-out परीक्षणों के विवरण या zero-shot परिदृश्यों के साथ तुलना हमेशा नहीं बताती। यह विशिष्ट enterprise कार्यों से परे वास्तविक सामान्यीकरण के बारे में सवाल छोड़ता है।

इस परिदृश्य में यह GPT-Live के साथ OpenAI और Grok Voice Think Fast के साथ xAI के दृष्टिकोणों से भिन्न है। Google केवल प्रतिक्रिया की गति पर नहीं, बल्कि समानांतर कार्य निष्पादन और दृश्य आधार पर ज़ोर देता है। पिछले मॉडलों को अक्सर तर्क के लिए विराम की आवश्यकता होती थी, जिससे संवाद की सहजता भंग होती थी।

नई क्षमताएँ प्रोडक्शन-ग्रेड वॉइस एजेंट्स का मार्ग खोलती हैं, जहाँ मॉडल बातचीत का प्रवाह बनाए रखते हुए जटिल बहु-चरणीय कार्य कर सकता है। यह Search Live, Gemini Live और Workspace के एकीकरणों में विशेष रूप से स्पष्ट है।

यह अस्पष्ट बना हुआ है कि स्वतंत्र सत्यापन और वास्तविक शोर या उच्चारणों की स्थितियों में परिणाम कितने टिकाऊ हैं। समुदाय संभवतः एज-केस में विलंबता का परीक्षण करेगा और open-source विकल्पों से तुलना करेगा।

मुख्य बदलाव प्रतिक्रियात्मक वॉइस इंटरफ़ेस से सच्चे एजेंटिक इंटरफ़ेस की ओर संक्रमण है, जहाँ तर्क स्वाभाविक संवाद में बाधा नहीं डालता।

3 दृश्य

स्रोतों

  • Google launches Gemini 3.8 Live models

टिप्पणियाँ

इस विषय पर अधिक लेख पढ़ें:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
क्या आपने कोई गलती या अशुद्धि पाई?हम जल्द ही आपकी टिप्पणियों पर विचार करेंगे।