في 15 سبتمبر 2026، أعلنت Google عن نموذجين جديدين — Gemini 3.8 Live وGemini 3.8 Live Extended Thinking. ويُروَّج لهما بوصفهما أكثر النماذج تقدمًا للحوار المباشر، إذ جرى تحسينهما لتحقيق زمن استجابة منخفض والعمل في الزمن الحقيقي.
يتمثل الفارق الأساسي عن النماذج السابقة، مثل Gemini 3.1 Flash Live، في دعم الاستدلال المتداخل والاستدعاءات غير المتزامنة للدوال. فالنموذج قادر على الاستدلال وتوليد الكلام في الوقت نفسه، بينما تُنفَّذ الأدوات في الخلفية دون مقاطعة المحادثة.
ويتحقق ذلك بفضل بنية صوتية أصلية يكون فيها الإدخال والإخراج صوتًا ونصًا في الزمن الحقيقي. ويُدعم السياق البصري في زمن شبه حقيقي، والتبديل التلقائي بين 97 لغات، وتحديثات محتوى الجلسة. أما السعر فهو $0.005 لكل دقيقة من الإدخال الصوتي و$0.018 لكل دقيقة من الإخراج.
يتصدر Extended Thinking اختبارات الأداء: 82.6 نقطة في مؤشر Artificial Analysis Speech to Speech Quality Index، و68.6% في τ-Voice، و35.1% في Sierra’s τ-Voice-banking، و97.7% في Big Bench Audio. وتحتل النسخة الأساسية المركز الثاني في Speech Agent Arena، وتحقق نتائج قوية في EVA-Bench.
تركّز منهجية اختبارات الأداء على إنجاز المهام الوكيلية وجودة الكلام، لكنها لا تكشف دائمًا تفاصيل الاختبارات المحجوزة أو المقارنة بسيناريوهات zero-shot. وهذا يترك أسئلة حول التعميم الفعلي خارج مهام المؤسسات المحددة.
وفي هذا المشهد، يختلف الأمر عن مقاربات OpenAI مع GPT-Live وxAI مع Grok Voice Think Fast. فـ Google تركز على التنفيذ المتوازي للمهام والتأصيل البصري، لا على سرعة الاستجابة وحدها. وكثيرًا ما كانت النماذج السابقة تتطلب وقفات للاستدلال، ما يخل بسلاسة الحوار.
تفتح القدرات الجديدة الطريق أمام وكلاء صوتيين بمستوى الإنتاج، حيث يستطيع النموذج تنفيذ عمليات معقدة متعددة الخطوات مع الحفاظ على تدفق المحادثة. ويظهر ذلك بوضوح بشكل خاص في التكاملات مع Search Live وGemini Live وWorkspace.
ويبقى غير واضح مدى متانة النتائج عند التحقق المستقل وفي ظروف الضوضاء أو اللهجات الواقعية. ومن المرجح أن يختبر المجتمع زمن الاستجابة في الحالات الحدية ويقارنه بالبدائل مفتوحة المصدر.
التحول الجوهري هو الانتقال من واجهات صوتية استجابية إلى واجهات وكيلية بحق، حيث لا يعيق الاستدلال التواصل الطبيعي.

