Gemini 3.8 Live: كيف يغيّر الاستدلال المتداخل والاستدعاءات غير المتزامنة للأدوات الوكلاء الصوتيين لدى Google

تم التعديل بواسطة: Svitlana Velhush

في 15 سبتمبر 2026، أعلنت Google عن نموذجين جديدين — Gemini 3.8 Live وGemini 3.8 Live Extended Thinking. ويُروَّج لهما بوصفهما أكثر النماذج تقدمًا للحوار المباشر، إذ جرى تحسينهما لتحقيق زمن استجابة منخفض والعمل في الزمن الحقيقي.

يتمثل الفارق الأساسي عن النماذج السابقة، مثل Gemini 3.1 Flash Live، في دعم الاستدلال المتداخل والاستدعاءات غير المتزامنة للدوال. فالنموذج قادر على الاستدلال وتوليد الكلام في الوقت نفسه، بينما تُنفَّذ الأدوات في الخلفية دون مقاطعة المحادثة.

ويتحقق ذلك بفضل بنية صوتية أصلية يكون فيها الإدخال والإخراج صوتًا ونصًا في الزمن الحقيقي. ويُدعم السياق البصري في زمن شبه حقيقي، والتبديل التلقائي بين 97 لغات، وتحديثات محتوى الجلسة. أما السعر فهو $0.005 لكل دقيقة من الإدخال الصوتي و$0.018 لكل دقيقة من الإخراج.

يتصدر Extended Thinking اختبارات الأداء: 82.6 نقطة في مؤشر Artificial Analysis Speech to Speech Quality Index، و68.6% في τ-Voice، و35.1% في Sierra’s τ-Voice-banking، و97.7% في Big Bench Audio. وتحتل النسخة الأساسية المركز الثاني في Speech Agent Arena، وتحقق نتائج قوية في EVA-Bench.

تركّز منهجية اختبارات الأداء على إنجاز المهام الوكيلية وجودة الكلام، لكنها لا تكشف دائمًا تفاصيل الاختبارات المحجوزة أو المقارنة بسيناريوهات zero-shot. وهذا يترك أسئلة حول التعميم الفعلي خارج مهام المؤسسات المحددة.

وفي هذا المشهد، يختلف الأمر عن مقاربات OpenAI مع GPT-Live وxAI مع Grok Voice Think Fast. فـ Google تركز على التنفيذ المتوازي للمهام والتأصيل البصري، لا على سرعة الاستجابة وحدها. وكثيرًا ما كانت النماذج السابقة تتطلب وقفات للاستدلال، ما يخل بسلاسة الحوار.

تفتح القدرات الجديدة الطريق أمام وكلاء صوتيين بمستوى الإنتاج، حيث يستطيع النموذج تنفيذ عمليات معقدة متعددة الخطوات مع الحفاظ على تدفق المحادثة. ويظهر ذلك بوضوح بشكل خاص في التكاملات مع Search Live وGemini Live وWorkspace.

ويبقى غير واضح مدى متانة النتائج عند التحقق المستقل وفي ظروف الضوضاء أو اللهجات الواقعية. ومن المرجح أن يختبر المجتمع زمن الاستجابة في الحالات الحدية ويقارنه بالبدائل مفتوحة المصدر.

التحول الجوهري هو الانتقال من واجهات صوتية استجابية إلى واجهات وكيلية بحق، حيث لا يعيق الاستدلال التواصل الطبيعي.

3 مشاهدات

المصادر

  • Google launches Gemini 3.8 Live models

التعليقات

اقرأ المزيد من المقالات حول هذا الموضوع:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
هل وجدت خطأً أو عدم دقة؟سننظر في ملاحظاتك في أقرب وقت ممكن.