ב-15 בספטמבר 2026 הציגה Google שני מודלים חדשים — Gemini 3.8 Live ו-Gemini 3.8 Live Extended Thinking. הם ממוצבים כמודלים המתקדמים ביותר לשיחה חיה, מותאמים להשהיה נמוכה ולזמן אמת.
ההבדל העיקרי מקודמיהם, כגון Gemini 3.1 Flash Live, הוא בתמיכה ב-interleaved reasoning ובקריאות פונקציות אסינכרוניות. המודל יכול לחשוב ובו-זמנית להפיק דיבור, והכלים מבוצעים ברקע בלי לקטוע את השיחה.
הדבר מושג הודות לארכיטקטורת אודיו נייטיבית, שבה הקלט והפלט הם אודיו וטקסט בזמן אמת. נתמכים הקשר חזותי ב-near real-time, מעבר אוטומטי בין 97 שפות ועדכוני תוכן של הסשן. המחיר — $0.005 לדקת קלט אודיו ו-$0.018 לדקת פלט.
Extended Thinking מוביל בבנצ'מרקים: 82.6 נקודות ב-Artificial Analysis Speech to Speech Quality Index, 68.6% ב-τ-Voice, 35.1% ב-Sierra’s τ-Voice-banking ו-97.7% ב-Big Bench Audio. הגרסה הבסיסית תופסת את המקום השני ב-Speech Agent Arena ומציגה תוצאות חזקות ב-EVA-Bench.
מתודולוגיית הבנצ'מרקים מתמקדת בהשלמת משימות agentic ובאיכות הדיבור, אך לא תמיד חושפת פרטים של מבחני held-out או השוואה לתרחישי zero-shot. הדבר מותיר שאלות לגבי ההכללה האמיתית מעבר למשימות enterprise מסוימות.
בנוף הכולל, הדבר שונה מהגישות של OpenAI עם GPT-Live ושל xAI עם Grok Voice Think Fast. Google שמה דגש על ביצוע מקבילי של משימות ועל grounding חזותי, ולא רק על מהירות התגובה. מודלים קודמים דרשו לעתים קרובות הפסקות לצורך reasoning, מה שפגע בטבעיות השיחה.
היכולות החדשות סוללות את הדרך לסוכני קול ברמת production, שבהם המודל יכול לבצע פעולות מורכבות מרובות-שלבים תוך שמירה על זרימת השיחה. הדבר בולט במיוחד באינטגרציות עם Search Live, Gemini Live ו-Workspace.
נותר לא ברור עד כמה התוצאות יציבות באימות בלתי תלוי ובתנאי רעש או מבטא אמיתיים. סביר להניח שהקהילה תבחן את ההשהיה במקרי קצה ותשווה לחלופות open-source.
השינוי המרכזי הוא המעבר מממשקי קול תגובתיים לסוכניים ממש, שבהם ה-reasoning אינו מפריע לתקשורת טבעית.

