Ngày 15 tháng 9 năm 2026, Google đã giới thiệu hai mô hình mới — Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Chúng được định vị là những mô hình tiên tiến nhất cho đối thoại trực tiếp, được tối ưu hóa cho độ trễ thấp và thời gian thực.
Điểm khác biệt chính so với các phiên bản tiền nhiệm như Gemini 3.1 Flash Live nằm ở việc hỗ trợ suy luận xen kẽ và các lệnh gọi hàm bất đồng bộ. Mô hình có thể vừa suy luận vừa tạo lời nói, đồng thời các công cụ được thực thi ở chế độ nền mà không làm gián đoạn cuộc trò chuyện.
Điều này đạt được nhờ kiến trúc âm thanh gốc, nơi đầu vào và đầu ra là âm thanh và văn bản theo thời gian thực. Hệ thống hỗ trợ ngữ cảnh thị giác trong gần thời gian thực, tự động chuyển đổi giữa 97 ngôn ngữ và cập nhật nội dung phiên. Giá là $0.005 mỗi phút âm thanh đầu vào và $0.018 mỗi phút đầu ra.
Extended Thinking dẫn đầu trong các bài kiểm tra chuẩn: 82.6 điểm trên Artificial Analysis Speech to Speech Quality Index, 68.6% trên τ-Voice, 35.1% trên Sierra’s τ-Voice-banking và 97.7% trên Big Bench Audio. Phiên bản cơ sở đứng thứ hai trong Speech Agent Arena và cho thấy kết quả mạnh mẽ trên EVA-Bench.
Phương pháp đánh giá tập trung vào việc hoàn thành nhiệm vụ dạng tác tử và chất lượng giọng nói, nhưng không phải lúc nào cũng tiết lộ chi tiết các bài kiểm tra held-out hoặc so sánh với các kịch bản zero-shot. Điều này để lại những câu hỏi về khả năng khái quát hóa thực sự ngoài các nhiệm vụ doanh nghiệp cụ thể.
Trong bối cảnh chung, điều này khác biệt so với các cách tiếp cận của OpenAI với GPT-Live và xAI với Grok Voice Think Fast. Google nhấn mạnh vào việc thực thi song song các nhiệm vụ và việc neo giữ bằng thị giác, chứ không chỉ tốc độ phản hồi. Các mô hình trước đây thường yêu cầu tạm dừng để suy luận, điều này phá vỡ tính tự nhiên của cuộc đối thoại.
Những khả năng mới mở ra con đường dẫn đến các tác tử giọng nói cấp độ sản xuất, nơi mô hình có thể thực hiện các thao tác nhiều bước phức tạp trong khi vẫn duy trì luồng hội thoại. Điều này đặc biệt rõ rệt trong các tích hợp với Search Live, Gemini Live và Workspace.
Vẫn chưa rõ liệu kết quả có vững chắc đến đâu khi được xác minh độc lập và trong điều kiện tiếng ồn thực tế hoặc giọng địa phương. Cộng đồng có thể sẽ kiểm tra độ trễ trong các trường hợp biên và so sánh với các giải pháp thay thế mã nguồn mở.
Bước chuyển then chốt là sự chuyển dịch từ các giao diện giọng nói phản ứng sang dạng tác tử thực sự, nơi suy luận không cản trở giao tiếp tự nhiên.

