Gemini 3.8 Live: কীভাবে interleaved reasoning এবং অ্যাসিঙ্ক্রোনাস টুল কল Google-এর ভয়েস এজেন্টদের বদলে দিচ্ছে

সম্পাদনা করেছেন: Svitlana Velhush

15 সেপ্টেম্বর 2026 সালে Google দুটি নতুন মডেল উপস্থাপন করেছে — Gemini 3.8 Live এবং Gemini 3.8 Live Extended Thinking। এগুলো কম লেটেন্সি ও রিয়েল-টাইমের জন্য অপ্টিমাইজ করা, জীবন্ত সংলাপের জন্য সবচেয়ে উন্নত মডেল হিসেবে অবস্থান করছে।

Gemini 3.1 Flash Live-এর মতো পূর্বসূরিদের থেকে মূল পার্থক্য হলো interleaved reasoning এবং অ্যাসিঙ্ক্রোনাস ফাংশন কলের সমর্থন। মডেল একইসঙ্গে চিন্তা করতে ও কথা বলতে পারে, আর টুলগুলো কথোপকথন না থামিয়ে পটভূমিতে সম্পাদিত হয়।

এটি অর্জিত হয় নেটিভ অডিও আর্কিটেকচারের মাধ্যমে, যেখানে ইনপুট ও আউটপুট রিয়েল-টাইমে অডিও ও টেক্সট। near real-time ভিজ্যুয়াল কনটেক্সট, 97 ভাষার মধ্যে স্বয়ংক্রিয় পরিবর্তন এবং সেশনের কনটেন্ট আপডেট সমর্থিত। মূল্য — অডিও ইনপুটের প্রতি মিনিটে $0.005 এবং আউটপুটের প্রতি মিনিটে $0.018।

Extended Thinking বেঞ্চমার্কে শীর্ষে: Artificial Analysis Speech to Speech Quality Index-এ 82.6 পয়েন্ট, τ-Voice-এ 68.6%, Sierra’s τ-Voice-banking-এ 35.1% এবং Big Bench Audio-তে 97.7%। বেস সংস্করণ Speech Agent Arena-তে দ্বিতীয় স্থান নেয় এবং EVA-Bench-এ শক্তিশালী ফলাফল দেখায়।

বেঞ্চমার্কের পদ্ধতিটি agentic task completion ও বক্তৃতার গুণমানে মনোযোগ দেয়, তবে সবসময় held-out পরীক্ষার বিস্তারিত বা zero-shot পরিস্থিতির সঙ্গে তুলনা প্রকাশ করে না। এটি নির্দিষ্ট enterprise-কাজের বাইরে প্রকৃত সাধারণীকরণ নিয়ে প্রশ্ন রেখে যায়।

এই পরিসরে এটি OpenAI-এর GPT-Live এবং xAI-এর Grok Voice Think Fast দৃষ্টিভঙ্গি থেকে আলাদা। Google কেবল প্রতিক্রিয়ার গতি নয়, সমান্তরালভাবে কাজ সম্পাদন ও ভিজ্যুয়াল grounding-এর উপর জোর দেয়। পূর্ববর্তী মডেলগুলোকে প্রায়ই reasoning-এর জন্য বিরতি নিতে হতো, যা সংলাপের স্বাভাবিকতা নষ্ট করত।

নতুন সামর্থ্য production-grade voice-এজেন্টের পথ খুলে দেয়, যেখানে মডেল কথোপকথনের ধারা বজায় রেখে জটিল বহু-ধাপের কাজ সম্পাদন করতে পারে। এটি Search Live, Gemini Live এবং Workspace-এর ইন্টিগ্রেশনে বিশেষভাবে লক্ষণীয়।

স্বাধীন যাচাইকরণে এবং প্রকৃত শব্দ বা উচ্চারণের পরিস্থিতিতে ফলাফল কতটা টেকসই, তা অস্পষ্ট রয়ে গেছে। সম্প্রদায় সম্ভবত edge-কেসে latency পরীক্ষা করবে এবং open-source বিকল্পের সঙ্গে তুলনা করবে।

মূল পরিবর্তন হলো প্রতিক্রিয়াশীল ভয়েস ইন্টারফেস থেকে truly agentic-এর দিকে উত্তরণ, যেখানে reasoning স্বাভাবিক যোগাযোগে বাধা দেয় না।

3 দৃশ্য

উৎসসমূহ

  • Google launches Gemini 3.8 Live models

মন্তব্য

এই বিষয়ে আরও নিবন্ধ পড়ুন:

Replying to @agentcommunity_

The Navier-Stokes dispute raises unsettled questions on AI research credit. Mathematicians Buckmaster and Alpöge reportedly made progress with AI assistance; reports claim OpenAI then prompted models on the same direction and possibly dropped Alpöge from authorship. OpenAI denies

Emad
Emad
@EMostaque

Wow, Navier-Stokes drama This statement is worth reading in full from Tristan Buckmaster discussing his work with @__alpoge__ and OpenAI’s upcoming Condition C/D result (!) Crazy cims.nyu.edu/~tristanb/stat… mastodon.social/@tristanbuckma…

Image
Reply
আপনি কি কোনো ত্রুটি বা অসঠিকতা খুঁজে পেয়েছেন?আমরা আপনার মন্তব্য যত তাড়াতাড়ি সম্ভব বিবেচনা করব।