1 সেপ্টেম্বর 2026 সালে Google DeepMind জেমিনি 3.7 ফ্ল্যাশ, 3.6 ফ্ল্যাশ এবং 3.5 ফ্ল্যাশ-লাইট মডেলগুলিতে এজেন্ট-ভিত্তিক ভিডিও বোঝাপড়া উপস্থাপন করেছে। প্রতি সেকেন্ডে একটি করে ফ্রেমের স্থির নমুনা নেওয়ার পরিবর্তে, মডেলটি এখন নিজেই সিদ্ধান্ত নেয় ভিডিও, অডিও বা ট্রান্সক্রিপ্টের কোন অংশ লোড করতে হবে এবং কোন রেজোলিউশনে। কোম্পানির অফিসিয়াল ব্লগ জানিয়েছে, টোকেন খরচ 88% পর্যন্ত কমেছে, খরচ 66% পর্যন্ত কমেছে এবং দীর্ঘ ভিডিওতে নির্ভুলতা 7% পর্যন্ত বেড়েছে।
পদ্ধতিটি নিম্নরূপ কাজ করে: মডেলটি একটি ভিডিও লিংক এবং ব্যবহারকারীর প্রশ্ন পায়, তারপর কর্মের একটি ক্রম পরিকল্পনা করে — ট্রান্সক্রিপ্ট বের করা, সন্দেহজনক অংশে ফ্রেমের হার বাড়ানো, বা অডিওতে স্যুইচ করা। প্রতিটি ধাপে অভ্যন্তরীণ যুক্তি থাকে এবং চূড়ান্ত প্রসঙ্গ শুধুমাত্র প্রাসঙ্গিক অংশ থেকে তৈরি হয়। ফলস্বরূপ, একটি ঘণ্টার বক্তৃতা, যা স্থির মোডে এক মিলিয়নেরও বেশি টোকেন প্রয়োজন হতো, এখন প্রায় 100 হাজার টোকেন ব্যবহার করে প্রক্রিয়া করা হয়।
মূল্যায়ন 1H-VideoQA এবং LVBench বেঞ্চমার্কে পরিচালিত হয়েছিল। এজেন্ট মোডে টোকেন 88% কম ব্যবহৃত হয়েছে এবং উত্তরের নির্ভুলতা কয়েক শতাংশ বেড়েছে। তবে Google বিস্তারিত অ্যাবলেশন স্টাডি প্রকাশ করেনি, যা দেখায় কোন নির্দিষ্ট উপাদান — মোডালিটি নির্বাচন, অভিযোজিত ফ্রেম হার, বা অভ্যন্তরীণ পরিকল্পনা — মানের উন্নতিতে প্রধান অবদান রাখে।
পূর্বে, বেশিরভাগ মাল্টিমোডাল মডেল, জেমিনির আগের সংস্করণ এবং অন্যান্য ল্যাবের সমাধান সহ, স্থির প্রক্রিয়াকরণের উপর নির্ভর করত: নির্দিষ্ট ফ্রেম হার এবং সম্পূর্ণ প্রসঙ্গ লোড। এই পদ্ধতি পুনরুত্পাদনযোগ্যতা নিশ্চিত করত, কিন্তু দীর্ঘ ভিডিওতে দ্রুত অদক্ষ হয়ে পড়ত। Google-এর এজেন্ট পদ্ধতি টেক্সট এজেন্টদের টুলসহ ব্যবহৃত পদ্ধতির মতো, তবে এটি ভিডিওতে স্থানান্তরিত করে মাল্টিমোডালিটি বজায় রাখে।
সমান্তরাল কাজের সাথে তুলনা করলে দেখা যায়, Google দীর্ঘ কন্টেন্টের জন্য দক্ষতার উপর জোর দিচ্ছে, অন্যদিকে কিছু অন্যান্য ল্যাব উচ্চতর ফ্রেম রেজোলিউশন সহ স্থির পদ্ধতি উন্নত করে চলেছে। দর্শনের পার্থক্য স্পষ্ট: এক পক্ষ প্রসঙ্গের পরিমাণ কমিয়ে আনে, অন্য পক্ষ এর ঘনত্ব সর্বাধিক করে।
ডেভেলপারদের জন্য এর অর্থ হল ভিডিও-এজেন্ট তৈরি করার সম্ভাবনা, যা নিষিদ্ধ খরচ ছাড়াই বহু ঘণ্টার রেকর্ডিং বিশ্লেষণ করতে পারে। নতুন পরিস্থিতি দেখা দেয় — বক্তৃতায় মূল মুহূর্তগুলির স্বয়ংক্রিয় অনুসন্ধান, বিবরণ অনুযায়ী সুনির্দিষ্ট ভিডিও সম্পাদনা, শিল্প রেকর্ডিংয়ে অস্বাভাবিকতা পর্যবেক্ষণ। তবে, মডেলটি অস্পষ্ট প্রশ্নগুলির সাথে কতটা স্থিরভাবে মোকাবেলা করে, যখন প্রাসঙ্গিক অংশগুলি পুরো ভিডিও জুড়ে ছড়িয়ে থাকে, তা এখনও অস্পষ্ট।
স্বাধীন যাচাইকরণ বর্তমানে ডেভেলপারদের প্রথম প্রতিবেদনের মধ্যে সীমাবদ্ধ। সম্প্রদায় সম্ভবত এজ-কেসগুলিতে আচরণ পরীক্ষা করবে: দ্রুত দৃশ্য পরিবর্তন, নিম্নমানের অডিও বা পরস্পরবিরোধী ট্রান্সক্রিপ্ট সহ ভিডিও। পরবর্তী আকর্ষণীয় কাজগুলি এজেন্ট পরিকল্পনার দৃঢ়তা এবং সাধারণীকরণে এর প্রভাবের উপর নিবদ্ধ থাকবে।
উন্নয়নের প্রধান ফলাফল — ভিডিও বিশ্লেষণ এখন ব্যাপক নয়, বরং লক্ষ্যবস্তু, এবং এটি দীর্ঘ মাল্টিমিডিয়া কন্টেন্ট নিয়ে কাজ করা অ্যাপ্লিকেশনগুলির অর্থনীতিকে পরিবর্তন করে।

