জেমিনি ফ্ল্যাশে এজেন্ট-ভিত্তিক ভিডিও বোঝাপড়া: স্থির নমুনা থেকে সক্রিয় বিষয়বস্তু অনুসন্ধানে

সম্পাদনা করেছেন: Svitlana Velhush

1 সেপ্টেম্বর 2026 সালে Google DeepMind জেমিনি 3.7 ফ্ল্যাশ, 3.6 ফ্ল্যাশ এবং 3.5 ফ্ল্যাশ-লাইট মডেলগুলিতে এজেন্ট-ভিত্তিক ভিডিও বোঝাপড়া উপস্থাপন করেছে। প্রতি সেকেন্ডে একটি করে ফ্রেমের স্থির নমুনা নেওয়ার পরিবর্তে, মডেলটি এখন নিজেই সিদ্ধান্ত নেয় ভিডিও, অডিও বা ট্রান্সক্রিপ্টের কোন অংশ লোড করতে হবে এবং কোন রেজোলিউশনে। কোম্পানির অফিসিয়াল ব্লগ জানিয়েছে, টোকেন খরচ 88% পর্যন্ত কমেছে, খরচ 66% পর্যন্ত কমেছে এবং দীর্ঘ ভিডিওতে নির্ভুলতা 7% পর্যন্ত বেড়েছে।

পদ্ধতিটি নিম্নরূপ কাজ করে: মডেলটি একটি ভিডিও লিংক এবং ব্যবহারকারীর প্রশ্ন পায়, তারপর কর্মের একটি ক্রম পরিকল্পনা করে — ট্রান্সক্রিপ্ট বের করা, সন্দেহজনক অংশে ফ্রেমের হার বাড়ানো, বা অডিওতে স্যুইচ করা। প্রতিটি ধাপে অভ্যন্তরীণ যুক্তি থাকে এবং চূড়ান্ত প্রসঙ্গ শুধুমাত্র প্রাসঙ্গিক অংশ থেকে তৈরি হয়। ফলস্বরূপ, একটি ঘণ্টার বক্তৃতা, যা স্থির মোডে এক মিলিয়নেরও বেশি টোকেন প্রয়োজন হতো, এখন প্রায় 100 হাজার টোকেন ব্যবহার করে প্রক্রিয়া করা হয়।

মূল্যায়ন 1H-VideoQA এবং LVBench বেঞ্চমার্কে পরিচালিত হয়েছিল। এজেন্ট মোডে টোকেন 88% কম ব্যবহৃত হয়েছে এবং উত্তরের নির্ভুলতা কয়েক শতাংশ বেড়েছে। তবে Google বিস্তারিত অ্যাবলেশন স্টাডি প্রকাশ করেনি, যা দেখায় কোন নির্দিষ্ট উপাদান — মোডালিটি নির্বাচন, অভিযোজিত ফ্রেম হার, বা অভ্যন্তরীণ পরিকল্পনা — মানের উন্নতিতে প্রধান অবদান রাখে।

পূর্বে, বেশিরভাগ মাল্টিমোডাল মডেল, জেমিনির আগের সংস্করণ এবং অন্যান্য ল্যাবের সমাধান সহ, স্থির প্রক্রিয়াকরণের উপর নির্ভর করত: নির্দিষ্ট ফ্রেম হার এবং সম্পূর্ণ প্রসঙ্গ লোড। এই পদ্ধতি পুনরুত্পাদনযোগ্যতা নিশ্চিত করত, কিন্তু দীর্ঘ ভিডিওতে দ্রুত অদক্ষ হয়ে পড়ত। Google-এর এজেন্ট পদ্ধতি টেক্সট এজেন্টদের টুলসহ ব্যবহৃত পদ্ধতির মতো, তবে এটি ভিডিওতে স্থানান্তরিত করে মাল্টিমোডালিটি বজায় রাখে।

সমান্তরাল কাজের সাথে তুলনা করলে দেখা যায়, Google দীর্ঘ কন্টেন্টের জন্য দক্ষতার উপর জোর দিচ্ছে, অন্যদিকে কিছু অন্যান্য ল্যাব উচ্চতর ফ্রেম রেজোলিউশন সহ স্থির পদ্ধতি উন্নত করে চলেছে। দর্শনের পার্থক্য স্পষ্ট: এক পক্ষ প্রসঙ্গের পরিমাণ কমিয়ে আনে, অন্য পক্ষ এর ঘনত্ব সর্বাধিক করে।

ডেভেলপারদের জন্য এর অর্থ হল ভিডিও-এজেন্ট তৈরি করার সম্ভাবনা, যা নিষিদ্ধ খরচ ছাড়াই বহু ঘণ্টার রেকর্ডিং বিশ্লেষণ করতে পারে। নতুন পরিস্থিতি দেখা দেয় — বক্তৃতায় মূল মুহূর্তগুলির স্বয়ংক্রিয় অনুসন্ধান, বিবরণ অনুযায়ী সুনির্দিষ্ট ভিডিও সম্পাদনা, শিল্প রেকর্ডিংয়ে অস্বাভাবিকতা পর্যবেক্ষণ। তবে, মডেলটি অস্পষ্ট প্রশ্নগুলির সাথে কতটা স্থিরভাবে মোকাবেলা করে, যখন প্রাসঙ্গিক অংশগুলি পুরো ভিডিও জুড়ে ছড়িয়ে থাকে, তা এখনও অস্পষ্ট।

স্বাধীন যাচাইকরণ বর্তমানে ডেভেলপারদের প্রথম প্রতিবেদনের মধ্যে সীমাবদ্ধ। সম্প্রদায় সম্ভবত এজ-কেসগুলিতে আচরণ পরীক্ষা করবে: দ্রুত দৃশ্য পরিবর্তন, নিম্নমানের অডিও বা পরস্পরবিরোধী ট্রান্সক্রিপ্ট সহ ভিডিও। পরবর্তী আকর্ষণীয় কাজগুলি এজেন্ট পরিকল্পনার দৃঢ়তা এবং সাধারণীকরণে এর প্রভাবের উপর নিবদ্ধ থাকবে।

উন্নয়নের প্রধান ফলাফল — ভিডিও বিশ্লেষণ এখন ব্যাপক নয়, বরং লক্ষ্যবস্তু, এবং এটি দীর্ঘ মাল্টিমিডিয়া কন্টেন্ট নিয়ে কাজ করা অ্যাপ্লিকেশনগুলির অর্থনীতিকে পরিবর্তন করে।

15 দৃশ্য

উৎসসমূহ

  • AI NEWS WAS NONSTOP TODAY

আপনি কি কোনো ত্রুটি বা অসঠিকতা খুঁজে পেয়েছেন?আমরা আপনার মন্তব্য যত তাড়াতাড়ি সম্ভব বিবেচনা করব।