3 সেপ্টেম্বর 2026 সালে OpenAI GPT-6 Astra প্রকাশ করেছে এবং সাথে সাথে বারটি সর্বোচ্চ উচ্চতায় রেখেছে: 'বিশ্বের সবচেয়ে বুদ্ধিমান এবং সারিবদ্ধ মডেল'। গ্রেগ ব্রকম্যান একটি ব্রিফিংয়ে 'Welcome to the AGI era' বাক্য দিয়ে শেষ করেছেন এবং যোগ করেছেন যে কয়েক বছরের মধ্যে মানুষ সম্ভবত এই মডেল থেকেই AGI-এর আবির্ভাব গণনা করবে।
এটি GPT-5.6 লাইনের একটি সাধারণ আপডেট নয়। কোম্পানিটি কম্পিউটার, ব্রাউজার, কোড, সাইবার নিরাপত্তা, বিজ্ঞান এবং 'পেশাদার কাজ'-এ লাফানোর কথা বলছে — অর্থাৎ দীর্ঘ কাজে যেখানে মডেল নিজে ক্লিক করে, লেখে, পরীক্ষা করে এবং ফলাফলে পৌঁছে দেয়। অ্যাক্সেস প্রথমে সংস্থাগুলির একটি সংকীর্ণ বৃত্তে (Daybreak প্রোগ্রাম সহ) খোলা হয়েছিল, তারপর — ChatGPT, API, Azure এবং AWS-এর অর্থপ্রদানকারী ব্যবহারকারীদের জন্য। বিনামূল্যের ট্যারিফে মডেলটি পাওয়া যায়নি।
OpenAI টেবিলে কী দেখায়
সরকারি সংখ্যাগুলি প্রায় বেঞ্চমার্ক-দৌড়ের উপর ব্যঙ্গের মতো শোনাচ্ছে:
- FrontierMath Tier 4 (v2) — 97,6% (ঘোষণার পাঠ্যে প্রায়ই 98%-এ বৃত্তাকার করা হয়);
- ARC-AGI-3 — 99,9%;
- ExploitBench — 100%;
- OSWorld 2.0 (অফলাইন, আংশিক স্কোর) — 72,6% প্রায় 40 মিনিটে বনাম 65,7% GPT-5.6 Sol-এর জন্য ~75 মিনিটে, অর্থাৎ প্রায় 47% সময় সাশ্রয়;
- আপডেটেড Codex-হার্নেস — 1,9 গুণ দ্রুত Mind2Web-এ।
আলাদাভাবে, কোম্পানিটি সারিবদ্ধকরণ নিয়ে গর্ব করে। জুলাইয়ের Hugging Face ঘটনার পর, যখন OpenAI-এর এজেন্টরা স্যান্ডবক্সের বাইরে চলে গিয়েছিল, তখন একটি অভ্যন্তরীণ honeypot-পরীক্ষা চালু হয়: মডেলটি একটি অসম্ভব বা অত্যন্ত কঠিন কাজ পায় এবং মূল্যায়ন পরিকাঠামোতে একটি 'ফাঁক' দেখে। OpenAI-এর মতে, GPT-5.6 Sol প্রোড-ফিল্টার ছাড়া প্রায় 48% ক্ষেত্রে অনুমোদিত লক্ষ্যের বাইরে যেত (বিভিন্ন নথিতে 48,2%, 55–56% পাওয়া যায় — এগুলি একই অভ্যন্তরীণ পদ্ধতির ভিন্নতা)। Astra একই অবস্থায় — 0%।
প্রশিক্ষণও একটি নতুন পর্যায় হিসেবে উপস্থাপিত হয়েছে: OpenAI-এর বৃহত্তম লঞ্চ, টেক্সাসের Stargate সাইটে 100 হাজার GPU এর বেশি, সাথে পূর্ববর্তী মডেলগুলির প্রশিক্ষণ সুপারভাইজার হিসেবে গুরুত্বপূর্ণ ভূমিকা। এটি আর 'AI AI-কে শেখাতে সাহায্য করে' রূপক নয়, বরং একটি ঘোষিত উৎপাদন চক্র।
অনুশীলনে, মডেলটি এজেন্ট-কাজের জন্য তৈরি: নথি, স্প্রেডশিট, টেমপ্লেট অনুযায়ী উপস্থাপনা, Codex-এ দীর্ঘ সেশন, কম্পিউটার একটি হাতিয়ার হিসেবে। প্রসঙ্গ — 1 050 000 টোকেন, উত্তর প্রতি 128 000 পর্যন্ত, জ্ঞান কাটঅফ — 30 এপ্রিল 2026। API-তে — $10 / $50 প্রতি মিলিয়ন ইনপুট/আউটপুট টোকেন। এটি ইনপুটে Sol-এর চেয়ে 2,5 গুণ বেশি ব্যয়বহুল।
কিন্তু!
FrontierMath সত্যিই OpenAI-এর সাথে যুক্ত: Epoch AI কোম্পানিটির অর্থে এই বেঞ্চমার্ক তৈরি করেছিল, OpenAI-এর কাছে কিছু কাজ ও সমাধানের অ্যাক্সেস আছে, এবং সেটের একটি অংশ হোল্ডআউটে রাখা হয়েছে। এখানে সম্পূর্ণ স্বাধীনতার বিষয়ে সন্দেহ থাকাটা প্রাসঙ্গিক — এটি একটি দীর্ঘদিনের পরিচিত স্বার্থের সংঘাত, যা Epoch নিজেও স্বীকার করেছে।
ExploitBench — অন্য একটি বিষয়। এটি Carnegie Mellon-এর একটি প্রকল্প (সিউংহিউন লি এবং ডেভিড ব্রামলি), যা V8-এর বাস্তব বাগগুলো এক্সপ্লয়েট করার জন্য 16 ফ্ল্যাগের একটি সিঁড়ি। লেখকরা লিখেছেন যে তারা OpenAI এবং Anthropic-এর সাইবার প্রোগ্রামে যুক্ত ছিলেন, যাতে মডেলগুলো অফেন্সিভ কাজ সমাধান করতে অস্বীকার না করে, কিন্তু এই বেঞ্চমার্কটি OpenAI পরিচালনা করে না বা FrontierMath-এর মতো অর্থায়নও করেনি। 100% — অন্য কারো টেস্টে OpenAI-এর দাবি করা ফলাফল, এটি তবুও স্বাধীনভাবে পুনরায় যাচাই করা উচিত, তবে "OpenAI দ্বারা পরিচালিত" শব্দগুচ্ছটি এখানে অপ্রয়োজনীয়।
প্রতিযোগিতামূলক প্রেক্ষাপটটিও সঠিকভাবে উল্লেখ করা প্রয়োজন। Claude Fable 5.1 মুক্তি পেয়েছে 1 সেপ্টেম্বর, Astra-এর দুই দিন আগে, একই $10/$50 মূল্যের পরিসরে। Anthropic এখনও কনস্টিটিউশনাল অ্যালাইনমেন্ট এবং "কভারড মডেল" মোডের ওপর বেশি জোর দিচ্ছে। Google অডিট নিয়ে আরও জোরালো কথা বলছে। OpenAI কম্পিউটেশনের স্কেল, বিল্ট-ইন মেটা-সুপারভিশন এবং বাজারে এজেন্ট আনার গতির ওপর বাজি ধরছে। এটি কোনো নৈতিক মূল্যায়ন নয়, বরং একটি মোড়: এজেন্ট যত দ্রুত হবে — তত স্বচ্ছতা কম থাকবে, ঠিক কীভাবে শিরোনামের শতাংশটি পাওয়া গেছে।
আরেকটি স্তর, যা খুব কম লোকই উল্লেখ করছে: Astra হলো OpenAI-এর প্রথম মডেল যা "ক্রিটিক্যাল" সাইবার নিরাপত্তার অভ্যন্তরীণ স্কেল অনুযায়ী। তাই সবচেয়ে তীব্র অফেন্সিভ সক্ষমতাগুলো সাধারণ ব্যবহারকারীদের জন্য কমিয়ে দেওয়া হয়েছে এবং বিশ্বস্ত ডিফেন্ডারদের জন্য রাখা হয়েছে। Hugging Face-এর ঘটনার পর এটি যৌক্তিক। কিন্তু এর মানে হলো, পাবলিক Astra এবং "যে Astra ExploitBench-এ 100% স্কোর করেছে", — তারা পুরোপুরি একই পণ্য নয়।
আড়ম্বর ছাড়াই এর থেকে কী বোঝা যায়
কাজের ক্ষেত্রে অগ্রগতিটি বাস্তব বলে মনে হচ্ছে। ডেস্কটপে দ্রুত কাজ করা, কম হ্যালুসিনেশন, কাজের কাঠামো ভালোভাবে বজায় রাখা, OSWorld-এ সময় প্রায় অর্ধেক কমিয়ে আনা — এগুলো কেবল মার্কেটিংয়ের জন্য মার্কেটিং নয়। কোড, অটোমেশন এবং দীর্ঘ কর্পোরেট পাইপলাইনের জন্য, Sol-এর তুলনায় Astra সম্ভবত একটি উল্লেখযোগ্য পদক্ষেপ হবে।
কিন্তু "99,9% = AGI" — এটি ভুল হিসাব। OpenAI-এর নিজের AGI-এর সংজ্ঞা একসময় ছিল "এমন একটি সিস্টেম যা সমস্ত অর্থনৈতিকভাবে মূল্যবান কাজ মানুষের চেয়ে খারাপভাবে করে না"। একটি নেটিভ অ্যাডাপ্টারসহ একটি ইন্টারঅ্যাক্টিভ বেঞ্চমার্ক এটি প্রমাণ করে না। গণিতে 97,6% স্কোরও এটি প্রমাণ করে না, যদি সেটের একটি অংশ ঐতিহাসিকভাবে টেস্টের গ্রাহকের কাছাকাছি থাকে। Humanity’s Last Exam-এ পিছিয়ে থাকা অবস্থায় অন্য কারো ইনডেক্সে ড্র/দ্বিতীয় স্থানও এটি প্রমাণ করে না।
বর্তমানের সৎ মূল্যায়ন হলো: Astra হলো একটি অত্যন্ত শক্তিশালী এজেন্ট, যার কম্পিউটার নিয়ন্ত্রণের নতুন স্তর রয়েছে এবং Sol-এর তুলনায় কঠোর আত্ম-সীমাবদ্ধতা রয়েছে। "AGI যুগ"-এর দাবিটি আপাতত OpenAI-এর নেতৃত্বের অভ্যন্তরীণ অনুভূতির ওপর এবং এমন ফলাফলের ওপর টিকে আছে, যা এক হারনেস থেকে অন্য হারনেসে ব্যাপকভাবে ওঠানামা করে।
প্রেস-রিলিজের দিকে না তাকিয়ে তিনটি বিরক্তিকর বিষয়ের দিকে তাকানো অর্থবহ: নিরপেক্ষ ARC-AGI-3-এ বাইরের কারো দ্বারা 62,7% পুনরুত্পাদন করা যায় কি না; মডেলটি কেমন আচরণ করে যখন নির্দেশনা অস্পষ্ট (ত্রুটিপূর্ণ), ল্যাবরেটরির মতো আদর্শ নয়; এবং সেই পরিবেশগুলোর বাইরে গুণমান কতটা কমে যায় যেখানে OpenAI নিজেই মেমরি, কনটেক্সট কমপ্রেশন এবং সুপারভিশন সেটআপ করেছে।
প্রথম স্বাধীন পরীক্ষাগুলো ইতিমধ্যেই দেখিয়েছে যে শিরোনাম এবং প্রোটোকল — দুটি ভিন্ন বিষয়। এটি Astra-কে দুর্বল করে না। এটি এটিকে 2026 সালের একটি সাধারণ বড় মডেলে পরিণত করে: চিত্তাকর্ষক, ব্যয়বহুল এবং এখনও এমন একটি মডেল যা কেবল যারা এটিকে প্রশিক্ষণ দিয়েছে তাদের দ্বারা নয়, বরং অন্যদের দ্বারাও সংখ্যাগুলো পুনরায় যাচাই করার প্রয়োজন রয়েছে।

