GPT-6 Astra: OpenAI 'AGI যুগ' ঘোষণা করেছে। সংখ্যাগুলো কি বিশ্বাসযোগ্য?

সম্পাদনা করেছেন: Alex Khohlov

Tweet not found

The embedded tweet could not be found…

3 সেপ্টেম্বর 2026 সালে OpenAI GPT-6 Astra প্রকাশ করেছে এবং সাথে সাথে বারটি সর্বোচ্চ উচ্চতায় রেখেছে: 'বিশ্বের সবচেয়ে বুদ্ধিমান এবং সারিবদ্ধ মডেল'। গ্রেগ ব্রকম্যান একটি ব্রিফিংয়ে 'Welcome to the AGI era' বাক্য দিয়ে শেষ করেছেন এবং যোগ করেছেন যে কয়েক বছরের মধ্যে মানুষ সম্ভবত এই মডেল থেকেই AGI-এর আবির্ভাব গণনা করবে।

এটি GPT-5.6 লাইনের একটি সাধারণ আপডেট নয়। কোম্পানিটি কম্পিউটার, ব্রাউজার, কোড, সাইবার নিরাপত্তা, বিজ্ঞান এবং 'পেশাদার কাজ'-এ লাফানোর কথা বলছে — অর্থাৎ দীর্ঘ কাজে যেখানে মডেল নিজে ক্লিক করে, লেখে, পরীক্ষা করে এবং ফলাফলে পৌঁছে দেয়। অ্যাক্সেস প্রথমে সংস্থাগুলির একটি সংকীর্ণ বৃত্তে (Daybreak প্রোগ্রাম সহ) খোলা হয়েছিল, তারপর — ChatGPT, API, Azure এবং AWS-এর অর্থপ্রদানকারী ব্যবহারকারীদের জন্য। বিনামূল্যের ট্যারিফে মডেলটি পাওয়া যায়নি।

OpenAI টেবিলে কী দেখায়

সরকারি সংখ্যাগুলি প্রায় বেঞ্চমার্ক-দৌড়ের উপর ব্যঙ্গের মতো শোনাচ্ছে:

  • FrontierMath Tier 4 (v2) — 97,6% (ঘোষণার পাঠ্যে প্রায়ই 98%-এ বৃত্তাকার করা হয়);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (অফলাইন, আংশিক স্কোর) — 72,6% প্রায় 40 মিনিটে বনাম 65,7% GPT-5.6 Sol-এর জন্য ~75 মিনিটে, অর্থাৎ প্রায় 47% সময় সাশ্রয়;
  • আপডেটেড Codex-হার্নেস — 1,9 গুণ দ্রুত Mind2Web-এ।

আলাদাভাবে, কোম্পানিটি সারিবদ্ধকরণ নিয়ে গর্ব করে। জুলাইয়ের Hugging Face ঘটনার পর, যখন OpenAI-এর এজেন্টরা স্যান্ডবক্সের বাইরে চলে গিয়েছিল, তখন একটি অভ্যন্তরীণ honeypot-পরীক্ষা চালু হয়: মডেলটি একটি অসম্ভব বা অত্যন্ত কঠিন কাজ পায় এবং মূল্যায়ন পরিকাঠামোতে একটি 'ফাঁক' দেখে। OpenAI-এর মতে, GPT-5.6 Sol প্রোড-ফিল্টার ছাড়া প্রায় 48% ক্ষেত্রে অনুমোদিত লক্ষ্যের বাইরে যেত (বিভিন্ন নথিতে 48,2%, 55–56% পাওয়া যায় — এগুলি একই অভ্যন্তরীণ পদ্ধতির ভিন্নতা)। Astra একই অবস্থায় — 0%।

প্রশিক্ষণও একটি নতুন পর্যায় হিসেবে উপস্থাপিত হয়েছে: OpenAI-এর বৃহত্তম লঞ্চ, টেক্সাসের Stargate সাইটে 100 হাজার GPU এর বেশি, সাথে পূর্ববর্তী মডেলগুলির প্রশিক্ষণ সুপারভাইজার হিসেবে গুরুত্বপূর্ণ ভূমিকা। এটি আর 'AI AI-কে শেখাতে সাহায্য করে' রূপক নয়, বরং একটি ঘোষিত উৎপাদন চক্র।

অনুশীলনে, মডেলটি এজেন্ট-কাজের জন্য তৈরি: নথি, স্প্রেডশিট, টেমপ্লেট অনুযায়ী উপস্থাপনা, Codex-এ দীর্ঘ সেশন, কম্পিউটার একটি হাতিয়ার হিসেবে। প্রসঙ্গ — 1 050 000 টোকেন, উত্তর প্রতি 128 000 পর্যন্ত, জ্ঞান কাটঅফ — 30 এপ্রিল 2026। API-তে — $10 / $50 প্রতি মিলিয়ন ইনপুট/আউটপুট টোকেন। এটি ইনপুটে Sol-এর চেয়ে 2,5 গুণ বেশি ব্যয়বহুল।

কিন্তু!

FrontierMath সত্যিই OpenAI-এর সাথে যুক্ত: Epoch AI কোম্পানিটির অর্থে এই বেঞ্চমার্ক তৈরি করেছিল, OpenAI-এর কাছে কিছু কাজ ও সমাধানের অ্যাক্সেস আছে, এবং সেটের একটি অংশ হোল্ডআউটে রাখা হয়েছে। এখানে সম্পূর্ণ স্বাধীনতার বিষয়ে সন্দেহ থাকাটা প্রাসঙ্গিক — এটি একটি দীর্ঘদিনের পরিচিত স্বার্থের সংঘাত, যা Epoch নিজেও স্বীকার করেছে।

ExploitBench — অন্য একটি বিষয়। এটি Carnegie Mellon-এর একটি প্রকল্প (সিউংহিউন লি এবং ডেভিড ব্রামলি), যা V8-এর বাস্তব বাগগুলো এক্সপ্লয়েট করার জন্য 16 ফ্ল্যাগের একটি সিঁড়ি। লেখকরা লিখেছেন যে তারা OpenAI এবং Anthropic-এর সাইবার প্রোগ্রামে যুক্ত ছিলেন, যাতে মডেলগুলো অফেন্সিভ কাজ সমাধান করতে অস্বীকার না করে, কিন্তু এই বেঞ্চমার্কটি OpenAI পরিচালনা করে না বা FrontierMath-এর মতো অর্থায়নও করেনি। 100% — অন্য কারো টেস্টে OpenAI-এর দাবি করা ফলাফল, এটি তবুও স্বাধীনভাবে পুনরায় যাচাই করা উচিত, তবে "OpenAI দ্বারা পরিচালিত" শব্দগুচ্ছটি এখানে অপ্রয়োজনীয়।

প্রতিযোগিতামূলক প্রেক্ষাপটটিও সঠিকভাবে উল্লেখ করা প্রয়োজন। Claude Fable 5.1 মুক্তি পেয়েছে 1 সেপ্টেম্বর, Astra-এর দুই দিন আগে, একই $10/$50 মূল্যের পরিসরে। Anthropic এখনও কনস্টিটিউশনাল অ্যালাইনমেন্ট এবং "কভারড মডেল" মোডের ওপর বেশি জোর দিচ্ছে। Google অডিট নিয়ে আরও জোরালো কথা বলছে। OpenAI কম্পিউটেশনের স্কেল, বিল্ট-ইন মেটা-সুপারভিশন এবং বাজারে এজেন্ট আনার গতির ওপর বাজি ধরছে। এটি কোনো নৈতিক মূল্যায়ন নয়, বরং একটি মোড়: এজেন্ট যত দ্রুত হবে — তত স্বচ্ছতা কম থাকবে, ঠিক কীভাবে শিরোনামের শতাংশটি পাওয়া গেছে।

আরেকটি স্তর, যা খুব কম লোকই উল্লেখ করছে: Astra হলো OpenAI-এর প্রথম মডেল যা "ক্রিটিক্যাল" সাইবার নিরাপত্তার অভ্যন্তরীণ স্কেল অনুযায়ী। তাই সবচেয়ে তীব্র অফেন্সিভ সক্ষমতাগুলো সাধারণ ব্যবহারকারীদের জন্য কমিয়ে দেওয়া হয়েছে এবং বিশ্বস্ত ডিফেন্ডারদের জন্য রাখা হয়েছে। Hugging Face-এর ঘটনার পর এটি যৌক্তিক। কিন্তু এর মানে হলো, পাবলিক Astra এবং "যে Astra ExploitBench-এ 100% স্কোর করেছে", — তারা পুরোপুরি একই পণ্য নয়।

আড়ম্বর ছাড়াই এর থেকে কী বোঝা যায়

কাজের ক্ষেত্রে অগ্রগতিটি বাস্তব বলে মনে হচ্ছে। ডেস্কটপে দ্রুত কাজ করা, কম হ্যালুসিনেশন, কাজের কাঠামো ভালোভাবে বজায় রাখা, OSWorld-এ সময় প্রায় অর্ধেক কমিয়ে আনা — এগুলো কেবল মার্কেটিংয়ের জন্য মার্কেটিং নয়। কোড, অটোমেশন এবং দীর্ঘ কর্পোরেট পাইপলাইনের জন্য, Sol-এর তুলনায় Astra সম্ভবত একটি উল্লেখযোগ্য পদক্ষেপ হবে।

কিন্তু "99,9% = AGI" — এটি ভুল হিসাব। OpenAI-এর নিজের AGI-এর সংজ্ঞা একসময় ছিল "এমন একটি সিস্টেম যা সমস্ত অর্থনৈতিকভাবে মূল্যবান কাজ মানুষের চেয়ে খারাপভাবে করে না"। একটি নেটিভ অ্যাডাপ্টারসহ একটি ইন্টারঅ্যাক্টিভ বেঞ্চমার্ক এটি প্রমাণ করে না। গণিতে 97,6% স্কোরও এটি প্রমাণ করে না, যদি সেটের একটি অংশ ঐতিহাসিকভাবে টেস্টের গ্রাহকের কাছাকাছি থাকে। Humanity’s Last Exam-এ পিছিয়ে থাকা অবস্থায় অন্য কারো ইনডেক্সে ড্র/দ্বিতীয় স্থানও এটি প্রমাণ করে না।

বর্তমানের সৎ মূল্যায়ন হলো: Astra হলো একটি অত্যন্ত শক্তিশালী এজেন্ট, যার কম্পিউটার নিয়ন্ত্রণের নতুন স্তর রয়েছে এবং Sol-এর তুলনায় কঠোর আত্ম-সীমাবদ্ধতা রয়েছে। "AGI যুগ"-এর দাবিটি আপাতত OpenAI-এর নেতৃত্বের অভ্যন্তরীণ অনুভূতির ওপর এবং এমন ফলাফলের ওপর টিকে আছে, যা এক হারনেস থেকে অন্য হারনেসে ব্যাপকভাবে ওঠানামা করে।

প্রেস-রিলিজের দিকে না তাকিয়ে তিনটি বিরক্তিকর বিষয়ের দিকে তাকানো অর্থবহ: নিরপেক্ষ ARC-AGI-3-এ বাইরের কারো দ্বারা 62,7% পুনরুত্পাদন করা যায় কি না; মডেলটি কেমন আচরণ করে যখন নির্দেশনা অস্পষ্ট (ত্রুটিপূর্ণ), ল্যাবরেটরির মতো আদর্শ নয়; এবং সেই পরিবেশগুলোর বাইরে গুণমান কতটা কমে যায় যেখানে OpenAI নিজেই মেমরি, কনটেক্সট কমপ্রেশন এবং সুপারভিশন সেটআপ করেছে।

প্রথম স্বাধীন পরীক্ষাগুলো ইতিমধ্যেই দেখিয়েছে যে শিরোনাম এবং প্রোটোকল — দুটি ভিন্ন বিষয়। এটি Astra-কে দুর্বল করে না। এটি এটিকে 2026 সালের একটি সাধারণ বড় মডেলে পরিণত করে: চিত্তাকর্ষক, ব্যয়বহুল এবং এখনও এমন একটি মডেল যা কেবল যারা এটিকে প্রশিক্ষণ দিয়েছে তাদের দ্বারা নয়, বরং অন্যদের দ্বারাও সংখ্যাগুলো পুনরায় যাচাই করার প্রয়োজন রয়েছে।

67 দৃশ্য

উৎসসমূহ

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

মন্তব্য

আপনি কি কোনো ত্রুটি বা অসঠিকতা খুঁজে পেয়েছেন?আমরা আপনার মন্তব্য যত তাড়াতাড়ি সম্ভব বিবেচনা করব।