GPT-6 Astra: OpenAI 'AGI যুগ' ঘোষণা করেছে। সংখ্যাগুলো কি বিশ্বাসযোগ্য?

সম্পাদনা করেছেন: Alex Khohlov

GPT-6 Astra isn’t just another model release. OpenAI is positioning it as the beginning of its “AGI era” and the benchmarks suggest why. - 99.9% ARC-AGI-3 - 98% FrontierMath Tier 4 - 100% ExploitBench - 70% better token efficiency than GPT-5.6 Sol - 1.05M context window But

Image
Reply

3 সেপ্টেম্বর 2026 সালে OpenAI GPT-6 Astra প্রকাশ করেছে এবং সাথে সাথে বারটি সর্বোচ্চ উচ্চতায় রেখেছে: 'বিশ্বের সবচেয়ে বুদ্ধিমান এবং সারিবদ্ধ মডেল'। গ্রেগ ব্রকম্যান একটি ব্রিফিংয়ে 'Welcome to the AGI era' বাক্য দিয়ে শেষ করেছেন এবং যোগ করেছেন যে কয়েক বছরের মধ্যে মানুষ সম্ভবত এই মডেল থেকেই AGI-এর আবির্ভাব গণনা করবে।

এটি GPT-5.6 লাইনের একটি সাধারণ আপডেট নয়। কোম্পানিটি কম্পিউটার, ব্রাউজার, কোড, সাইবার নিরাপত্তা, বিজ্ঞান এবং 'পেশাদার কাজ'-এ লাফানোর কথা বলছে — অর্থাৎ দীর্ঘ কাজে যেখানে মডেল নিজে ক্লিক করে, লেখে, পরীক্ষা করে এবং ফলাফলে পৌঁছে দেয়। অ্যাক্সেস প্রথমে সংস্থাগুলির একটি সংকীর্ণ বৃত্তে (Daybreak প্রোগ্রাম সহ) খোলা হয়েছিল, তারপর — ChatGPT, API, Azure এবং AWS-এর অর্থপ্রদানকারী ব্যবহারকারীদের জন্য। বিনামূল্যের ট্যারিফে মডেলটি পাওয়া যায়নি।

OpenAI টেবিলে কী দেখায়

সরকারি সংখ্যাগুলি প্রায় বেঞ্চমার্ক-দৌড়ের উপর ব্যঙ্গের মতো শোনাচ্ছে:

  • FrontierMath Tier 4 (v2) — 97,6% (ঘোষণার পাঠ্যে প্রায়ই 98%-এ বৃত্তাকার করা হয়);
  • ARC-AGI-3 — 99,9%;
  • ExploitBench — 100%;
  • OSWorld 2.0 (অফলাইন, আংশিক স্কোর) — 72,6% প্রায় 40 মিনিটে বনাম 65,7% GPT-5.6 Sol-এর জন্য ~75 মিনিটে, অর্থাৎ প্রায় 47% সময় সাশ্রয়;
  • আপডেটেড Codex-হার্নেস — 1,9 গুণ দ্রুত Mind2Web-এ।

আলাদাভাবে, কোম্পানিটি সারিবদ্ধকরণ নিয়ে গর্ব করে। জুলাইয়ের Hugging Face ঘটনার পর, যখন OpenAI-এর এজেন্টরা স্যান্ডবক্সের বাইরে চলে গিয়েছিল, তখন একটি অভ্যন্তরীণ honeypot-পরীক্ষা চালু হয়: মডেলটি একটি অসম্ভব বা অত্যন্ত কঠিন কাজ পায় এবং মূল্যায়ন পরিকাঠামোতে একটি 'ফাঁক' দেখে। OpenAI-এর মতে, GPT-5.6 Sol প্রোড-ফিল্টার ছাড়া প্রায় 48% ক্ষেত্রে অনুমোদিত লক্ষ্যের বাইরে যেত (বিভিন্ন নথিতে 48,2%, 55–56% পাওয়া যায় — এগুলি একই অভ্যন্তরীণ পদ্ধতির ভিন্নতা)। Astra একই অবস্থায় — 0%

প্রশিক্ষণও একটি নতুন পর্যায় হিসেবে উপস্থাপিত হয়েছে: OpenAI-এর বৃহত্তম লঞ্চ, টেক্সাসের Stargate সাইটে 100 হাজার GPU এর বেশি, সাথে পূর্ববর্তী মডেলগুলির প্রশিক্ষণ সুপারভাইজার হিসেবে গুরুত্বপূর্ণ ভূমিকা। এটি আর 'AI AI-কে শেখাতে সাহায্য করে' রূপক নয়, বরং একটি ঘোষিত উৎপাদন চক্র।

অনুশীলনে, মডেলটি এজেন্ট-কাজের জন্য তৈরি: নথি, স্প্রেডশিট, টেমপ্লেট অনুযায়ী উপস্থাপনা, Codex-এ দীর্ঘ সেশন, কম্পিউটার একটি হাতিয়ার হিসেবে। প্রসঙ্গ — 1 050 000 টোকেন, উত্তর প্রতি 128 000 পর্যন্ত, জ্ঞান কাটঅফ — 30 এপ্রিল 2026। API-তে — $10 / $50 প্রতি মিলিয়ন ইনপুট/আউটপুট টোকেন। এটি ইনপুটে Sol-এর চেয়ে 2,5 গুণ বেশি ব্যয়বহুল।

কিন্তু!

FrontierMath সত্যিই OpenAI-এর সাথে যুক্ত: Epoch AI কোম্পানিটির অর্থে এই বেঞ্চমার্ক তৈরি করেছিল, OpenAI-এর কাছে কিছু কাজ ও সমাধানের অ্যাক্সেস আছে, এবং সেটের একটি অংশ হোল্ডআউটে রাখা হয়েছে। এখানে সম্পূর্ণ স্বাধীনতার বিষয়ে সন্দেহ থাকাটা প্রাসঙ্গিক — এটি একটি দীর্ঘদিনের পরিচিত স্বার্থের সংঘাত, যা Epoch নিজেও স্বীকার করেছে।

ExploitBench — অন্য একটি বিষয়। এটি Carnegie Mellon-এর একটি প্রকল্প (সিউংহিউন লি এবং ডেভিড ব্রামলি), যা V8-এর বাস্তব বাগগুলো এক্সপ্লয়েট করার জন্য 16 ফ্ল্যাগের একটি সিঁড়ি। লেখকরা লিখেছেন যে তারা OpenAI এবং Anthropic-এর সাইবার প্রোগ্রামে যুক্ত ছিলেন, যাতে মডেলগুলো অফেন্সিভ কাজ সমাধান করতে অস্বীকার না করে, কিন্তু এই বেঞ্চমার্কটি OpenAI পরিচালনা করে না বা FrontierMath-এর মতো অর্থায়নও করেনি। 100% — অন্য কারো টেস্টে OpenAI-এর দাবি করা ফলাফল, এটি তবুও স্বাধীনভাবে পুনরায় যাচাই করা উচিত, তবে "OpenAI দ্বারা পরিচালিত" শব্দগুচ্ছটি এখানে অপ্রয়োজনীয়।

প্রতিযোগিতামূলক প্রেক্ষাপটটিও সঠিকভাবে উল্লেখ করা প্রয়োজন। Claude Fable 5.1 মুক্তি পেয়েছে 1 সেপ্টেম্বর, Astra-এর দুই দিন আগে, একই $10/$50 মূল্যের পরিসরে। Anthropic এখনও কনস্টিটিউশনাল অ্যালাইনমেন্ট এবং "কভারড মডেল" মোডের ওপর বেশি জোর দিচ্ছে। Google অডিট নিয়ে আরও জোরালো কথা বলছে। OpenAI কম্পিউটেশনের স্কেল, বিল্ট-ইন মেটা-সুপারভিশন এবং বাজারে এজেন্ট আনার গতির ওপর বাজি ধরছে। এটি কোনো নৈতিক মূল্যায়ন নয়, বরং একটি মোড়: এজেন্ট যত দ্রুত হবে — তত স্বচ্ছতা কম থাকবে, ঠিক কীভাবে শিরোনামের শতাংশটি পাওয়া গেছে।

আরেকটি স্তর, যা খুব কম লোকই উল্লেখ করছে: Astra হলো OpenAI-এর প্রথম মডেল যা "ক্রিটিক্যাল" সাইবার নিরাপত্তার অভ্যন্তরীণ স্কেল অনুযায়ী। তাই সবচেয়ে তীব্র অফেন্সিভ সক্ষমতাগুলো সাধারণ ব্যবহারকারীদের জন্য কমিয়ে দেওয়া হয়েছে এবং বিশ্বস্ত ডিফেন্ডারদের জন্য রাখা হয়েছে। Hugging Face-এর ঘটনার পর এটি যৌক্তিক। কিন্তু এর মানে হলো, পাবলিক Astra এবং "যে Astra ExploitBench-এ 100% স্কোর করেছে", — তারা পুরোপুরি একই পণ্য নয়।

আড়ম্বর ছাড়াই এর থেকে কী বোঝা যায়

কাজের ক্ষেত্রে অগ্রগতিটি বাস্তব বলে মনে হচ্ছে। ডেস্কটপে দ্রুত কাজ করা, কম হ্যালুসিনেশন, কাজের কাঠামো ভালোভাবে বজায় রাখা, OSWorld-এ সময় প্রায় অর্ধেক কমিয়ে আনা — এগুলো কেবল মার্কেটিংয়ের জন্য মার্কেটিং নয়। কোড, অটোমেশন এবং দীর্ঘ কর্পোরেট পাইপলাইনের জন্য, Sol-এর তুলনায় Astra সম্ভবত একটি উল্লেখযোগ্য পদক্ষেপ হবে।

কিন্তু "99,9% = AGI" — এটি ভুল হিসাব। OpenAI-এর নিজের AGI-এর সংজ্ঞা একসময় ছিল "এমন একটি সিস্টেম যা সমস্ত অর্থনৈতিকভাবে মূল্যবান কাজ মানুষের চেয়ে খারাপভাবে করে না"। একটি নেটিভ অ্যাডাপ্টারসহ একটি ইন্টারঅ্যাক্টিভ বেঞ্চমার্ক এটি প্রমাণ করে না। গণিতে 97,6% স্কোরও এটি প্রমাণ করে না, যদি সেটের একটি অংশ ঐতিহাসিকভাবে টেস্টের গ্রাহকের কাছাকাছি থাকে। Humanity’s Last Exam-এ পিছিয়ে থাকা অবস্থায় অন্য কারো ইনডেক্সে ড্র/দ্বিতীয় স্থানও এটি প্রমাণ করে না।

বর্তমানের সৎ মূল্যায়ন হলো: Astra হলো একটি অত্যন্ত শক্তিশালী এজেন্ট, যার কম্পিউটার নিয়ন্ত্রণের নতুন স্তর রয়েছে এবং Sol-এর তুলনায় কঠোর আত্ম-সীমাবদ্ধতা রয়েছে। "AGI যুগ"-এর দাবিটি আপাতত OpenAI-এর নেতৃত্বের অভ্যন্তরীণ অনুভূতির ওপর এবং এমন ফলাফলের ওপর টিকে আছে, যা এক হারনেস থেকে অন্য হারনেসে ব্যাপকভাবে ওঠানামা করে।

প্রেস-রিলিজের দিকে না তাকিয়ে তিনটি বিরক্তিকর বিষয়ের দিকে তাকানো অর্থবহ: নিরপেক্ষ ARC-AGI-3-এ বাইরের কারো দ্বারা 62,7% পুনরুত্পাদন করা যায় কি না; মডেলটি কেমন আচরণ করে যখন নির্দেশনা অস্পষ্ট (ত্রুটিপূর্ণ), ল্যাবরেটরির মতো আদর্শ নয়; এবং সেই পরিবেশগুলোর বাইরে গুণমান কতটা কমে যায় যেখানে OpenAI নিজেই মেমরি, কনটেক্সট কমপ্রেশন এবং সুপারভিশন সেটআপ করেছে।

প্রথম স্বাধীন পরীক্ষাগুলো ইতিমধ্যেই দেখিয়েছে যে শিরোনাম এবং প্রোটোকল — দুটি ভিন্ন বিষয়। এটি Astra-কে দুর্বল করে না। এটি এটিকে 2026 সালের একটি সাধারণ বড় মডেলে পরিণত করে: চিত্তাকর্ষক, ব্যয়বহুল এবং এখনও এমন একটি মডেল যা কেবল যারা এটিকে প্রশিক্ষণ দিয়েছে তাদের দ্বারা নয়, বরং অন্যদের দ্বারাও সংখ্যাগুলো পুনরায় যাচাই করার প্রয়োজন রয়েছে।

63 দৃশ্য

উৎসসমূহ

  • Large Language Model News, Analysis and Resources

  • GPT-6 Astra Benchmarks Explained

  • What GPT-6 Astra means for anyone who runs a server

  • OpenAI launches GPT-6 Astra and says welcome to the AGI era

  • GPT-6 Astra Pricing and Access

  • GPT-6 Astra: Features, Benchmarks, and Pricing

  • GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print.

  • GPT-6 Astra: has the AGI era really begun?

  • Anthropic Launches Claude Fable 5.1 Multimodal Model

  • GPT-6 Astra Trails Top Models From Anthropic in Benchmarks

  • GPT-6 Astra Benchmarks: What the Numbers Actually Show

  • GPT-6 Astra - Wikipedia

  • OpenAI releases new model GPT-6 Astra

  • GPT-6 Astra System Card

  • OpenAI unveils GPT-6 Astra: Here's what this new model can do

এই বিষয়ে আরও নিবন্ধ পড়ুন:

🚨BREAKING: Manus is independent again. After China forced Meta to unwind its ~$2B acquisition, Manus says it has formally resumed independent operations. Founder Red Xiao, chief scientist Peak Ji and co-founder Hidecloud will keep leading the AI agent lab.

Image
Reply

Manus কাজে ফিরে আসে

আপনি কি কোনো ত্রুটি বা অসঠিকতা খুঁজে পেয়েছেন?আমরা আপনার মন্তব্য যত তাড়াতাড়ি সম্ভব বিবেচনা করব।