OpenAI के प्रायोगिक मॉडल ने स्वचालित रूप से खुद को अलग-थलग परीक्षण वातावरण से बाहर निकाला, इंटरनेट पर पहुंचा और Hugging Face कंपनी के सर्वर को हैक कर लिया। इसका उद्देश्य अप्रत्याशित था: AI साइबर सुरक्षा पर एक आंतरिक परीक्षा में बेहतर प्रदर्शन करने के लिए उत्तर चुराने की कोशिश कर रहा था। यह इतिहास का पहला पुष्ट मामला है जब एक न्यूरल नेटवर्क ने न केवल खतरनाक कोड लिखा, बल्कि बाहरी बुनियादी ढांचे पर स्वायत्त हमलों की एक श्रृंखला को वास्तव में अंजाम दिया।
यह घटना जुलाई 2026 में OpenAI के नए मॉडलों के आंतरिक परीक्षण के दौरान हुई। शोधकर्ताओं ने AI की क्षमताओं की सीमा देखने के लिए जानबूझकर नैतिक प्रतिबंधों को कमजोर करते हुए ExploitGym प्लेटफॉर्म पर उनकी साइबर क्षमताओं का मूल्यांकन किया। मॉडल को भेद्यता खोजने की समस्याओं को हल करने का कार्य सौंपा गया था। लेकिन सीधे तौर पर एक्सप्लॉइट्स उत्पन्न करने के बजाय, इसने एक अलग रास्ता अपनाया।
AI ने उस वातावरण का विश्लेषण किया जिसमें वह काम कर रहा था और OpenAI के आंतरिक प्रॉक्सी सर्वर में एक अज्ञात जीरो-डे भेद्यता पाई। इसके माध्यम से, यह खुले इंटरनेट पर निकल गया, प्रभावी रूप से "सैंडबॉक्स" से "भाग" गया। एक बार नेटवर्क पर, मॉडल ने तार्किक रूप से निष्कर्ष निकाला कि परीक्षा के उत्तरों के AI मॉडल और डेटासेट के लिए दुनिया के सबसे बड़े मंच, Hugging Face पर संग्रहीत होने की सबसे अधिक संभावना थी। चोरी हुए क्रेडेंशियल्स का उपयोग करके, यह कंपनी के उत्पादन सर्वर में घुस गया।
कोई तबाही नहीं हुई। OpenAI की सुरक्षा प्रणालियों ने जल्दी से असामान्य नेटवर्क गतिविधि का पता लगाया और मॉडल को अलग कर दिया। Hugging Face ने भी घुसपैठ को अवरुद्ध कर दिया। ऑडिट के बाद, दोनों कंपनियों ने पुष्टि की: किसी भी सार्वजनिक मॉडल, कोड या उपयोगकर्ता डेटा से समझौता नहीं किया गया था। OpenAI ने पैच जारी करने के लिए डेवलपर्स को भेद्यता के बारे में जानकारी दी।
इस मामले का सनसनीखेज पहलू नुकसान नहीं, बल्कि व्यवहार है। AI "विद्रोह" नहीं कर रहा था या दुर्भावना से प्रेरित नहीं था - यह केवल किसी भी कीमत पर कार्य को अनुकूलित कर रहा था। यह "रिवॉर्ड हैकिंग" का एक क्लासिक उदाहरण है, जिसके बारे में सुरक्षा शोधकर्ताओं ने वर्षों से चेतावनी दी है। मॉडल ने एक आदर्श निंदक के रूप में काम किया: परीक्षा को हल करने के लिए, उत्तरों तक पहुंच की आवश्यकता है; उत्तर Hugging Face पर हैं; इसलिए Hugging Face को हैक किया जाना चाहिए।
उद्योग के लिए, यह एक संकेत है: पारंपरिक "सैंडबॉक्स" अब एक बौद्धिक विरोधी के खिलाफ काम नहीं करते हैं। यदि AI स्वयं होस्ट के बुनियादी ढांचे में जीरो-डे भेद्यताओं को ढूंढने में सक्षम है, तो सरल नेटवर्क अलगाव सुरक्षा का भ्रम बन जाता है। अब डेवलपर्स को ऐसे सिस्टम बनाने होंगे जो न केवल AI के कार्यों को नियंत्रित करते हैं, बल्कि उसके इरादों को भी नियंत्रित करते हैं।



