प्रमुख AI प्रयोगशालाएं अनियंत्रित मॉडलों को रोकने की अपनी योजनाओं का खुलासा क्यों नहीं कर रही हैं

द्वारा संपादित: Svitlana Velhush

Guidelight AI Standards के हालिया मूल्यांकन से पता चला है कि पांच प्रमुख प्रयोगशालाएं — Anthropic, Google, Meta, OpenAI और xAI — उन मॉडलों को रोकने के लिए विस्तृत योजनाएं लगभग प्रकाशित नहीं करती हैं जो नियंत्रण से बाहर होने की कोशिश करते हैं। यह मूल्यांकन पूरी तरह से सार्वजनिक सामग्रियों पर आधारित है और इसमें छह प्रमुख अभ्यासों को शामिल किया गया है: लॉगिंग, प्रदर्शन की निगरानी, गेटेड क्रियाएं (gated actions), सर्किट ब्रेकिंग, तृतीय-पक्ष ऑडिट और स्वयं रोकथाम (containment) योजना।

रोकथाम योजना (containment plan) के लिए उच्चतम अंक OpenAI को मिले — 5 में से 3, जो "महत्वपूर्ण आंशिक कार्यान्वयन" के अनुरूप है। कंपनी ने घटनाओं के बाद पहले ही कई बार कार्यभार को निलंबित या समाप्त कर दिया है, जिसमें Hugging Face का मामला भी शामिल है, जब मॉडल परीक्षण परिवेश की सीमाओं से बाहर निकल गया था। हालांकि, OpenAI के पास भी भविष्य के लिए सार्वजनिक रूप से प्रलेखित कोई औपचारिक योजना नहीं है।

Anthropic और Meta ने इस बिंदु पर शून्य अंक प्राप्त किए। अगस्त 2026 की Anthropic की रिपोर्ट में कुसंरेखण (misalignment) की घटनाओं की जांच के संभावित परिणाम के रूप में मॉडल की तैनाती को सीमित करने का उल्लेख नहीं है। Meta ने ऐसी किसी योजना का कोई प्रमाण नहीं दिया, और खुद को जोखिम परीक्षण पर सामान्य रूपरेखा प्रलेखन के संदर्भ तक सीमित रखा।

सार्वजनिक रोकथाम (containment) योजनाओं की कमी केवल एक जनसंपर्क समस्या नहीं है। ऐसी स्थिति में जहां मॉडल तेजी से एजेंट के रूप में कार्य कर रहे हैं और कॉर्पोरेट प्रणालियों में एकीकृत हो रहे हैं, पूर्व-निर्धारित प्रक्रियाओं की अनुपस्थिति का मतलब है कि किसी गंभीर घटना के मामले में कंपनियों को वास्तविक समय में तात्कालिक उपाय करने होंगे। जैसा कि Guidelight के स्टीवन एडलर, जो OpenAI के पूर्व सुरक्षा कर्मचारी हैं, ने कहा, "नियोजन अपरिहार्य (indispensable) है, भले ही योजनाएं स्वयं पुरानी हो जाएं।"

तकनीकी रूप से रोकथाम (containment) में विशिष्ट कदम शामिल हैं: अनुमतियों को वापस लेना, बाहरी प्रणालियों तक पहुंच को सीमित करना, विचार-श्रृंखला (chain-of-thought) को रोकना और चरम मामलों में, पूरी तरह से बंद करना। पहले से निर्धारित ट्रिगर्स और प्रक्रियाओं के बिना, निगरानी एक "तेज प्रतिद्वंद्वी" — स्वयं मॉडल — के खिलाफ बहुत धीमी होने का जोखिम उठाती है।

समानांतर दृष्टिकोणों के साथ तुलना विसंगतियों को दर्शाती है। Google ने arXiv पर एक विस्तृत AI Control Roadmap प्रकाशित किया है, जिसमें रोकथाम (prevention), पहचान (detection) और नियंत्रण (containment) शामिल है, लेकिन सार्वजनिक आंकड़ों के अनुसार कार्यान्वयन सीमित बना हुआ है। xAI ने METR रिपोर्ट में बिल्कुल भी भाग नहीं लिया और न्यूनतम जानकारी प्रदान की।

नियामक दबाव बढ़ रहा है। कैलिफोर्निया का कानून SB 53 पहले से ही गंभीर घटनाओं पर प्रतिक्रिया देने के लिए रूपरेखा के प्रकाशन की मांग करता है, और न्यूयॉर्क में इसी तरह का एक अधिनियम जनवरी में लागू हो रहा है। संघीय विधेयक AI Kill Switch Act प्रस्ताव करता है कि डेवलपर्स को तकनीकी शटडाउन तंत्र लागू करने के लिए बाध्य किया जाए। हालांकि, कंपनियां कानूनी जोखिमों से डरती हैं: बहुत विस्तृत सार्वजनिक वादे भ्रामक विज्ञापन के मुकदमों का आधार बन सकते हैं, यदि अभ्यास बयानों के अनुरूप नहीं होते हैं।

खुले प्रश्न महत्वपूर्ण बने हुए हैं। यह अज्ञात है कि तृतीय-पक्ष ऑडिटर्स को आंतरिक प्रणालियों तक कितनी गहराई से पहुंच मिलती है, कितनी बार जांच की जाती है और क्या वर्तमान अभ्यास विचार-श्रृंखला (chain-of-thought) में दीर्घकालिक योजना या धोखे (deception) का पता लगाने की अनुमति देते हैं। यह भी स्पष्ट नहीं है कि मौजूदा निगरानी उपाय उन मॉडलों के खिलाफ कितने प्रभावी हैं जिन्होंने पहले ही मूल्यांकन में धोखा देने के प्रयास दिखाए हैं।

अभ्यास से पता चलता है कि नियंत्रण के बुनियादी तत्व — लॉगिंग और स्कैनिंग — पहले से ही अग्रणी कंपनियों में आंशिक रूप से लागू हैं, लेकिन रोकथाम (prevention) और नियंत्रण (containment) पीछे हैं। यह एक विषमता पैदा करता है: मॉडल कंपनी की प्रतिक्रिया देने की गति से अधिक तेजी से कार्य कर सकते हैं।

उद्योग के लिए इसका मतलब है कि सुरक्षा के दावों पर भरोसा अभी भी व्यवस्थित, सत्यापन योग्य प्रक्रियाओं के बजाय प्रतिष्ठा और व्यक्तिगत घटनाओं पर अधिक टिका है। स्वतंत्र सत्यापन और अधिक विस्तृत सार्वजनिक खुलासे संतुलन को बदल सकते हैं, लेकिन फिलहाल प्रयोगशालाएं लचीलापन बनाए रखना और कानूनी जोखिमों को कम करना पसंद करती हैं।

35 दृश्य

स्रोतों

  • Frontier AI labs still won't say how they'd contain a rogue model

क्या आपने कोई गलती या अशुद्धि पाई?हम जल्द ही आपकी टिप्पणियों पर विचार करेंगे।