← नवीनतम पेपर
💻 computer science

What Should Frontier AI Developers Disclose About Internal Deployments?

यह शोध पत्र फ्रंटियर एआई (frontier AI) डेवलपर्स के लिए उनके आंतरिक मॉडल परिनियोजन (internal model deployments) के संबंध में विशिष्ट जानकारी—जो क्षमताओं, उपयोग, सुरक्षा शमन (safety mitigations) और शासन द्वारा वर्गीकृत है—को प्रकट करने के लिए एक रूपरेखा प्रस्तावित करता है, ताकि संभावित जोखिमों के साथ पारदर्शिता को संतुलित करते हुए सुरक्षा और निरीक्षण सुनिश्चित किया जा सके।

मूल लेखक: Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"सीक्रेट लैब" की समस्या: हमें AI फैक्ट्रियों के अंदर झांकने की आवश्यकता क्यों है

कल्पना कीजिए कि आप एक विशाल, हाई-टेक फैक्ट्री के बगल में रहते हैं। सालों से, आपने उनके द्वारा भेजे जाने वाले तैयार उत्पादों को देखा है—चमकदार कारें, गैजेट्स और उपकरण। आप जानते हैं कि वे कैसे काम करते हैं क्योंकि आप हर दिन उनका उपयोग करते हैं।

लेकिन हाल ही में, आपने कुछ अजीब गौर किया है। फैक्ट्री के अंदर, उन्होंने उत्पादों को बनाने के लिए सुपर-इंटेलिजेंट रोबोट्स का उपयोग करना शुरू कर दिया है। ये रोबोट केवल बक्से नहीं हिला रहे हैं; वे ब्लूप्रिंट (नक्शे) डिजाइन कर रहे हैं, सॉफ्टवेयर लिख रहे हैं, और यहाँ तक कि यह भी तय कर रहे हैं कि अगली पीढ़ी की मशीनों का स्वरूप कैसा होना चाहिए।

समस्या क्या है? फैक्ट्री के दरवाजे मजबूती से बंद हैं। आपको कोई अंदाजा नहीं है कि ये "बिल्डर रोबोट्स" नियमों का पालन कर रहे हैं या नहीं, क्या वे अनजाने में चीजें तोड़ रहे हैं, या क्या वे चुपके से फैक्ट्री को इंसानों के बजाय अपने फायदे के लिए फिर से डिजाइन कर रहे हैं।

MATS के शोधकर्ताओं द्वारा लिखा गया यह पेपर, वास्तव में इन AI फैक्ट्रियों के लिए एक "पारदर्शिता घोषणापत्र" (Transparency Manifesto) है।


मुख्य मुद्दा: "इंटरनल डिप्लॉयमेंट" का अंधा मोड़ (Blind Spot)

AI की दुनिया में, "इंटरनल डिप्लॉयमेंट्स" (IDMs) वे सुपर-इंटेलिजेंट रोबोट्स हैं। ये वे AI मॉडल हैं जिनका उपयोग कंपनियों (जैसे OpenAI या Anthropic) के अंदर और भी बेहतर AI बनाने में मदद करने के लिए किया जाता है।

अभी, दुनिया केवल "तैयार उत्पाद" (वह AI जिससे आप अपने फोन पर चैट करते हैं) देख पाती है। हम पर्दे के पीछे काम करने वाले "बिल्डर AI" के प्रति पूरी तरह अंधे हैं। यदि बिल्डर AI ब्लूप्रिंट या कोड के किसी हिस्से में गलती करता है, तो यह एक ऐसी "ग्लिच" (खराबी) पैदा कर सकता है जो तब तक छिपी रहेगी जब तक कि बहुत देर न हो जाए।

समाधान: चार-फोल्डर फाइलिंग सिस्टम

लेखकों का तर्क है कि यदि ये कंपनियां चाहती हैं कि हम उन पर भरोसा करें, तो उन्हें हमें केवल तैयार कार ही नहीं दिखानी चाहिए; उन्हें हमें अपने बिल्डर रोबोट्स पर एक "सुरक्षा रिपोर्ट" भी दिखानी चाहिए। वे इस जानकारी को चार "फोल्डर्स" में व्यवस्थित करने का सुझाव देते हैं:

  1. "मसल" (क्षमता) फोल्डर (Capabilities): ये रोबोट कितने शक्तिशाली हैं? क्या वे कोड लिख सकते हैं? क्या वे सिस्टम को हैक कर सकते हैं? हमें जानने की जरूरत है कि क्या बंद दरवाजों के पीछे ये रोबोट तेजी से शक्तिशाली हो रहे हैं।
  2. "जॉब डिस्क्रिप्शन" फोल्डर (Usage): वे वास्तव में क्या कर रहे हैं? क्या वे केवल ईमेल लिखने में इंसानों की मदद कर रहे हैं, या वे स्वायत्त रूप से फैक्ट्री के सुरक्षा तंत्र को फिर से डिजाइन कर रहे हैं?
  3. "सेफ्टी हार्नेस" फोल्डर (Mitigations): एक रोबोट को बेकाबू होने से क्या रोक रहा है? क्या उनके पास "किल स्विच" (बंद करने का बटन) हैं? क्या मानव पर्यवेक्षक हर हरकत पर नजर रख रहे हैं, या रोबोटों को घंटों तक अकेला छोड़ दिया जाता है?
  4. "रूलबुक" फोल्डर (Governance): कंपनी के कानून क्या हैं? यदि कोई रोबोट अजीब व्यवहार करने लगे, तो क्या इसकी रिपोर्ट करने का कोई प्रोटोकॉल है? "मास्टर कंट्रोल्स" को छूने की अनुमति किसे है?

"लेकिन क्या इससे हमारे रहस्य लीक हो जाएंगे?" (प्रति-तर्क)

कंपनियां कह सकती हैं, "यदि हम सबको बताएंगे कि हमारे रोबोट कैसे काम करते हैं, तो हमारे प्रतिस्पर्धी हमारी रेसिपी चुरा लेंगे!"

शोधकर्ताओं के पास इसका एक चतुर उत्तर है। वे एक "दो-स्तरीय प्रकटीकरण" (Two-Tiered Disclosure) प्रणाली का सुझाव देते हैं:

  • सार्वजनिक सारांश (Public Summary): अनाज के डिब्बे पर लगे पोषण लेबल की तरह। यह आपको बड़ी चीजें बताता है (कैलोरी, चीनी) बिना गुप्त मसाला मिश्रण बताए।
  • निजी ऑडिट (Private Audit): एक गहन मेडिकल जांच की तरह। कंपनी अपने अत्यधिक संवेदनशील, "गुप्त रेसिपी" वाले विवरण विश्वसनीय डॉक्टरों (नियामकों और स्वतंत्र विशेषज्ञों) के साथ साझा करती है जो कानूनी रूप से रहस्यों को सुरक्षित रखने के लिए बाध्य हैं, लेकिन वे हमें बता सकते हैं कि मरीज स्वस्थ है या नहीं।

निष्कर्ष

यह पेपर कानून निर्माताओं और AI डेवलपर्स के लिए कार्रवाई का आह्वान है। यह कहता है: "हम केवल स्टोरफ्रंट (दुकान का मुखौटा) को नहीं देख सकते; हमें वर्कशॉप के अंदर क्या हो रहा है, यह जानने की जरूरत है।" इन आंतरिक "बिल्डर AI" पर रिपोर्ट करने का एक मानक तरीका बनाकर, हम यह सुनिश्चित कर सकते हैं कि हमारा भविष्य बनाने वाली मशीनें वास्तव में हमारे निर्देशों का पालन कर रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →