← नवीनतम पेपर
💻 computer science

Escaping the Agreement Trap: Defensibility Signals for Evaluating Rule-Governed AI

यह शोध पत्र नियम-शासित एआई (AI) के लिए एक नए मूल्यांकन ढांचे का प्रस्ताव करता है जो दोषपूर्ण सहमति-आधारित मेट्रिक्स को नीति-आधारित शुद्धता मापों, जैसे कि डिफेन्सिबिलिटी इंडेक्स (Defensibility Index) और प्रोबेबिलिस्टिक डिफेन्सिबिलिटी सिग्नल (Probabilistic Defensibility Signal) से बदल देता है, ताकि कंटेंट मॉडरेशन में वैध निर्णयों और वास्तविक त्रुटियों के बीच सटीक रूप से अंतर किया जा सके।

मूल लेखक: Michael O'Herlihy, Rosa Català

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael O'Herlihy, Rosa Català

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यह शोध पत्र एक ऐसे निष्कर्ष के साथ एक शोध परिणाम प्रस्तुत करता है जो आश्चर्यजनक है: "जब यह मूल्यांकन किया जाता है कि क्या एक AI नियमों का पालन कर रहा है, तो हमें केवल यह नहीं देखना चाहिए कि क्या वह 'मानवीय राय से सहमत' है।"

जटिल शैक्षणिक शब्दावली के बजाय, आइए इसे "एक ड्रामा प्रोडक्शन सेट" के उदाहरण से समझाएं।


🎬 उपमा: "ड्रामा स्क्रिप्ट समीक्षा" और "निर्देशक का विवेक"

एक ऑनलाइन समुदाय (जैसे, Reddit) एक विशाल ड्रामा सेट की तरह है, जहाँ नियम (पॉलिसी) एक पटकथा (स्क्रिप्ट) के रूप में कार्य करते हैं। AI एक नौसिखिया संपादक की भूमिका निभाता है जो इस स्क्रिप्ट की समीक्षा करता है और निर्णय लेता है: "क्या यह दृश्य प्रसारित किया जा सकता है (Approve), या इसे हटा दिया जाना चाहिए (Remove)?"

पिछले मूल्यांकन के तरीकों ने केवल यह जांचा कि क्या मानवीय समीक्षक (Human) और AI एकमत थे। हालाँकि, यह शोध पत्र उस दृष्टिकोण में एक घातक दोष की ओर इशारा करता है: "सहमति का जाल" (Agreement Trap)।

1. सहमति का जाल (The Agreement Trap)

परिदृश्य: स्क्रिप्ट में लिखा है कि "हिंसक दृश्य प्रतिबंधित हैं।" फिर भी, एक विशेष दृश्य एक अस्पष्ट स्थिति प्रस्तुत करता है: "क्या यह हिंसक है, या इसमें उच्च कलात्मक मूल्य है?"

  • मानवीय समीक्षक A: "यह कलात्मक है; चलिए इसे प्रसारित करते हैं!" (Approve)
  • मानवीय समीक्षक B: "यह हिंसक है; इसे हटा दें!" (Remove)
  • AI: "यह हिंसक है; इसे हटा दें!" (Remove)

पुराने मूल्यांकन पद्धति के तहत, क्योंकि AI मानवीय समीक्षक A से असहमत था, इसे एक त्रुटि (Error) माना गया। हालाँकि, AI ने स्क्रिप्ट (नियमों) को सही ढंग से पढ़ा था। AI ने "इसे हटा दें" का निष्कर्ष निकाला, जो कि स्क्रिप्ट के आधार पर एक तर्कसंगत निर्णय (Defensible decision) है।

मुख्य संदेश: केवल इसलिए कि AI किसी मनुष्य से असहमत है, इसका मतलब यह नहीं है कि वह अनिवार्य रूप से गलत है। यदि AI नियमों की व्याख्या के दायरे (ग्रे एरिया) के भीतर एक तार्किक रूप से सुदृढ़ निर्णय लेता है, तो यह 'त्रुटि' नहीं बल्कि एक 'तर्कसंगत निर्णय' है।

2. नया दिशा-सूचक: "डिफेंसिबिलिटी इंडेक्स (DI)" और "एम्बिग्युटी इंडेक्स (AI)"

यह शोध पत्र AI के मूल्यांकन के लिए दो नए मेट्रिक्स प्रस्तावित करता है:

  • डिफेंसिबिलिटी इंडेक्स (DI - रक्षात्मकता सूचकांक):
    • उपमा: "स्क्रिप्ट (नियमों) के आधार पर यह निर्णय कितना तार्किक रूप से बचाव योग्य है?"
    • यदि AI का निर्णय स्क्रिप्ट के शाब्दिक पाठ या तार्किक प्रवाह का अनुसरण करता है, तो उसे 100 अंक मिलते हैं, भले ही वह मनुष्यों से असहमत हो।
  • एम्बिग्युटी इंडेक्स (AI - अस्पष्टता सूचकांक):
    • उपमा: "क्या स्क्रिप्ट में यह दृश्य वास्तव में अस्पष्ट है?"
    • यह उन अनुभागों की पहचान करता है जहाँ स्क्रिप्ट इतनी अमूर्त है कि मनुष्य और AI दोनों संघर्ष करते हैं और सोचते हैं, "हमें क्या करना चाहिए?" यह AI की गलती नहीं है, बल्कि एक संकेत है कि स्क्रिप्ट (नियम) अपूर्ण हैं।

3. AI के "आंतरिक विचारों" को पढ़ने की तकनीक (PDS)

AI आमतौर पर कहता है, "मैं 99% आश्वस्त हूँ!" लेकिन अक्सर भ्रमित महसूस करता है। इस शोध पत्र ने एक ऐसी तकनीक विकसित की है जो निर्णय लेने से ठीक पहले, अपने तर्क को समझाने की प्रक्रिया में AI द्वारा उपयोग किए गए शब्दों की संभावना (Log-probs) का विश्लेषण करती है।

  • उपमा: AI द्वारा "इसे हटा दें!" कहने से ठीक पहले, उसके आंतरिक विचारों की थरथराहट का पता लगाना, जब वह स्वयं से बुदबुदाता है, "हम्म... स्क्रिप्ट के पेज 3 के अनुसार... लेकिन पेज 5 भी कहता है..."
  • यदि यह "आंतरिक विचारों की थरथराहट" बड़ी है, तो इसका अर्थ है कि AI संघर्ष कर रहा है क्योंकि नियम अस्पष्ट हैं। यह संकेत हमें पहले से बताता है कि कहाँ मानवीय हस्तक्षेप की आवश्यकता है।

4. वास्तविक दुनिया का अनुप्रयोग: "गवर्नेंस गेट" (Governance Gate)

इस तकनीक को वास्तविक प्रणालियों पर लागू करने से निम्नलिखित लाभ होते हैं:

  • सुरक्षित स्वचालन (Safe Automation): जब AI स्पष्ट रूप से नियमों को समझता है और एक तार्किक निर्णय लेता है (उच्च डिफेंसिबिलिटी इंडेक्स), तो इसे स्वचालित रूप से संसाधित (Processed) किया जाता है।
  • मानवीय हस्तक्षेप (Human Intervention): जब नियम बहुत अस्पष्ट होते हैं या AI संघर्ष कर रहा होता है (उच्च एम्बिग्युटी इंडेक्स), तो मनुष्य इसकी पुन: समीक्षा करते हैं।
  • परिणाम: पुराने तरीके ने AI के 80% सही निर्णयों को गलत तरीके से "त्रुटि" के रूप में लेबल किया था, जबकि इस नई विधि ने 78.6% कार्यों को स्वचालित करते हुए जोखिमों को 64.9% तक कम करने का परिणाम प्राप्त किया।

📝 एक पंक्ति का सारांश

"केवल इसलिए कि AI मनुष्यों से असहमत है, इसका मतलब यह नहीं है कि वह अनिवार्य रूप से गलत है। यदि AI नियमों (स्क्रिप्ट) के आधार पर एक तार्किक रूप से सुदृढ़ निर्णय लेता है, तो हमें उस 'अंतर' को 'त्रुटि' के रूप में नहीं बल्कि एक 'तर्कसंगत व्याख्या' के रूप में पहचानना चाहिए, और केवल वहीं हस्तक्षेप करना चाहिए जहाँ नियम अस्पष्ट हों।"

यह शोध पत्र तर्क देता है कि AI का मूल्यांकन केवल एक "मानव की नकल करने वाली मशीन" के रूप में नहीं, बल्कि "नियमों की तार्किक व्याख्या करने वाले विशेषज्ञ" के रूप में किया जाना चाहिए, जिससे सुरक्षित और अधिक कुशल AI संचालन का मार्ग प्रशस्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →