← नवीनतम पेपर
🤖 AI

Adaptive auditing of AI systems with anytime-valid guarantees

यह शोध पत्र एक अनुकूलन योग्य ऑडिटिंग फ्रेमवर्क पेश करता है जो जनरेटिव एआई सिस्टम के लिए सेफ एनीटाइम-वैलिड इन्फरेंस (SAVI) और एक "टेस्टिंग बाय बेटिंग" दृष्टिकोण का लाभ उठाता है ताकि पारंपरिक तरीकों की तुलना में काफी कम अवलोकनों के साथ मॉडल मजबूती पर सांख्यिकीय रूप से कठोर, एनीटाइम-वैलिड गारंटी प्रदान की जा सके।

मूल लेखक: Siyu Zhou, Patrick Vossler, Venkatesh Sivaraman, Yifan Mai, Jean Feng

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyu Zhou, Patrick Vossler, Venkatesh Sivaraman, Yifan Mai, Jean Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए, सुपर-स्मार्ट रोबोट शेफ के लिए एक गुणवत्ता नियंत्रण निरीक्षक (quality control inspector) हैं। आप यह जानना चाहते हैं कि क्या यह शेफ वास्तव में "मजबूत" (robust) है—यानी, क्या यह आपके द्वारा दिए गए किसी भी सामग्री के साथ एक आदर्श भोजन बना सकता है, या इसमें कुछ गुप्त कमजोरियां हैं (जैसे कि ब्रेड थोड़ी बासी होने पर टोस्ट जला देना)?

समस्या यह है कि हर एक संभावित सामग्री संयोजन की जांच करने में बहुत समय लगता है और बहुत अधिक लागत आती है। इसलिए, सब कुछ जांचने के बजाय, आप एक स्मार्ट, अनुकूलन योग्य निरीक्षक (adaptive inspector) बनने का निर्णय लेते हैं। आप रोबोट की पिछली गलतियों को देखते हैं, अनुमान लगाते हैं कि अगली बार कहां विफलता हो सकती है, और केवल उन्हीं कठिन स्थानों का परीक्षण करते हैं।

यह शोध पत्र ठीक इसी तरह काम करने का एक नया, गणितीय रूप से कठोर तरीका पेश करता है, बिना सांख्यिकी के नियमों को तोड़े। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "झांकना" (Peeking) नियमों को तोड़ देता है

पारंपरिक विज्ञान में, यदि आप किसी परिकल्पना (hypothesis) का परीक्षण करना चाहते हैं, तो आपको पहले से ही यह तय करना होगा कि आप कितने परीक्षण करेंगे और कौन से परीक्षण करेंगे। यदि आप बीच में ही अपना विचार बदल देते हैं (जैसे, "ओह, यह परीक्षण दिलचस्प लग रहा है, चलिए एक और करते हैं!"), तो आप खुद को धोखा देने का जोखिम उठाते हैं कि आपने कोई समस्या ढूंढ ली है जबकि वास्तव में ऐसी कोई समस्या नहीं थी। इसे "झांकना" (peeking) कहा जाता है, और यह आमतौर पर गणित को खराब कर देता है।

लेकिन वास्तविक दुनिया में, AI ऑडिटर्स को झांकने की आवश्यकता होती है। उन्हें जो वे देखते हैं उसके आधार पर अपने परीक्षणों को अनुकूलित करने की आवश्यकता होती है। लेखक कहते हैं: "ठीक है, झांकने की अक्षमता का ढोंग करना बंद करते हैं। आइए एक नया नियम पुस्तिका बनाते हैं जो झांकने की अनुमति देती है लेकिन गणित को ईमानदार रखती है।"

2. समाधान: एक "द्वंद्व" खेल (A "Dueling" Game)

लेखक ऑडिट को दो खिलाड़ियों के बीच एक खेल के रूप में देखने का प्रस्ताव देते हैं: द मॉडल (रोबोट शेफ) और द ऑडिटर (आप, निरीक्षक)

  • खिलाड़ी 1: मॉडल का दावा (दावा: "मैं पूर्ण हूँ")
    मॉडल कहता है: "मैं मजबूत हूँ! आप मुझे सामग्रियों का कोई भी समूह दें, मैं उसे संभाल सकता हूँ। मेरी कोई कमजोरी नहीं है।"

    • लक्ष्य: यदि आप एक भी ऐसा समूह ढूंढ लेते हैं जहाँ रोबोट विफल हो जाता है, तो आप जीत जाते हैं (आप मॉडल के दावे को खारिज कर देते हैं)।
  • खिलाड़ी 2: ऑडिटर का दावा (दावा: "मैं दोष ढूंढ सकता हूँ")
    ऑडिटर कहता है: "मेरे पास एक रणनीति है। यदि मैं पर्याप्त समय तक परीक्षण करता रहूँ, तो मैं अंततः एक कमजोरी ढूंढ लूँगा।"

    • लक्ष्य: यदि आपके पास समय या संसाधन समाप्त हो जाते हैं और फिर भी आप कोई दोष नहीं ढूंढ पाते हैं, तो आप जीत जाते हैं (आप ऑडिटर के दावे को खारिज कर देते हैं, जिसका अर्थ है कि रोबोट ने आपके विशिष्ट ऑडिट को पास कर लिया है)।

जादुई मोड़:
आमतौर पर, ये दोनों दावे पूर्णतः विपरीत नहीं होते हैं। लेकिन लेखक सिद्ध करते हैं कि यदि ऑडिटर पर्याप्त स्मार्ट (asymptotically consistent) है, तो ये दोनों दावे एक-दूसरे के सटीक दर्पण बन जाते हैं।

  • यदि मॉडल वास्तव में पूर्ण है, तो ऑडिटर अंततः हार मान लेगा और कहेगा, "मैं कोई दोष नहीं ढूंढ पा रहा हूँ।"
  • यदि मॉडल में कोई दोष है, तो स्मार्ट ऑडिटर अंततः उसे ढूंढ लेगा।

यह ऑडिट को एक बाइनरी स्विच में बदल देता है: या तो रोबोट वैश्विक रूप से मजबूत है, या नहीं है।

3. तंत्र: "दांव लगाकर परीक्षण करना" (Testing by Betting)

आप झांकते हुए भी गणित को ईमानदार कैसे रख सकते हैं? लेखक "सेफ एनीटाइम-वैलिड इन्फरेंस" (SAVI) का उपयोग करते हैं, जिसे वे "दांव लगाकर परीक्षण करना" के रूप में वर्णित करते हैं।

कल्पना कीजिए कि आप एक कैसीनो में एक जुआरी हैं:

  • द हाउस (शून्य परिकल्पना/Null Hypothesis): कैसीनो दावा करता है कि खेल निष्पक्ष है (रोबोट मजबूत है)।
  • द गैम्बलर (ऑडिटर): आप कैसीनो के खिलाफ दांव लगा रहे हैं। आप इस बात पर दांव लगाते हैं कि अगला विशिष्ट परीक्षण मामला जिसमें आप भाग लेंगे, उसमें रोबोट विफल हो जाएगा।
  • नियम: यदि कैसीनो वास्तव में निष्पक्ष है (रोबोट पूर्ण है), तो आप लगातार अपने पैसे को दोगुना नहीं कर पाएंगे। आपकी "संपत्ति" (एक सांख्यिकीय स्कोर जिसे e-process कहा जाता है) कम रहनी चाहिए।
  • जीत: यदि आप वास्तव में बहुत सारी "संपत्ति" (आपका स्कोर एक उच्च सीमा को पार कर जाता है) जमा करने में सफल होते हैं, तो यह साबित करता है कि कैसीनो में हेरफेर किया गया है (रोब적으로 रोबोट में एक दोष है)।

क्योंकि "e-processes" के पीछे का गणित ऐसा है, आप किसी भी क्षण दांव लगाना बंद कर सकते हैं। यदि आपकी संपत्ति अधिक है, तो आप तुरंत रुक सकते हैं और कह सकते हैं, "मैं जीत गया, रोबोट खराब है!" बिना इस बात की चिंता किए कि आपने झांककर धोखाधड़ी की है।

4. परिणाम: तेज़ और स्मार्ट

लेखकों ने इस पद्धति का दो तरीकों से परीक्षण किया:

  1. सिम्युलेटेड डेटा: उन्होंने ज्ञात दोषों वाले नकली AI परिदृश्य बनाए। उनकी "दांव लगाने" वाली विधि ने पारंपरिक तरीकों की तुलना में बहुत तेज़ी से (कभी-कभी केवल 20 परीक्षणों के साथ) दोषों को खोज निकाला, जिन्हें पूर्व-नियोजित, कठोर परीक्षणों की आवश्यकता थी।
  2. वास्तविक दुनिया का मेडिकल AI: उन्होंने एक ऐसे AI का परीक्षण किया जो सामाजिक मुद्दों (जैसे बेघर होना या मानसिक स्वास्थ्य) को खोजने के लिए डॉक्टर के नोट्स पढ़ता है। उनकी विधि ने सफलतापूर्वक पहचान लिया कि AI कुछ श्रेणियों (जैसे "पेशेंट कॉन्टैक्ट्स") में खराब था और दोष की पुष्टि होते ही ऑडिट को जल्दी रोक दिया।

सारांश

यह शोध पत्र AI ऑडिटर्स को लचीला होने का एक "सुरक्षित" तरीका देता है। एक कठोर, पूर्व-लिखित स्क्रिप्ट से बंधे रहने के बजाय, अब ऑडिटर्स वास्तविक समय में कमजोरियों को खोजने के लिए अनुकूलित हो सकते हैं। वे एक "दांव लगाने" वाली प्रणाली का उपयोग करते है जो गारंटी देती है: यदि आप एक दोष पाते हैं, तो वह एक वास्तविक दोष है। यदि आप एक कठोर खोज के बाद भी एक दोष नहीं पाते हैं, तो सिस्टम संभवतः मजबूत है।

यह "AI को तोड़ने की कोशिश करने" की अराजक प्रक्रिया को एक गणितीय रूप से सुदृढ़ खेल में बदल देता है जहाँ आप एक निश्चित उत्तर मिलने के क्षण ही खेलना बंद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →