← नवीनतम पेपर
🤖 AI

AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

यह शोध पत्र एंटरप्राइज एआई प्रणालियों के लिए एक व्यापक, परिचालन रूप से तैनात करने योग्य आश्वासन रणनीति प्रस्तावित करता है जो पारंपरिक शुद्धता सत्यापन (correctness verification) से ध्यान हटाकर एक संरचित विफलता वर्गीकरण (failure taxonomy), एक संशोधित पांच-स्तरीय आश्वासन पिरामिड और एकीकृत मूल्यांकन-संचालित इंजीनियरिंग प्रथाओं के माध्यम से निरंतर जोखिम न्यूनीकरण पर केंद्रित करता है।

मूल लेखक: Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

प्रकाशित 2026-05-25
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने व्यवसाय को चलाने के लिए अविश्वसनीय रूप से प्रतिभाशाली, लेकिन थोड़े अप्रत्याशित, सलाहकारों (consultants) की एक टीम रख रहे हैं। ये सलाहकार इतने स्मार्ट हैं कि वे कविता लिख सकते हैं, गणित की समस्याएँ हल कर सकते हैं और कानूनी अनुबंध तैयार कर सकते हैं। लेकिन यहाँ एक पेंच है: उनके पास कोई निश्चित नियम पुस्तिका नहीं है। वे किताबों के एक विशाल पुस्तकालय से सीखते हैं, और हर बार जब वे किसी प्रश्न का उत्तर देते हैं, तो वे जो कुछ भी पहले पढ़ चुके हैं उसके आधार पर सबसे संभावित उत्तर का अनुमान लगाते हैं। कभी-कभी वे सही अनुमान लगाते हैं। कभी-कभी वे आत्मविश्वास के साथ पूरी तरह गलत भी होते हैं।

यह पेपर, जिसे Thoughtworks के विशेषज्ञों द्वारा लिखा गया है, यह तर्क देता है कि हम इन "AI सलाहकारों" का परीक्षण उसी तरह नहीं कर सकते जैसे हम पारंपरिक कंप्यूटर सॉफ़्टवेयर का परीक्षण करते हैं।

यहाँ उनकी रणनीति का विवरण दिया गया है, जिसे सरल शब्दों और उपमाओं (analogies) के माध्यम से समझाया गया है।

1. पुराना तरीका बनाम नया तरीका

पुराना तरीका (पारंपरिक सॉफ़्टवेयर):
एक वेंडिंग मशीन की कल्पना करें। आप "A1" दबाते हैं, और चिप्स का एक पैकेट बाहर आता है। यदि आप फिर से "A1" दबाते हैं, तो आपको वही सटीक चिप्स का पैकेट मिलता है। यदि ऐसा नहीं होता है, तो मशीन खराब है। इसका परीक्षण करना आसान है: आपको बस यह जांचना है कि हर बार सही चीज़ बाहर आई या नहीं।

नया तरीका (AI सिस्टम):
अब एक मानव ट्रैवल एजेंट की कल्पना करें। आप पूछते हैं, "पेरिस की यात्रा की योजना बनाएं।"

  • रन 1: वे एफिल टॉवर के पास एक होटल का सुझाव देते हैं।
  • रन 2: वे लौवर (Louvre) के पास एक होटल का सुझाव देते हैं।
  • रन 3: वे ध्यान भटकने के कारण गलती से लंदन की यात्रा बुक कर देते हैं।

आप यह नहीं कह सकते कि "रन 2 गलत है" सिर्फ इसलिए क्योंकि यह रन 1 से अलग है। दोनों वैध हैं। लेकिन आप कह सकते हैं कि रन 3 एक आपदा है।
पेपर का बिंदु: हम AI का परीक्षण वेंडिंग मशीन की तरह "पास/फेल" (Pass/Fail) की जाँच करके नहीं कर सकते। हमें जोखिम न्यूनीकरण (Risk Reduction) के लिए परीक्षण करना होगा। हम यह साबित करने की कोशिश नहीं कर रहे हैं कि AI पूर्ण है; हम यह साबित करने की कोशिश कर रहे हैं कि यह कुछ खतरनाक या मूर्खतापूर्ण नहीं करेगा।

2. "AI विफलता वर्गीकरण" (AI विफल होने के 5 तरीके)

लेखकों का कहना है कि AI पुराने सॉफ़्टवेयर की तरह केवल "क्रैश" नहीं होता। यह पांच विशिष्ट, चालाकी भरे तरीकों से विफल होता है। इन्हें आपकी यात्रा को बिगाड़ने वाले पांच तरीकों के रूप में सोचें:

  1. आत्मविश्वासी झूठा (ग्राउंडिंग विफलता - Grounding Failure): एजेंट आपको एक बेहतरीन यात्रा कार्यक्रम देता है, लेकिन वह होटल अस्तित्व में ही नहीं है। उन्होंने इसे बना दिया क्योंकि वे आत्मविश्वास से भरे हुए लग रहे थे।
  2. गलत रास्ता (तर्क विफलता - Reasoning Failure): एजेंट आपको सही होटल तक पहुँचा देता है, लेकिन वे वहाँ पहुँचने के लिए एक अजीब, महंगा रास्ता लेते हैं, या वे आपके "सीढ़ियों के बिना" वाले नियम को भूल जाते हैं।
  3. धोखेबाज (सुरक्षा विफलता - Safety Failure): कोई व्यक्ति एजेंट को आपका क्रेडिट कार्ड नंबर बताने या नियमों को तोड़ने के लिए बहला लेता है।
  4. टीम की लड़ाई (समन्वय विफलता - Coordination Failure): आपके पास तीन एजेंट मिलकर काम कर रहे हैं (एक उड़ान बुक करता है, एक होटल, और एक ईमेल भेजता है)। वे एक-दूसरे से बात करते हैं, लेकिन वे संदेश को गलत समझ लेते हैं। उड़ान मंगलवार के लिए बुक है, लेकिन होटल बुधवार के लिए है।
  5. मूड स्विंग (स्टोकेस्टिक विफलता - Stochastic Failure): एजेंट 10 में से 9 बार बिल्कुल सही काम करता है, लेकिन 10वीं बार में, वह अचानक अजीब व्यवहार करने लगता है। आप अनुमान नहीं लगा सकते कि यह कब होगा।

3. "AI आश्वासन पिरामिड" (परीक्षण कैसे करें)

परीक्षणों की एक सपाट सूची के बजाय, पेपर एक पिरामिड का प्रस्ताव करता है। यह 5 मंजिलों वाली एक इमारत है। आप निचली मंजिलों पर गलतियों को पकड़ना चाहते हैं क्योंकि यह सस्ता और आसान है। यदि आप शीर्ष मंजिल तक प्रतीक्षा करते हैं, तो गलती पूरी यात्रा को बर्बाद कर चुकी होगी।

  • मंजिल 0 (नींव): प्लंबिंग की जाँच करना। क्या कंप्यूटर कोड वास्तव में डेटाबेस से जुड़ रहा है? क्या प्रॉम्प्ट (दिया गया निर्देश) सही प्रारूप में लिखा गया है? यह 100% निश्चित है।
  • मंजिल 1 (घटक/Components): व्यक्तिगत एजेंटों का परीक्षण करना। क्या "फ्लाइट एजेंट" को उड़ानें खोजने का तरीका पता है? क्या "सेफ्टी एजेंट" को बुरे शब्दों को रोकने का तरीका पता है?
  • मंजिल 2 (एकल एजेंट): एक बहु-चरणीय कार्य करने वाला एकल एजेंट। "मेरे लिए फ्लाइट बुक करें।" क्या उन्होंने सही उड़ान चुनी? क्या उन्होंने सही तारीख चुनी? क्या उन्हें आपका नाम याद है?
  • मंजिल 3 (टीम): एजेंट एक-दूसरे से कैसे बात करते हैं, इसका परीक्षण करना। क्या "फ्लाइट एजेंट" ने "होटल एजेंट" को सही तारीखें बताईं? क्या उन्होंने जानकारी सही ढंग से आगे बढ़ाई?
  • मंजिल 4 (व्यावसायिक परिणाम): अंतिम परीक्षण। क्या ग्राहक को वास्तव में वह छुट्टी मिली जिससे वह खुश था? क्या कंपनी ने कानून का पालन किया? यह परीक्षण करने के लिए सबसे महंगी मंजिल है क्योंकि इसके लिए परिणामों को देखने के लिए मनुष्यों की आवश्यकता होती है।

स्वर्ण नियम: त्रुटि को मंजिल 0 या 1 पर पकड़ें। यदि आप केवल मंजिल 4 पर परीक्षण करते हैं, तो आप तब तक प्रतीक्षा कर रहे हैं जब तक ग्राहक शिकायत न करने लगे, तभी आपको पता चलेगा कि कुछ गलत है।

4. RAG: "पुस्तकालय" की समस्या

कई कंपनियाँ RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक प्रणाली का उपयोग करती हैं।

  • उपमा: कल्पना कीजिए कि AI एक परीक्षा देने वाला छात्र है।
    • RAG के बिना: छात्र केवल अपनी याददाश्त पर निर्भर रहता है। वह चीजों को गलत याद रख सकता है (भ्रम/Hallucinate)।
    • RAG के साथ: छात्र को उत्तर देने से पहले एक विशिष्ट पाठ्यपुस्तक (कंपनी का डेटा) खोलने की अनुमति है।
  • परीक्षण चुनौती: आपको दो चीजों को अलग-अलग परीक्षण करना होगा:
    1. क्या छात्र ने पाठ्यपुस्तक में सही पृष्ठ खोजा? (रिट्रीवल/Retrieval)
    2. क्या छात्र ने उस पृष्ठ को पढ़ा और उसके आधार पर सही उत्तर दिया? (जनरेशन/Generation)
    • यदि उत्तर गलत है, तो आपको जानना होगा: क्या उन्होंने गलत पृष्ठ देखा, या उन्होंने सही पृष्ठ पढ़ा और उसे गलत समझा?

5. "साइलेंट ड्रिफ्ट" (मॉडल बदल जाता है)

पारंपरिक सॉफ़्टवेयर में, यदि आप एक लाइब्रेरी अपडेट करते हैं, तो आप जानते हैं कि क्या बदला है।
AI में, "शिक्षक" (AI मॉडल प्रदाता) बीच सेमेस्टर में चुपचाप पाठ्यपुस्तक बदल सकता है।

  • जोखिम: कल, AI आपके नियम "हमेशा नॉन-स्टॉप उड़ान बुक करें" का पालन कर रहा था। आज, एक साइलेंट अपडेट के बाद, यह स्टॉपओवर वाली उड़ानें बुक करने लगा है।
  • समाधान: आपको निरंतर मूल्यांकन (Continuous Evaluation) की आवश्यकता है। आप केवल लॉन्च करने से पहले एक बार परीक्षण नहीं कर सकते। आपको हर दिन एक टेस्ट सुइट चलाना होगा, जैसे कि दैनिक स्वास्थ्य जांच, यह सुनिश्चित करने के लिए कि AI "ड्रिफ्ट" नहीं हुआ है और बुरा व्यवहार करना शुरू नहीं कर दिया है।

6. बड़ा बदलाव: QA से "इवैल्यूएशन इंजीनियरिंग" तक

पेपर निष्कर्ष निकालता है कि हमें एक नई भूमिका की आवश्यकता है।

  • पुराना QA: "क्या कोड चल रहा है? क्या बटन काम कर रहा है?"
  • नई इवैल्यूएशन इंजीनियरिंग: "क्या AI सुरक्षित रूप से व्यवहार करता है? क्या यह सुसंगत है? क्या इसने भ्रम (hallucinate) पैदा किया?"

यह केवल अधिक परीक्षण लिखने के बारे में नहीं है। यह एक प्लेटफॉर्म बनाने के बारे में है जहाँ:

  • हमारे पास "गोल्डन डेटासेट्स" (प्रश्न और उत्तर के आदर्श उदाहरण) हैं जिन्हें परीक्षण के लिए उपयोग किया जा सके।
  • हमारे पास "जज" (अन्य AI या मनुष्य) हैं जो उत्तरों को ग्रेड दे सकें।
  • हम प्रॉम्प्ट (निर्देश) को कोड के रूप में मानते हैं जिसे हर बार जब AI मॉडल बदलता है, तो वर्जन-कंट्रोल और टेस्ट किया जाना चाहिए।

सारांश

पेपर कहता है: AI को पूर्ण बनाने की कोशिश न करें। इसे सुरक्षित बनाना शुरू करें।
AI को वेंडिंग मशीन की तरह न मानें। इसे प्रतिभाशाली लेकिन अप्रत्याशित इंटर्न की एक टीम की तरह मानें। आपको जाँच की एक सख्त प्रणाली (पिरामिड), उन्हें झूठ पकड़ने का एक तरीका (वर्गीकरण), और एक दैनिक दिनचर्या की आवश्यकता है ताकि यह सुनिश्चित हो सके कि वे अपने प्रशिक्षण को भूले नहीं हैं (निरंतर निगरानी)। यदि आप ऐसा करते हैं, तो आप उन पर अपने व्यवसाय के साथ भरोसा कर सकते हैं। यदि आप नहीं करते हैं, तो आप अंधेरे में उड़ रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →