← नवीनतम पेपर
💻 computer science

From Untestable to Testable: Metamorphic Testing in the Age of LLMs

यह शोध पत्र स्केलेबल ग्राउंड ट्रुथ (scalable ground truth) की अनुपस्थिति में अविश्वसनीय LLM-एकीकृत प्रणालियों के परीक्षण की चुनौती को संबोधित करने के लिए मेटामॉर्फिक टेस्टिंग (Metamorphic Testing) का प्रस्ताव करता है, जो निष्पादन योग्य टेस्ट ओरेकल (executable test oracles) बनाने के लिए कई परीक्षण निष्पादनों के बीच संबंधों का उपयोग करता है।

मूल लेखक: Valerio Terragni

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Valerio Terragni

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी- little ही एक बेहद प्रतिभाशाली लेकिन थोड़े अराजक (chaotic) नए सहायक को काम पर रखा है। यह सहायक अविश्वसनीय रूप से तेज़ है, बहुत कुछ जानता है, और सेकंडों में कविताएँ, कोड और ईमेल लिख सकता है। लेकिन एक पेंच है: वे कभी-कभी पूरे आत्मविश्वास के साथ झूठ भी बोलते हैं। वे तथ्य गढ़ सकते हैं, खुद का खंडन कर सकते हैं, या आपके पूछने के तरीके के आधार पर आपको दो अलग-अलग उत्तर दे सकते हैं।

आज के लार्ज लैंग्वेज मॉडल्स (LLMs) बिल्कुल ऐसे ही हैं। वे हमारे सॉफ़्टवेयर को शक्ति दे रहे हैं, लेकिन वे भरोसेमंद नहीं हैं।

इंजीनियरों के लिए बड़ी समस्या यह है: आप किसी चीज़ का परीक्षण कैसे करें जब आपको "सही" उत्तर ही पता न हो?

पुराना तरीका: "उत्तर कुंजी" की समस्या

पारंपरिक सॉफ़्टवेयर टेस्टिंग में, आपके पास एक "उत्तर कुंजी" (जिसे ग्राउंड ट्रुथ/Ground Truth कहा जाता है) होती है।

  • उदाहरण: यदि आप कैलकुलेटर से पूछते हैं "2 + 2", तो उत्तर कुंजी कहती है "4"। यदि कैलकुलेटर "5" कहता है, तो आप जानते हैं कि वह खराब है।

लेकिन AI के साथ, एक "उत्तर कुंजी" बनाना एक दुःस्वप्न जैसा है।

  • यदि आप AI से "उदासी" पर एक कविता लिखने को कहते हैं, तो वहाँ केवल एक "सही" कविता नहीं होती। लाखों अच्छी कविताएँ हो सकती हैं।
  • AI का ठीक से परीक्षण करने के लिए, आपको लाखों कविताओं को पढ़ने और उन्हें ग्रेड देने के लिए मनुष्यों की आवश्यकता होगी। यह बहुत महंगा और धीमा है। यह एक रोबोट द्वारा लिखे गए होमवर्क को ग्रेड करने के लिए लाखों शिक्षकों को काम पर रखने जैसा है।

नया समाधान: "मेटामॉर्फिक" जासूस

लेखक, वैलेरियो टेरग्नी (Valerio Terragni) एक चतुर तकनीक सुझाते हैं जिसे मेटामॉर्फिक टेस्टिंग (MT) कहा जाता है। "सही उत्तर क्या है?" पूछने के बजाय, हम पूछते हैं, "यदि मैं प्रश्न को थोड़ा बदल दूँ, तो उत्तर कैसे बदलना चाहिए?"

इसे एक क्विज़ के बजाय एक जादुई दर्पण या भौतिकी प्रयोग की तरह समझें।

उपमा: "परछाई" का परीक्षण

कल्पना कीजिए कि आप एक छाया कठपुतली थिएटर (shadow puppet theater) का परीक्षण कर रहे हैं। आपको यह जानने की ज़रूरत नहीं है कि परछाई का सटीक आकार क्या है, बस यह जानने के लिए कि कठपुतली चलाने वाला सही काम कर रहा है या नहीं। आपको बस प्रकाश के नियमों को जानना है:

  1. नियम: यदि मैं प्रकाश स्रोत को बाईं ओर ले जाता हूँ, तो परछाई को दाईं ओर जाना चाहिए।
  2. परीक्षण: आपको इस बात की परवाह नहीं है कि परछाई कैसी दिखती है। आप बस प्रकाश को हिलाते हैं। यदि परछाई दाईं ओर नहीं जाती है, तो आप जानते हैं कि कुछ गड़बड़ है, भले ही आप "परफेक्ट" परछाई नहीं जानते हों।

सॉफ्टवेयर के संदर्भ में, इस नियम को मेटामॉर्फिक रिलेशन (MR) कहा जाता है।

यह वास्तव में कैसे काम करता है

लेखक की टीम ने लोकप्रिय AI मॉडल्स (जैसे GPT-4 और Llama 3) पर 36 अलग-अलग "नियमों" का उपयोग करके इसका परीक्षण किया। यहाँ कुछ सरल उदाहरण दिए गए हैं कि कैसे उन्होंने बिना किसी उत्तर कुंजी के AI का परीक्षण किया:

  • पैराफ्रेस (Paraphrase) नियम: यदि मैं AI से पूछता हूँ, "फ्रांस की राजधानी क्या है?" और फिर पूछता हूँ, "मुझे फ्रांस की राजधानी शहर के बारे में बताओ," तो उत्तर समान होना चाहिए। यदि AI पहले वाले के लिए "पेरिस" कहता है और दूसरे के लिए "लंदन" कहता है, तो यह परीक्षण में विफल रहा।
  • निषेध (Negation) नियम: यदि मैं पूछता हूँ, "क्या यह फिल्म अच्छी है?" और AI कहता है "हाँ," तो मैं पूछता हूँ, "क्या यह फिल्म बुरी है?" तो AI को "नहीं" कहना चाहिए। यदि वह फिर से "हाँ" कहता है, तो वह विफल रहा।
  • स्वैप (Swap) नियम: यदि मैं पूछता हूँ, "जॉन के पिता कौन हैं?" और AI कहता है "मार्क," तो मैं नाम बदल देता हूँ और पूछता हूँ, "मार्क के पिता कौन हैं?" तो उत्तर बदलकर "जॉन" होना चाहिए (या अलग होना चाहिए)। यदि AI बिल्कुल वही उत्तर देता है, तो वह विफल रहा।

परिणाम: एक मिला-जुला अनुभव

टीम ने लगभग 560,000 ऐसे परीक्षण किए।

  • अच्छी खबर: AI मॉडल औसतन 18% बार विफल हुए। कुछ विशिष्ट नियमों ने 80% तक त्रुटियों को पकड़ा। इसका मतलब है कि मेटामॉर्फिक टेस्टिंग एक शक्तिशाली "बग डिटेक्टर" है जो बिना हर उत्तर को इंसानों द्वारा ग्रेड किए काम करता है।
  • बुरी खबर: कभी-कभी AI चालाक होता है। यदि आप प्रश्न की शब्दावली बदलते हैं, तो अर्थ थोड़ा बदल सकता है जिसे एक इंसान नहीं नोटिस करेगा, जिससे AI ऐसा लग सकता है जैसे वह विफल हो गया जबकि वास्तव में वह नहीं हुआ। यह वैसा ही है जैसे हवा चलने के कारण "परछाई" थोड़ी हिल गई हो, न कि इसलिए कि कठपुतली चलाने वाले ने गड़बड़ की। शोधकर्ताओं ने पाया कि "विफलताओं" में से लगभग 62% वास्तविक बग थे।

भविष्य के लिए यह क्यों महत्वपूर्ण है

लेखक का तर्क है कि हमें "उत्तर कुंजियों" के बनने का इंतज़ार नहीं करना चाहिए। इसके बजाय, कंपनियों को आज ही अपने सॉफ़्टवेयर में इन "छाया नियमों" (मेटामॉर्फिक रिलेशंस) को बनाना शुरू कर देना चाहिए।

  • इंजीनियरों के लिए: आपको लाखों मानव ग्रेडर्स की आवश्यकता नहीं है। आपको बस कुछ स्मार्ट नियमों (जैसे "यदि मैं इन शब्दों को बदल दूँ, तो उत्तर पलट जाना चाहिए") की आवश्यकता है। एक बार जब आप वे नियम लिख लेते हैं, तो कंप्यूटर स्वचालित रूप से, सस्ते में और तेज़ी से लाखों परीक्षण चला सकता है।
  • भविष्य के लिए: जैसे-जैसे AI कोड लिखना और "एजेंट" (कार्य करने वाले रोबोट) के रूप में कार्य करना शुरू करेगा, ये नियम और भी महत्वपूर्ण हो जाएंगे। उदाहरण के लिए, यदि कोई AI एजेंट फ्लाइट बुक करने वाला है, तो इससे कोई फर्क नहीं पड़ना चाहिए कि वह तारीख चेक करने से पहले या बाद में कीमत चेक करता है—अंतिम परिणाम समान होना चाहिए।

मुख्य निष्कर्ष (The Bottom Line)

AI का परीक्षण करना कठिन है क्योंकि हम हमेशा "सही" उत्तर नहीं जान सकते। लेकिन मेटामॉर्फिक टेस्टिंग खेल बदल देती है। "परफेक्ट" उत्तर खोजने के बजाय, हम सुसंगत व्यवहार (consistent behavior) देखते हैं।

यह कार का परीक्षण करने जैसा है कि क्या वह एक विशिष्ट गंतव्य तक पहुँचती है, इसके बजाय यह जाँचने के लिए कि: "यदि मैं स्टीयरिंग व्हील को बाईं ओर घुमाता हूँ, तो क्या कार बाईं ओर जाती है?" यदि कार दाईं ओर जाती है, तो आप जानते हैं कि वह खराब है, भले ही आप यह नहीं जानते कि उसे वास्तव में कहाँ गाड़ी चलानी चाहिए।

यह सुनिश्चित करने के लिए कि AI-संचालित भविष्य सुरक्षित, विश्वसनीय और वास्तव में काम करने वाला हो, हमारे पास मौजूद सबसे तेज़ औजारों में से एक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →