Tricky: Towards a Benchmark for Evaluating Human and LLM Error Interactions
यह शोध पत्र Tricky को प्रस्तुत करता है, जो कई प्रोग्रामिंग भाषाओं में मानव-लिखित दोषों को LLM-इंजेक्टेड त्रुटियों के साथ संवर्धित करने वाला एक हाइब्रिड डेटासेट है, ताकि यह अध्ययन किया जा सके कि मानव और मशीन-जनित बग कैसे परस्पर क्रिया करते हैं, जिससे हाइब्रिड सॉफ्टवेयर विकास वर्कफ़्लो में त्रुटि वर्गीकरण, स्थानीयकरण और मरम्मत के नए मूल्यांकन को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक घर बना रहे हैं। कभी-कभी, मानव वास्तुकार (architect) गलती कर देता है, जैसे कि दरवाजे को सही जगह पर लगाना भूल जाना। दूसरी ओर, एक सुपर-स्मार्ट रोबोट सहायक घर बनाने में मदद करता है लेकिन गलती से ऐसी खिड़की लगा देता है जो खुलती नहीं है या एक ईंट को गलत जगह रख देता है।
अब तक, शोधकर्ता मुख्य रूप से इन दो प्रकार की गलतियों का अलग-अलग अध्ययन करते रहे हैं। उन्होंने या तो केवल मानवीय त्रुटियों वाले घरों का अध्ययन किया, या केवल रोबोट की त्रुटियों वाले घरों का। लेकिन वास्तविक दुनिया में, इंसान और रोबोट एक ही घर पर मिलकर काम कर रहे होते हैं, और अक्सर उनकी गलतियाँ एक-दूसरे में उलझ जाती हैं।
यह पेपर Tricky2 पेश करता है, जो एक नया "प्रशिक्षण मैदान" (या बेंचमार्क) है जिसे विशेष रूप से यह अध्ययन करने के लिए डिज़ाइन किया गया है कि क्या होता है जब एक ही कोड में मानवीय गलतियाँ और रोबोट की गलतियाँ आपस में मिल जाती हैं।
यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया और उन्हें क्या पता चला, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. रेसिपी: सामग्रियों को मिलाना
शोधकर्ताओं ने "बग्गी" (buggy) कोड का एक मौजूदा संग्रह लिया जिसे TrickyBugs कहा जाता है। इसे घर के ब्लूप्रिंट्स (नक्शों) के एक बॉक्स के रूप में समझें जिन्हें इंसानों ने बनाया था लेकिन उनमें गलतियाँ रह गई थीं।
Tricky2 बनाने के लिए, उन्होंने केवल पुराने ब्लूप्रिंट्स को फेंका नहीं। इसके बजाय, उन्होंने एक बहुत ही स्मार्ट रोबोट (एक AI जिसे GPT-5 कहा गया है) और एक दूसरे थोड़े अलग रोबोट (OpenAI-oss-20b) को एक पेचीदा काम करने के लिए कहा:
- नियम: "इस ब्लूप्रिंट को देखें जिसमें पहले से ही एक मानवीय गलती है। अपनी ओर से एक नई गलती जोड़ें, लेकिन मानवीय गलती को ठीक न करें। बाकी घर को बिल्कुल वैसा ही रहने दें जैसा वह है।"
- परिणाम: उन्होंने तीन प्रकार के "घर" (डेटासेट) बनाए:
- केवल मानव (Human-Only): मूल ब्लूप्रिंट जिनमें केवल मानवीय त्रुटियाँ थीं।
- केवल रोबोट (Robot-Only): ब्लूप्रिंट जहाँ रोबोट ने एक आदर्श घर पर गलती की।
- "हाइब्रिड" (मानव + रोबोट): सबसे महत्वपूर्ण हिस्सा। ये वे ब्लूप्रिंट हैं जहाँ एक इंसान ने गलती की, और फिर रोबोट ने उसके ऊपर एक दूसरी गलती जोड़ दी।
उन्होंने यह तीन अलग-अलग "भाषाओं" (C++, Python, और Java) के लिए किया, जिससे 11,000 से अधिक मिश्रित कोड उदाहरणों का एक विशाल पुस्तकालय तैयार हुआ।
2. परीक्षण: क्या मरम्मत टीम इसे ठीक कर सकती है?
एक बार जब उन्होंने यह लाइब्रेरी बना ली, तो उन्होंने अन्य AI मॉडलों से "मरम्मत दल" (repair crews) के रूप में कार्य करने के लिए कहा। उन्होंने AI को तीन काम दिए ताकि यह देखा जा सके कि वह इस गड़बड़ी को कितनी अच्छी तरह संभाल सकता है:
- काम 1: जासूस (Classification): क्या AI कोड को देखकर अनुमान लगा सकता है कि, "क्या यह गलती इंसान ने की थी, रोबोट ने, या दोनों ने?"
- काम 2: पहचानकर्ता (Localization): क्या AI ठीक उस लाइन की ओर इशारा कर सकता है जहाँ गलती छिपी हुई है?
- काम 3: सुधारक (Repair): क्या AI वास्तव में कोड को ठीक कर सकता है ताकि घर फिर से काम करने योग्य हो जाए?
3. सरप्राइज: "दोहरी मुसीबत" का प्रभाव (The "Double Trouble" Effect)
शोधकर्ताओं ने कुछ सबसे कठिन समस्याओं के साथ एक छोटा परीक्षण चलाया। यहाँ उन्हें क्या पता चला:
- अकेली गलतियाँ आसान होती हैं: जब AI ने एक ऐसा घर ठीक करने की कोशिश की जिसमें केवल मानवीय गलती थी, या केवल रोबोट की गलती थी, तो वह इसमें काफी अच्छा था।
- मिश्रित गलतियाँ कठिन होती हैं: जब AI ने हाइब्रिड घरों (जहाँ एक मानवीय त्रुटि और एक रोबोट त्रुटि आपस में उलझी हुई थी) को ठीक करने की कोशिश की, तो उसे काफी संघर्ष करना पड़ा।
- वास्तव में, कोड के एक विशिष्ट प्रकार (C++) के लिए, AI हाइब्रिड समस्याओं में से किसी को भी ठीक करने में विफल रहा, जबकि वह एकल-स्रोत वाली समस्याओं को ठीक कर सकता था।
उपमा (Analogy): कल्पना कीजिए कि दो गांठों को सुलझाने की कोशिश कर रहे हैं। यदि केवल एक गांठ है, तो यह आसान है। यदि दो गांठें इस तरह से एक-दूसरे में बंधी हैं कि एक दूसरी को छिपा लेती है, तो यह एक बुरा सपना बन जाता है। पेपर सुझाव देता है कि जब मानवीय और AI त्रुटियाँ परस्पर क्रिया करती हैं, तो वे एक "दोहरी मुसीबत" का प्रभाव पैदा करती हैं जो सबसे स्मार्ट मरम्मत उपकरणों को भी भ्रमित कर देती है।
4. यह क्यों महत्वपूर्ण है
लेखकों का कहना है कि यह तो बस शुरुआत है। वे यह दावा नहीं कर रहे हैं कि वे अभी सभी सॉफ़्टवेयर समस्याओं को हल कर देते हैं। इसके बजाय, वे कह रहे हैं:
- हमें मरम्मत उपकरणों का परीक्षण केवल "शुद्ध" मानवीय कोड या "शुद्ध" रोबोट कोड पर करना बंद करना होगा।
- वास्तविक दुनिया का सॉफ़्टवेयर दोनों का मिश्रण है, और यह मिश्रण अद्वितीय समस्याएँ पैदा करता है जिनके लिए वर्तमान उपकरण तैयार नहीं हैं।
- Tricky2 शोधकर्ताओं के लिए इन "मिश्रित-उत्पत्ति" (mixed-origin) की त्रुटियों का अध्ययन करने के लिए एक नया उपकरण है ताकि वे भविष्य के लिए बेहतर उपकरण बना सकें।
संक्षेप में, पेपर कहता है: "हमने एक विशेष टेस्ट किट बनाई है यह देखने के लिए कि क्या होता है जब मानवीय और रोबोट की गलतियाँ आपस में टकराती हैं। हमने पाया कि जब वे टकराती हैं, तो कोड को ठीक करना बहुत कठिन हो जाता है, और हमें इस विशिष्ट समस्या का अध्ययन करने की आवश्यकता है ताकि सॉफ़्टवेयर को सुरक्षित बनाया जा सके।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।