← नवीनतम पेपर
🤖 AI

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

यह शोध पत्र MPC-Patch-Bench को प्रस्तुत करता है, जो एक नवीन रिपॉजिटरी-स्तरीय बेंचमार्क है जिसे एक विशेष डेटा क्यूरेशन फ्रेमवर्क और एक कठोर MPC वेरीफायर के माध्यम से क्रिप्टोग्राफिक सुरक्षा और संख्यात्मक निष्ठा (numerical fidelity) को लागू करके, मौजूदा बेंचमार्क की अद्वितीय संरचनात्मक और सुरक्षा सीमाओं को संबोधित करते हुए, सिक्योर मल्टी-पार्टी कंप्यूटेशन कोड रिपेयर पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Yukuan Zhang, Mengxin Zheng, Qian Lou

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yukuan Zhang, Mengxin Zheng, Qian Lou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अविश्वसनीय रूप से बुद्धिमान, सुपर-फास्ट रोबोटों (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक टीम है जो सामान्य कंप्यूटर प्रोग्रामों में टूटे हुए कोड को ठीक करने में माहिर हैं। वे किसी वेबसाइट में टाइपिंग की गलती सुधार सकते हैं या कैलकुलेटर ऐप के बग को आसानी से ठीक कर सकते हैं।

लेकिन क्या होता है जब आप इन रोबोटों से सिक्योर मल्टी-पार्टी कंप्यूटेशन (MPC) के लिए कोड ठीक करने को कहते हैं?

MPC को एक हाई-सिक्योरिटी वॉल्ट (तिजोरी) की तरह समझें जहाँ कई लोग एक साथ गणितीय समस्या को हल करना चाहते हैं, बिना एक-दूसरे को अपने गुप्त नंबर दिखाए। यह जासूसों के एक समूह की तरह है जो अपने छिपे हुए बैंक खातों के कुल मूल्य की गणना करने की कोशिश कर रहे हैं, बिना अपना व्यक्तिगत बैलेंस प्रकट किए। इस कोड का काम अविश्वसनीय रूप से नाजुक है; यदि आप एक छोटी सी भी गलती करते हैं, तो आप केवल गलत उत्तर ही नहीं देंगे—आप अनजाने में किसी जासूस की गुप्त पहचान लीक कर सकते हैं।

यह शोध पत्र, MPC-Patch-Bench, तर्क देता है कि हम इन कोड-ठीक करने वाले रोबोटों को गलत परीक्षाओं के साथ टेस्ट कर रहे हैं।

समस्या: गलत परीक्षा

वर्तमान में, हम कोड-ठीक करने वाले रोबोटों को सामान्य बेंचमार्क (जैसे SWE-bench) का उपयोग करके टेस्ट करते हैं। यह एक ब्रेन सर्जन की हृदय सर्जरी करने की क्षमता को कार का टायर बदलने के टेस्ट देकर परखने जैसा है।

लेखकों ने पाया कि सामान्य टेस्ट MPC के लिए तीन प्रमुख कारणों से विफल होते हैं:

  1. गलत सामग्री: MPC प्रोजेक्ट्स में अधिकांश कोड वास्तव में गुप्त गणित के बारे में नहीं होता है; यह केवल उबाऊ "प्लंबिंग" (जैसे सर्वर सेटअप करना या डॉक्यूमेंटेशन लिखना) है। सामान्य टेस्ट इन उबाऊ कार्यों को चुन लेते हैं, और वास्तविक कठिन क्रिप्टोग्राफिक कार्य को अनदेखा कर देते हैं।
  2. निर्देशों की कमी: गुप्त गणित की दुनिया में, डेवलपर्स अक्सर बिना मानक "टेस्ट स्क्रिप्ट" लिखे बग्स को ठीक करते हैं, जिनकी मदद से रोबोटों को पता चलता है कि उन्होंने अच्छा काम किया है या नहीं। सामान्य टेस्ट ऐसे सुधारों को इसलिए हटा देते हैं क्योंकि उनमें कागजी कार्रवाई (डॉक्यूमेंटेशन) की कमी होती है।
  3. "पर्याप्त अच्छा" का जाल: एक सामान्य टेस्ट कहता है कि एक सुधार "अच्छा" है यदि कोड बिना क्रैश हुए चल जाता है। लेकिन MPC में, एक सुधार जो बिना क्रैश हुए चल जाता है, वह फिर भी गुप्त जानकारी लीक कर सकता है या राउंडिंग एरर (rounding errors) के कारण गणितीय रूप से थोड़ा गलत उत्तर दे सकता है। एक "फंक्शनल" सुधार अभी भी एक सुरक्षा आपदा हो सकता है।

समाधान: एक नया, विशिष्ट परीक्षा केंद्र

इसे ठीक करने के लिए, लेखकों ने MPC-Patch-Bench बनाया है, जो इन गुप्त-कंप्यूटेशन रोबोटों के लिए एक नया, विशेष परीक्षण मैदान है।

1. "गोल्ड माइनर" (डेटा क्यूरेशन फ्रेमवर्क)
एक विशेषज्ञ माइनर्स (AI और मानव विशेषज्ञों का मिश्रण) की टीम की कल्पना करें जो 7,305 फेंके गए कोड सुधारों के विशाल पहाड़ को छान रही है।

  • AI फ़िल्टर: पहले, एक AI एजेंट एक मेटल डिटेक्टर की तरह काम करता है, जो केवल उन चट्टानों को खोजने के लिए ढेर को स्कैन करता है जिनमें वास्तविक "सोना" (वास्तविक क्रिप्टोग्राफिक लॉजिक) मौजूद है। यह 6,000+ ऐसी चट्टानों को फेंक देता है जो केवल मिट्टी (जेनेरिक कोड) हैं।
  • मानव-AI टीम: उन्हें 1,175 आशाजनक चट्टानें मिलती हैं, लेकिन उनमें से कई टूटी हुई या अधूरी हैं (निर्देशों की कमी है)। उन्हें फेंकने के बजाय, एक मानव विशेषज्ञ और एक AI एक रिस्टोरेशन टीम की तरह मिलकर काम करते हैं। मानव कहता है, "यह सुधार शानदार था, लेकिन हमें टेस्ट के लिए निर्देश लिखने की आवश्यकता है," और AI उन्हें लिखता है।
  • परिणाम: वे इस कच्चे ढेर को 205 पूर्ण, पूरी तरह से सत्यापित परीक्षा प्रश्नों में बदल देते हैं।

2. "डबल-चेक" इंस्पेक्टर (द MPC वेरिफायर)
जब एक रोबोट इन 205 समस्याओं में से किसी एक को ठीक करने की कोशिश करता है, तो एक सामान्य टेस्ट केवल यह जाँचता है: "क्या कोड चला?"
नया MPC वेरिफायर एक सुरक्षा गार्ड और एक गणित के प्रोफेसर के रूप में मिलकर काम करता है:

  • सुरक्षा गार्ड (स्टैटिक एनालिसिस): वे कोड चलने से पहले उसे देखते हैं। वे खतरनाक आदतों की जाँच करते हैं, जैसे "क्या आपने गलती से कोई गुप्त नंबर प्रिंट कर दिया?" या "क्या आपने ऐसे रैंडम नंबर जनरेटर का उपयोग किया जो सुरक्षित नहीं है?"
  • गणित का प्रोफेसर (डायनामिक टेस्टिंग): वे कोड चलाते हैं और रोब lewat (मानव द्वारा गणना किए गए) "साधारण" उत्तर के विरुद्ध रोबोट के "गुप्त" उत्तर की तुलना करते हैं ताकि यह देखा जा सके कि क्या संख्याएँ पूरी तरह से मेल खाती हैं। यहाँ तक कि एक मामूली राउंडिंग एरर को भी चिह्नित कर दिया जाता है।

परिणाम: रोबोट संघर्ष कर रहे हैं

लेखकों ने दुनिया के सर्वश्रेष्ठ कोड-ठीक करने वाले रोबोटों का इस नए एग्जाम पर परीक्षण किया। परिणाम आश्चर्यजनक थे:

  • "पास" रेट: सबसे स्मार्ट रोबोट भी केवल 23% समस्याओं को सही ढंग से ठीक कर सका।
  • "सुरक्षा" में गिरावट: जब "डबल-चेक इंस्पेक्टर" (MPC वेरिफायर) ने उन सुधारों की जाँच की जो काम करते हुए प्रतीत होते थे, तो उसने लगभग 40% को खारिज कर दिया।
    • उपमा: कल्पना कीजिए कि एक छात्र गणित की परीक्षा देता है और सही संख्या प्राप्त करता है, लेकिन शिक्षक को एहसास होता है कि उसने एक थोड़े से खराब कैलकुलेटर का उपयोग किया था, इसलिए उत्तर वास्तव में गलत है। या, छात्र ने समस्या हल की लेकिन गलती से अपना उत्तर एक ऐसे कागज पर लिख दिया जिसे हर कोई देख सकता था।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि सुरक्षा सॉफ्टवेयर के लिए कार्यात्मक शुद्धता (functional correctness) पर्याप्त नहीं है। सिर्फ इसलिए कि कोड बिना क्रैश हुए चलता है, इसका मतलब यह नहीं है कि वह सुरक्षित है।

लेखक दिखाते हैं कि सामान्य बेंचमार्क AI को गोपनीयता सॉफ्टवेयर को ठीक करने में अत्यधिक क्षमतावान (overestimate) बताते हैं। गोपनीयता सॉफ्टवेयर के साथ AI पर भरोसा करने के लिए, हमें विशेष परीक्षाओं की आवश्यकता है जो न केवल यह जाँचती हैं कि कोड काम करता है, बल्कि यह भी कि क्या वह रहस्यों को सुरक्षित रखता है।

संक्षेप में: हम पायलट को प्रमाणित करने के लिए ड्राइवर लाइसेंस टेस्ट का उपयोग नहीं कर सकते। MPC-Patch-Bench वह नया फ्लाइट सिम्युलेटर है जिसे विशेष रूप से यह देखने के लिए डिज़ाइन किया गया है कि क्या AI गुप्त कंप्यूटेशन के विमान को सुरक्षित रूप से उड़ा सकता है। अब तक, AI अभी भी ट्रेनिंग व्हील्स (सीखने के शुरुआती चरण) के दौर में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →