← नवीनतम पेपर
💻 computer science

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

यह शोध पत्र SAFEdit प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो निर्देशित कोड संपादन को प्लानिंग, लिटरल मॉडिफिकेशन और वेरिफिकेशन भूमिकाओं में विभाजित करता है जिसे एक फेलियर एब्स्ट्रैक्शन लेयर द्वारा उन्नत किया गया है, जिससे EditBench बेंचमार्क पर 68.6% टास्क सक्सेस रेट प्राप्त होता है और यह सिंगल-मॉडल और ReAct सिंगल-एजेंट बेसलाइन्स दोनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक सहायक है जो शून्य से नई कहानियाँ लिखने में माहिर है। हालाँकि, जब आप इस सहायक को किसी मौजूदा कहानी को संपादित (edit) करने के लिए कहते हैं—जैसे कि, "मुख्य पात्र का नाम बॉब से बदलकर एलिस कर दो, लेकिन बाकी कथानक बिल्कुल वैसा ही रहने दो"—तो वह सहायक अक्सर गड़बड़ कर देता है। वह गलती से पूरी कहानी को हटा सकता है, अंत बदल सकता है, या संवाद में पात्र का नाम अपडेट करना भूल सकता है।

यह शोध पत्र, SAFEdit, ठीक इसी समस्या पर प्रहार करता है। शोधकर्ताओं ने पाया कि बेहतरीन AI मॉडल भी मौजूदा कोड में सटीक और सुरक्षित बदलाव करने में संघर्ष करते हैं। "EditBench" नामक एक मानक परीक्षण पर, अधिकांश मॉडल 40% से अधिक बार काम को सही ढंग से करने में विफल रहे।

इसे ठीक करने के लिए, शोधकर्ताओं ने केवल AI को "अधिक स्मार्ट" बनाने की कोशिश नहीं की। इसके बजाय, उन्होंने काम करने के तरीके को बदल दिया। उन्होंने SAFEdit नामक एक सिस्टम बनाया जो एक एकल सामान्य ठेकेदार के बजाय एक छोटी, विशिष्ट निर्माण टीम (construction crew) की तरह काम करता है।

तीन-कर्मी दल (The Three-Worker Crew)

एक अकेले AI द्वारा एक साथ सब कुछ करने के बजाय, SAFEdit काम को तीन अलग-अलग भूमिकाओं में विभाजित करता है, जैसे कि एक सुव्यवस्थित टीम:

  1. योजनाकार (द आर्किटेक्ट/वास्तुकार):

    • वे क्या करते हैं: किसी भी कोड को छूने से पहले, यह एजेंट आपकी रिक्वेस्ट और मौजूदा कोड को पढ़ता है। यह एक विस्तृत, चरण-दर-चरण ब्लूप्रिंट बनाता है कि क्या बदलना है और कहाँ बदलना है। महत्वपूर्ण बात यह है कि यह अभी तक कोई कोड लिखता नहीं है। यह केवल एक योजना बनाता है।
    • उपमा: एक वास्तुकार के बारे में सोचें जो एक नया कमरा जोड़ने के लिए नक्शा बना रहा है। वे ईंटें नहीं रखते; वे बस यह सुनिश्चित करते हैं कि योजना सही हो।
  2. संपादक (द मेसन/राजमिस्त्री):

    • वे क्या करते हैं: यह एजेंट योजनाकार के ब्लूप्रिंट को लेता है और बदलाव करता है। इसे सख्ती से निर्देश दिया जाता है कि वह योजना का अक्षरशः पालन करे और केवल उन विशिष्ट हिस्सों को छुए जिनका उल्लेख किया गया है। इसे कोड को "बेहतर" बनाने या उन चीजों को बदलने की अनुमति नहीं है जो पूछी नहीं गई थीं।
    • उपमा: यह वह राजमिस्त्री है जो वास्तुकार के नक्शे का ठीक से पालन करता है। यदि नक्शा कहता है "यहाँ एक खिड़की जोड़ें," तो वह खिड़की जोड़ता है। वह पूरे घर को फिर से पेंट करने या मुख्य दरवाजे को हटाने का निर्णय नहीं लेता।
  3. सत्यापनकर्ता (द इंस्पेक्टर/निरीक्षक):

    • वे क्या करते हैं: एक बार जब संपादक बदलाव कर देता है, तो सत्यापनकर्ता कोड को एक वास्तविक टेस्ट सुइट (जैसे सुरक्षा निरीक्षण) के माध्यम से चलाता है। क्या कोड काम कर रहा था? क्या इसने कुछ और खराब कर दिया?
    • उपमा: यह बिल्डिंग इंस्पेक्टर है जो जाँचता है कि नया कमरा सुरक्षित है या नहीं और क्या बाकी घर अभी भी खड़ा है।

"सुरक्षा जाल" (Failure Abstraction Layer)

यदि इंस्पेक्टर (सत्यापनकर्ता) को कोई समस्या मिलती है, तो सिस्टम केवल "Error" नहीं कहता। यह फेलियर एब्स्ट्रैक्शन लेयर (FAL) नामक एक विशेष टूल का उपयोग करता है।

  • समस्या: कंप्यूटर से आने वाले कच्चे एरर मैसेज अक्सर अव्यवस्थित, भ्रमित करने वाले और तकनीकी शब्दावली से भरे होते हैं (जैसे कंप्यूटर से आया एक लंबा, गुस्से वाला पत्र)।
  • समाधान: FAL एक अनुवादक की तरह कार्य करता है। यह उस अव्यवस्थित एरर लॉग को लेता है और उसे संपादक के लिए एक सरल, संरचित नोट में बदल देता है: "हे, स्टेप 3 में गणित गलत है। आपने जोड़ने के बजाय घटा दिया। कृपया केवल उसी हिस्से को ठीक करें।"
  • लूप (चक्र): संपादक फिर इस स्पष्ट नोट का उपयोग करके अपनी विशिष्ट गलती को सुधारता है और टेस्ट को फिर से चलाता है। वे तब तक तीन बार प्रयास कर सकते हैं जब तक कि कोड पास न हो जाए।

उन्होंने क्या पाया?

शोधकर्ताओं ने इस "क्रू" दृष्टिकोण का परीक्षण एक एकल AI के विरुद्ध किया जो अकेले पूरा काम करने की कोशिश करता है (जैसे एक अकेला ठेकेदार) और अन्य अध्ययनों के सर्वश्रेष्ठ सिंगल-मॉडल परिणामों के विरुद्ध किया।

  • बेहतर सफलता दर: SAFEdit क्रू 68.6% बार सफल रहा। सर्वश्रेष्ठ एकल AI मॉडल केवल 64.8% सफल रहा, और एक मानक "सब-कुछ-करने-वाला" AI दृष्टिकोण 60% सफल रहा।
  • पुनरावृत्ति (Iteration) की शक्ति: सबसे बड़ा उछाल "कोशिश करो, जाँचो, ठीक करो" लूप से आया। कुल सफलता में से लगभग 17.4% केवल इस तथ्य से आया कि सिस्टम को पहली कोशिश के बाद अपनी गलतियों को सुधारने की अनुमति दी गई थी।
  • कम दुर्घटनाएँ: सबसे महत्वपूर्ण निष्कर्ष सुरक्षा के बारे में था। सिंगल-AI दृष्टिकोण अक्सर उन चीजों को तोड़ देते थे जो पहले से काम कर रही थीं (जिसे "रिग्रेशन एरर" कहा जाता है)। SAFEdit ने मौजूदा फंक्शनलिटी को कभी नहीं तोड़ा। यह बिना किसी अन्य हिस्से को गलती से हटाए, अनुरोधित परिवर्तन करने में बहुत बेहतर था।
  • स्थिरता: यहाँ तक कि जब शोधकर्ताओं ने AI को कम जानकारी दी (जैसे कोड के कुछ हिस्सों को छिपा दिया), तब भी SAFEdit क्रू स्थिर रहा। संदर्भ बदलने पर एकल AI बहुत आसानी से भ्रमित हो गया।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि कोड को विश्वसनीय रूप से संपादित करने के लिए केवल एक "स्मार्ट" दिमाग (एक बड़ा मॉडल) होना ही काफी नहीं है। यह इस बारे में है कि काम को कैसे व्यवस्थित किया जाता है

काम को योजना बनाने, करने और जाँचने में विभाजित करके—और सिस्टम को अपनी गलतियों को समझने का एक स्पष्ट तरीका देकर—SAFEdit फ्रेमवर्क कोड एडिटिंग को बहुत अधिक भरोसेमंद बनाता है। यह साबित करता है कि विशेषज्ञों की एक संरचित टीम, एक अकेले, सर्वशक्तिमान कार्यकर्ता की तुलना में अधिक विश्वसनीय है जो एक साथ सब कुछ संभालने की कोशिश कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →