Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs
फिनिक्स (Phoenix) एक मल्टी-एजेंट एलएलएम (LLM) सिस्टम है जो सात स्तरित सुरक्षा नियंत्रणों और एक बेसलाइन-जागरूक मूल्यांकन रणनीति को नियोजित करते हुए, ट्राइएज से लेकर पुल-रिक्वेस्ट निर्माण तक GitHub इश्यूज़ को सुरक्षित रूप से हल करता है, जिससे एक क्यूरेटेड SWE-bench Lite स्लाइस पर 75% ऑरेकल-रेज़ोल्यूशन दर प्राप्त होती है और वास्तविक दुनिया के इश्यूज़ पर 100% शुद्धता संरक्षण बनाए रखा जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि GitHub नामक एक विशाल, हलचल भरी लाइब्रेरी है जहाँ लाखों लोग किताबों पर स्टिकी नोट्स छोड़ते हैं, जिनमें सुधार, नए फीचर्स या टाइपो (लिखने की गलती) की ओर इशारा किया जाता है। इन नोट्स को "इश्यूज" (issues) कहा जाता है। आमतौर पर, एक मानव लाइब्रेरियन को वह नोट पढ़ना पड़ता है, किताब का सटीक पन्ना ढूँढना पड़ता है, यह पता लगाना पड़ता है कि क्या गलत है, टेक्स्ट को फिर से लिखना पड़ता है, और फिर इसे वापस शेल्फ पर रखने से पहले एक सीनियर लाइब्रेरियन से जांच करने के लिए कहना पड़ता है। यह प्रक्रिया धीमी और थकाऊ है।
Phoenix एआई (AI) रोबोटों की एक नई टीम है जिसे यह काम करने के लिए डिज़ाइन किया गया है, लेकिन इसके साथ एक बहुत सख्त नियम है: कोई नुकसान न पहुँचाना (Do no harm)।
Phoenix कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:
1. विशेषज्ञों की टीम (छह एजेंट)
एक सुपर-स्मार्ट रोबोट के सारा काम एक साथ करने के बजाय (जिससे अक्सर गलतियाँ होती हैं), Phoenix छह विशिष्ट विशेषज्ञों की एक टीम का उपयोग करता है, जो एक सुव्यवस्थित असेंबली लाइन की तरह काम करते हैं:
- द प्लानर (The Planner): यह स्टिकी नोट को पढ़ता है और एक नक्शा बनाता है। यह तय करता है कि किन पन्नों को बदलने की आवश्यकता है और उन्हें कैसे ठीक किया जाए।
- द रिप्रोड्यूसर (The Reproducer - जासूस): कुछ भी ठीक करने से पहले, यह रोबोट समस्या को फिर से पैदा करने की कोशिश करता है। यह कहता है, "ठीक है, अगर मैं X करता हूँ, तो क्या किताब टूट जाती है?" यदि यह साबित कर सकता है कि किताब खराब है, तो यह आगे बढ़ता है। यदि नहीं, तो यह इस चरण को छोड़ देता है ताकि टीम अटक न जाए।
- द कोडर (The Coder): यह लेखक है। यह प्लानर के नक्शे को लेता है और वास्तव में पन्नों पर टेक्स्ट को फिर से लिखता है।
- द टेस्टर (The Tester): यह गुणवत्ता निरीक्षक है। यह देखने के लिए कि क्या नया टेक्स्ट नई त्रुटियाँ पैदा कर रहा है, किताब को एक मशीन के माध्यम से चलाता है।
- द फेलियर एनालिस्ट (The Failure Analyst): यह डॉक्टर है। यदि टेस्टर को कोई नई त्रुटि मिलती है, तो यह रोबोट निदान करता है कि वह क्यों हुई और कोडर को बताता है कि उसे कैसे ठीक किया जाए। उन्हें ठीक करने के लिए दो मौके मिलते हैं; यदि वे दो बार विफल हो जाते हैं, तो वे रुक जाते हैं और मानव सहायता मांगते हैं।
- द पीआर एजेंट (The PR Agent): यह संदेशवाहक है। एक बार जब सुधार तैयार हो जाता है, तो यह सब कुछ पैक करता है और अंतिम अनुमोदन के लिए एक मानव लाइब्रेरियन को सौंप देता है।
2. "सुरक्षा जाल" (सुरक्षा की सात परतें)
पेपर इस बात पर जोर देता है कि यदि एआई बिना सोचे-समझे किताबों को बेतरतीब ढंग से फिर से लिखना शुरू कर दे, तो यह खतरनाक हो सकता है। Phoenix के पास आपदाओं को रोकने के लिए सात "सुरक्षा गार्ड" हैं:
- द फेंस (The Fence): यह रोबोट्स को लाइब्रेरी की दीवारों के बाहर लिखने नहीं देगा (यह रोकने के लिए कि वे उन फाइलों को डिलीट न कर दें जिन्हें उन्हें नहीं छूना चाहिए)।
- द आईडी बैच (The ID Badge): यह जाँचता है कि रोबोट्स के पास वैध चाबियाँ (टोकन) हैं या नहीं ताकि वे काम के बीच में लॉक न हो जाएँ।
- द क्लीन-अप क्रू (The Clean-Up Crew): यह रोबोट्स को दिखाने से पहले स्टिकी नोट्स के अस्त-व्यस्त और भ्रमित करने वाले हिस्सों को हटा देता है, ताकि वे खराब फॉर्मेटिंग से भ्रमित न हों।
- द "नो-गो" ज़ोन (The "No-Go" Zone): यह लाइब्रेरी की सुरक्षा प्रणाली फाइलों (वर्कफ्लो फाइल्स) को छूने से इनकार करता है क्योंकि उन्हें छेड़ने से सभी लोग बाहर लॉक हो सकते हैं।
- द स्टॉप बटन (The Stop Button): यदि रोबोट्स लूप में फंस जाते हैं या एक ही गलती बार-बार करते हैं, तो सिस्टम प्लग खींच लेता है।
- द सोलो वर्कर (The Solo Worker): एक समय में केवल एक ही किताब पर काम किया जाता है ताकि रोबोट्स एक-दूसरे से टकरा न जाएँ।
- द फ्रेश की (The Fresh Key): यह अपने आईडी बैचों को समाप्त होने से पहले स्वचालित रूप से रिफ्रेश करता है, ताकि काम टाइमआउट के कारण न रुके।
3. "पहले और बाद का" परीक्षण (बेसलाइन अवेयरनेस)
यह Phoenix की सबसे चतुर तकनीक है। कभी-कभी, रोबोट के छूने से पहले भी लाइब्रेरी की किताब पहले से ही खराब होती है।
- पुराना तरीका: एक रोबोट टाइपो ठीक करता है, लेकिन किताब फिर भी फेल हो जाती है क्योंकि वह पहले से ही खराब थी। रोबलेट को विफलता के लिए दोषी ठहराया जाता है।
- Phoenix का तरीका: रोबोट कुछ भी बदलने से पहले, वह किताब की वर्तमान स्थिति का एक "स्नैपशॉट" लेता है। बदलाव करने के बाद, वह नए स्नैपशॉट की तुलना पुराने स्नैपशॉट से करता है।
- यदि किताब पहले से ही खराब थी और वैसी ही रहती है (लेकिन कोई नई चीज़ खराब नहीं होती), तो Phoenix कहता है, "सफलता! हमने इसे और खराब नहीं किया।"
- यदि किताब काम कर रही थी और अब वह खराब हो गई है, तो Phoenix कहता है, "रुकिए! हमने एक रिग्रेशन (regression) पेश किया है।"
4. परिणाम क्या दर्शाते हैं
शोधकर्ताओं ने Phoenix का दो तरह से परीक्षण किया:
- अभ्यास सत्र (SWE-bench Lite): उन्होंने Phoenix को 24 विशिष्ट, पूर्व-निर्धारित समस्याएँ दीं। Phoenix ने बिना कुछ भी खराब किए उनमें से 75% को पूरी तरह से हल किया।
- वास्तविक दुनिया का परीक्षण (42 वास्तविक इश्यूज): उन्होंने Phoenix को 14 अलग-अलग वास्तविक प्रोजेक्ट्स से जुड़े 42 वास्तविक इश्यूज पर काम करने दिया।
- सुरक्षा (Safety): Phoenix ने 100% "करेक्टनेस प्रिजर्वेशन" (Correctness Preservation) हासिल किया। इसका मतलब है कि इसने कभी भी उस टेस्ट को नहीं तोड़ा जो पहले पास हो रहा था। यह अविश्वसनीय रूप से सुरक्षित था।
- सफलता दर (Success Rate): हालाँकि, केवल आधे सुधार ही वास्तव में सही सुधार थे। बाकी आधे "हैलुसिनेशन" (hallucinations) थे जहाँ रोबोट ने गलत जगह पर कोड लिखा (जैसे फिक्शन सेक्शन में मरम्मत नियमावली लिखना)। रोबोट जानता था कि इसे कैसे ठीक करना है, लेकिन कभी-कभी वह यह नहीं ढूंढ पाता था कि समस्या कहाँ है।
निष्कर्ष
Phoenix एक बहुत ही सावधान, अत्यधिक प्रशिक्षित प्रशिक्षु (apprentice) लाइब्रेरियन की तरह है। यह चीजों को और खराब न करने में उत्कृष्ट है और एक सख्त प्रक्रिया का पालन करने में बहुत अच्छा है। हालाँकि, यदि विवरण फ़ाइल नामों से पूरी तरह मेल नहीं खाता है, तो यह कभी-कभी समस्या के सटीक स्थान को खोजने में संघर्ष करता है।
पेपर निष्कर्ष निकालता है कि वास्तविक दुनिया में एआई के उपयोगी होने के लिए, गति से पहले सुरक्षा (safety must come before speed) अनिवार्य है। Phoenix यह सिद्ध करता है कि विशेषज्ञ एजेंटों की एक टीम और सख्त सुरक्षा गार्डों का उपयोग करके, आप सॉफ्टवेयर को अनजाने में खराब किए बिना सॉफ्टवेयर सुधारों को स्वचालित कर सकते हैं। मुख्य चीज़ जिसे अभी भी ठीक करने की आवश्यकता है, वह यह है कि "प्लानर" रोबोट को किताब का सही पन्ना अधिक बार खोजने में मदद की जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।