← नवीनतम पेपर
💻 computer science

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

यह शोध पत्र DeepDiscovery को प्रस्तुत करता है, जो एक दो-चरणीय "लोकेशन-इन्फरेंस" (स्थान-अनुमान) ढांचा है जो स्थानीय अंशों से आगे बढ़कर बड़े औद्योगिक कोडबेस से कार्य-प्रासंगिक संदर्भ को प्रभावी ढंग से पुनर्प्राप्त करता है, जिससे जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों पर फ़ाइल पुनर्प्राप्ति और कोडिंग एजेंट के प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुशल जासूस हैं जिसे एक विशाल, अराजक शहर (एक बड़ी औद्योगिक कोडबेस - Large Industrial Codebase) में एक जटिल मामले को सुलझाना है। इस शहर में लाखों इमारतें, गुप्त सुरंगें, छिपी हुई वायरिंग और लगातार बदलते हुए सड़क के संकेत हैं। आपका काम अपराध को सुलझाने के लिए आवश्यक विशिष्ट सुराग (एक कार्य - Task, जैसे कि किसी बग को ठीक करना या कोई नया फीचर जोड़ना) ढूंढना है।

समस्या यह है कि अधिकांश वर्तमान जासूसी उपकरण (मौजूदा AI विधियाँ) उन टॉर्च की तरह हैं जो केवल पास के कोने पर रोशनी डालते हैं। वे कुछ प्रासंगिक दस्तावेज़ तो ढूंढ सकते हैं, लेकिन वे महत्वपूर्ण कनेक्शनों को मिस कर देते हैं: इमारतों के बीच का छिपा हुआ वायरिंग, किसी विशिष्ट मशीन का ओनर मैनुअल, या तीन ब्लॉक दूर से आने वाले टेस्ट लॉग्स। पूरे चित्र को देखे बिना, जासूस फंस जाता है।

यह पेपर एक नया जासूसी उपकरण पेश करता है जिसे DEEPDISCOVERY कहा जाता है। केवल यादृच्छिक स्थानों पर रोशनी डालने के बजाय, यह एक स्मार्ट, दो-चरणीय रणनीति का उपयोग करता है ताकि उस पूरे "पथ" (path) का पुनर्निर्माण किया जा सके जिसे जासूस को मामला सुलझाने के लिए तय करने की आवश्यकता है।

यह यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. दो-चरणीय रणनीति: "एंकर खोजें, फिर पथ का पता लगाएं"

अधिकांश उपकरण एक ही बार में पूरे शहर को खोजने की कोशिश करते हैं, जो धीमा और भ्रमित करने वाला होता है। DEEPDISCOVERY दो चरणों में काम करता है:

  • चरण 1: एंकर (स्थान)
    कल्पना कीजिए कि आप एक स्टेडियम में एक विशिष्ट व्यक्ति को खोज रहे हैं। हर सीट को स्कैन करने के बजाय, आप पहले "उच्च-विश्वास" वाले प्रवेश बिंदुओं को देखते हैं: टीम के लोगो, विशिष्ट सेक्शन नंबर, या टिकट में उल्लेखित वीआईपी पास।

    • पेपर में: सिस्टम कोड को जल्दी से स्कैन करके कुछ "एंकर" (मुख्य कॉन्फ़िगरेशन फ़ाइल या विशिष्ट सर्विस एंट्री पॉइंट जैसी प्रमुख फ़ाइलें) ढूंढता है। यह अभी तक कोड की हर एक लाइन को पढ़े बिना, फ़ाइल के नाम, फ़ोल्डर संरचना और कोडिंग पैटर्न जैसे सुरागों का उपयोग करके यह अनुमान लगाता है कि कार्रवाई कहाँ हो रही है।
  • चरण 2: पथ (अनुमान/Inference)
    एक बार एंकर मिल जाने के बाद, जासूस वहीं नहीं रुकता। वे "इम्प्लीमेंटेशन पाथ" (implementation path) पर चलना शुरू करते हैं।

    • पेपर में: सिस्टम उन एंकर्स से बाहर की ओर विस्तार करता है। यह स्पष्ट लिंक (जैसे दो कमरों को जोड़ने वाला एक दरवाजा) और अंतर्निहित लिंक (जैसे एक गुप्त सुरंग या दो लोगों के बीच फोन कॉल जो इमारत के ब्लूप्रिंट में नहीं लिखा है) को देखता है। वे उन कनेक्शनों का पीछा करते हैं ताकि उन कॉन्फ़िगरेशन फ़ाइलों, टेस्ट और संबंधित कोड को खोज सकें जिनकी वास्तव में कार्य (task) को आवश्यकता है।

2. "स्मार्ट बजट" (मेटाडेटा-प्रथम)

कल्पना कीजिए कि आप हाइकिंग ट्रिप के लिए अपना बैकपैक पैक कर रहे हैं, लेकिन आपके पास केवल कुछ ही चीजें रखने की जगह है।

  • पुराना तरीका: आप पूरी लाइब्रेरी बैग में ठूस देते हैं, इस उम्मीद में कि आपको सही नक्शा मिल जाएगा। यह भारी और धीमा है।
  • DEEPDISCOVERY का तरीका: आप पहले किताब की रीढ़ (मेटाडेटा/सारांश) देखते हैं। यदि रीढ़ बताती है कि किताब "कुकिंग" के बारे में है, तो आप उसे शेल्फ पर ही छोड़ देते हैं। आप किताब को तभी खोलते हैं और उसके पन्ने पढ़ते हैं जब रीढ़ यह सुझाव देती है कि वह आपकी हाइक के लिए महत्वपूर्ण है।
  • पेपर में: सिस्टम पहले फ़ाइलों का "सारांश" पढ़ता है। यह फ़ाइल के पूर्ण, भारी टेक्स्ट को केवल तभी लोड करता है जब वह कार्य के लिए बिल्कुल आवश्यक हो। इससे समय और पैसा (कंप्यूटिंग पावर) बचता है।

3. यह क्यों मायने रखता है: "ताजगी" (Freshness) की समस्या

कई मौजूदा उपकरण शहर के पूर्व-निर्मित मानचित्रों (ऑफलाइन इंडेक्स) पर निर्भर करते हैं। लेकिन एक तेजी से बढ़ते शहर में, जैसे ही एक नई इमारत बनाई जाती है, मानचित्र पुराने हो जाते हैं।

  • पेपर का दावा: DEEPDISCOVERY शहर का नया नक्शा बनने का इंतजार नहीं करता है। यह अभी, वास्तविक समय में शहर की खोज करता है। इसका मतलब है कि यह तब भी पूरी तरह से काम करता है जब कोड हर मिनट बदल रहा हो, जो बड़ी कंपनियों में आम है।

4. परिणाम: अधिक मामलों को सुलझाना

लेखकों ने इस नए जासूसी उपकरण का तीन तरीकों से परीक्षण किया:

  • टेस्ट ड्राइव (मेथड लेवल): उन्होंने इसे 27 मध्यम आकार की पहेलियों के साथ टेस्ट किया। DEEPDISCOVERY ने 92.6% बार आवश्यक सुरागों का पूर्ण सेट खोज लिया, जिसने सभी अन्य उपकरणों को पीछे छोड़ दिया। इसने यह सब बिना किसी पूर्व-निर्मित मानचित्र के किया, जिससे यह तेज़ और सस्ता बना।
  • वास्तविक दुनिया (औद्योगिक प्रणालियाँ): उन्होंने इसे एक बड़ी कंपनी के छह अलग-अलग वास्तविक दुनिया के AI कोडिंग असिस्टेंट में प्लग किया। लगभग हर मामले में, असिस्टेंट समस्या को ठीक करने के लिए आवश्यक फ़ाइलों का पूर्ण सेट खोजने में बहुत बेहतर हो गए। बड़े, जटिल प्रोजेक्ट्स के लिए सुधार बहुत बड़ा था (सफलता में 9.2% तक की वृद्धि)।
  • अंतिम परीक्षा (एंड-टू-एंड): उन्होंने इसे SWE-bench Verified पर टेस्ट किया, जो सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए एक प्रसिद्ध बेंचमार्क है।
    • परिणाम: DEEPDISCOVERY का उपयोग करने वाले सिस्टम ने 78.6% कार्यों को हल किया।
    • तुलना: DEEPDISCOVERY के बिना वाला समान सिस्टम केवल 70.4% कार्य हल कर पाया।
    • निष्कर्ष: कोड को बेहतर ढंग से समझकर, AI ने 500 में से 41 और कार्य हल किए।

सारांश

DEEPDISCOVERY को एक ऐसे जासूस के रूप में समझें जो केवल एक मैनुअल का निकटतम पृष्ठ नहीं पढ़ता, बल्कि समझता है कि पूरी मशीन कैसे काम करती है। यह शुरुआती बिंदु खोजता है, छिपे हुए तारों और कनेक्शनों का पीछा करता है, और केवल तभी भारी निर्देशों को पढ़ता है जब वह बिल्कुल आवश्यक हो।

पेपर का दावा है कि ऐसा करके, AI कोडिंग असिस्टेंट कोड के महत्वपूर्ण हिस्सों को मिस करना बंद कर सकते हैं और जटिल सॉफ्टवेयर इंजीनियरिंग समस्याओं को बहुत अधिक विश्वसनीयता के साथ हल करना शुरू कर सकते हैं, विशेष रूप से विशाल, तेजी से बदलने वाले कोडबेस में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →