← नवीनतम पेपर
🤖 machine learning

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

यह शोध पत्र "प्रोब-एंड-रिफाइन ट्यूनिंग" (probe-and-refine tuning) पेश करता है, जो सिंथेटिक बग-फिक्स प्रोब्स (synthetic bug-fix probes) का उपयोग करके रिपॉजिटरी गाइडेंस फाइल्स (AGENTS.md) को पुनरावृत्ति के साथ अनुकूलित करने की एक विधि है, जो प्रति-पैच परिशुद्धता (per-patch precision) बढ़ाने के बजाय मूल्यांकन योग्य पैच के कवरेज का विस्तार करके SWE-bench Verified पर कोडिंग एजेंट के प्रदर्शन में उल्लेखनीय सुधार करती है।

मूल लेखक: Asa Shepard, Jeannie Albrecht

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Asa Shepard, Jeannie Albrecht

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक विशाल, प्राचीन पुस्तकालय (कोड रिपॉजिटरी) को ठीक करने के लिए एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को काम पर रखा है। प्रशिक्षु किताबें पढ़ने और फटे हुए पन्नों को ठीक करने के लिए पर्याप्त बुद्धिमान है, लेकिन वह पुस्तकालय के गुप्त नियम नहीं जानता: कौन सी अलमारी में दुर्लभ मानचित्र रखे हैं, मदद के लिए लाइब्रेरियन से कैसे पूछना है ताकि सोती हुई बिल्लियाँ न जागें, या कौन सी सीढ़ियाँ चढ़ने के लिए सुरक्षित हैं।

इस "स्थानीय ज्ञान" के बिना, प्रशिक्षु बिना किसी लक्ष्य के भटकता रहता है, गलत सीढ़ी चढ़ जाता है, या गलत सेक्शन में किताब ठीक करने की कोशिश करता है, जिससे अक्सर चीजें खराब हो जाती हैं।

यह शोध पत्र इस समस्या को हल करने के लिए "प्रोब-एंड-रिफाइन ट्यूनिंग" (Probe-and-Refine Tuning) नामक एक विधि पेश करता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

समस्या: "एक ही आकार के सभी के लिए" वाला मैनुअल (The "One-Size-Fits-All" Manual)

इंजीनियर अक्सर अपने AI कोडिंग एजेंट्स के लिए एक "चीट शीट" (जैसे कि एक AGENTS.md फ़ाइल) लिखते हैं।

  • पुराना तरीका (स्थिर ज्ञान): वे एक स्मार्ट AI से एक सामान्य मैनुअल लिखवाते हैं: "हमेशा ठीक करने से पहले इंडेक्स चेक करें," या "मुख्य एंट्री पॉइंट को खोजें।" यह दुनिया के हर पुस्तकालय के नक्शे को एक प्रशिक्षु को देने जैसा है। यह मददगार तो है, लेकिन यह उसे यह नहीं बताता कि उस विशिष्ट पुस्तकालय का गुप्त खजाना कहाँ छिपा है।
  • परिणाम: प्रशिक्षु ठीक-ठाक काम करता है, लेकिन फिर भी वह अक्सर भटक जाता है।

समाधान: "प्रयास-और-त्रुटि" वाला कोच (The "Trial-and-Error" Coach)

लेखकों ने "प्रोब-एंड-रिफाइन" नामक एक नई प्रक्रिया बनाई है। केवल एक बार मैनुअल लिखने के बजाय, वे मैनुअल को एक जीवित दस्तावेज़ की तरह मानते हैं जिसे गलतियाँ करके प्रशिक्षित किया जाता है।

इसे एक कोच द्वारा नए खिलाड़ी को प्रशिक्षित करने की तरह समझें:

  1. द प्रोब्स (अभ्यास/Drills): कोच इस विशिष्ट पुस्तकालय के लिए 10 नकली, बनावटी समस्याएँ (प्रोब्स) उत्पन्न करता है।
  2. प्रयास (The Attempt): प्रशिक्षु वर्तमान मैनुअल का उपयोग करके इन नकली समस्याओं को हल करने की कोशिश करता है।
  3. निदान (The Diagnosis): कोच प्रयास को देखता है। "ओह, तुमने रसोई में प्लंबिंग ठीक करने की कोशिश की, लेकिन पाइप वास्तव में बेसमेंट में हैं। और तुम पहले ब्लूप्रिंट चेक करना भूल गए।"
  4. परिमार्जन (The Refinement): कोच तुरंत एक विशिष्ट नियम के साथ मैनुअल को अपडेट करता है: "इस पुस्तकालय के लिए, प्लंबिंग बेसमेंट में है, और हमेशा पहले ब्लूप्रिंट चेक करें।"
  5. दोहराना (Repeat): वे इसे 3 से 5 बार करते हैं। मैनुअल एक सामान्य गाइड से विकसित होकर एक हाइपर-स्पेसिफिक, "इनसाइडर" गाइड बन जाता है।

महत्वपूर्ण रूप से, यह पूरी प्रशिक्षण प्रक्रिया वास्तविक बग्स को ठीक किए बिना होती है। यह एक सिमुलेशन लूप है जहाँ AI मैनुअल लिखता है, नकली समस्याओं पर उसका परीक्षण करता है, और विफलता के आधार पर मैनुअल को ठीक करता है।

उन्होंने क्या पाया

शोधकर्ताओं ने चार अलग-अलग रन के साथ एक प्रसिद्ध कोडिंग बेंचमार्क (SWE-bench) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • कोई गाइड नहीं: प्रशिक्षु ने 25.5% समस्याओं को हल किया।
  • जेनेरिक गाइड (सामान्य गाइड): प्रशिक्षु ने 28.3% समस्याओं को हल किया।
  • प्रोब-एंड-रिफाइन गाइड: प्रशिक्षु ने 33.0% समस्याओं को हल किया।

बड़ा रहस्य: यह सही दरवाजा खोजने के बारे में है, बेहतर ठीक करने के बारे में नहीं
आप सोच सकते हैं कि बेहतर मैनुअल ने प्रशिक्षु को अधिक बुद्धिमान बनाया या चीज़ों को ठीक करने में बेहतर बनाया। ऐसा नहीं हुआ।

  • जब प्रशिक्षु ने कुछ ठीक किया, तो सुधार की गुणवत्ता (quality of the fix) बिल्कुल वैसी ही थी (लगभग 59% सफलता दर), चाहे उन्होंने कोई भी मैनुअल इस्तेमाल किया हो।
  • असली जादू "कवरेज" (Coverage) में था। बेहतर मैनुअल ने प्रशिक्षु को ठीक करने के लिए सही फ़ाइल बहुत अधिक बार खोजने में मदद की।
    • उपमा: जेनेरिक मैनुअल ने प्रशिक्षु को 100 दरवाजों पर दस्तक देने के लिए कहा, लेकिन उनमें से केवल 40 सही थे। रिफाइंड मैनुअल ने उन्हें 100 दरवाजों पर दस्तक दी, और उनमें से 56 सही थे। एक बार जब वे सही दरवाजे तक पहुँच गए, तो ताला ठीक करने की उनकी क्षमता समान थी।

"स्टेप बजट" का जाल (The "Step Budget" Trap)

शोधकर्ताओं ने यह भी पाया कि यह गाइड तभी काम करती है जब आप प्रशिक्षु को पर्याप्त समय देते हैं।

  • यदि आप प्रशिक्षु को एक समस्या को हल करने के लिए केवल 25 स्टेप्स देते हैं, तो फैंसी मैनुअल काम नहीं आता। उनके पास जटिल निर्देशों का पालन करने का समय नहीं होता।
  • यदि आप उन्हें 200 स्टेप्स देते हैं, तो फैंसी मैनुअल चमक उठता है। यह उन्हें एक वर्कफ़्लो (Reproduce -> Trace -> Fix) बताता है जो समय लेता है लेकिन काम करता है। बिना मैनुअल के, वे जल्दबाजी करते हैं और विफल हो जाते हैं।
  • उपमा: यदि आप किसी को कहते हैं, "ट्रैफ़िक से बचने के लिए सुंदर रास्ता लें," लेकिन आप उन्हें काम पर पहुँचने के लिए केवल 5 मिनट देते हैं, तो वे बस रास्ता भटक जाएंगे। आपको वास्तव में वह सुंदर रास्ता लेने के लिए पर्याप्त समय देना होगा।

"मॉडल मिसमैच" की चेतावनी (The "Model Mismatch" Warning)

सबसे आश्चर्यजनक खोज यह थी कि यह गाइड सार्वभौमिक (universal) नहीं है।

  • उन्होंने एक AI मॉडल (Qwen) पर प्रशिक्षित गाइड को दूसरे, थोड़े कमजोर AI मॉडल (Nemotron) के साथ आज़माया।
  • परिणाम: दूसरा मॉडल क्रैश हो गया। वह विशिष्ट निर्देशों से इतना भ्रमित हो गया कि उसने काम करना ही बंद कर दिया।
  • उपमा: यह एक ड्राइवर को एक तेज़ गति वाली रेसिंग कार का विस्तृत मैनुअल देने जैसा है। निर्देश उस पुरानी कार के लिए बहुत जटिल हैं, और ड्राइवर जम जाता है। गाइड को उस मस्तिष्क (मॉडल) के लिए विशेष रूप से "ट्यून" किया जाना चाहिए जो उसे पढ़ेगा।

सारांश

यह शोध पत्र सिद्ध करता है कि निर्देश कैसे लिखे जाते हैं, यह केवल निर्देश होने से अधिक महत्वपूर्ण है।
"एक नकली समस्या बनाना, उसे हल करने का प्रयास करना, और विफलता के आधार पर निर्देशों को ठीक करना" के एक सरल लूप का उपयोग करके, आप एक जेनेरिक गाइड को एक विशेषज्ञ मैनुअल में बदल सकते हैं। यह AI को कोड ठीक करने में स्मार्ट नहीं बनाता; यह बस उसे गलत जगह देखने से रोकता है, जिससे वह अधिक समस्याओं को हल करने के लिए अपनी पूरी क्षमता का उपयोग कर पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →