← नवीनतम पेपर
🤖 machine learning

Fix Initial Codes and Iteratively Refine Textual Directions Toward Safe Multi-Turn Code Correction

यह शोध पत्र इटरेटिव रिफाइनमेंट ऑफ टेक्स्टुअल डायरेक्शंस (IRTD) का प्रस्ताव करता है, जो एक सरल विधि है जो स्थिर प्रारंभिक कोड के लिए टेक्स्टुअल डायरेक्शंस को पुनरावृत्ति से परिष्कृत करके अत्याधुनिक (state-of-the-art) कोड सुधार प्रदर्शन प्राप्त करती है, जो स्कैटरड फॉरेस्ट सर्च जैसे जटिल खोज-आधारित तरीकों की तुलना में अधिक कुशल और सैद्धांतिक रूप से सुरक्षित विकल्प प्रदान करती है।

मूल लेखक: Yuto Tanaka, Issei Sato

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuto Tanaka, Issei Sato

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "जंगल में खो जाने" की दुविधा

कल्पना कीजिए कि आप एक जटिल जिग्सॉ पहेली (jigsaw puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन आपकी आँखों पर पट्टी बंधी है। आप केवल एक गाइड से पूछ सकते हैं, "क्या यह टुकड़ा सही जगह पर है?" और वह "हाँ" या "नहीं" में जवाब देता है।

वर्तमान में, सबसे स्मार्ट AI मॉडल एक विधि का उपयोग करते हैं जिसे SFS (Scattered Forest Search) कहा जाता है। SFS को एक विशाल, महंगी यात्रा की तरह समझें। पहेली को हल करने के लिए, AI दर्जनों खोजकर्ताओं (initial codes) को जंगल के अलग-अलग हिस्सों में भेजता है। ये खोजकर्ता जटिल मानचित्रों (Monte Carlo Tree Search) का उपयोग करके जंगल में और गहरा जाने की कोशिश करते हैं। यह काम करता है, लेकिन यह अविश्वसनीय रूप से जटिल, महंगा है, और उन सभी अलग-अलग खोजकर्ताओं और मानचित्रों को प्रबंधित करने के लिए बहुत अधिक "दिमागी शक्ति" (compute) का उपयोग करता है।

शोधकर्ताओं ने कुछ अजीब देखा: भले ही AI खोजकर्ताओं को जंगल में गहराई तक भेज रहा था, अधिकांश खोजकर्ताओं को उत्तर लगभग तुरंत मिल गया—या तो शुरुआत में ही या बस एक या दो चरणों के बाद। "गहन अन्वेषण" (deep exploration) का अधिकांश हिस्सा बेकार मेहनत थी।


समाधान: IRTD ("स्मार्ट कंपास" विधि)

इस शोध पत्र के लेखक एक बहुत ही सरल, अधिक सुरुचिपूर्ण तरीका प्रस्तावित करते हैं, जिसे वे IRTD (Iterative Refinement of Textual Directions) कहते हैं।

जंगल में बिना किसी दिशा के भटकने के लिए खोजकर्ताओं की एक पूरी सेना भेजने के बजाय, IRTD यह करता है:

  1. कुछ ठोस शुरुआती बिंदु चुनें: एक विशाल जंगल के बजाय, बस कुछ विश्वसनीय शुरुआती रास्ते (initial codes) चुनें।
  2. रास्ता न बदलें, निर्देश बदलें: यही वह "गुप्त मंत्र" है। पुराने तरीकों में, यदि कोई खोजकर्ता रास्ता भटक जाता था, तो वे एक बिल्कुल नया रास्ता खोजने की कोशिश करते थे। IRTD में, खोजकर्ता उसी रास्ते पर रहता है लेकिन एक बेहतर दिशा निर्देश (textual directions) मांगता है।
  3. गलतियों से सीखें: हर बार जब कोई दिशा विफल होती है, तो AI एक नोट लिखता है: "अरे, उत्तर दिशा में जाना X के कारण काम नहीं आया; चलिए एक ऐसी दिशा आजमाते हैं जो X से बच सके।" यह लक्ष्य तक पहुँचने तक इन "दिशा निर्देशों" को बार-बार परिष्कृत (refine) करता रहता है।

उपमा: शेफ बनाम किचन स्टाफ

  • पुरानी विधि (SFS): आप 50 शेफ को काम पर रखते हैं। प्रत्येक शेफ शुरू से एक अलग व्यंजन बनाने की कोशिश करता है, और यदि वे असफल होते हैं, तो वे पूरी तरह से एक अलग रेसिपी आज़माते हैं। यह अराजक और महंगा है।
  • नई विधि (IRTD): आप 5 शेफ को काम पर रखते हैं। आप उन्हें एक मूल रेसिपी (initial code) देते हैं। यदि व्यंजन बहुत नमकीन है, तो आप रेसिपी को फेंक नहीं देते; आप बस उन्हें एक बेहतर निर्देश देते हैं: "रेसिपी वही रखें, लेकिन अगली बार कम नमक का उपयोग करें।" आप निर्देश को तब तक परिष्कृत करते रहते हैं जब तक कि व्यंजन एकदम सही न हो जाए।

यह बेहतर क्यों है? ("सुरक्षा" की गारंटी)

शोधकर्ताओं ने केवल यह नहीं कहा कि "यह काम करता है"; उन्होंने गणितीय रूप से इसे सिद्ध किया। उन्होंने यह दिखाने के लिए OGS (Oracle-Guided Inductive Synthesis) नामक एक अवधारणा का उपयोग किया कि IRTD "सुरक्षित" (Safe) है।

सरल शब्दों में, "सुरक्षित" का अर्थ है: "आप गलती से सही उत्तर को खो नहीं देंगे।"

कई AI विधियों में, यदि AI कोई गलती करता है और उसे "ठीक करने" की कोशिश करता है, तो यह कभी-कभी सच्चाई से इतना दूर जा सकता है कि वह सही समाधान को पूरी तरह से भूल जाता है। यह एक ऐसे GPS की तरह है जो, ट्रैफिक जाम से बचने के प्रयास में, आपको समुद्र के बीच में भेज देता है।

चूंकि IRTD प्रारंभिक कोड को स्थिर रखता है और केवल निर्देशों को बदलता है, इसलिए शोधकर्ताओं ने सिद्ध किया कि जब तक एक "सही निर्देश" मौजूद है, AI गणितीय रूप से उस तक पहुँचने में सक्षम होगा बिना मूल लक्ष्य को खोए।

सारांश: मुख्य निष्कर्ष

  • पुराना तरीका: जटिल, महंगा, और अनावश्यक रास्तों में भटकने में बहुत अधिक समय बिताता है।
  • नया तरीका (IRTD): सरल, कुशल, और नए क्षेत्रों में भटकने के बजाय बेहतर "निर्देश" प्राप्त करने पर ध्यान केंद्रित करता है।
  • परिणाम: यह महंगे तरीकों के समान ही प्रदर्शन करता है लेकिन अपने "सोचने के समय" का उपयोग करने में बहुत अधिक स्मार्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →