← नवीनतम पेपर
💻 computer science

RepoZero: Can LLMs Generate a Code Repository from Scratch?

यह शोध पत्र RepoZero प्रस्तुत करता है, जो API विनिर्देशों के माध्यम से शून्य से पूर्ण सॉफ़्टवेयर रिपॉजिटरी बनाने वाले LLMs के पूर्णतः स्वचालित, निष्पादन-आधारित सत्यापन के लिए पहला बेंचमार्क है, और इसके साथ ही एजेंटिक कोड-टेस्ट इवोल्यूशन (ACE) फ्रेमवर्क को भी पेश करता है, जो यह प्रकट करता है कि इस जटिल कार्य में उच्च सफलता दर प्राप्त करने के लिए अत्याधुनिक एजेंट भी संघर्ष करते हैं।

मूल लेखक: Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "RepoZero" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

मुख्य विचार: क्या AI ब्लूप्रिंट (नक्शे) से एक घर बना सकता है?

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक (एक AI) है जो नल ठीक करने या एक दीवार पेंट करने में बहुत माहिर है। लेकिन अब, आप उससे एक बहुत कठिन सवाल पूछते हैं: "क्या तुम केवल निर्देशों की एक सूची का उपयोग करके, मूल ब्लूप्रिंट या तैयार घर को देखे बिना, शुरुआत से एक पूरा घर बना सकते हो?"

यह पेपर, RepoZero, बिल्कुल यही सवाल पूछता है, लेकिन घरों के बजाय, यह सॉफ्टवेयर कोड रिपॉजिटरी (एक सॉफ्टवेयर प्रोग्राम बनाने वाली फाइलों का संग्रह) के बारे में है।

समस्या: "दिखावा करो जब तक सफल न हो जाओ" वाला जाल (The "Fake It Till You Make It" Trap)

पहले, शोधकर्ता इन AI रोबोटों का परीक्षण करने के लिए उन्हें छोटे बग्स ठीक करने या सिंगल फाइल लिखने के लिए कहते थे। लेकिन जब बात शुरुआत से एक पूरा प्रोग्राम बनाने की आती है, तो यह बताना मुश्किल हो जाता है कि AI ने वास्तव में इसे बनाना समझ लिया है या इसने केवल अपने ट्रेनिंग डेटा से उत्तर याद (memorize) कर लिया है (जैसे कि एक छात्र जिसने गणित सीखने के बजाय सीधे किताब के उत्तर रट लिए हों)।

मौजूदा अधिकांश परीक्षण मानव या अन्य AI पर निर्भर करते हैं जो कोड को पढ़कर कहते हैं, "यह अच्छा लग रहा है!" यह एक शिक्षक की तरह है जो गणित के टेस्ट को केवल अंतिम संख्या देखकर ग्रेड देता है, बिना यह देखे कि काम कैसे किया गया। इसमें धोखाधड़ी करना आसान है, और यह बहुत विश्वसनीय नहीं है।

समाधान: "RepoZero" चुनौती

लेखकों ने एक नई, बेहद कठिन परीक्षा बनाई है जिसे RepoZero कहा जाता है। यह कैसे काम करता है, इसके लिए एक खाना पकाने का उदाहरण (Cooking Analogy) देखें:

  1. मूल व्यंजन (स्रोत): कल्पना कीजिए कि एक प्रसिद्ध शेफ के पास एक जटिल केक की गुप्त रेसिपी है। हमें पता है कि उसका स्वाद और व्यवहार कैसा है।
  2. चुनौती: हम AI रोबोट को सामग्री की एक सूची और एक विवरण देते हैं कि केक को क्या करना चाहिए (जैसे, "इसे गर्म करने पर फूलना चाहिए," "इसका स्वाद मीठा होना चाहिए")।
  3. ट्विस्ट (क्रॉस-लैंग्वेज): रोबोट को मूल रेसिपी का उपयोग करने की अनुमति नहीं है। इससे भी बुरा यह है कि उसे एक पूरी तरह से अलग किचन में केक बनाना होगा जिसमें अलग उपकरण हों।
    • यदि मूल केक Python किचन में बनाया गया था, तो रोबोट को इसे JavaScript किचन में बनाना होगा।
    • यदि मूल C++ था, तो रोबोट को इसे Rust में बनाना होगा।
    • क्यों? यह रोबोट को केवल रेसिपी कॉपी करने से रोकता है। यह उसे तर्क (logic) को वास्तव में समझने और उसे शून्य से फिर से बनाने के लिए मजबूर करता है।
  4. टेस्ट (सत्यापन): रोबोट अपना खुद का केक बनाता है। फिर हम दोनों केकों को साथ रखकर चखते हैं। यदि रोबोट का केक मूल के समान ही व्यवहार करता है (वही उभार, वही स्वाद, वही बनावट), तो वह पास हो जाता है। यदि यह थोड़ा भी अलग है, तो वह फेल हो जाता है।

"ACE" फ्रेमवर्क: रोबोट का सेल्फ-करेक्शन लूप

यह पेपर एक नया तरीका भी पेश करता है जिससे रोबकर काम करते समय सीख सकता है, जिसे ACE (एजेंटिक कोड-टेस्ट इवोल्यूशन) कहा जाता है।

इसे एक बड़े खेल से पहले अभ्यास सत्र की तरह समझें:

  • सिर्फ एक बार घर बनाने की कोशिश करने और उम्मीद करने के बजाय कि सब ठीक होगा, रोबोट एक छोटा हिस्सा बनाता है, और फिर तुरंत उसका परीक्षण (test) करता है।
  • यदि परीक्षण विफल होता है (जैसे, "दरवाजा नहीं खुल रहा है"), तो रोबोट त्रुटि (error) देखता है, दरवाजे को ठीक करता है, और फिर से परीक्षण करता है।
  • यह चक्र दोहराता है: बनाओ -> टेस्ट करो -> ठीक करो -> बनाओ
  • पेपर में पाया गया कि "ACE" लूप (अभ्यास लूप) का उपयोग करने वाले रोबोटों ने एक बार में निर्माण करने की कोशिश करने वाले रोबोटों की तुलना में अंतिम उत्पाद बनाने में बहुत बेहतर प्रदर्शन किया।

उन्होंने क्या पाया?

परिणाम आश्चर्यजनक और थोड़े गंभीर थे:

  • यहाँ तक कि "सबसे स्मार्ट" रोबोट भी संघर्ष करते हैं: आज उपलब्ध सबसे उन्नत AI मॉडल (जैसे Claude, DeepSeek, और Kimi) केवल 30% से 55% बार ही सफलतापूर्वक पूरा सॉफ्टवेयर "घर" बना सके।
  • अंतर बहुत बड़ा है: हालांकि ये AI कोड की एक सिंगल लाइन लिखने में अद्भुत हैं, लेकिन वे अभी भी स्वायत्त रूप से जटिल, काम करने वाले सॉफ्टवेयर सिस्टम को शून्य से बनाने के मामले में बहुत पीछे हैं।
  • सेल्फ-चेकिंग महत्वपूर्ण है: जिन रोबोटों ने "ACE" लूप (अपने काम को टेस्ट और फिक्स करना) का उपयोग किया, उन्होंने काफी बेहतर प्रदर्शन किया। यह सुझाव देता है कि AI के लिए एक सच्चा सॉफ्टवेयर इंजीनियर बनने के लिए, उसे केवल अनुमान लगाने के बजाय अपने काम की जांच करने में बेहतर होने की आवश्यकता है।

सारांश

RepoZero AI रोबोटों के लिए एक नया, सख्त जिम है। यह उन्हें एक अलग भाषा में जटिल सॉफ्टवेयर को फिर से बनाने के लिए मजबूर करता है ताकि यह साबित हो सके कि वे केवल उत्तर याद करके धोखाधड़ी नहीं कर रहे हैं। यह परीक्षण दिखाता है कि हालांकि AI छोटे कार्यों के लिए अच्छा हो रहा है, लेकिन स्वतंत्र रूप से पूरे सॉफ्टवेयर प्रोजेक्ट बनाने के लिए उसे अभी लंबा रास्ता तय करना है। पेपर का सुझाव है कि वहां पहुँचने की कुंजी AI को बनाने के दौरान अपनी गलतियों को टेस्ट करने और ठीक करने के लिए सिखाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →