← नवीनतम पेपर
🤖 AI

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

यह शोध पत्र BUILD-AND-FIND को प्रस्तुत करता है, जो एक प्रयास-जागरूक (effort-aware) मूल्यांकन प्रोटोकॉल है जो न केवल कोडबेस की व्यवहारिक शुद्धता का आकलन करता है, बल्कि यह भी मापता है कि डाउनस्ट्रीम एजेंटों के लिए मूल डिज़ाइन इरादे और विशिष्टताओं को पुनः प्राप्त करने हेतु कितनी सटीकता और निरीक्षण प्रयास की आवश्यकता होती है।

मूल लेखक: Jhen-Ke Lin

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jhen-Ke Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर "BUILD-AND-FIND" की व्याख्या दी गई है।

मुख्य विचार: यह केवल उत्तर के बारे में नहीं है, यह नोट (नोट लिखने) के बारे में है

कल्पना कीजिए कि आपने एक शेफ (एक AI एजेंट) को एक गुप्त रेसिपी के आधार पर एक जटिल भोजन बनाने के लिए काम पर रखा है।

  • पुराना तरीका: आप भोजन चखते हैं। यदि स्वाद अच्छा है, तो शेफ को पास कर दिया जाता है।
  • नई समस्या: क्या होगा यदि शेफ एक स्वादिष्ट भोजन बनाता है, लेकिन वे गुप्त सामग्रियों को एक ताले वाले बॉक्स में छिपा देते हैं, रेसिपी को अदृश्य स्याही में लिखते हैं, या रसोई को अस्त-व्यस्त छोड़कर चले जाते हैं? बाद में, एक अन्य शेफ (एक अलग AI) को अंदर आने, भोजन का स्वाद लेने और यह समझने की आवश्यकता होगी कि इसे कैसे बनाया गया था ताकि वे जले हुए किनारे को ठीक कर सकें या नमक की मात्रा बढ़ा सकें। यदि पहले शेफ ने स्पष्ट संकेत नहीं छोड़े, तो दूसरा शेफ विफल हो सकता है, भले ही भोजन स्वादिष्ट रहा हो।

यह पेपर AI कोडर्स को टेस्ट करने का एक नया तरीका पेश करता है जिसे BUILD-AND-FIND कहा जाता है। केवल यह जाँचने के बजाय कि कोड "काम करता है" (स्वाद अच्छा है), यह जाँचता है कि क्या कोड अगले व्यक्ति (या AI) के लिए पढ़ना और समझना आसान है जिसे बाद में इसके साथ काम करना होगा।


दो भूमिकाएँ: बिल्डर और फाइंडर

शोधकर्ताओं ने दो अलग-अलग भूमिकाओं के साथ एक खेल तैयार किया है:

  1. बिल्डर (शेफ):

    • उन्हें एक गुप्त "स्पेसिफिकेशन" (एक गुप्त रेसिपी) दी जाती है।
    • उनका काम उन निर्देशों के आधार पर एक पूर्ण सॉफ्टवेयर प्रोजेक्ट (रसोई और भोजन) बनाना है।
    • उन्हें यह नहीं पता कि कोई तुरंत उनके काम को देखने वाला है; उन्हें बस इसे काम करने योग्य बनाना है।
  2. फाइंडर (निरीक्षक):

    • उन्हें केवल तैयार कोड (रसोई और भोजन) दिया जाता है। उन्हें मूल गुप्त रेसिपी देखने की अनुमति नहीं है।
    • उन्हें डिज़ाइन विकल्पों (जैसे, "शेफ ने इस विशिष्ट प्रकार के ओवन को क्यों चुना?" या "नमक कहाँ रखा गया है?") के बारे में कई विकल्प वाले प्रश्न दिए जाते हैं।
    • उनका काम कोड को देखना, सबूत ढूँढना और प्रश्नों के सही उत्तर देना है।

स्कोरकार्ड: सटीकता बनाम प्रयास (Accuracy vs. Effort)

पेपर दो मुख्य चीजें मापता है:

  1. क्या उन्होंने इसे सही किया? (सटीकता/Accuracy)

    • क्या फाइंडर केवल कोड को देखकर सही उत्तर का पता लगा सकता है?
    • उदाहरण: क्या निरीक्षक सफलतापूर्वक छिपे हुए मसाले के जार को ढूँढ पाया?
  2. उन्हें कितनी मेहनत करनी पड़ी? (निरीक्षण प्रयास/Inspection Effort)

    • यह इस पेपर का सबसे बड़ा नवाचार है। यदि दो बिल्डर ऐसा कोड बनाते हैं जिससे फाइंडर सही उत्तर तक पहुँच सके, तो किसका कोड समझना अधिक आसान था?
    • शोधकर्ता "प्रयास" को इस बात से मापते हैं कि फाइंडर को कितने बाइट्स (bytes) कोड को पढ़ना या खोजना पड़ा।
    • उदाहरण: यदि शेफ A ने नमक का जार काउंटर पर छोड़ दिया, और शेफ B ने उसे एक जटिल कोड वाले ताले वाले सेफ के अंदर छिपा दिया, तो दोनों शेफ ने खाने योग्य भोजन बनाया। लेकिन शेफ A ने इसे अगले व्यक्ति के लिए आसान बनाया। यह पेपर उस शेफ को पुरस्कृत करता है जो "नमक" को काउंटर पर छोड़ता है।

यह क्यों महत्वपूर्ण है

यह पेपर तर्क देता है कि भविष्य में, AI एजेंट टीमों में काम करेंगे। एक AI प्रोग्राम लिखता है, और दूसरा AI बाद में उसे ठीक करता है या अपडेट करता है।

  • यदि पहला AI ऐसा कोड लिखता है जो "सही" है लेकिन अव्यवस्थित या भ्रमित करने वाला है, तो दूसरा AI संघर्ष करेगा।
  • BUILD-AND-FIND यह सिद्ध करता है कि हम यह मापने के लिए कि AI का कोड कितना "पठनीय" (legible) या "संवादात्मक" (communicative) है, इसे इस बात से अलग कर सकते हैं कि क्या वह वास्तव में चलता है।

परिणाम (उन्होंने क्या पाया)

शोधकर्ताओं ने कई शक्तिशाली AI मॉडल (जैसे GPT-5, Claude Opus और अन्य) का दो प्रकार के कार्यों पर परीक्षण किया: एक मिनी-डेटाबेस बनाना और एक छोटा वेब सर्वर बनाना।

  • "हाई प्रायर" (High Prior) की समस्या: उन्होंने जो प्रश्न पूछे थे वे ऐसी चीजें थीं जिन्हें अनुभवी इंजीनियर आमतौर पर जानते हैं (जैसे, "डेटाबेस आमतौर पर लिखने से पहले लॉग सेव करते हैं")। क्योंकि AI स्मार्ट हैं, वे अपने सामान्य ज्ञान का उपयोग करके बिना कोड पढ़े भी सही उत्तर का अनुमान लगा सकते थे।
  • समाधान: क्योंकि सभी ने उत्तर सही दिए, शोधकर्ता केवल "सही उत्तरों" को नहीं गिन सकते थे। इसके बजाय, उन्होंने देखा कि AI को कितना पढ़ना पड़ा।
    • कुछ AI मॉडल ने ऐसा कोड लिखा जहाँ उत्तर स्पष्ट और खोजने में आसान थे (कम प्रयास)।
    • अन्य AI मॉडल ने ऐसा कोड लिखा जहाँ उत्तर फाइलों में गहराई में दबे हुए थे, जिससे फाइंडर को बहुत अधिक पढ़ने की आवश्यकता पड़ी (अधिक प्रयास)।
  • विजेता: जिन मॉडल ने ऐसे कोड बनाए जिन्हें खोजने के लिए न्यूनतम पठन (reading) की आवश्यकता थी, उन्हें उनके डिज़ाइन विकल्पों को "संवादित" करने में सर्वश्रेष्ठ माना गया।

सुरक्षा जाल (कंट्रोल्स)

यह सुनिश्चित करने के लिए कि AI केवल धोखाधड़ी या अनुमान नहीं लगा रहे थे, शोधकर्ताओं ने सुरक्षा जाँचें जोड़ीं:

  • प्रश्न-मात्र परीक्षण (Question-Only Test): उन्होंने फाइंडर को बिना कोई कोड दिखाए प्रश्न पूछे। यदि AI ने यहाँ सही उत्तर दिया, तो वह केवल सामान्य ज्ञान के आधार पर अनुमान लगा रहा था।
  • स्पेसिफिकेशन-मात्र परीक्षण (Spec-Only Test): उन्होंने फाइंडर को गुप्त रेसिपी दिखाई लेकिन कोई कोड नहीं दिखाया। इससे यह सिद्ध हुआ कि रेसिपी स्पष्ट थी।
  • "गेट" (The Gate): शोधकर्ता "प्रयास" के स्कोर को तभी गिनते थे जब फाइंडर वास्तव में सही उत्तर तक पहुँच जाता था। यदि फाइंडर उत्तर नहीं ढूँढ पाता था, तो कोड को विफल माना जाता था, चाहे उसे पढ़ने में कितना भी कम समय क्यों न लगा हो।

सारांश

BUILD-AND-FIND AI कोडर्स के लिए एक नया परीक्षण है। यह पूछता है: "यदि आप यह कोड लिखते हैं, तो क्या दूसरा AI आसानी से समझ पाएगा कि आपने ये चुनाव क्यों किए?"

यह केवल "क्या कोड चलता है?" पूछने से आगे बढ़कर यह पूछता है कि "क्या कोड भविष्य के लिए एक अच्छा संचार उपकरण है?" सबसे अच्छा AI वह नहीं है जो केवल सही चीज़ बनाता है; बल्कि वह है जो चीज़ को इस तरह से बनाता है जिससे अगले व्यक्ति के लिए काम को आगे बढ़ाना आसान हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →