← नवीनतम पेपर
🤖 AI

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

यह शोध पत्र "एआई हार्नेस इंजीनियरिंग" (AI Harness Engineering) का प्रस्ताव करता है, जो एक रनटाइम सबस्ट्रेट फ्रेमवर्क है जो स्वायत्त सॉफ्टवेयर इंजीनियरिंग के केंद्र को केवल मॉडल क्षमता से हटाकर एकीकृत मॉडल-हार्नेस-एनवायरनमेंट सिस्टम पर स्थानांतरित करता है, जो सत्यापन योग्य, ऑडिट करने योग्य और रखरखाव योग्य सॉफ्टवेयर परिवर्तनों को उत्पन्न करने के लिए ग्यारह घटक जिम्मेदारियों और एक चार-स्तरीय सीढ़ी को परिभाषित करता है।

मूल लेखक: Hailin Zhong, Shengxin Zhu

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hailin Zhong, Shengxin Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, सुपर-फास्ट प्रशिक्षु (apprentice) प्रोग्रामर है। यह प्रशिक्षु (फाउंडेशन मॉडल) लगभग किसी भी अन्य व्यक्ति से बेहतर कोड लिख सकता है, बग्स ठीक कर सकता है और यह समझा सकता है कि सॉफ्टवेयर कैसे काम करता है। लेकिन यदि आप इस प्रशिक्षु को बिना किसी सहायता के एक वास्तविक सॉफ्टवेयर प्रोजेक्ट में खुला छोड़ देते हैं, तो वे अक्सर असफल हो जाते हैं। वे गलत फ़ाइल को ठीक कर सकते हैं, कुछ और तोड़ सकते हैं, भूल सकते हैं कि वे क्या कर रहे थे, या जीत घोषित कर सकते हैं जबकि काम वास्तव में पूरा नहीं हुआ होता है।

लंबे समय तक, लोगों ने सोचा कि समस्या यह थी कि प्रशिक्षु पर्याप्त स्मार्ट नहीं था। उन्होंने सोचा कि हमें बस प्रशिक्षु को और अधिक स्मार्ट बनाने के लिए प्रशिक्षित करने की आवश्यकता है।

यह पेपर तर्क देता है कि यह देखने का गलत तरीका है। समस्या प्रशिक्षु का मस्तिष्क नहीं है; समस्या वह वर्कशॉप (कार्यशाला) है जिसमें वे काम कर रहे हैं।

मुख्य विचार: "हार्नेस" (Harness)

लेखक एक विशेष रनटाइम सबस्ट्रेट (runtime substrate) प्रस्तावित करते हैं, जिसे वे एक AI हार्नेस कहते हैं।

AI हार्नेस को एक उच्च-तकनीकी निर्माण हार्नेस (construction harness) या एक पर्वतारोही के लिए सुरक्षा उपकरण (safety rig) की तरह समझें।

  • प्रशिक्षु (मॉडल): चढ़ने की शक्ति और कौशल रखता है।
  • पर्वत (सॉफ्टवेयर वातावरण): जटिल है, ढीले पत्थरों और छिपी हुई दरारों से भरा है।
  • हार्नेस (नया सिस्टम): यह वह गियर है जो पर्वतारोही को पर्वत से जोड़ता है। यह उनके औजारों को थामे रखता है, उन्हें बताता है कि कहाँ हाथ रखना है, यह जाँचता है कि उनकी रस्सी सुरक्षित है या नहीं, और उन्होंने बिल्कुल क्या किया इसका सटीक रिकॉर्ड रखता है।

हार्नेस के बिना, पर्वतारोही के पास बेहतरीन मांसपेशियां हो सकती हैं, फिर भी वे गिर सकते हैं क्योंकि उन्हें पता नहीं था कि कदम कहाँ रखना है या उनके पास अपनी सुरक्षा की जाँच करने का कोई तरीका नहीं था। पेपर का दावा है कि सॉफ्टवेयर इंजीनियरिंग क्षमता केवल मॉडल की बुद्धिमत्ता के बारे में नहीं है; यह इस बारे में है कि सिस्टम (मॉडल + हार्नेस + वातावरण) एक साथ मिलकर कैसे काम करता है।

हार्नेस के 11 कार्य

यह पेपर इस "हार्नेस" को 11 विशिष्ट कार्यों में विभाजित करता है, जो एक प्रोजेक्ट मैनेजर और एक सुरक्षा निरीक्षक के संयोजन के समान है:

  1. टास्क स्पेसिफिकेशन (कार्य विशिष्टता): प्रशिक्षु को स्पष्ट रूप से बताना कि क्या बनाना है।
  2. कॉन्टेक्स्ट सिलेक्शन (संदर्भ चयन): उन्हें सही ब्लूप्रिंट (फ़ाइलें) सौंपना ताकि वे गलत फ़ाइलों को न देखें।
  3. टूल एक्सेस (औजारों तक पहुँच): उन्हें सही रिंच और पेचकश देना।
  4. प्रोजेक्ट मेमोरी (परियोजना स्मृति): उन्हें इमारत के इतिहास और चीजों के स्थान के बारे में याद दिलाना।
  5. टास्क स्टेट (कार्य अवस्था): उन्होंने क्या किया और आगे क्या करना है, इसकी चेकलिस्ट रखना।
  6. ऑब्जर्वेबिलिटी (अवलोकन क्षमता): उन्हें लॉग और त्रुटि संदेश (error messages) स्पष्ट रूप से देखने देना।
  7. फेलियर एट्रिब्यूशन (विफलता का कारण निर्धारण): यदि कुछ टूट जाता है, तो उसे ठीक करने की कोशिश करने से पहले यह समझने में मदद करना कि क्यों हुआ।
  8. वेरिफिकेशन (सत्यापन): उनसे यह साबित करवाना कि सुधार वास्तव में काम करता है।
  9. परमिशन (अनुमति): उन्हें खतरनाक चीजें करने से रोकना (जैसे पूरी इमारत को डिलीट कर देना)।
  10. एन्ट्रॉपी ऑडिटिंग (एन्ट्रॉपी ऑडिट): यह जाँच करना कि क्या उन्होंने पीछे कोई गंदगी छोड़ी है (जैसे पुराना कोड या अव्यवस्थित दस्तावेज़)।
  11. इंटरवेंशन रिकॉर्डिंग (हस्तक्षेप रिकॉर्डिंग): यह नोट करना कि क्या किसी इंसान को मदद के लिए हस्तक्षेप करना पड़ा, और क्यों।

"लैडर" (सीढ़ी) प्रयोग (H0 से H3)

अपने बिंदु को सिद्ध करने के लिए, लेखकों ने यह परीक्षण करने के लिए चार स्तरों की एक "सीढ़ी" बनाई कि प्रशिक्षु को कितनी मदद की आवश्यकता है। उन्होंने कार्य और मॉडल को समान रखा, लेकिन हार्नेस स्तर को बदल दिया:

  • स्तर 0 (नग्न प्रशिक्षु - The Naked Apprentice): प्रशिक्षु को कार्य और फ़ाइलें मिल जाती हैं। कोई औजार नहीं, कोई स्मृति नहीं, कोई सुरक्षा जाँच नहीं। उन्हें सब कुछ अनुमान लगाना पड़ता है।
  • स्तर 1 (टूल बेल्ट): प्रशिक्षु को उन औजारों की एक सूची मिलती है जिनका वे उपयोग कर सकते हैं और उनका उपयोग करने के लिए एक प्रोटोकॉल मिलता है। वे अभी भी भटक सकते हैं, लेकिन उनके पास सही उपकरण हैं।
  • स्तर 2 (मैप और नोटबुक): प्रशिक्षु को औजारों के साथ-साथ इमारत का एक नक्शा (आर्किटेक्चर), पिछली गलतियों की एक नोटबुक, और अपनी प्रगति को ट्रैक करने के लिए एक चेकलिस्ट मिलती है।
  • स्तर 3 (पूर्ण सुरक्षा उपकरण - The Full Safety Rig): प्रशिक्षु को ऊपर दी गई सभी चीजें मिलती हैं, साथ ही बग को दोहराने (reproduce), निदान करने, उसे ठीक करने, और काम पूरा होने से पहले यह साबित करने के लिए एक औपचारिक रिपोर्ट लिखने का एक सख्त प्रोटोकॉल मिलता है कि सुधार वास्तव में काम करता है।

उन्हें क्या मिला

जब उन्होंने प्रत्येक स्तर पर एक ही कार्य (लॉगिन बग को ठीक करना) चलाया, तो परिणाम स्पष्ट थे:

  • स्तर 0 पर, प्रशिक्षु अंततः बग को ठीक कर सकता है, लेकिन वह इस बात का कोई प्रमाण नहीं छोड़ता कि उसने इसे कैसे किया, और वह अन्य चीजों को भी तोड़ सकता है।
  • स्तर 3 पर, प्रशिक्षु ने केवल एक सुधार ही नहीं दिया; उसने साक्ष्य का एक पूर्ण पैकेज तैयार किया। उन्होंने बग दिखाया, बताया कि यह क्यों हुआ, सुधार दिखाया, और यह साबित करने के लिए परीक्षण चलाए कि यह काम करता है।

पेपर निष्कर्ष निकालता है कि प्रश्न यह नहीं होना चाहिए कि "क्या AI कोड लिखने के लिए पर्याप्त स्मार्ट है?" बल्कि यह है कि "क्या मॉडल-हार्नेस-वातावरण सिस्टम एक ऐसा परिवर्तन उत्पन्न करता है जो सत्यापन योग्य (verifiable), एट्रिब्यूटेड (attributed), और रखरखाव योग्य (maintainable) है?"

मुख्य निष्कर्ष (The Takeaway)

पेपर सुझाव देता है कि AI को सॉफ्टवेयर इंजीनियरिंग के लिए वास्तव में उपयोगी बनाने के लिए, हमें केवल AI को स्मार्ट बनाने पर ध्यान केंद्रित नहीं करना चाहिए। हमें बेहतर वर्कशॉप (हार्नेस) बनाने की आवश्यकता है जो कॉन्टेक्स्ट, टूल्स, मेमोरी और सुरक्षा जाँचों को प्रबंधित करे।

जिस तरह एक मानव डेवलपर अपने IDE, अपने दस्तावेज़ों और अपने टेस्टिंग सूट पर निर्भर करता है, एक AI एजेंट को अपनी कच्ची कोडिंग क्षमता को विश्वसनीय सॉफ्टवेयर इंजीनियरिंग में बदलने के लिए एक संरचित हार्नेस की आवश्यकता होती है। यह पेपर इस "हार्नेस" को बनाने के लिए एक ब्लूप्रिंट और यह मापने का एक तरीका प्रदान करता है कि यह कितनी अच्छी तरह काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →