← नवीनतम पेपर
🤖 AI

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

यह सर्वेक्षण एलएलएम-आधारित एजेंटों के लिए एक मॉडल-हार्नेस फ्रेमवर्क प्रस्तावित करता है जो निष्क्रिय प्रश्न-उत्तर से सक्रिय कार्य पूर्णता की ओर ध्यान केंद्रित करता है, और यह विश्लेषण करता है कि फाउंडेशन मॉडल और निष्पादन रनटाइम के बीच का युग्मन—जिसमें छह प्रमुख उत्तरदायित्व शामिल हैं—सिस्टम के प्रदर्शन, विश्वसनीयता और सामान्यीकरण को कैसे निर्धारित करता है।

मूल लेखक: Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yu
प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "From Question Answering to Task Completion: A Survey on Agent System and Harness Design" नामक शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

मुख्य विचार: यह केवल दिमाग के बारे में नहीं है

कल्पना कीजिए कि आपने एक शानदार डिनर पार्टी के लिए एक जटिल, बहु-कोर्स भोजन पकाने के लिए एक विश्व स्तरीय प्रतिभाशाली शेफ (AI मॉडल) को काम पर रखा है। अतीत में, लोगों को लगता था कि केवल यह मायने रखता है कि शेफ कितना बुद्धिमान है। यदि शेफ को हर रेसिपी पता हो, तो भोजन उत्तम होगा।

लेकिन यह शोध पत्र तर्क देता है कि शेफ केवल आधी कहानी है।

यदि आप उस शेफ को एक टूटा हुआ चूल्हा, बिना सामग्री, एक भ्रमित करने वाला मेनू और कोई बताने वाला नहीं देते कि सूप कब जल रहा है, तो भोजन विफल हो जाएगा—भले ही शेफ एक जीनियस क्यों न हो। वह "चूल्हा", "सामग्री" और "किचन मैनेजर" ही वह है जिसे लेखक हार्नेस (Harness) कहते हैं।

शोध पत्र का मुख्य दावा है: एजेंट का प्रदर्शन केवल इस पर निर्भर नहीं करता कि AI कितना स्मार्ट है; बल्कि इस पर निर्भर करता है कि AI को उस "किचन" (Harness) के साथ कितनी अच्छी तरह जोड़ा गया है जिसमें वह काम करता है।


बड़े होने के चार चरण

लेखक बताते हैं कि हमने इन AI "एजेंटों" को एक बच्चे के बड़े होने की तरह चार विशिष्ट चरणों में बनाया है:

  1. चरण 1: प्रॉम्प्ट इंजीनियर ( "कृपया विनम्र रहें" वाला चरण)

    • उपमा: आप एक बुद्धिमान लेकिन शर्मीले छात्र से सवाल पूछने की कोशिश कर रहे हैं। आप पूछने के अलग-अलग तरीके आजमाते हैं: "कृपया इसे समझाएं," "यहाँ एक उदाहरण है," या "कदम-दर-कदम सोचें।"
    • सीमा: आप केवल कुछ ही बार विनम्रता से पूछ सकते हैं। यदि छात्र को उत्तर नहीं पता है, या यदि प्रश्न के लिए उन्हें लाइब्रेरी जाने, एक किताब खोलने और रिपोर्ट लिखने की आवश्यकता है, तो केवल विनम्रता से पूछने से मदद नहीं मिलेगी।
  2. चरण 2: कॉन्टेक्स्ट इंजीनियर ( "लाइब्रेरी सहायक" वाला चरण)

    • उपमा: अब आपको एहसास होता है कि छात्र को सही किताबें खोजने में मदद की जरूरत है। आप एक ऐसा सिस्टम बनाते हैं जो सही पन्ने निकालता है, उन्हें सारांशित करता है, और छात्र के जवाब देने से पहले उन्हें थमा देता है।
    • सीमा: आप अभी भी उन्हें केवल जानकारी दे रहे हैं। यदि छात्र गलत चीज़ लिखना शुरू कर देता है, या यदि वे विचलित हो जाते हैं, तो आपके पास उन्हें रोकने, उनके काम की जांच करने या उनकी गलतियों को सुधारने के लिए कोई सिस्टम नहीं है।
  3. चरण 3: हार्नेस इंजीनियर ( "प्रोजेक्ट मैनेजर" वाला चरण)

    • उपमा: यह एक बड़ा बदलाव है। आप केवल निर्देश देना बंद कर देते हैं और छात्र के चारों ओर एक पूर्ण ऑपरेटिंग सिस्टम बनाना शुरू करते हैं।
      • अवलोकन (Observation): आप उन्हें देखने के लिए एक कैमरा देते हैं कि क्या हो रहा है।
      • नियंत्रण (Control): आपके पास एक टाइमर और एक स्टॉप बटन है।
      • क्रिया (Action): आप उन्हें कीबोर्ड और माउस देते हैं।
      • सत्यापन (Verification): आपके पास एक शिक्षक है जो हर कदम की जांच करता है। यदि छात्र ऐसा कोड लिखता है जो टूट जाता है, तो सिस्टम स्वचालित रूप से उसे वापस ले लेता है और कहता है, "फिर से प्रयास करें।"
    • परिणाम: शोध पत्र दिखाता है कि केवल इस "किचन" (Harness) को फिर से डिजाइन करके, आप एक औसत दर्जे के शेफ से 5-स्टार भोजन बनवा सकते हैं, या एक जीनियस शेफ से और भी बेहतर काम करवा सकते हैं।
  4. चरण 4: सह-विकास का चरण ( "स्व-सुधार टीम" वाला चरण)

    • उपमा: अब, छात्र और किचन मैनेजर एक-दूसरे से सीखते हैं। छात्र इस विशिष्ट किचन में अभ्यास करके खाना बनाने में बेहतर होता है, और किचन मैनेजर छात्र को खाना बनाते हुए देखकर प्रबंधन करने में बेहतर होता है। वे एक साथ विकसित होते हैं।

"किचन" के छह भाग (Harness की संरचना)

यह शोध पत्र इस "Harness" को छह विशिष्ट कार्यों में विभाजित करता है, जैसे एक सुव्यवस्थित किचन क्रू:

  1. अवलोकन (आंखें): AI दुनिया को कैसे देखता है? क्या वह एक धुंधली स्क्रीनशॉट देख रहा है या डेटा की एक स्पष्ट, व्यवस्थित सूची?
  2. कॉन्टेक्स्ट (याददाश्त): AI क्या याद रखता है? क्या हम उसे बातचीत का पूरा इतिहास देते हैं, या केवल सबसे महत्वपूर्ण नोट्स?
  3. नियंत्रण (कंडक्टर): कौन तय करता है कि आगे क्या होगा? क्या AI तब तक चलता रहता है जब तक वह थक न जाए, या एक मैनेजर उसे बताता है कि कब रुकना है, कब मदद मांगनी है, या कब कार्य बदलना है?
  4. क्रिया (हाथ): AI वास्तव में चीजें कैसे करता है? क्या वह एक बटन क्लिक कर सकता है, या वह केवल कहता है "मैंने इसे क्लिक किया"? हार्नेस AI के शब्दों को वास्तविक क्रियाओं में बदल देता है।
  5. स्टेट (फाइलिंग कैबिनेट): AI अपना काम कहाँ संग्रहीत करता है? यदि वह एक ड्राफ्ट लिखता है, तो क्या वह एक फाइल में सुरक्षित है, या स्क्रीन रिफ्रेश होने पर खो जाता है?
  6. सत्यापन (सुरक्षा निरीक्षक): यह बहुत महत्वपूर्ण है। इससे पहले कि AI ग्राहक को कोई फाइल भेजे, क्या कोई सुरक्षा जांच चलती है? यदि AI कोई खतरनाक कदम उठाता है, तो क्या सिस्टम उसे रोकता है?

यह क्यों मायने रखता है: "बॉटलनेक" का बदलाव

शोध पत्र ने कई परीक्षणों (benchmarks) को देखा जहाँ AI वास्तविक काम करने की कोशिश करता है, जैसे कंप्यूटर कोड ठीक करना या वेब ब्राउज़ करना।

  • पुराना दृष्टिकोण: हमें लगा कि यदि हम बस AI के दिमाग को बड़ा और स्मार्ट बना देंगे, तो वह सब कुछ हल कर देगा।
  • नया दृष्टिकोण: शोध पत्र ने पाया कि "दिमाग" एक सीमा तक पहुँच गया है। दिमाग को बड़ा बनाने से केवल मामूली सुधार ही मिलते हैं। असली बाधा (bottleneck) अब Harness है।

प्रमाण:

  • कोडिंग टेस्ट में, एक ही AI मॉडल एक साधारण हार्नेस के साथ 23% सफलता दर प्राप्त करता है, लेकिन एक बेहतर डिज़ाइन किए गए हार्नेस के साथ 72% सफलता दर प्राप्त करता है।
  • यह एक फेरारी इंजन (AI) को साइकिल के फ्रेम (खराब हार्नेस) में रखने जैसा है। यह तेज़ नहीं चलेगा। उसी इंजन को रेस कार के चेसिस (अच्छा हार्नेस) में रखें, और वह जीत जाएगा।

निष्कर्ष

हम AI को केवल एक "चैटबॉट" के रूप में सोचने से दूर जा रहे हैं जो सवालों के जवाब देता है। हम स्वायत्त कार्यकर्ता (autonomous workers) बना रहे हैं।

एक विश्वसनीय कार्यकर्ता बनाने के लिए, आप केवल सबसे स्मार्ट दिमाग नहीं चुन सकते। आपको वह संपूर्ण वातावरण डिजाइन करना होगा जिसमें वे काम करते हैं:

  • वे क्या देखते हैं?
  • उनके पास कौन से उपकरण हैं?
  • उनके काम की जांच कौन करता है?
  • गलती होने पर वे कैसे उबरते हैं?

शोध पत्र का निष्कर्ष है कि AI का भविष्य केवल बड़े मॉडल्स के बारे में नहीं है; यह उन प्रणालियों की बेहतर इंजीनियरिंग के बारे में है जो उन मॉडल्स के चारों ओर होती हैं। एजेंट की गुणवत्ता मॉडल और उसके हार्नेस के बीच की साझेदारी से आती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →