From Question Answering to Task Completion: A Survey on Agent System and Harness Design
यह सर्वेक्षण एलएलएम-आधारित एजेंटों के लिए एक मॉडल-हार्नेस फ्रेमवर्क प्रस्तावित करता है जो निष्क्रिय प्रश्न-उत्तर से सक्रिय कार्य पूर्णता की ओर ध्यान केंद्रित करता है, और यह विश्लेषण करता है कि फाउंडेशन मॉडल और निष्पादन रनटाइम के बीच का युग्मन—जिसमें छह प्रमुख उत्तरदायित्व शामिल हैं—सिस्टम के प्रदर्शन, विश्वसनीयता और सामान्यीकरण को कैसे निर्धारित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "From Question Answering to Task Completion: A Survey on Agent System and Harness Design" नामक शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।
मुख्य विचार: यह केवल दिमाग के बारे में नहीं है
कल्पना कीजिए कि आपने एक शानदार डिनर पार्टी के लिए एक जटिल, बहु-कोर्स भोजन पकाने के लिए एक विश्व स्तरीय प्रतिभाशाली शेफ (AI मॉडल) को काम पर रखा है। अतीत में, लोगों को लगता था कि केवल यह मायने रखता है कि शेफ कितना बुद्धिमान है। यदि शेफ को हर रेसिपी पता हो, तो भोजन उत्तम होगा।
लेकिन यह शोध पत्र तर्क देता है कि शेफ केवल आधी कहानी है।
यदि आप उस शेफ को एक टूटा हुआ चूल्हा, बिना सामग्री, एक भ्रमित करने वाला मेनू और कोई बताने वाला नहीं देते कि सूप कब जल रहा है, तो भोजन विफल हो जाएगा—भले ही शेफ एक जीनियस क्यों न हो। वह "चूल्हा", "सामग्री" और "किचन मैनेजर" ही वह है जिसे लेखक हार्नेस (Harness) कहते हैं।
शोध पत्र का मुख्य दावा है: एजेंट का प्रदर्शन केवल इस पर निर्भर नहीं करता कि AI कितना स्मार्ट है; बल्कि इस पर निर्भर करता है कि AI को उस "किचन" (Harness) के साथ कितनी अच्छी तरह जोड़ा गया है जिसमें वह काम करता है।
बड़े होने के चार चरण
लेखक बताते हैं कि हमने इन AI "एजेंटों" को एक बच्चे के बड़े होने की तरह चार विशिष्ट चरणों में बनाया है:
चरण 1: प्रॉम्प्ट इंजीनियर ( "कृपया विनम्र रहें" वाला चरण)
- उपमा: आप एक बुद्धिमान लेकिन शर्मीले छात्र से सवाल पूछने की कोशिश कर रहे हैं। आप पूछने के अलग-अलग तरीके आजमाते हैं: "कृपया इसे समझाएं," "यहाँ एक उदाहरण है," या "कदम-दर-कदम सोचें।"
- सीमा: आप केवल कुछ ही बार विनम्रता से पूछ सकते हैं। यदि छात्र को उत्तर नहीं पता है, या यदि प्रश्न के लिए उन्हें लाइब्रेरी जाने, एक किताब खोलने और रिपोर्ट लिखने की आवश्यकता है, तो केवल विनम्रता से पूछने से मदद नहीं मिलेगी।
चरण 2: कॉन्टेक्स्ट इंजीनियर ( "लाइब्रेरी सहायक" वाला चरण)
- उपमा: अब आपको एहसास होता है कि छात्र को सही किताबें खोजने में मदद की जरूरत है। आप एक ऐसा सिस्टम बनाते हैं जो सही पन्ने निकालता है, उन्हें सारांशित करता है, और छात्र के जवाब देने से पहले उन्हें थमा देता है।
- सीमा: आप अभी भी उन्हें केवल जानकारी दे रहे हैं। यदि छात्र गलत चीज़ लिखना शुरू कर देता है, या यदि वे विचलित हो जाते हैं, तो आपके पास उन्हें रोकने, उनके काम की जांच करने या उनकी गलतियों को सुधारने के लिए कोई सिस्टम नहीं है।
चरण 3: हार्नेस इंजीनियर ( "प्रोजेक्ट मैनेजर" वाला चरण)
- उपमा: यह एक बड़ा बदलाव है। आप केवल निर्देश देना बंद कर देते हैं और छात्र के चारों ओर एक पूर्ण ऑपरेटिंग सिस्टम बनाना शुरू करते हैं।
- अवलोकन (Observation): आप उन्हें देखने के लिए एक कैमरा देते हैं कि क्या हो रहा है।
- नियंत्रण (Control): आपके पास एक टाइमर और एक स्टॉप बटन है।
- क्रिया (Action): आप उन्हें कीबोर्ड और माउस देते हैं।
- सत्यापन (Verification): आपके पास एक शिक्षक है जो हर कदम की जांच करता है। यदि छात्र ऐसा कोड लिखता है जो टूट जाता है, तो सिस्टम स्वचालित रूप से उसे वापस ले लेता है और कहता है, "फिर से प्रयास करें।"
- परिणाम: शोध पत्र दिखाता है कि केवल इस "किचन" (Harness) को फिर से डिजाइन करके, आप एक औसत दर्जे के शेफ से 5-स्टार भोजन बनवा सकते हैं, या एक जीनियस शेफ से और भी बेहतर काम करवा सकते हैं।
- उपमा: यह एक बड़ा बदलाव है। आप केवल निर्देश देना बंद कर देते हैं और छात्र के चारों ओर एक पूर्ण ऑपरेटिंग सिस्टम बनाना शुरू करते हैं।
चरण 4: सह-विकास का चरण ( "स्व-सुधार टीम" वाला चरण)
- उपमा: अब, छात्र और किचन मैनेजर एक-दूसरे से सीखते हैं। छात्र इस विशिष्ट किचन में अभ्यास करके खाना बनाने में बेहतर होता है, और किचन मैनेजर छात्र को खाना बनाते हुए देखकर प्रबंधन करने में बेहतर होता है। वे एक साथ विकसित होते हैं।
"किचन" के छह भाग (Harness की संरचना)
यह शोध पत्र इस "Harness" को छह विशिष्ट कार्यों में विभाजित करता है, जैसे एक सुव्यवस्थित किचन क्रू:
- अवलोकन (आंखें): AI दुनिया को कैसे देखता है? क्या वह एक धुंधली स्क्रीनशॉट देख रहा है या डेटा की एक स्पष्ट, व्यवस्थित सूची?
- कॉन्टेक्स्ट (याददाश्त): AI क्या याद रखता है? क्या हम उसे बातचीत का पूरा इतिहास देते हैं, या केवल सबसे महत्वपूर्ण नोट्स?
- नियंत्रण (कंडक्टर): कौन तय करता है कि आगे क्या होगा? क्या AI तब तक चलता रहता है जब तक वह थक न जाए, या एक मैनेजर उसे बताता है कि कब रुकना है, कब मदद मांगनी है, या कब कार्य बदलना है?
- क्रिया (हाथ): AI वास्तव में चीजें कैसे करता है? क्या वह एक बटन क्लिक कर सकता है, या वह केवल कहता है "मैंने इसे क्लिक किया"? हार्नेस AI के शब्दों को वास्तविक क्रियाओं में बदल देता है।
- स्टेट (फाइलिंग कैबिनेट): AI अपना काम कहाँ संग्रहीत करता है? यदि वह एक ड्राफ्ट लिखता है, तो क्या वह एक फाइल में सुरक्षित है, या स्क्रीन रिफ्रेश होने पर खो जाता है?
- सत्यापन (सुरक्षा निरीक्षक): यह बहुत महत्वपूर्ण है। इससे पहले कि AI ग्राहक को कोई फाइल भेजे, क्या कोई सुरक्षा जांच चलती है? यदि AI कोई खतरनाक कदम उठाता है, तो क्या सिस्टम उसे रोकता है?
यह क्यों मायने रखता है: "बॉटलनेक" का बदलाव
शोध पत्र ने कई परीक्षणों (benchmarks) को देखा जहाँ AI वास्तविक काम करने की कोशिश करता है, जैसे कंप्यूटर कोड ठीक करना या वेब ब्राउज़ करना।
- पुराना दृष्टिकोण: हमें लगा कि यदि हम बस AI के दिमाग को बड़ा और स्मार्ट बना देंगे, तो वह सब कुछ हल कर देगा।
- नया दृष्टिकोण: शोध पत्र ने पाया कि "दिमाग" एक सीमा तक पहुँच गया है। दिमाग को बड़ा बनाने से केवल मामूली सुधार ही मिलते हैं। असली बाधा (bottleneck) अब Harness है।
प्रमाण:
- कोडिंग टेस्ट में, एक ही AI मॉडल एक साधारण हार्नेस के साथ 23% सफलता दर प्राप्त करता है, लेकिन एक बेहतर डिज़ाइन किए गए हार्नेस के साथ 72% सफलता दर प्राप्त करता है।
- यह एक फेरारी इंजन (AI) को साइकिल के फ्रेम (खराब हार्नेस) में रखने जैसा है। यह तेज़ नहीं चलेगा। उसी इंजन को रेस कार के चेसिस (अच्छा हार्नेस) में रखें, और वह जीत जाएगा।
निष्कर्ष
हम AI को केवल एक "चैटबॉट" के रूप में सोचने से दूर जा रहे हैं जो सवालों के जवाब देता है। हम स्वायत्त कार्यकर्ता (autonomous workers) बना रहे हैं।
एक विश्वसनीय कार्यकर्ता बनाने के लिए, आप केवल सबसे स्मार्ट दिमाग नहीं चुन सकते। आपको वह संपूर्ण वातावरण डिजाइन करना होगा जिसमें वे काम करते हैं:
- वे क्या देखते हैं?
- उनके पास कौन से उपकरण हैं?
- उनके काम की जांच कौन करता है?
- गलती होने पर वे कैसे उबरते हैं?
शोध पत्र का निष्कर्ष है कि AI का भविष्य केवल बड़े मॉडल्स के बारे में नहीं है; यह उन प्रणालियों की बेहतर इंजीनियरिंग के बारे में है जो उन मॉडल्स के चारों ओर होती हैं। एजेंट की गुणवत्ता मॉडल और उसके हार्नेस के बीच की साझेदारी से आती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।