← नवीनतम पेपर
🤖 AI

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

SkillHEX एक क्लोज्ड-लूप फ्रेमवर्क है जो परिकल्पना-संचालित स्व-सत्यापन (hypothesis-driven self-verification) को साक्ष्य-निर्देशित ट्री सर्च (evidence-guided tree search) के साथ जोड़कर, स्पार्स रिवार्ड्स और सीमित इंटरैक्शन बजट के तहत स्वायत्त एजेंट कौशल विकास में सुधार करता है ताकि शोषण के जाल (exploitation traps) से बचा जा सके और अन्वेषण (exploration) एवं शोषण (exploitation) के बीच गतिशील संतुलन बनाया जा सके।

मूल लेखक: Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

प्रकाशित 2026-08-07
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को नल ठीक करना सिखा रहे हैं। आप उसे एक मैनुअल देते हैं, लेकिन पहली बार कोशिश करते समय, वह आपके पैर पर रिंच (wrench) गिरा देता है। एक साधारण रोबोट शायद फिर से बिल्कुल वही चीज़ करने की कोशिश करेगा, इस उम्मीद में कि परिणाम अलग होगा, या वह घबराकर रुक सकता है। लेकिन एक वास्तव में मददगार रोबोट को एक जासूस होना चाहिए। उसे उस गड़बड़ी को देखना होगा, अंदाज़ा लगाना होगा कि उसने रिंच क्यों गिराया (क्या वह बहुत फिसलन भरा था? क्या मैनुअल गलत था?), अपने अंदाज़ों का परीक्षण करना होगा, और फिर एक नया तरीका आज़माना होगा। यह "AI एजेंट्स" की दुनिया है—ऐसे कंप्यूटर प्रोग्राम जो केवल चैट नहीं करते, बल्कि वास्तव में वास्तविक दुनिया में काम करते हैं, जैसे कोड लिखना, गणित की समस्याओं को हल करना, या डेटा का प्रबंधन करना।

बड़ी चुनौती यह है कि ये रोबोट अक्सर एक "अनुमान लगाने के खेल" में फंस जाते हैं जहाँ उन्हें अंत में केवल एक सरल "हाँ" या "नहीं" मिलता है। क्या नल का टपकना बंद हो गया? हाँ या नहीं। उन्हें कोई विस्तृत रिपोर्ट कार्ड नहीं मिलता कि "आपने रिंच को बहुत कसकर पकड़ा था।" इस विस्तृत फीडबैक के बिना, रोबोट एक ही गलत चीज़ को बार-बार करने की कोशिश कर सकता है, जिससे उसके सीमित अवसर बर्बाद हो जाते हैं। यह पेपर, जिसे SkillHEX कहा जाता है, इन AI एजेंट्स के लिए एक चतुर नया तरीका पेश करता है जिससे वे बिना किसी मानव शिक्षक के हाथ थामे अपनी गलतियों से सीख सकें। यह ऐसा है जैसे रोबोट को एक आवर्धक लेंस (magnifying glass) और एक नोटबुक देना ताकि वह अपनी गलतियों को खुद समझ सके और तब तक अलग-अलग समाधान आज़मा सके जब तक कि वह सही न हो जाए।

समस्या: "एक ही दिशा में सोचने" का जाल (The "One-Track Mind" Trap)

आज के अधिकांश AI एजेंट्स अपनी गलतियों को सुधारने के लिए अपने निर्देशों में एक छोटा सा बदलाव करने और तुरंत फिर से प्रयास करने की कोशिश करते हैं। लेखक इसे "लालची" (greedy) दृष्टिकोण कहते हैं। कल्पना कीजिए कि आप एक भूलभुलैया (maze) को हल करने की कोशिश कर रहे हैं, लेकिन आप केवल एक कदम आगे देखते हैं। यदि आप दीवार से टकराते हैं, तो आप बाईं ओर मुड़ते हैं और चलते रहते हैं। यदि आप फिर से दीवार से टकराते हैं, तो आप फिर से बाईं ओर मुड़ते हैं। अंततः, आप एक डेड-एंड (बंद रास्ते) में फंस सकते हैं, इस विश्वास के साथ कि बाईं ओर मुड़ना ही एकमात्र रास्ता है, भले ही निकास वास्तव में दाईं ओर हो।

AI की दुनिया में, इसे एक्सप्लोइटेशन ट्रैप (exploitation trap) कहा जाता है। एजेंट को एक विफलता का संकेत मिलता है (जैसे "कार्य विफल रहा"), वह एक कारण का अनुमान लगाता है (शायद "मुझे बाईं ओर मुड़ने की आवश्यकता है"), और तुरंत उस नए पथ के प्रति प्रतिबद्ध हो जाता है। यदि उसका वह अनुमान गलत है—जिसकी संभावना बहुत अधिक है क्योंकि विफलता का संकेत अस्पष्ट होता है—तो एजेंट अपने शेष सभी प्रयासों को एक डेड-एंड वाले रास्ते पर बर्बाद कर देता है। यह एक ऐसे जासूस की तरह है जो उंगलियों के निशान (fingerprints) की जांच किए बिना पहले संदिग्ध को गिरफ्तार कर लेता है, और फिर अपना सारा बजट उस संदिग्ध को दोषी साबित करने में लगा देता है, जबकि असली अपराधी को अनदेखा कर देता है।

समाधान: SkillхEX का डिटेक्टिव किट

लेखक SkillHEX का प्रस्ताव देते हैं, जो एक ऐसा सिस्टम है जो एजेंट को निष्कर्ष पर पहुँचने की जल्दबाजी करने से रोकता है। केवल निर्देशों को बदलने और बेहतर होने की उम्मीद करने के बजाय, SkillHEX दो मुख्य तरकीबों का उपयोग करता है: हाइपोथीसिस-ड्रिवन सेल्फ-वेरिफिकेशन (Hypothesis-Driven Self-Verification) और एविडेंस-गाइडेड ट्री सर्च (Evidence-Guided Tree Search)।

1. जासूस की नोटबुक (Hypothesis-Driven Self-Verification)
जब एजेंट विफल होता है, तो SkillHEX केवल यह नहीं कहता, "फिर से प्रयास करें।" यह पूछता है, "हम क्यों विफल हुए?" यह विशिष्ट, परीक्षण योग्य अनुमानों (हाइपोथीसिस) की एक सूची बनाता है। उदाहरण के लिए: "शायद कोड में एक विशिष्ट फ़ाइल गायब है?" या "शायद नंबर गलत फॉर्मेट में हैं?"

केवल अनुमान लगाने के बजाय, एजेंट प्रत्येक अनुमान की जाँच करने के लिए एक छोटा, स्वचालित परीक्षण लिखता है। यह एक जासूस द्वारा नोट लिखने जैसा है: "यदि संदिग्ध घटनास्थल पर था, तो दरवाज़ा खुला होगा।" फिर, एजेंट वास्तविक दुनिया में वापस जाए बिना अपने पुराने विफल प्रयासों पर इस परीक्षण को चलाता है। यह "साक्ष्य" (प्रत्येक अनुमान के लिए पास या फेल) का एक ढेर बनाता है जो एक साधारण "कार्य विफल रहा" संदेश की तुलना में बहुत अधिक विस्तृत है। यह एक अस्पष्ट विफलता को यह समझने के स्पष्ट मानचित्र में बदल देता है कि क्या गलत हुआ था।

2. कई रास्तों का मानचित्र (Evidence-Guided Tree Search)
एक बार जब एजेंट के पास यह साक्ष्य आ जाता है, तो वह केवल "सर्वश्रेष्ठ" अनुमान चुनकर आगे नहीं बढ़ता। इसके बजाय, वह संभावनाओं का एक वृक्ष (tree) बनाता है। एक 'चूज़-योर-ओन-एडवेंचर' किताब की कल्पना करें जहाँ, केवल एक रास्ता चुनने के बजाय, आप सभी दिलचस्प विकल्पों को मेज पर खुला रखते हैं।

SkillHEX विभिन्न कौशल संस्करणों का एक "वृक्ष" बनाए रखता है। कुछ शाखाएं सबसे संभावित अनुमान पर आधारित हो सकती हैं, जबकि अन्य "शायद" वाले विकल्पों को जीवित रखती हैं। जैसे-जैसे एजेंट अपने परीक्षणों से अधिक साक्ष्य एकत्र करता है, वह देख सकता है कि कौन सी शाखाएं आशाजनक दिख रही हैं और कौन सी डेड-एंड हैं। यदि कोई शाखा खराब दिखने लगती है, तो एजेंट आसानी से एक अलग शाखा को आज़माने के लिए "बैकट्रैक" (पीछे हट) सकता है, बजाय इसके कि वह उस पथ पर अटका रहे जो शुरू से ही बेकार था। यह एक्सप्लोरेशन (नए, अजीब विचार आज़माना) और एक्सप्लोइटेशन (उन विचारों पर ध्यान केंद्रित करना जो अच्छे दिखते हैं) के बीच संतुलन बनाता है।

उन्होंने क्या पाया

शोधकर्ताओं ने 87 विभिन्न कार्यों पर इस प्रणाली का परीक्षण किया, जिसमें सॉफ्टवेयर कोड लिखने से लेकर जटिल गणित की समस्याओं को हल करना तक शामिल है। उन्होंने यह देखने के लिए कि क्या SkillHEX उन्हें सुधारने में मदद कर सकता है, दो शक्तिशाली AI मॉडल (GPT-5.3-Codex और Claude Opus 4.7) का उपयोग किया।

परिणाम प्रभावशाली थे। किसी कार्य को ठीक करने के लिए केवल पाँच प्रयासों दिए जाने पर, SkillHEX ने पहले मॉडल के साथ 55.9% बार और दूसरे के साथ 57.9% बार सफलता प्राप्त की। यह उन अन्य तरीकों की तुलना में काफी बेहतर था जो केवल एक-एक करके निर्देशों को ठीक करने की कोशिश करते हैं। वास्तव में, SkillHEX ने अगले सबसे अच्छे तरीके से लगभग 9.5 प्रतिशत अंक बेहतर प्रदर्शन किया।

अध्ययन ने यह भी दिखाया कि SkillHEX अपने "दिमाग की शक्ति" (कंप्यूटिंग संसाधनों) का उपयोग करने में स्मार्ट था। हर बार नए, महंगे परीक्षण चलाने के बजाय पुराने डेटा पर अनुमानों का परीक्षण करके, इसने बहुत प्रयास बचाया। भले ही AI ने एक मानव-लिखित स्किल (जो पहले से ही काफी अच्छी थी) के साथ शुरुआत की हो, SkillHEX फिर भी इसमें सुधार कर सका, जिससे सॉफ्टवेयर इंजीनियरिंग और गणित जैसे जटिल क्षेत्रों में सफलता दर और भी बढ़ गई।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि AI एजेंट्स को वास्तव में स्वायत्त बनाने की कुंजी केवल उन्हें स्मार्ट बनाना नहीं है; बल्कि उन्हें अपनी सोच के बारे में सोचना सिखाना है। एजेंट को अपने अनुमान लिखने, उनका परीक्षण करने और कई विकल्प खुले रखने के लिए मजबूर करके, SkillHEX AI को बुरे विचारों के लूप में फंसने से रोकता है।

हालाँकि परिणाम सिमुलेशन और विशिष्ट बेंचमार्क पर आधारित हैं (जिसका अर्थ है कि उनका अभी तक हर वास्तविक दुनिया के परिदृश्य में परीक्षण नहीं किया गया है), निष्कर्ष दृढ़ता से सुझाव देते हैं कि यह "जासूस" वाला दृष्टिकोण AI एजेंट्स को उनकी गलतियों से सीखने में मदद करने का एक शक्तिशाली तरीका है। यह "विफल, अनुमान लगाओ, फिर से विफल हो जाओ" के निराशाजनक चक्र को "विफल, जांच करो, परीक्षण करो, और सबसे अच्छा रास्ता चुनो" की एक संरचित प्रक्रिया में बदल देता है। जो कोई भी वास्तविक दुनिया में हमारी मदद करने के लिए वास्तव में सक्षम रोबोट बनाने की उम्मीद कर रहा है, उनके लिए यह उन्हें अधिक विश्वसनीय बनाने और चीजें कठिन होने पर हार मानने से रोकने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →