← नवीनतम पेपर
🤖 AI

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

यह शोध पत्र इस धारणा का खंडन करता है कि इष्टतम हार्नेस जटिलता (harness complexity) मॉडल क्षमता के साथ निरंतर घटती है, जो 432-रन प्रयोग के माध्यम से यह प्रकट करता है कि हार्नेस संवेदनशीलता गैर-एकदिष्ट (non-monotone) है और मॉडल के प्रकार पर महत्वपूर्ण रूप से निर्भर करती है, जहाँ विस्तृत संरचनाएं (verbose structures) फ्रंटियर चैट मॉडल्स में बाधा डालती हैं जबकि सख्त मार्गदर्शन फ्रंटियर रीजनिंग मॉडल्स को लाभ पहुँचाता है।

मूल लेखक: Yong-eun Cho

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yong-eun Cho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिखरे हुए कमरे (कार्यक्षेत्र/workspace) को ठीक करने के लिए विभिन्न श्रमिकों की एक टीम रख रहे हैं। आपके पास एक मैनेजर है जो उन्हें निर्देश देता है (हार्नेस/harness)।

AI की दुनिया में एक सामान्य धारणा रही है: "श्रमिक जितना बुद्धिमान होगा, उसे उतने ही कम विस्तृत निर्देशों की आवश्यकता होगी।" दूसरे शब्दों शब्दों में, एक जीनियस को एक सरल नोट की आवश्यकता होती है, जबकि एक नौसिखिए को एक सख्त, चरण-दर-चरण नियमावली की आवश्यकता होती है। यह शोध पत्र तर्क देता है कि यह विश्वास गलत है।

यहाँ शोधकर्ताओं द्वारा किए गए निष्कर्षों का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. प्रयोग: AI के लिए एक टेस्ट किचन

शोधकर्ताओं ने एक "टेस्ट किचन" बनाया जिसे HEAT-24 कहा गया।

  • कमरा: 12 फाइलों (जैसे कोड, नोट्स और डेटा) वाला एक डिजिटल कार्यक्षेत्र।
  • काम: 24 विशिष्ट कार्य, जैसे "इस टूटे हुए कोड को ठीक करें," "एक विशिष्ट फ़ाइल खोजें," या "एक सख्त प्रारूप में रिपोर्ट लिखें।"
  • श्रमिक: उन्होंने "फ्रंटियर" (अत्यधिक बुद्धिमान, महंगी) से लेकर "कन्स्ट्रेंड" (छोटी, सस्ती) तक के 6 अलग-अलग AI मॉडल का परीक्षण किया।
  • निर्देश: उन्होंने श्रमिकों को तीन प्रकार की निर्देश नियमावलियाँ दीं:
    • लाइट (हल्की): एक साधारण दो-वाक्य का नोट।
    • बैलेंस्ड (संतुलित): चार चरणों वाली एक मार्गदर्शिका जिसमें अनुमत फाइलों की सूची शामिल है।
    • स्ट्रिक्ट (सख्त): एक विशाल, 6-चरणों वाली नियमावली जिसमें काम को सत्यापित करने के सख्त नियम और आउटपुट के सटीक प्रारूप पर नियम दिए गए हैं।

उन्होंने यह देखने के लिए कि कौन सा संयोजन सबसे अच्छा काम करता है, इस प्रयोग को 432 बार चलाया।

2. बड़ा आश्चर्य: "एक ही नियम सबके लिए" का नियम टूट गया

शोधकर्ता एक सहज वक्र (smooth curve) की उम्मीद कर रहे थे: स्मार्ट AI = सरल निर्देश। इसके बजाय, उन्हें एक अराजक, गैर-रेखीय (non-linear) उलझन मिली। "सर्वश्रेष्ठ" निर्देश शैली पूरी तरह से इस बात पर निर्भर करती है कि आप किस प्रकार के AI का उपयोग कर रहे हैं, न कि केवल इसकी बुद्धिमत्ता पर।

"ओवर-थिंकर" (फ्रंटियर चैट मॉडल)

  • यह कौन है: एक बहुत ही स्मार्ट मॉडल जिसे बातचीत (chatting) के लिए डिज़ाइन किया गया है (जैसे एक वार्ताकार)।
  • क्या हुआ: जब इसे स्ट्रिक्ट नियमावली दी गई, तो यह क्रैश हो गया। इसकी सफलता दर लगभग 30% गिर गई।
  • उपमा: कल्पना कीजिए कि एक प्रतिभाशाली कवि को एक जटिल टैक्स फॉर्म भरने के लिए कहा गया। यदि आप उन्हें एक सरल प्रॉम्प्ट देते हैं ("एक कविता लिखें"), तो वे उत्तम होते हैं। लेकिन यदि आप उन्हें कविता लिखने के तरीके पर 10 पन्नों का कानूनी अनुबंध देते हैं, तो वे भ्रमित हो जाते हैं, बड़बड़ाने लगते हैं और वास्तव में कविता लिखना भूल जाते हैं।
  • परिणाम: इस प्रकार के AI के लिए, कम ही अधिक है। सरल निर्देश सबसे अच्छा काम करते हैं।

"आर्किटेक्ट" (फ्रंटियर रीजनिंग मॉडल)

  • यह कौन है: एक अत्यंत स्मार्ट मॉडल जिसे गहरे तर्क और समस्या समाधान (गहन सोच/extended thinking सक्षम) के लिए डिज़ाइन किया गया है।
  • क्या हुआ: जब इसे स्ट्रिक्ट नियमावली दी गई, तो इसने सरल नोट्स की तुलना में बेहतर प्रदर्शन किया। इसने काम को तेजी से भी पूरा किया।
  • उपमा: कल्पना कीजिए कि एक मास्टर आर्किटेक्ट है। यदि आप कहते हैं, "एक घर बनाओ," तो वे 100 अलग-अलग संभावनाओं के बारे में सोचते हुए भटक सकते हैं। लेकिन यदि आप उन्हें सटीक माप और चेकलिस्ट के साथ एक सख्त ब्लूप्रिंट देते हैं, तो वे तुरंत काम शुरू कर देते हैं, विकर्षणों को अनदेखा करते हैं, और घर को पूरी तरह से बनाते हैं।
  • परिणाम: इस प्रकार के AI के लिए, अधिक संरचना बेहतर है। यह अपनी सोच को केंद्रित करने के लिए सख्त नियमों को एक मचान (scaffold) के रूप में उपयोग करता है।

"छोटा लेकिन शक्तिशाली" (कन्स्ट्रेंड मॉडल)

  • यह कौन है: एक बहुत छोटा मॉडल (केवल 2 बिलियन पैरामीटर्स वाला) जो आश्चर्यजनक रूप से अच्छी तरह से प्रशिक्षित था।
  • क्या हुआ: इसने सभी निर्देश प्रकारों में बड़े, महंगे मॉडलों के समान ही प्रदर्शन किया।
  • उपमा: यह एक छोटे, अत्यधिक अनुशासित प्रशिक्षु (apprentice) की तरह है, जो अपने छोटे मस्तिष्क के बावजूद, आदेशों का पालन करने के लिए इतने अच्छे से प्रशिक्षित है कि वह एक पीएचडी प्रोफेसर के समान काम कर सकता है।
  • परिणाम: आप केवल उसके आकार (पैरामीटर काउंट) से मॉडल की "हार्नेस जरूरतों" का अनुमान नहीं लगा सकते। प्रशिक्षण की गुणवत्ता अधिक मायने रखती है।

"खोया हुआ नौसिखिया" (कम क्षमता वाले मॉडल)

  • यह कौन है: कम प्रशिक्षण वाले छोटे मॉडल।
  • क्या हुआ: वे हर चीज़ के लिए संघर्ष करते रहे। सरल नोट्स ने उन्हें गलत फाइलें चुनने पर मजबूर किया; सख्त नोट्स ने उन्हें अभिभूत (overwhelm) कर दिया।
  • परिणाम: उन्हें "गोल्डिलॉक्स" दृष्टिकोण की आवश्यकता होती है—इतनी संरचना कि वे निर्देशित हो सकें, लेकिन इतनी भी नहीं कि वे भ्रमित हो जाएं।

3. दो मुख्य गलतियाँ

शोधकर्ताओं ने वर्गीकृत किया कि AI क्यों विफल हुआ:

  1. "चैटरबॉक्स" त्रुटि (फॉर्मेट उल्लंघन): स्मार्ट मॉडल्स ने कार्य को समझ लिया लेकिन रुक नहीं सके। आवश्यक डेटा (जैसे JSON फ़ाइल) देने के बजाय, उन्होंने यह समझाने के लिए एक लंबी कहानी लिख दी कि उन्होंने ऐसा क्यों किया। यह ज्यादातर तब हुआ जब निर्देश बहुत जटिल थे।
  2. "गलत दरवाजा" त्रुटि (गलत फ़ाइल): छोटे मॉडल्स अक्सर नहीं जानते थे कि किस फ़ाइल को छूना है। "अनुमत फाइलों" की स्पष्ट सूची के बिना, वे गलत दस्तावेज़ को संपादित कर देते थे।

4. निष्कर्ष: अनुमान लगाना बंद करें, मिलान करना शुरू करें

शोध पत्र निष्कर्ष निकालता है कि AI को प्रॉम्प्ट करने का कोई एक "सर्वश्रेष्ठ" तरीका नहीं है।

  • यदि आपके पास चैट AI है, तो निर्देश हल्के और सरल रखें। बहुत अधिक विस्तार न करें।
  • यदि आपके पास रीजनिंग AI है, तो उसे सख्त, विस्तृत नियम दें। वह संरचना में फलता-फूलता है।
  • यदि आपके पास एक छोटा, अच्छी तरह से प्रशिक्षित AI है, तो वह निर्देशों के प्रकार के बावजूद बड़े मॉडलों के समान ही अच्छा हो सकता है।

संक्षेप में: आप एक बच्चे को जटिल कानूनी अनुबंध नहीं देंगे, और आप एक सुप्रीम कोर्ट के न्यायाधीश को एक स्टिकी नोट नहीं देंगे। आपको निर्देश शैली को केवल बुद्धिमत्ता के स्तर के आधार पर नहीं, बल्कि श्रमिक के प्रकार के आधार पर मिलाना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →