← नवीनतम पेपर
💬 NLP

Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents

यह शोध पत्र MASA को प्रस्तुत करता है, जो एक मॉडल-जागरूक (model-aware) फ्रेमवर्क है जो एजेंट वेट्स को संशोधित किए बिना विशिष्ट LLM बैकबोन्स के साथ संरेखित करने के लिए बाहरी कौशलों को अनुकूल रूप से पुनर्गठित (rewrite) करता है, जिससे यह विविध संवादात्मक कार्यों में मॉडल-अज्ञेय (model-agnostic) बेसलाइन और बड़े टीचर मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Jianxiang Yu, Jiapeng Zhu, Bochen Lin, Qier Cui, Zichen Ding, Xiang Li

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianxiang Yu, Jiapeng Zhu, Bochen Lin, Qier Cui, Zichen Ding, Xiang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप जटिल पहेलियों को हल करने में मदद के लिए सहायकों की एक टीम रख रहे हैं। आपके पास एक "मास्टर इंस्ट्रक्शन मैनुअल" (कौशल पुस्तकालय) है जो उन्हें बताता है कि उन्हें कैसा व्यवहार करना है।

अतीत में, शोधकर्ताओं ने माना था कि एक ही सिंगल मैनुअल सभी के लिए पूरी तरह से काम करेगा, चाहे सहायक एक जीनियस पीएचडी छात्र हो, एक स्मार्ट कॉलेज छात्र हो, या एक बहुत ही बुद्धिमान हाई स्कूल का छात्र हो। उन्होंने सोचा, "यदि निर्देश अच्छे हैं, तो वे सभी के लिए अच्छे हैं।"

यह पेपर, जिसका शीर्षक "स्किल इज़ नॉट वन-साइज़-फिट्स-ऑल" (कौशल सबके लिए एक समान नहीं होता) है, यह तर्क देता है कि यह धारणा गलत है। यह साबित हुआ है कि निर्देशों को लिखने का तरीका उतना ही महत्वपूर्ण है जितना कि निर्देश स्वयं, और अलग-अलग "मस्तिष्क" को सर्वोत्तम कार्य करने के लिए लिखने की अलग-अलग शैलियों की आवश्यकता होती है।

यहाँ उनकी खोज और समाधान का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "वन-साइज़-फिट्स-ऑल" का जाल

शोधकर्ताओं ने चार अलग-अलग AI मॉडल (सोचिए कि वे अलग-अलग बुद्धिमत्ता के स्तर वाले सहायक हैं: छोटा, मध्यम, बड़ा और एक्स्ट्रा-लार्ज) को बिल्कुल समान सेट निर्देश देकर इसका परीक्षण किया।

  • परिणाम: वे निर्देश जिन्होंने "बड़े" सहायक को पहेली सुलझाने में मदद की, वास्तव में "मध्यम" सहायक को भ्रमित कर दिए।
    • उपमा: कल्पना कीजिए कि एक बच्चे को एक विस्तृत, 50-पेज का तकनीकी मैनुअल दिया जाता है। वे अभिभूत होकर रो सकते हैं। लेकिन यदि आप उसी बच्चे को एक सरल, एक-वाक्य का कमांड देते हैं, तो वे सफल हो सकते हैं। इसके विपरीत, यदि आप उस 50-पेज के मैनुअल को पीएचडी छात्र को देते हैं, तो उन्हें यह मददगार लग सकता है, लेकिन यदि आप उन्हें एक-वाक्य का कमांड देते हैं, तो उन्हें लग सकता है कि यह बहुत अस्पष्ट है और वे मुख्य बिंदु को छोड़ सकते हैं।
  • आश्चर्य: कभी-कभी, किसी विशिष्ट मॉडल के लिए कोई निर्देश न देना ही बेहतर होता था क्योंकि निर्देशों ने उन्हें बहुत अधिक सोचने (overthink) के लिए मजबूर किया और उन्हें वह करने से रोक दिया जो वे स्वाभाविक रूप से करने में अच्छे थे।

2. समाधान: MASA (द "टेलर")

इसे ठीक करने के लिए, लेखकों ने MASA (मॉडल-अवेयर स्किल अलाइनमेंट) नामक एक प्रणाली बनाई। MASA को AI निर्देशों के लिए एक फैशन टेलर के रूप में सोचें।

सभी के लिए रेडीमेड सूट (जेनेरिक निर्देश) खरीदने के बजाय, MASA प्रत्येक AI मॉडल के विशिष्ट "बॉडी टाइप" को मापता है और एक कस्टम सूट सिलता है जो बिल्कुल फिट बैठता है।

MASA दो चरणों में काम करता है:

चरण A: "ट्रायल एंड एरल" वर्कशॉप (स्किल इवोल्यूशन)

सिस्टम को तैनात करने से पहले, एक सुपर-स्मार्ट "टीचर AI" एक वर्कशॉप मैनेजर की तरह कार्य करता है।

  1. परीक्षण: यह एक विशिष्ट AI मॉडल को वर्तमान निर्देशों का उपयोग करके कार्यों को हल करने की कोशिश करते हुए देखता है।
  2. आलोचना: जब मॉडल विफल होता है, तो टीचर AI विश्लेषण करता है कि क्यों। क्या निर्देशों ने उसे भ्रमित किया? क्या वे बहुत लंबे थे? बहुत छोटे थे?
  3. पुनर्लेखन: टीचर AI उस विशिष्ट मॉडल के "मस्तिष्क" से मेल खाने के लिए निर्देशों को फिर से लिखता है।
    • एक छोटे मॉडल के लिए: "सरल रखें, स्टेप-बाय-स्टेप, बिना किसी फालतू बात के।"
    • एक बड़े मॉडल के लिए: "यहाँ गहरे विवरण और एज केसेस (edge cases) दिए गए हैं जिन पर ध्यान देना है।"
  4. दोहराना: वे इसे बार-बार (एक हिल-क्लाइंबिंग गेम की तरह) करते हैं जब तक कि उन्हें उस विशिष्ट मॉडल के लिए एकदम सही निर्देशों का सेट न मिल जाए।

चरण B: "इंस्टेंट ट्रांसलेटर" (द रीराइटर)

"वर्कशॉप" (चरण A) धीमा और महंगा है क्योंकि इसमें हजारों परीक्षण चलाने की आवश्यकता होती है। आप हर बार एक नया AI मॉडल उपयोग करने के लिए ऐसा नहीं कर सकते।

इसलिए, शोधकर्ताओं ने एक लाइटवेट "रीराइटर" AI (एक छोटा, तेज़ मॉडल) को प्रशिक्षित किया।

  • यह कैसे काम करता है: इस छोटे AI ने वर्कशॉप की ट्रायल-एंड-एरर प्रक्रिया से सीखा। इसने निर्देशों को बदलने के पैटर्न को सीखा।
  • जादू: अब, जब आपके पास एक नया AI मॉडल होता है, तो आपको महंगे वर्कशॉप की आवश्यकता नहीं होती है। आप बस नए मॉडल का "आईडी कार्ड" (इसके स्पेसिफिकेशन) और जेनेरिक निर्देश रीराइटर में डाल देते हैं।
  • परिणाम: एक ही सेकंड के भीतर, रीराइटर एक सटीक रूप से कस्टमाइज्ड निर्देश सेट निकाल देता है, जैसे कि महंगे वर्कशॉप ने ही इसे बनाया हो। यह एक मास्टर टेलर होने जैसा है जो ग्राहक का फोटो देखकर तुरंत एक परफेक्ट कस्टम सूट का स्केच बना सकता है, बिना उसे व्यक्तिगत रूप से मापे।

3. परिणाम

पेपर का परीक्षण तीन अलग-अलग प्रकार के "पहेलियों" (जैसे घर में नेविगेट करना, ऑनलाइन शॉपिंग करना और सामान्य ज्ञान के सवालों के जवाब देना) पर किया गया।

  • प्रदर्शन: कस्टम-अनुकूलित निर्देश (MASA) लगातार जेनेरिक निर्देशों से बेहतर रहे। कुछ मामलों में, सफलता दर 25 अंक तक बढ़ गई।
  • दक्षता: AI मॉडल न केवल स्मार्ट हुए; वे तेज़ भी हुए। उन्होंने उन चीजों के बारे में सोचने में कम समय बर्बाद किया जिनकी उन्हें आवश्यकता नहीं थी, क्योंकि निर्देश उनकी स्वाभाविक सोचने की शैली से मेल खाते थे।
  • सामान्यीकरण (Generalization): छोटा "रीराइटर" AI अपने काम में इतना अच्छा था कि वह एक प्रकार की पहेली के लिए डिज़ाइन किए गए निर्देशों को पूरी तरह से अलग पहेली के लिए अनुकूलित कर सकता था, जिसे उसने पहले कभी नहीं देखा था, और इसने बड़े AI मॉडलों को भी पीछे छोड़ दिया।

सारांश

यह पेपर सिद्ध करता है कि निर्देश सार्वभौमिक नहीं होते। जो एक विशाल AI के लिए काम करता है वह एक छोटे AI को खराब कर सकता है।

MASA एक ऐसी प्रणाली है जो:

  1. स्मार्ट ट्रायल-एंड-एरर के माध्यम से एक विशिष्ट AI मॉडल के लिए परफेक्ट निर्देश ढूंढती है।
  2. एक छोटे, तेज़ AI को उस प्रक्रिया की नकल करने के लिए सिखाती है।
  3. किसी भी AI मॉडल को तुरंत, कस्टम-अनुकूलित निर्देश देती है, जिससे वे बिना अपने मूल मस्तिष्क को बदले काफी बेहतर प्रदर्शन करते हैं।

यह सभी को एक ही जेनेरिक मैप देने और प्रत्येक व्यक्ति को उनके वाहन की गति और ईंधन क्षमता के लिए विशेष रूप से गणना किए गए GPS रूट देने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →