← नवीनतम पेपर
💬 NLP

AI Steerability 360: A Toolkit for Steering Large Language Models

यह शोध पत्र AI Steerability 360 को प्रस्तुत करता है, जो एक ओपन-सोर्स, Hugging Face-नेटिव पायथन टूलकिट है जो इनपुट, स्ट्रक्चरल, स्टेट और आउटपुट कंट्रोल सरफेसेस के माध्यम से विविध लार्ज लैंग्वेज मॉडल स्टीयरिंग विधियों को कंपोज़ करने, मूल्यांकन करने और तुलना करने के लिए एक एकीकृत इंटरफ़ेस प्रदान करता है।

मूल लेखक: Erik Miehling, Karthikeyan Natesan Ramamurthy, Praveen Venkateswaran, Irene Ko, Pierre Dognin, Moninder Singh, Tejaswini Pedapati, Avinash Balakrishnan, Matthew Riemer, Dennis Wei, Inge Vejsbjerg, Eli
प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Erik Miehling, Karthikeyan Natesan Ramamurthy, Praveen Venkateswaran, Irene Ko, Pierre Dognin, Moninder Singh, Tejaswini Pedapati, Avinash Balakrishnan, Matthew Riemer, Dennis Wei, Inge Vejsbjerg, Elizabeth M. Daly, Kush R. Varshney

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी जिद्दी शेफ है। यह शेफ (लार्ज लैंग्वेज मॉडल) लगभग कुछ भी बना सकता है, लेकिन कभी-कभी वह बहुत अधिक नमक डाल देता है, रेसिपी भूल जाता है, या आपकी हर बात से सहमत होने के लिए बहुत उत्सुक हो जाता है, भले ही आप गलत हों।

"AI Steerability 360" एक बिल्कुल नए, ओपन-सोर्स किचन टूलकिट की तरह है जिसे इस शेफ को निकालने और नया काम पर रखने के बजाय, उसे धीरे से निर्देशित करने में आपकी मदद करने के लिए डिज़ाइन किया गया है।

यह टूलकिट कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. चार "कंट्रोल नॉब्स" (Control Knobs)

पेपर बताता है कि आप शेफ को चार अलग-अलग तरीकों से नियंत्रित कर सकते हैं, जो इस बात पर निर्भर करता है कि आप उन्हें कितना बदलना चाहते हैं। इन्हें कंट्रोल पैनल पर चार अलग-अलग प्रकार के नॉब्स के रूप में सोचें:

  • इनपुट नॉब (द प्रॉम्प्ट): यह शेफ को खाना शुरू करने से पहले एक विशिष्ट निर्देश फुसफुसाने जैसा है। आप शेफ को नहीं बदलते; आप बस उन्हें दिया जाने वाला नोट बदल देते हैं। "हे, याद रखना, आज नमक मत डालना!"
  • स्ट्रक्चरल नॉब (द रेसिपी बुक): यह शेफ की वास्तविक रेसिपी बुक को फिर से लिखने या उन्हें एक नए तरीके से प्रशिक्षित करने जैसा है। आप उनके सोचने के तरीके को भौतिक रूप से बदल रहे हैं। यह भारी काम है (जैसे फाइन-ट्यूनिंग), लेकिन यह शेफ को स्थायी रूप से बदल देता है।
  • स्टेट नॉब (द मूड/ब्रेनवेव्स): यह इस टूलकिट का सबसे अनूठा हिस्सा है। कल्पना करें कि शेफ खाना बना रहा है, और आप सब्जियां काटते समय उनके दिमाग के अंदर पहुँच सकते हैं और उनके विचारों को धीरे से धकेल सकते हैं। आप उनकी रेसिपी बुक नहीं बदल रहे हैं; आप बस उनके वर्तमान मूड या फोकस को दिशा दे रहे हैं। यदि वे "नमक" के बारे में सोचने लगते हैं, तो आप उनके विचारों को धीरे से "ताजी जड़ी-बूटियों" की ओर मोड़ देते हैं। यह काम करते समय तुरंत होता है।
  • आउटपुट नॉब (द प्लेटिंग): यह काउंटर पर खड़े होकर शेफ को डिश परोसने से रोकने जैसा है। यदि वे प्लेट पर कोई अजीब सामग्री डालने वाले हैं, तो आप कहते हैं, "रुको, इसे हटा दो।" आप नियंत्रित करते हैं कि रसोई से वास्तव में क्या बाहर निकलता है।

2. "कंडक्टर" (द स्टीयरिंग पाइपलाइन)

अतीत में, यदि आप इन सभी नॉब्स का एक साथ उपयोग करना चाहते थे, तो यह एक अव्यवस्था थी। आपको अलग-अलग रूप से फुसफुसाना, किताब फिर से लिखना, दिमाग को धकेलना और प्लेट को रोकना पड़ता था।

यह टूलकिट एक स्टीयरिंग पाइपलाइन पेश करता है, जो एक ऑर्केस्ट्रा के कंडक्टर की तरह कार्य करता है।

  • यह आपको एक साथ कई "कंट्रोल्स" (नॉब्स) प्लग करने की अनुमति देता है।
  • यह सुनिश्चित करता है कि वे सभी सामंजस्य में काम करें।
  • उदाहरण के लिए, आप शेफ को कह सकते हैं कि "विनम्र रहें" (इनपुट), "तथ्यों पर ध्यान केंद्रित करें" (स्टेट) और "कोमा का उपयोग न करें" (आउटपुट) सभी एक साथ। कंडक्टर सुनिश्चित करता है कि ये निर्देश आपस में न लड़ें।

3. "टेस्ट टेस्ट" (बेंचमार्किंग)

आपको कैसे पता चलेगा कि आपका स्टीयरिंग काम कर रहा है? क्या आपने खाना बेहतर बनाया, या आपने इसे खराब कर दिया?

इस टूलकिट में एक टेस्ट टेस्ट स्टेशन (बेंचमार्किंग) शामिल है।

  • उपयोग का मामला (Use Case): आप एक विशिष्ट चुनौती को परिभाषित करते हैं, जैसे "एक ऐसा ईमेल लिखें जो इन 3 सख्त नियमों का पालन करता हो।"
  • स्कोरकार्ड: आप परिणामों को ग्रेड देने के लिए एक जज (या तो एक कंप्यूटर प्रोग्राम या दूसरा AI) सेट करते हैं।
  • प्रयोग: आप एक ही परीक्षण को 100 बार चला सकते हैं, केवल एक नॉब (जैसे कि आप शेफ के दिमाग को कितनी जोर से धकेल रहे हैं) को बदलकर यह देखने के लिए कि क्या होता है।
    • सादृश्य: कल्पना करें कि आप कितना "मसाला" (स्टीयरिंग स्ट्रेंथ) जोड़ने का परीक्षण कर रहे हैं। बहुत कम, और भोजन फीका रह जाएगा। बहुत अधिक, और यह खाने लायक नहीं रहेगा। टूलकिट आपको वह परफेक्ट "स्वीट स्पॉट" खोजने में मदद करता है जहाँ भोजन स्वादिष्ट होता है और नियमों का पालन करता है, बिना स्वाद बिगाड़े।

4. यह क्यों महत्वपूर्ण है

इस टूलकिट से पहले, शोधकर्ता अलग-थलग नए खाना पकाने के तरीके आविष्कार करने वाले शेफ की तरह थे। एक व्यक्ति ने शेफ को झूठ बोलने से रोकने का तरीका खोजा; दूसरे ने उन्हें कविता लिखने के लिए बनाया। वे आसानी से अपने तरीकों की तुलना नहीं कर सकते थे या उन्हें मिला नहीं सकते थे।

यह टूलकिट वह यूनिवर्सल एडेप्टर है जो सभी को एक ही भाषा बोलने की अनुमति देता है। यह शोधकर्ताओं को निम्नलिखित की अनुमति देता है:

  • विभिन्न स्टीयरिंग विधियों को आसानी से मिक्स और मैच करना।
  • यह देखना कि जब आप उन्हें मिलाते हैं तो वास्तव में क्या होता है (क्या वे एक-दूसरे की मदद करते हैं, या वे एक-दूसरे को बेअसर कर देते हैं?)।
  • "साइड इफेक्ट्स" को समझना (जैसे, "यदि मैं शेफ को सच बोलने के लिए मजबूर करता हूँ, तो क्या वे कम रचनात्मक हो जाते हैं?")।

निचोड़

AI Steerability 360 एक उपयोगकर्ता के अनुकूल टूलबॉक्स है जो हमें शक्तिशाली AI मॉडल को धीरे से निर्देशित करने में मदद करता है। AI को शुरू से फिर से बनाने के बजाय, यह हमें इसके इनपुट, इसके आंतरिक विचारों और इसके आउटपुट को ट्यून करने के उपकरण देता है, और यह भी सुनिश्चित करने के लिए कठोर परीक्षण करता है कि हम अनजाने में कुछ तोड़ न दें। यह AI को "वश में करने" की अराजक प्रक्रिया को एक सटीक, वैज्ञानिक और दोहराने योग्य शिल्प में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →