← नवीनतम पेपर
💬 NLP

We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong

यह शोध पत्र एडेप्टिव मल्टी-ब्रांच स्टीयरिंग (AMBS) प्रस्तुत करता है, जो एक दो-चरणीय 1-to-N ट्रांसफॉर्मर फ्रेमवर्क है, जो एक साझा प्रतिनिधित्व के सापेक्ष उद्देश्य-विशिष्ट रूपांतरणों को पैरामीटराइज़ करके लार्ज लैंग्वेज मॉडल्स को हेल्पफुलनेस (helpfulness), हार्मलेसनेस (harmlessness) और ऑनेस्टी (honesty) उद्देश्यों के साथ एक साथ संरेखित करता है, जिससे पूर्ववर्ती विधियों की हस्तक्षेप और असंगतता संबंधी समस्याओं को दूर करते हुए इन्फरेंस दक्षता को बनाए रखा जा सकता है।

मूल लेखक: Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ा अस्त-व्यस्त शेफ (AI) है जो आपके लिए भोजन बनाने की कोशिश कर रहा है। आप चाहते हैं कि वह भोजन Helpful (स्वादिष्ट और पेट भरने वाला), Harmless (बिना किसी ज़हर या खतरनाक सामग्री के), और Honest (बर्तन में जो है उसके बारे में झूठ न बोले) हो।

अतीत में, इस शेफ को एक साथ ये तीनों काम करने के लिए कहना ऐसा था जैसे उनके कान में एक साथ तीन अलग-अलग, विरोधाभासी निर्देश चिल्लाना: "इसे तीखा बनाओ!" "नमक मत डालना!" "यह मीठा होना चाहिए!" शेफ भ्रमित हो जाता था, अक्सर एक निर्देश पर ध्यान केंद्रित करने के लिए दूसरे को अनदेखा कर देता था, या इससे भी बुरा, वह आपको एक ऐसा व्यंजन परोस देता था जो सुरक्षित तो था लेकिन खाने लायक नहीं था, या स्वादिष्ट तो था लेकिन ज़हरीला था।

यह पेपर इस शेफ को निर्देशित करने का एक नया तरीका पेश करता है जिसे AMBS (Adaptive Multi-Branch Steering) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "सोलो शेफ" बनाम "भ्रमित टीम"

पिछले तरीकों ने शेफ को दो तरीकों से ठीक करने की कोशिश की, जिनमें दोनों की खामियां थीं:

  1. द सोलो शेफ (The Solo Chef): उन्होंने शेफ को एक समय में निर्देशों का एक सेट दिया। यदि वे चाहते थे कि भोजन सुरक्षित हो, तो उन्होंने शेफ को स्वाद को अनदेखा करने के लिए कहा। यदि वे चाहते थे कि वह स्वादिष्ट हो, तो उन्होंने सुरक्षा को अनदेखा कर दिया। शेफ दोनों के बीच संतुलन नहीं बना सका।
  2. द कन्फ्यूज्ड टीम (The Confused Team): नए तरीकों ने शेफ को तीन अलग-अलग क्लोन (एक सुरक्षा के लिए, एक स्वाद के लिए, एक सच्चाई के लिए) में विभाजित करने की कोशिश की जो समानांतर में काम करते हैं। लेकिन क्योंकि इन क्लोनों के बीच आपस में बातचीत नहीं होती थी या वे एक "बेस मेमोरी" साझा नहीं करते थे, इसलिए वे अक्सर आपको तीन पूरी तरह से अलग, विरोधाभासी उत्तर दे देते थे। एक क्लोन कह सकता था "इसे खाओ," जबकि दूसरा कह सकता था "इसे मत खाओ।"

समाधान: "साझा ब्लूप्रिंट" के साथ विशिष्ट समायोजन

लेखक एक 1-to-N Transformer सेटअप का उपयोग करके रसोई चलाने का एक स्मार्ट तरीका प्रस्तावित करते हैं। इसे इस प्रकार समझें:

  1. चरण 1: साझा ब्लूप्रिंट (The Shared Blueprint - "आधार"):
    शुरुआत से शुरू करने के बजाय, शेफ पहले आपके ऑर्डर के आधार पर व्यंजन का एक एकल, सटीक ब्लूप्रिंट बनाता है। यह "Shared Representation" है। यह वह सामान्य आधार है जहाँ शेफ सामग्री और बुनियादी रेसिपी को समझता है।

  2. चरण 2: विशिष्ट समायोजन (The Specialized Adjustments - "शाखाएं"):
    अब, तीन पूरी तरह से अलग व्यंजन बनाने के बजाय, शेफ उस एक ब्लूप्रिंट को लेता है और उसकी तीन प्रतियां बनाता है।

  • प्रति A (Helpfulness): शेफ इस प्रति में थोड़ा "मसाला" जोड़ता है ताकि यह अधिक उपयोगी बन सके।
  • प्रति B (Harmlessness): शेफ इसमें एक छोटा "सेफ्टी फ़िल्टर" जोड़ता है ताकि विषाक्त पदार्थों को हटाया जा सके।
  • प्रति C (Honesty): शेफ इसमें एक "ट्रुथ चेक" जोड़ता है ताकि तथ्य सही रहें।

जादुई ट्रिक: शेफ प्रत्येक प्रति के लिए पूरी रेसिपी को फिर से नहीं लिखता है। वे केवल साझा ब्लूप्रिंट में छोटे, विशिष्ट बदलाव (deviations) जोड़ते हैं। यह सुनिश्चित करता है कि तीनों प्रतियां अभी भी एक ही व्यंजन की तरह दिखें, बस उनके स्वाद अलग हों। वे इसलिए जुड़े रहते हैं क्योंकि वे सभी एक ही आधार से शुरू हुए थे।

  1. अंतिम प्लेट (Decoding):
    अंत में, शेफ आपको तीन अलग-अलग प्लेटें नहीं परोसता है। वह इन तीनों संशोधित संस्करणों को देखता है और उन्हें एक एकल, पूर्ण व्यंजन में मिला देता है जो एक साथ स्वादिष्ट, सुरक्षित और ईमानदार है।

यह बेहतर क्यों काम करता है

  • कोई भ्रम नहीं: क्योंकि सभी "क्लोन" एक ही ब्लूप्रिंट से शुरू होते हैं, वे एक-दूसरे से अलग नहीं होते। वे तालमेल में रहते हैं।
  • कोई ओवरराइटिंग नहीं: पुराने तरीकों में, भोजन को सुरक्षित बनाने से अनजाने में स्वाद मिट जाता था। इस नए तरीके में, "सेफ्टी टवीक" को "फ्लेवर टवीक" के ऊपर जोड़ा जाता है, इसलिए आपको दोनों मिलते हैं।
  • दक्षता (Efficiency): शेफ को केवल एक बार मूल रेसिपी बनानी पड़ती है। बाकी सब बस त्वरित, छोटे समायोजन हैं। इसका मतलब है कि रसोई तेज़ी से चलती है और अतिरिक्त ऊर्जा का उपयोग नहीं करती है।

परिणाम

लेखकों ने इस "AMBS" पद्धति का परीक्षण कई अलग-अलग AI मॉडल (जैसे LLaMA, Mistral, और Gemma) पर किया। उन्होंने पाया कि:

  • AI एक साथ Helpful, Harmless, और Honest होने में बहुत बेहतर हो गया।
  • यह भ्रमित नहीं हुआ या "कोलैप्स" (जहाँ वह सुरक्षित होने के लिए ईमानदार होना छोड़ देता है) नहीं हुआ।
  • यह तेज़ था और इसे चलाने के लिए महंगे कंप्यूटर पावर की आवश्यकता नहीं थी।

संक्षेप में, यह पेपर दिखाता है कि यदि आप एक AI को एक साझा आधार देते हैं और फिर उसे विभिन्न लक्ष्यों के लिए छोटे, विशिष्ट समायोजन करने देते हैं, तो वह बिना भ्रमित हुए या किसी भी चीज़ को छोड़े बिना आपकी सभी आवश्यकताओं को पूरा कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →