← नवीनतम पेपर
💬 NLP

H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs

H3Fusion एक मिक्सचर-ऑफ-एक्सपर्ट्स-आधारित फ्यूजन तंत्र पेश करता है जो संरेखण (alignment) को प्रतिनिधित्व उप-स्थान (representation subspace) के भीतर एक नियंत्रणीय ड्रिफ्ट के रूप में मॉडल करता है, जो प्रभावी रूप से मौजूदा व्यक्तिगत रूप से संरेखित मॉडलों, एन्सेम्बल दृष्टिकोणों और मॉडल-मर्जिंग तकनीकों से बेहतर प्रदर्शन करने के लिए सहायकता (helpfulness), हानिरहितता (harmlessness) और ईमानदारी (honesty) को संतुलित करता है।

मूल लेखक: Selim Furkan Tekin, Fatih Ilhan, Tiansheng Huang, Sihao Hu, Yichang Xu, Zachary Yahn, Ling Liu

प्रकाशित 2026-01-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Selim Furkan Tekin, Fatih Ilhan, Tiansheng Huang, Sihao Hu, Yichang Xu, Zachary Yahn, Ling Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास तीन अलग-अलग विशेषज्ञ शेफ हैं, जिनमें से प्रत्येक को खाना पकाने की एक विशिष्ट शैली में महारत हासिल करने के लिए प्रशिक्षित किया गया है:

  1. शेफ हेल्पफुल (Chef Helpful): ये स्वादिष्ट और संतोषजनक भोजन बनाते हैं जो बिल्कुल वैसा ही होता है जैसा आपने मांगा है, लेकिन कभी-कभी वे गलती से किसी अजीब सामग्री वाला व्यंजन परोस सकते हैं (भ्रम/hallucination) या किसी सुरक्षा नियम को अनदेखा कर सकते हैं।
  2. शेफ हार्मलेस (Chef Harmless): ये अविश्वसनीय रूप से सावधान हैं। वे कभी भी कोई खतरनाक चीज़ परोसेंगे नहीं, लेकिन वे इतने सतर्क हो सकते हैं कि कुछ भी पकाने से मना कर दें, या केवल सुरक्षित रहने के लिए एक बेस्वाद, उबाऊ प्लेट परोस दें।
  3. शेफ ऑनेस्ट (Chef Honest): ये केवल वही तथ्य परोसते हैं जिनके बारे में वे 100% सुनिश्चित हैं। वे झूठ नहीं बोलते, लेकिन वे किसी प्रश्न का उत्तर देने से इनकार कर सकते हैं क्योंकि वे पूरी तरह से आश्वस्त नहीं हैं, जिससे वे अनुपयोगी लग सकते हैं।

समस्या यह है कि यदि आप एक ही शेफ को एक साथ हेल्पफुल, हार्मलेस और ऑनेस्ट बनने के लिए प्रशिक्षित करने की कोशिश करते हैं, तो वे अक्सर भ्रमित हो जाते हैं। वे बहुत अधिक सावधान (शेफ हार्मलेस की तरह) हो सकते हैं और मददगार बनना बंद कर सकते हैं, या वे बहुत अधिक मददगार होने की कोशिश में अनजाने में कुछ असुरक्षित कह सकते हैं।

H3Fusion एक नया किचन सिस्टम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। एक एकल शेफ को सब कुछ करने के लिए मजबूर करने के बजाय, यह एक "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) का उपयोग करके एक सुपर-किचन बनाता है।

H3Fusion कैसे काम करता है (एक उपमा/एनालॉजी)

H3Fusion को एक स्मार्ट हेड शेफ (रूटर) के रूप में सोचें जो तीन विशेष स्टेशनों (विशेषज्ञों) वाले किचन के सामने खड़ा है।

  1. सेटअप: हेड शेफ शून्य से शुरुआत नहीं करता है। वे तीन मौजूदा विशेषज्ञ शेफ (हेल्पफुल, हार्मलेस, ऑनेस्ट) को लेते हैं और उन्हें किचन में रखते हैं।
  2. स्विचबोर्ड: जब एक ग्राहक (आप) कोई प्रश्न पूछता है, तो हेड शेफ देखता है कि कौन सा विशेषज्ञ भोजन तैयार करेगा।
    • यदि आप एक मजेदार रेसिपी मांगते हैं, तो हेड शेफ शेफ हेल्पफुल को बुलाता है।
    • यदि आप किसी खतरनाक रसायन के बारे में पूछते हैं, तो हेड शेफ शेफ हार्मलेस को बुलाता है।
    • यदि आप किसी ऐतिहासिक तथ्य के बारे में पूछते हैं, तो हेड शेफ शेफ ऑनेस्ट को बुलाता है।
  3. सीक्रेट सॉस (ड्रिफ्ट और गेटिंग): पेपर में इन दोनों विशेष उपकरणों का उल्लेख है जो इस टीम वर्क को पूर्ण बनाते हैं:
    • "ड्रिफ्ट" रेगुलेटर (The "Drift" Regulator): कभी-कभी, जब हेड शेफ शेफ हेल्पफुल को खाना पकाने के लिए कहता है, तो भोजन सुरक्षित होने से बहुत दूर भटक सकता है। रेगुलेटर एक पट्टे (लीश) की तरह काम करता है, जो शेफ को वापस खींचता है यदि वे बहुत ज्यादा अनियंत्रित हो रहे हों, या उन्हें स्वतंत्र छोड़ देता है यदि उन्हें अधिक रचनात्मक होने की आवश्यकता हो। यह संतुलित करता है कि प्रत्येक शेफ अपने मूल प्रशिक्षण से कितना "ड्रिफ्ट" करता है।
    • "गेटिंग" लॉस (The "Gating" Loss): यह एक सख्त मैनेजर की तरह है जो हेड शेफ के निर्णयों की जांच करता है। यदि हेड शेफ एक साधारण गणित के प्रश्न के लिए शेफ हार्मलेस को बुलाता है (जो कि गलत है), तो मैनेजर एक "पेनल्टी" देता है। यह हेड शेफ को सही काम के लिए सही विशेषज्ञ चुनने में बेहतर बनाने के लिए प्रशिक्षित करता है।

जब आप इसका उपयोग करते हैं तो क्या होता है?

शोधकर्ताओं ने इस सिस्टम का परीक्षण तीन बड़ी चुनौतियों पर किया:

  • हेल्पफुलनेस (Helpfulness): क्या यह अच्छा उत्तर देता है?
  • हारmlessness (Harmlessness): क्या यह सुरक्षित है?
  • ऑनेस्टनेस (Honesty): क्या यह सत्यनिष्ठ है?

परिणाम:

  • अपने हिस्सों के योग से बेहतर: H3Fusion किचन ने केवल तीनों शेफ का औसत नहीं निकाला; इसने वास्तव में व्यक्तिगत विशेषज्ञों में से किसी भी अकेले शेफ के काम करने से बेहतर प्रदर्शन किया। यह व्यक्तिगत विशेषज्ञों से 11.37% बेहतर था।
  • अन्य टीमों से अधिक मजबूत: उन्होंने अन्य तरीकों (जैसे केवल उनके वेट्स को मिलाना या वोटिंग कराना) के साथ H3Fusion की तुलना की। H3Fusion काफी मजबूत था, जिसने कुछ क्षेत्रों में उन तरीकों को 13% से अधिक से पीछे छोड़ दिया।
  • कुशल (Efficient): भले ही इसमें तीन विशेषज्ञ हैं, यह किसी भी प्रश्न के लिए एक समय में केवल दो को ही "एक्टिवेट" करता है। इसका मतलब है कि यह तेज़ है और इसे चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि H3Fusion AI अलाइनमेंट की "टग-ऑफ-वॉर" (खींचातानी) की समस्या को हल करता है। आमतौर पर, AI को सुरक्षित बनाने से वह कम मददगार हो जाता है, या उसे ईमानदार बनाने से वह कम उपयोगी हो जाता है। H3Fusion एक ऐसा सिस्टम बनाता है जहाँ ये तीन लक्ष्य एक-दूसरे से लड़े बिना सह-अस्तित्व में रह सकते हैं।

यह निम्नलिखित तरीकों से इसे प्राप्त करता है:

  1. सब कुछ फिर से प्रशिक्षित नहीं करना: यह तीन विशेषज्ञ मॉडलों की मूल "मसल मेमोरी" को बनाए रखता है और बस एक छोटा "रूटर" जोड़ता है जो यह तय करता है कि कौन बोलेगा।
  2. संतुलन को फाइन-ट्यून करना: यह विशेष गणित (लॉस फंक्शन्स) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि हेड शेफ सही विशेषज्ञ को चुने और विशेषज्ञ अपने मुख्य गुणों से बहुत दूर न भटकें।

संक्षेप में, H3Fusion एक ऐसा AI बनाने का तरीका है जो स्मार्ट, सुरक्षित और सत्यनिष्ठ है, क्योंकि यह विशेषज्ञ विशेषज्ञों को वह करने देता है जिसमें वे सर्वश्रेष्ठ हैं, जिसका मार्गदर्शन एक स्मार्ट मैनेजर द्वारा किया जाता है जिसे पता होता है कि कब किसे बुलाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →