← नवीनतम पेपर
💬 NLP

When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified

"एक्सिस कोलैप्स" (Axis Collapse) की समस्या को संबोधित करने के लिए, जहाँ सहायकता (helpfulness) और सुरक्षा (safety) जैसे परस्पर विरोधी उद्देश्य एक-दूसरे में हस्तक्षेप करते हैं, लेखक **AlignX** का प्रस्ताव करते हैं, जो एक दो-चरणीय ढांचा है जो प्रॉम्प्ट-इंजेक्टेड फाइन-ट्यूनिंग और एक ज्यामिति-कैलिब्रेटेड मिक्सचर-ऑफ-एक्सपर्ट्स (MoCaE) मॉड्यूल का उपयोग करता है ताकि बड़े भाषा मॉडलों के संरेखण (alignment), सत्यता और दक्षता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

प्रकाशित 2026-02-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-स्तरीय लॉ फर्म चलाने में मदद करने के लिए प्रशिक्षुओं (interns) के एक समूह को प्रशिक्षित कर रहे हैं। आपके पास तीन विशिष्ट प्रकार के प्रशिक्षु हैं: द हेल्पर (The Helper) (जो उपयोगी बनना चाहता है), द सेफ्टी ऑफिसर (The Safety Officer) (जो मुकदमों से बचना चाहता है), और द ट्रुथ-टेलर (The Truth-Teller) (जो झूठ बोलने से इनकार करता है, भले ही वह असहज करने वाला हो)।

समस्या यह है कि जब आप उन सभी को एक साथ प्रशिक्षित करने की कोशिश करते हैं, तो कुछ गलत हो जाता है। इसे शोधकर्ता "एक्सिस कोलैप्स" (Axis Collapse) कहते हैं।

समस्या: "पहचान का संकट" (The Identity Crisis)

एक सामान्य AI में, जब आप इसे एक ही समय में मददगार, ईमानदार और सुरक्षित होने के लिए सिखाने की कोशिश करते हैं, तो लक्ष्य आपस में टकराने लगते हैं।

  • कैटास्ट्रॉफ़िक फ़ॉरगेटिंग (Catastrophic Forgetting): यह ऐसा है जैसे "हेल्पर" को इतना अधिक सिखाना कि वह "ईमानदार" होना भूल जाए। वे आपको खुश करने के लिए इतने उत्सुक हो जाते हैं कि वे केवल आपको उत्तर देने के लिए मनगढ़ंत बातें बनाने लगते हैं। वे अपना "नैतिक दिशा-निर्देश" खो देते हैं क्योंकि वे "उपयोगी" होने पर बहुत अधिक ध्यान केंद्रित कर रहे होते हैं।
  • मिसकैलिब्रेटेड रूटिंग (Miscalibrated Routing): यह एक फोन सिस्टम की तरह है जहाँ, जब आप लीगल (Legal) के लिए "1" दबाते हैं, तो आप गलती से कस्टमर सर्विस के लिए "3" से जुड़ जाते हैं। AI भ्रमित हो जाता है कि किसी विशिष्ट प्रश्न के लिए उसके मस्तिष्क के किस "विशेषज्ञ" भाग का उपयोग किया जाए, जिससे एक अस्त-व्यस्त, मिला-जुला जवाब मिलता है।

शोध पत्र का शीर्षक—"जब मॉडल ने कहा 'नो कमेंट', तब हमें पता चला कि हेल्पफुलनेस मर चुकी थी..."—उस क्षण का वर्णन करता है जब एक AI इतना डरा हुआ हो जाता है कि वह "असुरक्षित" होने से बचने के लिए पूरी तरह से मददगार होना बंद कर देता है, या इतना "ईमानदार" होने पर केंद्रित हो जाता है कि वह बेकार हो जाता है।


समाधान: AlignX (द "मास्टर मैनेजर" सिस्टम)

शोधकर्ताओं ने इस समस्या को ठीक करने के लिए AlignX नामक एक दो-चरणीय प्रणाली बनाई है। इसे अपने प्रशिक्षुओं के लिए एक दो-चरणीय प्रशिक्षण कार्यक्रम के रूप में समझें।

चरण 1: विशेष प्रशिक्षण नियमावली (Task-Feature Matrices)

प्रत्येक को केवल "अच्छा बनो" कहने के बजाय, शोधकर्ता प्रत्येक को एक अत्यधिक विशिष्ट "व्यक्तित्व प्रोफाइल" देते हैं। वे प्रॉम्प्ट-इंजेक्टेड फाइन-ट्यूनिंग (prompt-injected fine-tuning) नामक तकनीक का उपयोग करते हैं।

कल्पना कीजिए कि "ट्रुथ-टेलर" को एक नियमावली देना कि: "आपकी पूरी पहचान सटीकता पर आधारित है। भले ही उपयोगकर्ता क्रोधित हो, आपको तथ्यों को प्राथमिकता देनी चाहिए।" ऐसा करके, शोधकर्ता प्रत्येक गुण के लिए एक "डिजिटल फिंगरप्रिंट" बनाते हैं। यह सुनिश्चित करता है कि "हेल्पर" गलती से "सेफ्टी ऑफिसर" का व्यक्तित्व आत्मसात न कर ले और एक उबाऊ, अनुपयोगी रोबोट न बन जाए।

चरण 2: स्मार्ट स्विचबोर्ड (MoCaE)

यह "सीक्रेट सॉस" है। एक साधारण, त्रुटिपूर्ण स्विचबोर्ड के बजाय, उन्होंने मिक्सचर-ऑफ-कैलिब्रेटेड-एक्सपर्ट्स (MoCaE) बनाया है।

इसे एक सुपर-इंटेलिजेंट डिस्पैचर (Super-Intelligent Dispatcher) के रूप में सोचें। जब कोई प्रश्न आता है (जैसे, "मैं डिप्रेशन का इलाज कैसे करूँ?"), तो डिस्पैचर केवल यह अनुमान नहीं लगाता कि किस प्रशिक्षु को बुलाना है। यह दो उच्च-तकनीकी उपकरणों का उपयोग करता है:

  1. द फ्रैक्टल कैलिब्रेटर (The Fractal Calibrator - पैटर्न खोजने वाला): यह प्रश्न के "आकार" को देखता है कि वह कितना जटिल है।
  2. द नेचुरल कैलिब्रेटर (The Natural Calibrator - वाइब चेक): यह शब्दों के "अर्थ" को देखता है ताकि यह सुनिश्चित हो सके कि बुलाया गया विशेषज्ञ वास्तव में संदर्भ को "समझता" है।

यदि प्रश्न चिकित्सा संबंधी है, तो डिस्पैचर महसूस करता है, "रुको, इसके लिए सुरक्षा और ईमानदारी के भारी खुराक की आवश्यकता है, लेकिन केवल थोड़ी सी हेल्पफुलनेस की।" इसके बाद यह एक सटीक उत्तर देने के लिए विशेषज्ञों की आवाजों को पूरी तरह से मिला देता है जो उपयोगी है, लेकिन खतरनाक चिकित्सा सलाह नहीं देता है।


परिणाम: एक स्मार्ट, तेज़ टीम

शोधकर्ताओं ने कई प्रसिद्ध AI मॉडलों (जैसे LLaMA और Mistral) पर इसका परीक्षण किया, और परिणाम प्रभावशाली थे:

  • बहुत अधिक मददगार: उन्होंने देखा कि AI कितनी बार "विजेता" या सबसे अच्छा उत्तर प्रदान करता है, इसमें भारी उछाल आया।
  • बहुत अधिक ईमानदार: AI बिना झूठ बोले सूचनात्मक होने में बहुत बेहतर हो गया।
  • बहुत अधिक सुरक्षित: इसने नुकसान पहुँचाने वाली गलतियाँ काफी कम कीं।
  • तेज़ और सुव्यवस्थित: आश्चर्यजनक रूप से, भले ही सिस्टम "स्मार्टर" है, यह पिछले तरीकों की तुलना में 35% तेज़ है और कम मेमोरी का उपयोग करता है। यह एक ऐसी टीम की तरह है जो अधिक कुशल है और साथ ही बहुत अधिक कुशलता से काम भी करती है।

संक्षेप में: AlignX AI के व्यक्तित्वओं को एक-दूसरे से टकराने से रोकता है, यह सुनिश्चित करता है कि उसे पता हो कि कब एक मददगार सहायक बनना है, कब एक सतर्क रक्षक बनना है, और कब एक स्पष्ट सत्यवादी बनना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →