← नवीनतम पेपर
💬 NLP

Are Aligned Large Language Models Still Misaligned?

यह शोधपत्र Mis-Align Bench प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क और 382,000 से अधिक नमूनों का SAVACU डेटासेट है, जिसका उद्देश्य सुरक्षा, मूल्य और सांस्कृतिक आयामों के माध्यम से लार्ज लैंग्वेज मॉडल्स (LLMs) के मिस-अलाइनमेंट (misalignment) का एक साथ मूल्यांकन करना है, जो यह प्रकट करता है कि एकल आयामों के लिए अनुकूलित मॉडल वास्तविक दुनिया की संयुक्त स्थितियों का सामना करते समय उच्च 'फॉल्स फेल्योर रेट' (false failure rate) और कम अलाइनमेंट स्कोर से ग्रस्त होते हैं।

मूल लेखक: Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त, अंतर्राष्ट्रीय पारिवारिक पुनर्मिलन (family reunion) चलाने के लिए एक नया सहायक नियुक्त कर रहे हैं। आपके पास उनके लिए तीन मुख्य नियम हैं:

  1. सुरक्षा (Safety): उन्हें कभी भी कुछ भी खतरनाक या हानिकारक नहीं कहना चाहिए (जैसे किसी को जहर पीने का सुझाव देना)।
  2. मूल्य (Values): उन्हें मानवीय नैतिकता का सम्मान करना चाहिए (जैसे दयालु और ईमानदार होना)।
  3. संस्कृति (Culture): उन्हें यह समझना चाहिए कि अलग-अलग परिवारों की अलग-अलग परंपराएं होती हैं (जैसे यह जानना कि कुछ संस्कृतियों में शराब के साथ टोस्ट करना सामान्य है, जबकि अन्य में यह बिल्कुल भी स्वीकार्य नहीं है)।

समस्या: "विशेषज्ञ" बनाम "सामान्यज्ञ" (The "Specialist" vs. The "Generalist")

लंबे समय तक, शोधकर्ताओं ने एआई (AI) सहायकों का परीक्षण केवल एक समय में एक ही नियम की जाँच करके किया।

  • उन्होंने पूछा: "क्या यह उत्तर सुरक्षित है?" (हाँ/नहीं)।
  • उन्होंने पूछा: "क्या यह उत्तर नैतिक है?" (हाँ/नहीं)।
  • उन्होंने पूछा: "क्या यह उत्तर सांस्कृतिक रूप से सही है?" (हाँ/नहीं)।

यह शोध पत्र तर्क देता है कि यह एक शेफ (chef) का परीक्षण करने जैसा है जिसमें केवल यह पूछा जाता है, "क्या आप प्याज काट सकते हैं?" और "क्या आप केक बना सकते हैं?" अलग-अलग। आपको प्याज काटने में माहिर और केक बनाने में माहिर व्यक्ति मिल सकते हैं, लेकिन यदि आप उनसे एक पूरा भोजन बनाने के लिए कहें जहाँ प्याज की सॉस को केक के अंदर बेक किया जाना हो, तो वे बुरी तरह विफल हो सकते हैं।

वास्तविक दुनिया में, एक एआई को एक ही समय में तीनों नियमों को पूरा करना होता है।

नया टूल: "मिस-अलाइन बेंच" (Mis-Align Bench)

लेखकों ने एक नया परीक्षण क्षेत्र बनाया जिसे "मिस-अलाइन बेंच" कहा जाता है। इसे एक "तनाव परीक्षण" (Stress Test) के रूप में समझें।

साधारण प्रश्न पूछने के बजाय, उन्होंने 382,000 जटिल परिदृश्य (scenarios) का एक विशाल पुस्तकालय (जिसे SAVACU कहा जाता है) बनाया। ये परिदृश्य एआई को सुरक्षा, मूल्यों और संस्कृति को एक साथ संभालने के लिए मजबूर करते हैं।

उदाहरण परिदृश्य:

  • प्रश्न: "क्या सभी पारिवारिक समारोहों में शराब परोसी जानी चाहिए?"
  • "सुरक्षित" लेकिन "गलत" उत्तर: "हाँ, सबको पीना चाहिए!" (सुरक्षित? हाँ। नैतिक? शायद। सांस्कृतिक रूप से? नहीं, क्योंकि कुछ परिवार नशा मुक्त या धार्मिक होते हैं)।
  • "नैतिक" लेकिन "गलत" उत्तर: "नहीं, कभी न पिएं!" (सुरक्षित? हाँ। सांस्कृतिक रूप से? नहीं, क्योंकि कुछ संस्कृतियों में वाइन को पवित्र माना जाता है)।
  • "अलाइन" (Aligned) उत्तर: "यह परिवार की परंपराओं और स्थानीय कानूनों पर निर्भर करता है।" (सुरक्षित, नैतिक और सांस्कृतिक रूप से जागरूक)।

उन्होंने क्या पाया

शोधकर्ताओं ने कई अलग-अलग एआई मॉडल का परीक्षण किया (कुछ जिन्हें केवल एक क्षेत्र में विशेषज्ञ बनने के लिए "फाइन-ट्यून" किया गया था, और कुछ जो सामान्य प्रयोजन के थे)। यहाँ क्या हुआ:

  1. "विशेषज्ञ" का जाल (The "Specialist" Trap):
    ऐसे मॉडल जिन्हें केवल अत्यधिक सुरक्षित या केवल अत्यधिक नैतिक होने के लिए प्रशिक्षित किया गया था, वे अपने विशिष्ट कार्य में बहुत अच्छा प्रदर्शन करते हैं। उन्होंने अपने क्षेत्र की लगभग हर गलती को पकड़ लिया (97% सफलता!)।
  • नुकसान: जब आपने उनसे ऐसी स्थिति को संभालने के लिए कहा जिसमें तीनों नियमों की आवश्यकता थी, तो वे अनाड़ी हो गए। वे अच्छे उत्तरों को भी खारिज करने लगे क्योंकि वे एक नियम के प्रति बहुत सख्त हो रहे थे। वे बड़े चित्र (big picture) को देखने में विफल रहे।
  • उपमा: एक सुरक्षा गार्ड की कल्पना करें जो "सुरक्षा" के प्रति इतना जुनूनी है कि वह एक दादाजी को पार्क में प्रवेश करने से रोक देता है क्योंकि उस लड़के ने एक ऐसी टोपी पहनी है जो "संदिग्ध" दिखती है। उन्होंने नियम का पालन किया लेकिन मिशन में विफल रहे।
  1. "सामान्यज्ञ" का लाभ (The "Generalist" Advantage):
    वे मॉडल जिन्हें सब कुछ एक साथ संभालने के लिए प्रशिक्षित किया गया था (जनरल-परपज अलाइन्ड मॉडल), वे तीनों नियमों को संतुलित करने में बेहतर थे। उन्होंने हर छोटी गलती को नहीं पकड़ा, लेकिन उन्होंने बहुत अधिक "गलत अलार्म" (false alarms) भी नहीं दिए। वे बारीकियों को समझ गए।

  2. "कच्चे" मॉडल (The "Raw" Models):
    वे मॉडल जिन्हें अलाइनमेंट पर बिल्कुल भी प्रशिक्षित नहीं किया गया था, वे सबसे अधिक "चिल" (chill) थे। वे अच्छे उत्तरों को शायद ही कभी "ना" कहते थे (कम गलत अलार्म), लेकिन वे वास्तविक खतरों को भी बहुत मिस कर देते थे क्योंकि उन्हें नियमों की परवाह नहीं थी।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि "अलाइन" (aligned) होने का मतलब केवल सुरक्षित, नैतिक या सांस्कृतिक रूप से जागरूक होना नहीं है। यह उन तीनों को एक साथ बुनने के बारे में है।

यदि आप एक एआई को "सेफ्टी निंजा" बनाने के लिए प्रशिक्षित करते हैं, तो यह इतना डरा हुआ हो सकता है कि यह मददगार या सांस्कृतिक रूप से संवेदनशील होना छोड़ दे। एक वास्तव में सहायक एआई बनाने के लिए, हमें इसे जटिल, वास्तविक दुनिया की स्थितियों पर परखने की आवश्यकता है जहाँ इसे एक पूर्ण संतुलन बनाना होता है, न कि केवल एक नियम पुस्तिका का पालन करना होता है।

संक्षेप में: आप ऐसा रोबोट नहीं चाहते जो केवल सुरक्षित हो, या केवल विनम्र हो। आप एक ऐसा रोबोट चाहते हैं जो जानता हो कि कब सुरक्षित रहना है, कब विनम्र होना है, और कब किसी सांस्कृतिक परंपरा का सम्मान करना है, और यह सब आपसे बातचीत करते हुए करना हो। यह शोध पत्र हमें पहली बार यह परीक्षण करने का तरीका देता है कि क्या हमारे रोबोट वास्तव में यह कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →