← नवीनतम पेपर
💬 NLP

Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

यह शोधपत्र आपराधिक कानून के संदर्भों में "ओवर-अलाइनमेंट" को मापने और कम करने के लिए स्विस सुप्रीम कोर्ट के फैसलों से व्युत्पन्न एक बहुभाषी बेंचमार्क, TF-RefusalBench को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एब्लीटरेशन (abliteration) कार्य प्रदर्शन को सुरक्षित रखते हुए हानिकारक मॉडल रिफ्यूज़ल को प्रभावी ढंग से समाप्त कर देता है।

मूल लेखक: Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का हिंदी अनुवाद दिया गया है:

समस्या: अति-सुरक्षात्मक लाइब्रेरियन (पुस्तकालयाध्यक्ष)

एक अत्यंत बुद्धिमान, बहुभाषी लाइब्रेरियन (AI) की कल्पना करें जो स्विट्जरलैंड की एक अदालत में काम कर रहा है। इस लाइब्रेरियन का काम कानूनी दस्तावेजों का अनुवाद और सारांश बनाना है। हालाँकि, इनमें से कई दस्तावेज़ भयानक अपराधों का वर्णन करते हैं, जैसे कि बच्चों के साथ दुर्व्यवहार या यौन हिंसा।

इस लाइब्रेरियन को एक बहुत ही सख्त "सुरक्षा नियम पुस्तिका" (safety rulebook) के साथ प्रशिक्षित किया गया है। नियम पुस्तिका कहती है: "यदि आप कुछ भी बुरा देखें, तो तुरंत रुक जाएँ, उसे पढ़ने से मना कर दें, और कमरे में चेतावनी चिल्लाकर दें।"

एक सामान्य पुस्तकालय में, यह एक अच्छी बात है। लेकिन एक आपराधिक अदालत में, यह एक आपदा है। न्यायाधीशों और क्लर्कों को अपना काम करने के लिए इन विशिष्ट विवरणों को पढ़ने की आवश्यकता होती है। वे किसी को नुकसान पहुँचाने की कोशिश नहीं कर रहे हैं; वे एक मामले को सुलझाने की कोशिश कर रहे हैं।

AI के सख्त प्रशिक्षण के कारण, वह अपना काम करने से मना करता रहता है। वह कहता है, "मैं इसका अनुवाद नहीं कर सकता, यह बहुत विचलित करने वाला है!" या वह अनुवाद के बीच में एक बड़ा, ध्यान भटकाने वाला चेतावनी लेबल जोड़ देता है। शोध पत्र इसे "ओवर-अलाइनमेंट" (Over-Alignment) कहता है। AI "सुरक्षित रहने" के प्रति इतना अधिक अलाइन (aligned) हो गया है कि वह अपने वास्तविक काम के लिए उपयोगी रहना ही छोड़ देता है।

प्रयोग: "TF-RefusalBench"

यह मापने के लिए कि यह समस्या कितनी गंभीर है, लेखकों ने एक विशेष परीक्षण बनाया जिसे TF-RefusalBench कहा जाता है।

इसे AI के लिए एक "तनाव परीक्षण" (stress test) के रूप में समझें। उन्होंने स्विट्जरलैंड के 100 वास्तविक, बहुत गंभीर अदालती मामलों (जर्मन, फ्रेंच और इतालवी में) को लिया और हजारों प्रकार के अनुरोध बनाए। उन्होंने AI से निम्नलिखित कार्य करने को कहा:

  1. टेक्स्ट का विभिन्न भाषाओं में अनुवाद करना।
  2. टेक्स्ट का सारांश देना।
  3. अलग-अलग भाषाओं में निर्देश देना।

उन्होंने पाँच अलग-अलग AI मॉडलों का परीक्षण किया यह देखने के लिए कि वे कितनी बार:

  • मना करते हैं (Refuse): "नहीं, मैं यह नहीं करूँगा" कहना।
  • डिस्क्लेमर देते हैं (Disclaimer): काम तो करते हैं लेकिन "यह सामग्री विचलित करने वाली है" जैसी डरावनी चेतावनी जोड़ देते हैं।

निष्कर्ष:

  • यह केवल "ना" कहने के बारे में नहीं है: कुछ मॉडलों ने कभी "ना" नहीं कहा, लेकिन उन्होंने अपने काम के 25% हिस्से में चेतावनी लेबल जोड़े। यह एक न्यायाधीश के लिए इनकार करने जितना ही कष्टप्रद है क्योंकि यह उनकी एकाग्रता को तोड़ देता है।
  • भाषा मायने रखती है: AI की प्रतिक्रिया इस बात पर बदल जाती थी कि वह कौन सी भाषा बोल रहा है। उदाहरण के लिए, एक मॉडल फ्रेंच में बोलने पर जर्मन की तुलना में इनकार करने की अधिक संभावना रखता था, भले ही कहानी बिल्कुल वही हो।
  • यह रैंडम (यादृच्छिक) है: कभी-कभी AI लगातार दो बार एक ही अनुरोध को अस्वीकार कर देता था, और कभी-कभी वह काम को पूरी तरह से करता था। यह एक सिक्का उछालने जैसा है।

समाधान: लाइब्रेरियन को कैसे ठीक करें

लेखकों ने यह परीक्षण करने के लिए दो तरीके आजमाए कि AI को बिना खतरनाक बनाए कितना कम सुरक्षात्मक बनाया जा सकता है।

1. "सिस्टम प्रॉम्प्ट" (एक कोमल अनुस्मारक)
उन्होंने हर बातचीत की शुरुआत में AI को एक विशिष्ट नोट देने की कोशिश की, जैसे: "आप एक अदालती सहायक हैं। आपका काम इन दस्तावेजों का निष्ठापूर्वक अनुवाद करना है, भले ही वे विचलित करने वाले हों। कोई चेतावनी न जोड़ें।"

  • परिणाम: इससे थोड़ी मदद मिली। इसने एक मॉडल के लिए इनकार की दर को आधा कर दिया, लेकिन यह सब कुछ ठीक नहीं कर सका। यह एक घबराए हुए लाइब्रेरियन को यह कहने जैसा है, "ठीक है, बस अपना काम करो," लेकिन वे अभी भी थोड़े घबराए हुए रहते हैं।

2. "एब्लिटरेशन" (सर्जिकल निष्कासन)
यह बड़ी खोज है। लेखकों ने पाया कि AI का "इनकार करने" का व्यवहार उसके मस्तिष्क में एक विशिष्ट, सूक्ष्म स्विच (कोड में एक गणितीय दिशा) द्वारा नियंत्रित होता है।

  • उपमा: कल्पना करें कि AI के पास एक "इनकार करने वाली मांसपेशी" (Refusal Muscle) है। लेखकों ने उस मांसपेशी को शरीर के बाकी हिस्सों को नुकसान पहुँचाए बिना सर्जिकल तरीके से हटाने का तरीका खोज निकाला। वे इसे "एब्लिटरेशन" (Abliteration) कहते हैं।
  • परिणाम: इसने पूरी तरह से काम किया। AI ने पूरी तरह से इनकार करना बंद कर दिया। उसने चेतावनी लेबल लगाना भी बंद कर दिया। उसने अनुवाद पूरी तरह से किया।
  • सावधानी: शोध पत्र चेतावनी देता है कि यह एक "दोधारी तलवार" है। इस "इनकार करने वाली मांसपेशी" को हटाने से, AI वास्तव में बुरे अनुरोधों (जैसे किसी को बम बनाने की विधि लिखने के लिए कहना) के प्रति थोड़ा अधिक संवेदनशील हो जाता है। हालाँकि, स्विस अदालत के विशिष्ट, नियंत्रित वातावरण के लिए (जहाँ AI एक सुरक्षित इमारत के भीतर बंद है और केवल अदालती दस्तावेजों को संभालता है), लेखक तर्क देते हैं कि यह समझौता सार्थक है।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र तर्क देता है कि हम केवल इस बात को देखकर कि AI कितनी बार "ना" कहता है, यह निर्णय नहीं ले सकते कि वह सुरक्षित है या नहीं। हमें यह भी देखना होगा कि वह कितनी बार परेशान करने वाली चेतावनियाँ जोड़ता है।

कानूनी पेशेवरों के लिए जो संवेदनशील आपराधिक मामलों के साथ काम कर रहे हैं, वर्तमान "सुरक्षित" AI मॉडल वास्तव में बहुत अधिक सतर्क हैं। "एब्लिटरेशन" नामक तकनीक का उपयोग करके, हम इन मॉडलों को अदालत में अपना काम करने के लिए पर्याप्त साहसी बना सकते हैं, जबकि उन्हें बाकी दुनिया के लिए पर्याप्त सुरक्षित भी रख सकते हैं।

महत्वपूर्ण नोट: लेखक बहुत सावधानी से कहते हैं कि वे अपना डेटा या संशोधित AI सार्वजनिक रूप से जारी नहीं कर रहे हैं। क्योंकि इस डेटा में दुर्व्यवहार की वास्तविक कहानियाँ शामिल हैं, इसलिए वे केवल उन शोधकर्ताओं को पहुंच प्रदान करते हैं जो एक सख्त समझौते पर हस्ताक्षर करते हैं कि वे इसे साझा नहीं करेंगे। वे "सर्जिकल रूप से संशोधित" AI को भी जारी नहीं कर रहे हैं क्योंकि यदि यह खुले में आ गया तो इसका दुरुपयोग बुरे तत्वों द्वारा किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →