← नवीनतम पेपर
🤖 AI

How Useful Is Cross-Domain Generalization for Training LLM Monitors?

यह शोध पत्र प्रदर्शित करता है कि कई क्रॉस-डोमेन वर्गीकरण कार्यों पर भाषा मॉडलों को फाइन-ट्यून करने से अनदेखे डोमेनों पर प्रदर्शन में सुधार होता है, हालांकि यह प्रॉम्प्ट परिवर्तनों के साथ संघर्ष कर सकता है, एक ऐसी सीमा जिसे वर्गीकरण प्रशिक्षण को सामान्य निर्देश पालन के साथ मिश्रित करके कम किया जा सकता है ताकि जटिल तर्क कार्यों के लिए सामान्यीकृत करने वाले मजबूत, बिना-सोचने वाले मॉडलों को सक्षम बनाया जा सके।

मूल लेखक: Sam Martin, Fabien Roger

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sam Martin, Fabien Roger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ अनुवाद दिया गया है।

बड़ी तस्वीर: एक "सुरक्षा गार्ड" AI को प्रशिक्षित करना

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सामान्य-उद्देश्य वाला AI सहायक है (जैसे कि एक उच्च शिक्षित इंटर्न)। आप इस इंटर्न का उपयोग अपने कंप्यूटर सिस्टम के लिए एक सुरक्षा गार्ड के रूप में करना चाहते हैं। उनका काम बातचीत को पढ़ना और किसी भी खतरनाक चीज़ को पहचानना है, जैसे कि कोई बैंक को हैक करने या रासायनिक हथियार बनाने की कोशिश कर रहा हो।

इस इंटर्न को प्रशिक्षित करने के दो मुख्य तरीके हैं:

  1. "प्रॉम्प्ट" विधि: आप बस इंटर्न को कहते हैं, "हे, अगर तुम्हें हैकिंग का प्रयास दिखे, तो 'हाँ' कहना।" आप उन्हें कोई विशेष प्रशिक्षण नहीं देते; आप बस यह उम्मीद करते हैं कि उनकी सामान्य बुद्धिमत्ता पर्याप्त होगी।
  2. "विशेषज्ञ" विधि: आप इंटर्न को बुरे लोगों के 50,000 उदाहरणों का एक ढेर देते हैं और कहते हैं, "इन पैटर्न्स को याद कर लो।" यह आमतौर पर बेहतर काम करता है, लेकिन यह महंगा और कठोर है।

शोध का प्रश्न: क्या होगा अगर हम एक बीच का रास्ता अपनाएं? क्या होगा अगर हम इंटर्न को एक ही समय में कई अलग-अलग प्रकार की सुरक्षा समस्याओं (साइबर हमलों, रासायनिक खतरों आदि) पर प्रशिक्षित करें? क्या वे एक बेहतर, अधिक लचीला सुरक्षा गार्ड बन जाएंगे जो खतरों के उन नए प्रकारों को भी पहचान सके जिन्हें उन्होंने पहले कभी नहीं देखा?

मुख्य निष्कर्ष

1. "क्रॉस-ट्रेनिंग" प्रभाव (सामान्यीकरण/Generalization)

शोधकर्ताओं ने पाया कि यदि आप AI को एक प्रकार के खतरे (जैसे साइबर हमले) पर प्रशिक्षित करते हैं, तो यह वास्तव में दूसरे प्रकार के खतरे (जैसे AI एजेंटों का अनियस्त होना) को पहचानने में बेहतर हो जाता है, भले ही उसे उस दूसरे खतरे के उदाहरण दिखाए ही न गए हों।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक बास्केटबॉल खिलाड़ी को एक विशिष्ट कोर्ट पर अभ्यास करवाकर प्रशिक्षित कर रहे हैं। आश्चर्यजनक रूप से, यह प्रशिक्षण उसे पूरी तरह से अलग मैदान पर फुटबॉल खेलने में बेहतर बनाता है। शोध पत्र में पाया गया कि "साइबर हानि" (Cyber Harm) पर प्रशिक्षण देने से AI "AI नियंत्रण" (AI Control) के मुद्दों को पकड़ने में उतना ही सक्षम हो गया जितना कि इसे शुरू से विशेष रूप से उन AI नियंत्रण मुद्दों पर प्रशिक्षित करने से होता (लगभग 75% तक)।
  • यह क्यों मायने रखता है: यदि आपके पास किसी नए, दुर्लभ खतरे के केवल कुछ ही उदाहरण हैं, तो आप अपने सुरक्षा तंत्र के प्रदर्शन को बढ़ाने के लिए एक समान, अधिक सामान्य खतरे के डेटा का उपयोग कर सकते हैं।

2. "ज़िद्दी इंटर्न" की समस्या (सामान्यीकरण की विफलता)

हालाँकि, इसमें एक पेंच है। कभी-कभी AI अपने फायदे के लिए बहुत ज़्यादा स्मार्ट हो जाता है। यह निर्देशों (प्रॉम्प्ट) को सुनने के बजाय प्रशिक्षण के दौरान देखे गए डेटा के आधार पर नियमों का अनुमान लगाने लगता है।

  • उपमा: कल्पना कीजिए कि आप एक सुरक्षा गार्ड को "लाल टोपी" देखने के लिए प्रशिक्षित करते हैं। आप उन्हें लाल टोपी पहने लोगों की 1,000 तस्वीरें दिखाते हैं। बाद में, आप उन्हें कहते हैं, "अब, नीले जूते पहने लोगों को देखो।"
    • विफलता: क्योंकि गार्ड लाल टोपी देखने का इतना आदी हो चुका है, जब वह लाल टोपी वाले व्यक्ति को देखता है (भले ही आपने नीले जूतों के बारे में पूछा हो), तो वह फिर से चिल्लाता है, "खतरा! लाल टोपी!" वह आपके नए आदेश को सुनने के बजाय अपने पुराने प्रशिक्षण से "चिपका" रहता है।
    • समाधान: शोध पत्र में पाया गया कि यदि आप सुरक्षा प्रशिक्षण के बाद कुछ सामान्य बातचीत का प्रशिक्षण (AI को निर्देश ठीक से पालन करना सिखाना) मिला देते हैं, तो AI फिर से नए प्रॉम्प्ट को सुनना सीख जाता है। वह ज़िद्दी होना बंद कर देता है और आदेशों का पालन करने लगता है।

3. "जादुई स्थानांतरण" (एक शब्द से पूरे वाक्यों तक)

यह सबसे आश्चर्यजनक हिस्सा है। शोधकर्ताओं ने AI को खतरे को वर्गीकृत करने के लिए केवल एक एकल शब्द (हाँ के लिए "1", नहीं के लिए "0") आउटपुट करने के लिए प्रशिक्षित किया। उन्होंने इसे लंबी व्याख्या या सारांश लिखना कभी नहीं सिखाया।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को परीक्षा में केवल "सही" या "गलत" उत्तर देने के लिए प्रशिक्षित करते हैं। आपने उसे कभी निबंध लिखने के लिए नहीं कहा। लेकिन फिर, आप उससे किसी चीज़ के खतरनाक होने के पीछे का कारण बताते हुए एक पूरा निबंध लिखने को कहते हैं।
  • परिणाम: छात्र True/False प्रशिक्षण के बिना की तुलना में एक बेहतर निबंध लिखता है। सरल "True/False" प्रशिक्षण ने किसी तरह AI की जटिल स्थितियों को गहराई से सोचने और सारांशित करने की क्षमता में सुधार किया, भले ही प्रशिक्षण के दौरान उससे ऐसा करने के लिए कभी नहीं कहा गया था।

उन्होंने यह कैसे किया (नुस्खा/Recipe)

इन परिणामों को प्राप्त करने के लिए बिना AI को खराब किए, उन्होंने एक विशिष्ट नुस्खा इस्तेमाल किया:

  1. चरण 1: AI को सुरक्षा कार्यों (True/False अभ्यास) पर भारी रूप से प्रशिक्षित करें।
  2. चरण 2: फिर, बहुत बड़ी मात्रा में सामान्य बातचीत का डेटा (जैसे कि एक सामान्य चैटबॉट ट्रेनिंग) मिलाएं।
  3. महत्वपूर्ण विवरण: उन्होंने दोनों को रैंडमली (यादृच्छिक रूप से) नहीं मिलाया। उन्होंने सुरक्षा प्रशिक्षण पहले किया, फिर सामान्य प्रशिक्षण किया। यदि वे इन्हें आपस में मिला देते, तो सुरक्षा के सबक सामान्य चैट डेटा के विशाल भंडार के कारण "पतले" (diluted) हो जाते और AI सुरक्षा गार्ड के रूप में अपनी क्षमता भूल जाता।

निचोड़ (The Bottom Line)

यह शोध पत्र दिखाता है कि आप विभिन्न सुरक्षा कार्यों के मिश्रण पर प्रशिक्षित करके एक बहुत मजबूत AI सुरक्षा मॉनिटर बना सकते हैं।

  • यह नए, समान खतरों के लिए अच्छी तरह से सामान्यीकरण (Generalize) करता है।
  • यह अपने "ज़िद्दी" व्यवहार को ठीक कर देता है यदि आप सामान्य निर्देश प्रशिक्षण के साथ इसका अनुसरण करते हैं।
  • यह AI की सोचने और सारांश निकालने की क्षमता में सुधार करता है, भले ही आपने इसे केवल एक-शब्द के उत्तर देने के लिए प्रशिक्षित किया हो।

यह सुझाव देता है कि AI सुरक्षा प्रणालियों के निर्माण के लिए, आपको हर एक नए खतरे के लिए बहुत बड़े, विशेष डेटासेट की आवश्यकता नहीं है। आप अपने मॉनिटर्स को स्मार्ट और अधिक अनुकूल बनाने के लिए "क्रॉस-ट्रेनिंग" दृष्टिकोण का उपयोग कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →