← नवीनतम पेपर
🤖 machine learning

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

यह शोध पत्र DualSelect का प्रस्ताव करता है, जो एक युग्मित ढांचा (coupled framework) है जो कार्य उपयोगिता (task utility) से समझौता किए बिना LLM फाइन-ट्यूनिंग के दौरान सुरक्षा व्यवहारों को बनाए रखने के लिए संगत कार्य नमूनों (compatible task samples) और रिफ्रेश किए गए सुरक्षा संदर्भों (refreshed safety references) को संयुक्त रूप से चुनता है।

मूल लेखक: Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही विनम्र, सभ्य रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है, जिसे कभी भी कोई बुरी, खतरनाक या अवैध बात न कहने के लिए प्रशिक्षित किया गया है। यह उसकी "सेफ्टी अलाइनमेंट" (सुरक्षा संरेखण) है।

अब, आप इस रोबोट को एक नया कौशल सिखाना चाहते हैं, जैसे गणित की समस्याओं को हल करना या कोड लिखना। इसे "फाइन-ट्यूनिंग" कहा जाता है। समस्या यह है कि जब आप इसे ये नए कौशल सिखाते हैं, तो रोबोट अनजाने में अपने शिष्टाचार को भूल सकता है। वह गणित की समस्या हल करने के प्रयास में खतरनाक सलाह देने लग सकता है, या वह इतना "सहायक" होने के प्रति जुनूनी हो सकता है कि वह सुरक्षा नियमों को अनदेखा कर दे।

"Two to Tango: Coupled Task–Reference Selection" नामक शोध पत्र एक नया तरीका प्रस्तावित करता है जिससे आप रोब of को नया कौशल सिखा सकते हैं ताकि वह अपने सुरक्षा शिष्टाचार को खोए बिना सीख सके।

यहाँ उनके विचार का सरल विवरण दिया गया है:

1. समस्या: "वन-साइज़-फिट्स-ऑल" (एक ही नियम सबके लिए) की गलती

पिछले तरीकों ने रोबोट को सुरक्षित रखने के लिए उसे हर बार "अच्छे उदाहरणों" की एक निश्चित सूची (जैसे एक स्थिर सुरक्षा नियमावली) दिखाने की कोशिश की।

  • दोष: कल्पना कीजिए कि आप एक छात्र को पढ़ा रहे हैं। यदि आप उसे हर बार एक ही सुरक्षा नियम (जैसे, "आग को न छुएं") दिखाते हैं, चाहे वह खाना बनाना सीख रहा हो, कार चलाना सीख रहा हो, या रसायन विज्ञान (केमिस्ट्री) सीख रहा हो, तो यह काम नहीं करता है।
    • केमिस्ट्री सीखते समय, विशिष्ट खतरा है "गलत रसायनों को न मिलाएं।"
    • ड्राइविंग सीखते समय, खतरा है "रेड लाइट न तोड़ें।"
    • एक सामान्य सुरक्षा नियमावली इन विशिष्ट, सक्रिय खतरों को पकड़ने में विफल रहती है। शोध पत्र इसे "मिसमैच" (मेल न खाना) कहता है। रोबोट नया कौशल तो सीख लेता है लेकिन उस कौशल से संबंधित विशिष्ट सुरक्षा नियमों को अनदेखा कर देता है।

2. समाधान: "टैंगो" (DualSelect)

लेखक एक विधि प्रस्तावित करते हैं जिसे DualSelect कहा जाता है। वे एक टैंगो के रूपक का उपयोग करते हैं: दो साथी (नया कार्य और सुरक्षा संदर्भ) को एक साथ मिलकर चलना चाहिए, अलग-अलग नहीं।

एक स्थिर सुरक्षा नियमावली का उपयोग करने के बजाय, DualSelect प्रत्येक नए पाठ के लिए एक साथ दो चीजें करता है:

  • चरण A: सही सुरक्षा साथी खोजें (संदर्भ चयन - Reference Selection)
    नया कौशल सिखाने से पहले, सिस्टम उस विशिष्ट पाठ को देखता है और पूछता है: "इस पाठ के दौरान कौन से विशिष्ट सुरक्षा नियमों के टूटने की सबसे अधिक संभावना है?"

    • यदि पाठ कोडिंग के बारे में है, तो यह "डेटा चुराने वाला कोड न लिखें" जैसे सुरक्षा उदाहरण चुनता है।
    • यदि यह चिकित्सा सलाह के बारे में है, तो यह "खतरनाक खुराक निर्देश न दें" जैसे उदाहरण चुनता है।
    • यह उन सुरक्षा उदाहरणों को चुनता है जो नए कार्य के साथ सबसे अधिक "टकराव" (conflict) वाले हैं, प्रभावी रूप से विशिष्ट खतरे वाले क्षेत्रों को उजागर करता है।
  • चरण B: सही छात्रों को चुनें (कार्य चयन - Task Selection)
    एक बार जब इसे पता चल जाता है कि कौन से सुरक्षा नियम मायने रखते हैं, तो यह नए पाठ के डेटा को देखता है। यह उन उदाहरणों को फ़िल्टर करता है जो रोबोट को उन विशिष्ट सुरक्षा नियमों को तोड़ने के लिए प्रेरित करेंगे। यह केवल उन "सुरक्षित" उदाहरणों को रखता है जो चुने गए सुरक्षा नियमों के साथ अच्छी तरह फिट बैठते हैं।

  • चरण C: सुधार (द "स्टीयरिंग व्हील")
    अच्छे उदाहरण चुनने के बाद भी, रोबोट भटक सकता है। इसलिए, DualSelect एक "सुधार" चरण जोड़ता है। यह 'ग्रेडिएंट' (वह दिशा जिसमें रोबोट आगे बढ़ना चाहता है) को लेता है और इसे धीरे से उसी सुरक्षा दिशा की ओर मोड़ देता है जिसे इसने अभी पहचाना है। यह एक GPS की तरह है जो कहता है, "आप एक खाई की ओर बढ़ रहे हैं; आइए सुरक्षित सड़क पर रहने के लिए थोड़ा बाईं ओर मुड़ें।"

3. यह कैसे काम करता है ("मिन-मैक्स" डांस)

शोध पत्र गणितीय रूप से इसे एक "मिन-मैक्स" खेल के रूप में वर्णित करता है:

  • मैक्सिमाइज़र (सुरक्षा): उन सुरक्षा उदाहरणों को खोजने की कोशिश करता है जिन्हें इस विशिष्ट पाठ के दौरान सुरक्षित रखना सबसे कठिन है। (यह कमजोरियों को उजागर करता है)।
  • मिनिमाइज़र (कार्य): उन पाठ उदाहरणों को खोजने की कोशिश करता है जिन्हें उन विशिष्ट सुरक्षा नियमों को तोड़े बिना सीखना सबसे आसान है।
  • परिणाम: वे बीच में मिलते हैं। रोबोट केवल उस डेटा का उपयोग करके कार्य सीखता है जो उस कार्य के विशिष्ट सुरक्षा प्रतिबंधों का सम्मान करता है।

4. परिणाम

लेखकों ने गणित और सामान्य निर्देश डेटासेट का उपयोग करके विभिन्न आकार के रोबोटों (छोटे से बड़े तक) पर इसका परीक्षण किया।

  • सुरक्षा: रोबोट ने पिछले तरीकों की तुलना में अपने सुरक्षा शिष्टाचार को बहुत बेहतर तरीके से बनाए रखा। गणित सीखते समय वह सुरक्षित रहना नहीं भूला।
  • उपयोगिता (Utility): रोबोट "बेवकूफ" नहीं हुआ या हानिरहित सवालों के जवाब देने से मना नहीं किया (जिसे "ओवर-रिफ्यूज़ल" की समस्या कहा जाता है)। उसने नए कौशल भी अच्छी तरह से सीखे।
  • दक्षता (Efficiency): इसके लिए भारी मात्रा में अतिरिक्त कंप्यूटर शक्ति की आवश्यकता नहीं थी; यह मानक प्रशिक्षण की तुलना में केवल थोड़ा ही अधिक महंगा था।

सारांश उपमा

एक कुत्ते को प्रशिक्षित करने के बारे में सोचें।

  • पुराना तरीका: आप कुत्ते को हर बार नया करतब सिखाते समय एक सामान्य "अच्छे बनो" वाला इनाम देते हैं। यदि आप उसे "फेच" (चीज लाना) सिखाते हैं, तो वह गेंद को न काटने के नियम को भूल सकता है। यदि आप उसे "बैठना" सिखाते हैं, तो वह लोगों पर कूदना भूल सकता है।
  • DualSelect तरीका: "फेच" सिखाने से पहले, आप विशेष रूप से "न काटना" के नियम की समीक्षा करते हैं। आप ऐसी खेलने वाली गेंदें चुनते हैं जिन्हें सुरक्षित रूप से काटा जा सके। आप कुत्ते को चीज़ लाना सिखाते हैं जबकि लगातार उसे उस विशिष्ट गतिविधि के लिए प्रासंगिक "न काटने" के नियम की याद दिलाते रहते हैं। यदि वह काटना शुरू करता है, तो आप धीरे से उसके हाथ को दूर मोड़ देते हैं।

संक्षेप में: DualSelect सुरक्षा प्रशिक्षण को गतिशील और कार्य-विशिष्ट बनाता है, न कि स्थिर और सामान्य, जिससे यह सुनिश्चित होता है कि नई चीजें सीखते समय भी AI सुरक्षित रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →