← नवीनतम पेपर
💻 computer science

Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI

यह शोध पत्र ऑप्टिमस (Optimus) को प्रस्तुत करता है, जो एक सुदृढ़ रक्षा ढांचा है जो प्रशिक्षण-मुक्त विषाक्तता वर्गीकरण और एक दोहरी-रणनीति संरेखण प्रक्रिया का लाभ उठाकर फाइन-ट्यून किए गए संवादात्मक एआई में विषाक्तता को कम करता है, जो प्रभावी रूप से उपयोगिता को संरक्षित करता है और पक्षपाती क्लासिफायर और प्रतिकूल हमलों की स्थितियों में भी अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Aravind Cheruvu, Shravya Kanchi, Sifat Muhammad Abdullah, Nicholas Kong, Daphne Yao, Murtuza Jadliwala, Bimal Viswanath

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aravind Cheruvu, Shravya Kanchi, Sifat Muhammad Abdullah, Nicholas Kong, Daphne Yao, Murtuza Jadliwala, Bimal Viswanath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यक्तिगत रोबोट सहायक (एक चैटबॉट) बनाना चाहते हैं जो आपके दैनिक कार्यों में आपकी मदद कर सके। आपके पास एक शानदार, सुशिक्षित मस्तिष्क (एक लार्ज लैंग्वेज मॉडल या LLM) है जो दुनिया के बारे में बहुत कुछ जानता है। हालाँकि, इस रोबोट को आपकी विशिष्ट आवश्यकताओं के लिए उपयोगी बनाने के लिए, आपको इसे बातचीत की एक नोटबुक (एक डेटासेट) का उपयोग करके सिखाने की आवश्यकता है।

समस्या: ज़हरीली नोटबुक (The Poisoned Notebook)
दिक्कत यह है कि आप हमेशा उस नोटबुक पर भरोसा नहीं कर सकते जहाँ से आपको वह मिली है। कल्पना कीजिए कि आप किसी अजनबी से एक पुरानी नोटबुक खरीदते हैं, या किसी अराजक इंटरनेट फोरम से बातचीत को स्क्रैप करते हैं। इस नोटबुक में छिपा हुआ "ज़हर" (poison) हो सकता है, जैसे कि विषाक्त (toxic), घृणास्पद या द्वेषपूर्ण बातचीत।

यदि आप अपने रोबोट को इस ज़हरीली नोटबुक से सिखाते हैं, तो रोबोट भी बुरा सीख जाता है। वह लोगों का अपमान करना या खतरनाक बातें कहना शुरू कर सकता है। इसे डेटा पॉइजनिंग (Data Poisoning) कहा जाता है।

पुराना तरीका: अति-उत्साही बाउंसर (The Over-zealous Bouncer)
पहले, लोग इसे ठीक करने के लिए एक "बाउंसर" (एक टॉक्सिसिटी फ़िल्टर) को नियुक्त करने की कोशिश करते थे जो रोबोट के सीखने से पहले नोटबुक के हर वाक्य की जाँच करता था।

  • दोष: बाउंसर परफेक्ट नहीं होता है। कभी-कभी वे बुरी चीज़ों को मिस कर देते हैं (ज़हर को अंदर आने देते हैं), और कभी-कभी वे बहुत डर जाते हैं और अच्छी, निर्दोष वाक्यों को बाहर फेंक देते हैं (जिससे रोबोट उबाऊ या बेकार हो जाता है)। यदि बुरे लोग अपनी भाषा (नए स्लैंग या कोड) बदल देते हैं, तो बाउंसर भ्रमित हो जाता है और पूरी तरह विफल हो जाता है।

नया समाधान: ऑप्टिमस (Optimus)
लेखकों ने एक नया रक्षा तंत्र बनाया है जिसे ऑप्टिमस (Optimus) कहा जाता है। ऑप्टिमस को एक बाउंसर के रूप में नहीं, बल्कि एक बुद्धिमान, उपचार करने वाले मेंटर (Wise, Healing Mentor) के रूप में सोचें, जो नोटबुक को ठीक करता है और रोबोट को बेहतर व्यवहार करने का एक बेहतर तरीका सिखाता है, भले ही बाउंसर गलतियाँ करे।

ऑप्टिमस कैसे काम करता है, इसके चरणों को सरल उपमाओं का उपयोग करके यहाँ समझाया गया है:

1. "अस्वीकार करने वाला" जासूस (टॉक्सिसिटी क्लासिफिकेशन)

एक मानक बाउंसर को काम पर रखने के बजाय, ऑप्टिमस एक बहुत ही स्मार्ट, सुरक्षा-प्रशिक्षित AI (जैसे एक अनुभवी शिक्षक) का उपयोग करता है जो नोटबुक को देखता है।

  • यह कैसे काम करता है: यह शिक्षक बुरे विचारों को "ना!" कहने के लिए प्रशिक्षित है। जब यह एक विषाक्त वाक्य देखता है, तो यह स्वाभाविक रूप से उसे बोलने से इनकार करने की इच्छा रखता है। ऑप्टिमस इस प्राकृतिक "इनकार" (refusal) की प्रवृत्ति का उपयोग बुरे वाक्यों को चिह्नित करने के लिए करता है।
  • जादू: भले ही यह शिक्षक थोड़ा पक्षपाती हो या कुछ बुरे शब्दों को मिस कर दे, ऑप्टिमस घबराता नहीं है। यह जानता है कि शिक्षक परफेक्ट नहीं है और इसके पास एक बैकअप प्लान है।

2. "उपचार" कार्यशाला (सिंथेटिक डेटा)

एक बार जब शिक्षक एक विषाक्त वाक्य को चिह्नित कर देता है, तो ऑप्टिमस उसे केवल फेंक नहीं देता (जिससे नोटबुक में खाली जगह रह जाएगी)। इसके बजाय, यह सर्जरी करता है।

  • प्रक्रिया: यह बातचीत के विषाक्त हिस्से को लेता है और उसे एक "उपचार प्रतिक्रिया" (Healing Response) के साथ बदल देता है।
  • दो शैलियों में उपचार:
    • "कैंड" (Canned) प्रतिक्रिया: एक विनम्र, सामान्य "मैं इस बारे में बात नहीं कर सकता।" की तरह (सुरक्षित, लेकिन थोड़ा रोबोटिक)।
    • "संदर्भिक" (Contextual) प्रतिक्रिया: यह सुपरपावर है। AI एक नया जवाब लिखता है जो बातचीत में बिल्कुल फिट बैठता है लेकिन दयालु, सहानुभूतिपूर्ण और सहायक होता है।
    • उपमा: कल्पना कीजिए कि एक छात्र डायरी में एक बुरा कमेंट लिखता है। पन्ना फाड़ने के बजाय, एक बुद्धिमान संपादक उस कमेंट को रचनात्मक और दयालु तरीके से फिर से लिख देता है, जिससे कहानी का प्रवाह बना रहता है।

3. "स्वाद परीक्षण" (DPO एलाइनमेंट)

इस सर्जरी के बाद भी, रोबोट में पहले देखी गई पुरानी विषाक्त वाक्यांशों को दोहराने की बुरी आदत हो सकती है। ऑप्टिमस डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) नामक तकनीक का उपयोग करता है।

  • कैसे काम करता है: कल्पना कीजिए कि आप एक कुत्ते को प्रशिक्षित कर रहे हैं। आप केवल तब उसे दंडित नहीं करते जब वह काटता है; बल्कि आप उसे दो ट्रीट दिखाते हैं: एक "बुरा ट्रीट" (विषाक्त प्रतिक्रिया) और एक "अच्छा ट्रीट" (उपचार प्रतिक्रिया)। आप कुत्ते को बताते हैं, "मुझे अच्छा ट्रीट पसंद है।"
  • परिणाम: रोबोट बुरा व्यवहार करने के बजाय दयालु प्रतिक्रिया को चुनना सीख जाता है, भले ही वह बुरे व्यवहार को दोबारा देखे। यह शक्तिशाली है क्योंकि यह रोबोट को केवल प्रतिबंधित शब्दों की सूची रटाता नहीं है, बल्कि अच्छे होने की अवधारणा सिखाता है।

ऑप्टिमस क्यों एक गेम-चेंजर है?

पेपर यह सिद्ध करता है कि ऑप्टिमस अविश्वसनीय रूप से मजबूत है, भले ही चीजें गलत हो जाएं:

  • यह एक टूटे हुए बाउंसर के साथ भी काम करता है: भले ही टॉक्सिसिटी डिटेक्टर बहुत खराब हो (85% बुरे कंटेंट को मिस कर दे), ऑप्टिमस फिर भी रोबोट को साफ कर देता है। यह एक सुरक्षा जाल की तरह है जो आपको पकड़ लेता है भले ही ट्रैपेज़ कलाकार (trapeze artist) चूक जाए।
  • यह प्रतियोगिता को पछाड़ता है: यह वर्तमान सर्वश्रेष्ठ रक्षा (StarDSS) से बेहतर प्रदर्शन करता है, जो पूर्ण फिल्टरों पर बहुत अधिक निर्भर करती है।
  • यह हैकर्स का मुकाबला करता है: लेखकों ने ऑप्टिमस को "जेलब्रेक" हमलों (AI को बुरी चीजें कहने के लिए मजबूर करने की कोशिश) और "एडवर्सरियल" हमलों (चालाकी से जहर छिपाने की कोशिश) के साथ डराने की कोशिश की। ऑप्टिमस ने अपना रुख बनाए रखा और रोबोट को सुरक्षित रखा।

निचोड़ (The Bottom Line)

ऑप्टिमस एक मजबूत ढांचा है जो हमें अव्यवस्थित, अविश्वसनीय डेटा का उपयोग करके AI चैटबॉट्स को सुरक्षित रूप से कस्टमाइज़ करने की अनुमति देता है। यह केवल बुरे को फ़िल्टर करने की कोशिश नहीं करता; यह सक्रिय रूप से बुरे डेटा को हील (heal) करता है और AI को विषाक्तता के ऊपर दयालुता को प्राथमिकता देने के लिए पुनः प्रशिक्षित (re-train) करता है। यह सुनिश्चित करता है कि भले ही हम एक त्रुटिपूर्ण सुरक्षा प्रणाली का उपयोग करें, हमारे AI सहायक सहायक, हानिरहित और ईमानदार बने रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →