← नवीनतम पेपर
🤖 machine learning

Constitutional On-Policy Safe Distillation

यह शोध पत्र कॉन्स्टिट्यूशनल ऑन-पॉलिसी सेफ डिस्टिलेशन (COPSD) को प्रस्तुत करता है, जो एक ऐसी विधि है जो क्रॉस-SFT के माध्यम से शिक्षक मॉडल को कैलिब्रेट करके और 12 बेंचमार्क में बेहतर सुरक्षा-उपयोगिता संतुलन प्राप्त करने के लिए संविधान-सशर्त ऑन-पॉलिसी डिस्टिलेशन का उपयोग करके पूर्ववर्ती सुरक्षा डिस्टिलेशन दृष्टिकोणों में देखे गए गंभीर पतन और कम अभिव्यक्ति की समस्या का समाधान करती है।

मूल लेखक: Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एआई को बिना उबाऊ बनाए सुरक्षित बनाना सिखाना

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट और बातूनी रोबोट ( "छात्र" या "Student") को मददगार लेकिन सुरक्षित होने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह दुनिया के बारे में सवालों के जवाब दे, लेकिन कभी भी कुछ खतरनाक या अपमानजनक न कहे।

शोधकर्ताओं ने पाया कि रोबोटों को सुरक्षा सिखाने का एक लोकप्रिय तरीका वास्तव में उन्हें बेवकूफी से सतर्क (stupidly cautious) बना रहा था। विचारशील और सूक्ष्म उत्तर देने के बजाय, रोबbot लगभग हर चीज़ के लिए छोटे, रोबोटिक, "मैं इसमें मदद नहीं कर सकता" जैसे जवाब देने लगे। वे सुरक्षित तो हो गए, लेकिन साथ ही वे बेकार भी हो गए।

यह शोध पत्र एक नई विधि पेश करता है जिसे COPSD कहा जाता है जो इस समस्या को ठीक करती है। यह रोबोट को सुरक्षित रहने के साथ-साथ अपनी पर्सनैलिटी, रचनात्मकता और समझाने की क्षमता बनाए रखने के लिए प्रशिक्षित करता है।


समस्या: "अत्यधिक-सतर्क शिक्षक" का जाल (The "Over-Cautious Teacher" Trap)

समस्या को समझने के लिए, एक क्लासरूम परिदृश्य की कल्पना करें:

  1. पुराना तरीका (OPSD): आपके पास एक "शिक्षक" (Teacher) रोबोट है जो सुरक्षा के नियमों (एक "संविधान") को जानता है। "छात्र" (Student) रोबोट शिक्षक की नकल करने की कोशिश करता है।
  2. गड़बड़ी (The Glitch): जब शिक्षक को सुरक्षित रहने के लिए कहा जाता है, तो वह डर जाता है। वह बहुत छोटे, उबाऊ जवाब देने लगता है जैसे, "यह खतरनाक है। ऐसा न करें।" वह यह समझाना बंद कर देता है कि क्यों या सुरक्षित विकल्प क्या हो सकते हैं।
  3. पतन (The Collapse): छात्र रोबोट शिक्षक को देखता है और सोचता, "ओह, सुरक्षित रहने के लिए, मुझे बस छोटा होना है और 'नहीं' कहना है।" छात्र इस व्यवहार की पूरी तरह से नकल करता है।
    • परिणाम: रोबोट एक "सुरक्षा कर" (safety tax) बन जाता है। वह गलती करने से इतना डर जाता है कि वह मददगार सवालों के जवाब देने से मना कर देता है, या ऐसे एक-वाक्य के जवाब देता है जो वास्तव में मददगार नहीं होते।

शोध पत्र की खोज:
शोधकर्ताओं ने महसूस किया कि यह इसलिए नहीं था क्योंकि रोबोट जवाबों की नकल करके "चीटिंग" (जैसे गणित के सवालों में) कर रहा था। इसके बजाय, यह एक ज्यामितीय समस्या (geometric problem) थी।

  • कल्पना कीजिए कि सुरक्षा और "अभिव्यक्ति" (बातूनी और मददगार होना) एक मानचित्र पर दो दिशाएँ हैं।
  • एक आदर्श दुनिया में, आप "पश्चिम" (मददगार होना) को बदले बिना "उत्तर" (सुरक्षा) की ओर बढ़ सकते हैं।
  • लेकिन इस रोबोट के मस्तिष्क में, मानचित्र झुका हुआ है। जब आप रोबोट को "सुरक्षा" की ओर ज़ोर से धकेलते हैं, तो वह झुकाव उसे "असहायता" की ओर पीछे धकेल देता है। सुरक्षा का दबाव अनजाने में उसकी अभिव्यक्ति की क्षमता को कुचल देता है।

समाधान: COPSD (दो-चरणीय सुधार)

लेखक इस झुके हुए मानचित्र को सुलझाने के लिए एक दो-चरणीय प्रशिक्षण प्रक्रिया का प्रस्ताव करते हैं।

चरण 1: "क्रॉस-SFT कोल्ड-स्टार्ट" (शिक्षक को कैलिब्रेट करना)

छात्र के सीखने शुरू करने से पहले, शिक्षक को पहले ठीक करने की आवश्यकता है।

  • उपमा: कल्पना कीजिए कि शिक्षक एक सख्त माता-पिता है जो केवल "नहीं" कहना जानता है। शोधकर्ता शिक्षक को एक विशेष प्रशिक्षण पाठ्यक्रम देते हैं। वे शिक्षक को यह दिखाने के लिए उदाहरण देते हैं कि "नहीं" शालीनता से कैसे कहा जाए—यह समझाते हुए कि कोई चीज़ क्यों बुरी है और एक सुरक्षित विकल्प पेश करते हुए, वह भी मित्रवत और विस्तृत लहजे के साथ।
  • परिणाम: शिक्षक सुरक्षित रहना सीख जाता है बिना एक छोटे, उबाऊ रोबोट बने। वह सीख जाता है कि सुरक्षा और मददगार होना एक साथ रह सकते हैं।

चरण 2: ऑन-पॉलिसी डिस्टिलेशन (छात्र इस ठीक किए गए शिक्षक से सीखता है)

अब, छात्र रोबोट इस नए कैलिब्रेटेड शिक्षक से सीखना शुरू करता है।

  • उपमा: छात्र देखता है कि शिक्षक उन सटीक, सुरक्षित, फिर भी विस्तृत उत्तर दे रहा है। क्योंकि शिक्षक अब केवल "नहीं" नहीं कह रहा है, छात्र सीखता है कि वह सुरक्षित और विस्तृत भी हो सकता है।
  • जादू: छात्र केवल शब्दों की नकल नहीं करता; वह सुरक्षित होने के पैटर्न को सीखता है, बिना अपनी आवाज़ खोए।

जब उन्होंने इसका परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने 12 अलग-अलग परीक्षणों पर अन्य लोकप्रिय विधियों के विरुद्ध इस नई विधि (COPSD) का परीक्षण किया।

  1. सुरक्षा बनाम मददगार होना (Safety vs. Helpfulness):

    • अन्य विधियाँ: जब उन्होंने रोबोटों को सुरक्षित बनाया, तो रोबोट बहुत कम मददगार हो गए ( "सुरक्षा कर" बढ़ गया)।
    • COPSD: रोबोट सुरक्षित भी हो गए और मददगार भी रहे। उन्होंने एक "पारेटो सुधार" (Pareto Improvement) हासिल किया, जिसका अर्थ है कि वे किसी भी चीज़ में खराब हुए बिना सुरक्षा में बेहतर हुए। वास्तव में, वे एक बहुत बड़े, अधिक महंगे रोबोट मॉडल की तुलना में अधिक सुरक्षित थे।
  2. सामान्य बुद्धिमत्ता (General Intelligence):

    • अन्य विधियाँ: जब रोबोटों को सुरक्षित बनाने की कोशिश की गई, तो गणित या तर्क पहेलियों को हल करने की उनकी क्षमता काफी कम हो गई।
    • COPSD: रोबोटों ने अपने गणित और तर्क कौशल को लगभग पूरी तरह से बरकरार रखा। उनके मस्तिष्क की शक्ति पर "सुरक्षा कर" लगभग शून्य था।
  3. सीमा को तोड़ना (Breaking the Ceiling):

    • आमतौर पर, एक छात्र शिक्षक से बेहतर नहीं हो सकता। लेकिन क्योंकि COPSD शिक्षक को इतनी अच्छी तरह से कैलिब्रेट किया गया था, छात्र वास्तव में सुरक्षा और मददगार होने के बीच संतुलन बनाने में शिक्षक से बेहतर होने के लिए सीख गया।

एक वाक्य में सारांश

यह शोध पत्र दिखाता है कि एआई सुरक्षा सिखाने की कोशिश अक्सर इसे उबाऊ और अनुपयोगी बना देती है क्योंकि प्रशिक्षण विधि सुरक्षा और मददगार होने को गलत दिशा में धकेलती है; उनकी नई विधि, COPSD, पहले शिक्षक को "सुरक्षित रूप से अभिव्यंजक" (safely expressive) बनाकर ठीक करती है, जिससे छात्र अपनी पर्सनैलिटी या बुद्धिमत्ता खोए बिना सुरक्षा सीख पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →