← नवीनतम पेपर
🤖 machine learning

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

DOG-DPO एक प्रशिक्षण-मुक्त डेटा चयन ढांचा है जो प्राथमिकता युग्मों (preference pairs) को ज्यामितीय संकेतों के रूप में मानता है ताकि मल्टी-डेटासेट संरेखण दिशाओं को वैश्विक और अवशिष्ट उप-स्थानों (global and residual subspaces) में विघटित किया जा सके, जिससे बड़े भाषा मॉडल केवल 11% प्राथमिकता डेटा के साथ बेहतर उपयोगिता-मजबूती संतुलन बनाए रखते हुए मजबूत सुरक्षा संरेखण प्राप्त करने में सक्षम होते हैं।

मूल लेखक: Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शरारती रोबोट को सुरक्षित और सहायक बनना सिखाने की कोशिश कर रहे हैं। आपके पास लाखों "प्रशिक्षण उदाहरणों" (training examples) का एक विशाल पुस्तकालय है। प्रत्येक उदाहरण कहानियों के एक जोड़े से बना है: एक कहानी दिखाती है कि रोबोट सही काम कर रहा है ( "अच्छा" रिस्पॉन्स), और दूसरी कहानी दिखाती है कि वह गलत काम कर रहा है ( "बुरा" रिस्पॉन्स)।

समस्या यह है कि पुस्तकालय बहुत बड़ा है, इसमें बहुत सारी डुप्लिकेट चीजें हैं, और इसे पढ़ने में बहुत समय लगता है और बहुत पैसा खर्च होता है। इसके अलावा, कुछ उदाहरण ऐसे हैं जो "शोर" (noise) मात्र हैं—वे कुछ भी नया नहीं सिखाते।

पुराना तरीका: "स्कोरकार्ड" दृष्टिकोण (The "Scorecard" Approach)
पहले, शोधकर्ता प्रत्येक उदाहरण को एक स्कोर देने की कोशिश करते थे, जैसे रिपोर्ट कार्ड पर ग्रेड दिया जाता है। वे कहते थे, "यह उदाहरण 9/10 है, वह 5/10 है।" और फिर वे शीर्ष 100 चुन लेते थे।

लेकिन इसमें एक दोष है। यह हर उदाहरण को एक अलग बिंदु के रूप में मानता है। यह इस बात को नहीं समझ पाता कि यदि आप 50 उदाहरण चुनते हैं जो सभी "चोरी न करने" के बारे में हैं, तो आपने अपना समय बर्बाद किया है। आपने "चोरी" की दिशा को पांच बार कवर किया है, लेकिन आपने "झूठ न बोलने" या "बदतमीजी न करने" की दिशाओं को बिल्कुल नहीं छुआ है। यह सेबों के ढेर के बजाय एक संतुलित फ्रूट सलाद खरीदने जैसा है; आप सेबों से बहुत ज्यादा भर जाते हैं और केले की कमी रह जाती है।

नया तरीका: DOG-DPO (द "कम्पास" दृष्टिकोण)
यह पेपर DOG-DPO नामक एक नई विधि पेश करता है। उदाहरणों को केवल एक स्कोर देने के बजाय, यह उन्हें विचारों के एक विशाल, अदृश्य मानचित्र में विशिष्ट दिशाओं में इशारा करने वाले तीरों (arrows) के रूप में देखता है।

यह इस प्रकार काम करता है:

1. दिशाओं का मानचित्र (The Map of Directions)

कल्पना कीजिए कि रोबोट का मस्तिष्क हजारों दीवारों वाला एक विशाल कमरा है। हर बार जब वह सीखता है कि "चोरी न करें," तो वह "चोरी" की दिशा में एक दीवार को धकेलता है। हर बार जब वह सीखता है कि "झूठ न बोलें," तो वह "झूठ बोलने" की दिशा में एक दीवार को धकेलता है।

  • पुराना तरीका: यह बिना दिशा देखे केवल यह गिनता है कि कितनी जोर से धक्का दिया गया।
  • DOG-DPO: यह धक्के के कोण (angle) को देखता है। यह ऐसे धक्कों का एक सेट चाहता है जो पूरे कमरे को समान रूप से कवर करे, बिना एक ही दीवार को दो बार धकेले।

2. एंकर और रेसिडुअल्स (The Anchor and the Residuals - "मेन स्ट्रीट" और "साइड एलीज़")

शोधकर्ताओं ने देखा कि विभिन्न प्रशिक्षण डेटासेट्स के मिश्रण में, कुछ दिशाएं बहुत सामान्य होती हैं (जैसे "लोगों को चोट न पहुँचाना")। ये एंकर (Anchor) दिशाएं हैं। अन्य दिशाएं केवल एक विशिष्ट डेटासेट के लिए विशेष होती हैं (जैसे "बदतमीजी करने के लिए विशिष्ट स्लैंग का उपयोग न करना")। ये रेसिड्यूअल (Residual) दिशाएं हैं।

DOG-DPO एक मानचित्र बनाता है जिसमें दो परतें होती हैं:

  • एंकर लेयर (The Anchor Layer): सबसे बड़े, सबसे विश्वसनीय डेटासेट से निर्मित एक ठोस आधार। यह सुरक्षा के "मेन स्ट्रीट" (मुख्य मार्ग) को कवर करता है (वे बड़े, स्पष्ट नियम जिन पर सभी सहमत हैं)।
  • रेसिड्यूअल लेयर (The Residual Layer): विशेष साइड पाथ जो उन अनूठे, अजीब या विशिष्ट नियमों को पकड़ते हैं जो केवल छोटे डेटासेट्स में पाए जाते हैं।

3. चयन प्रक्रिया (The Selection Process - "टेंट पोल" रणनीति)

"सर्वश्रेष्ठ" 100 उदाहरण चुनने के बजाय, DOG-DPO उन उदाहरणों का एक समूह चुनता है जो टेंट पोल (तंबू के खंभों) की तरह काम करते हैं।

  • यदि आप दो पोल चुनते हैं जो एक-दूसरे के ठीक बगल में हैं, तो टेंट ढह जाएगा (Redundancy/दोहराव)।
  • यदि आप पोल को एक घेरे में फैला हुआ चुनते हैं, तो टेंट ऊंचा खड़ा रहता है और एक विशाल क्षेत्र को कवर करता है (Diversity/विविधता)।

एल्गोरिदम गणितीय रूप से गणना करता है कि "तीरों" (उदाहरणों) का कौन सा संयोजन सबसे बड़ा, सबसे स्थिर "टेंट" (सुरक्षा नियमों का कवरेज) बनाता है, और इसके लिए न्यूनतम संख्या में पोल का उपयोग करता है।

परिणाम: कम ही अधिक है (Less is More)

इस पेपर ने कई अलग-अलग रोबोट दिमागों (मॉडल्स) पर इसका परीक्षण किया।

  • दक्षता (Efficiency): वे मूल डेटा के केवल 11% का उपयोग करके रोबोट को प्रशिक्षित करने में सफल रहे। यह एक पूरी भाषा को डिक्शनरी के पूरे पन्ने पढ़ने के बजाय केवल एक अध्याय पढ़कर सीखने जैसा है।
  • गति (Speed): क्योंकि उन्हें महंगे अतिरिक्त परीक्षण चलाने या उदाहरणों को ग्रेड देने के लिए किसी "टीचर" रोबोट की आवश्यकता नहीं थी, इसलिए यह प्रक्रिया अन्य तरीकों की तुलना में 15 से 35 गुना तेज़ थी।
  • सुरक्षा (Safety): इस छोटे, सावधानीपूर्वक चुने गए उदाहरणों के साथ प्रशिक्षित रोबोट उतने ही सुरक्षित (या उससे भी अधिक सुरक्षित) थे जितने कि विशाल, दोहराव वाले पूर्ण डेटासेट पर प्रशिक्षित रोबोट। वे "जेलब्रेक्स" (उन्हें बुरी बातें कहने के लिए बहकाने वाली ट्रिक्स) का विरोध करने में बेहतर थे और उन्होंने अपनी मददगार होने की क्षमता को भी नहीं खोया।

सारांश

DOG-DPO एक मास्टर शेफ की तरह है जिसे एहसास होता है कि एक शानदार भोजन बनाने के लिए उसे 10,000 सामग्रियों से भरा पेंट्री की आवश्यकता नहीं है। इसके बजाय, वह सावधानीपूर्वक सामग्रियों का एक छोटा बास्केट चुनता है जो एक-दूसरे से बिल्कुल अलग हों (कोई डुप्लिकेट नहीं), यह सुनिश्चित करते हुए कि हर स्वाद (सुरक्षा दिशा) का प्रतिनिधित्व हो। यह खाना पकाने की प्रक्रिया (प्रशिक्षण) को तेज़, सस्ता और अंतिम व्यंजन (सुरक्षित AI) को उतना ही स्वादिष्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →