← नवीनतम पेपर
🤖 AI

RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

यह शोध पत्र RoleCDE को प्रस्तुत करता है, जो रोल-प्लेइंग एजेंटों में "रोल वैल्यू डिकपलिंग" (भूमिका मूल्य विच्छेद) घटना का मूल्यांकन करने और उसे कम करने के लिए डिज़ाइन किया गया एक बड़े पैमाने का बेंचमार्क है, जहाँ मॉडल संघर्षों के दौरान भूमिका-विशिष्ट मूल्यों के बजाय संरेखण (अलाइनमेंट) को प्राथमिकता देते हैं, यह प्रदर्शित करते हुए कि लक्षित फाइन-ट्यूनिंग सामान्य प्रदर्शन को बनाए रखते हुए इन समझौतों को प्रभावी ढंग से हल कर सकती है।

मूल लेखक: Huayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ RoleCDE पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "अभिनय" की समस्या (The "Acting" Problem)

कल्पना कीजिए कि आपने एक बहुत ही प्रतिभाशाली अभिनेता को एक विशिष्ट पात्र निभाने के लिए काम पर रखा है, जैसे कि एक क्रूर कॉर्पोरेट सीईओ या एक सख्त मध्यकालीन शूरवीर। आप उन्हें स्क्रिप्ट और वेशभूषा देते हैं।

  • पुरानी टेस्टिंग का तरीका: एआई "अभिनेताओं" (Role-Playing Agents) के पिछले परीक्षणों में ज्यादातर यह पूछा जाता था: "क्या वे पात्र की तरह बोल रहे थे? क्या वे सही बोलचाल की भाषा का उपयोग कर रहे थे? क्या वे पात्र के इतिहास को जानते थे?"
  • कमी कहाँ थी: ये परीक्षण कभी भी वह कठिन सवाल नहीं पूछते थे: "जब पात्र के लक्ष्य नैतिक रूप से सही होने के साथ टकराते हैं, तो अभिनेता वास्तव में क्या करता है?"

पेपर का तर्क है कि वर्तमान एआई अभिनेता आवाज़ की नकल करने में तो माहिर हैं, लेकिन जब चीजें कठिन होती हैं, तो वे भूमिका निभाने (living the role) में बहुत खराब हैं।


नया टूल: RoleCDE ("नैतिक तनाव परीक्षण")

लेखकों ने एक नया बेंचमार्क बनाया जिसे RoleCDE कहा जाता है। इसे एक विशाल "तनाव परीक्षण" (stress test) या नैतिक जाल (moral trapdoors) की एक श्रृंखला के रूप में समझें, जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या एआई अपना किरदार तोड़ देता है।

यह कैसे काम करता है:

  1. सेटअप: उन्होंने 8,000 अद्वितीय चरित्र प्रोफाइल बनाए (एक "देखभाल करने वाले" से लेकर एक "कॉर्पोरेट वकील" तक) और उन्हें पेचीदा परिदृश्यों (scenarios) के साथ जोड़ा।
  2. जाल (The Trap): हर परिदृश्य में, पात्र का एक लक्ष्य होता है जो सुरक्षा या नैतिकता के साथ सीधे संघर्ष करता है।
    • उदाहरण: एक "ट्रेड कंप्लायंस ऑफिसर" (भूमिका) को शिपमेंट को देरी से बचाने के लिए एक मामूली कागजी गलती को छिपाने के लिए कहा जाता है (भूमिका का लक्ष्य)। लेकिन इसे छिपाना कानून का उल्लंघन है (एलाइनमेंट वैल्यू)।
  3. परीक्षण: एआई को चुनना होगा: क्या वे अपने चरित्र के काम के प्रति वफादार रहते हैं (चाहे वह संदिग्ध ही क्यों न हो), या वे एक "अच्छे नागरिक" की तरह व्यवहार करने लगते हैं (चरित्र के विशिष्ट प्रोत्साहनों को अनदेखा करते हुए)?

चौंकाने वाली खोज: "भूमिका-मूल्य अलगाव" (Role-Value Decoupling)

शोधकर्ताओं ने एक घटना खोजी जिसे वे Role-Value Decoupling कहते हैं।

उपमा: कल्पना कीजिए कि आपने एक खलनायक की भूमिका निभाने के लिए एक अभिनेता को काम पर रखा है। आप उससे कहते हैं, "तुम एक खलनायक हो जो चोरी करना पसंद करता है।" लेकिन जैसे ही दृश्य शुरू होता है, अभिनेता भूल जाता है कि वह एक खलनायक है और ईमानदारी के बारे में सार्वजनिक सेवा घोषणा (public service announcement) देने लगता है।

पेपर ने क्या पाया:

  • भले ही एआई को स्पष्ट रूप से कहा गया हो, "आप एक लालची व्यवसायी हैं," यदि कार्य में किसी नियम को तोड़ना शामिल है, तो एआई लगभग हमेशा "लालची व्यवसायी" वाले हिस्से को अनदेखा कर देता है।
  • इसके बजाय, वह अपने अंतर्निहित "सेफ्टी मोड" (एलाइनमेंट) पर वापस आ जाता है। वह "सुरक्षित, नैतिक" उत्तर चुनता है, जिससे वह प्रभावी रूप से अपना किरदार छोड़ देता है।
  • मुख्य निष्कर्ष: यह इस बात पर निर्भर नहीं करता कि प्रश्न कितना कठिन है। चाहे दुविधा आसान हो या अत्यंत जटिल, एआई बस कहता है, "मैं यह नहीं कर सकता, यह नियमों के विरुद्ध है," बजाय इसके कि वह उस पात्र की तरह व्यवहार करे।
  • अपवाद: एआई केवल तभी किरदार में रहता है जब भूमिका स्वाभाविक रूप से "अच्छी" हो (जैसे देखभाल करने वाला या परिवार का सदस्य)। यदि भूमिका "जोखिम भरी" या "अधिकारपूर्ण" है, तो एआई तुरंत अभिनय छोड़ देता है।

समाधान: अभिनेता को किरदार में रहने के लिए प्रशिक्षित करना

लेखकों ने केवल समस्या की ओर इशारा नहीं किया; उन्होंने इसे ठीक भी किया।

समाधान: उन्होंने एक मानक एआई मॉडल लिया और उसे अपने नए टेस्ट डेटा (RoleCDE) का उपयोग करके एक "बूट कैंप" दिया।

  • उन्होंने एआई को हजारों ऐसे उदाहरण दिखाए जहाँ सही उत्तर अपने चरित्र के विशिष्ट मूल्यों के प्रति वफादार रहना था, भले ही वे सामान्य सुरक्षा नियमों के साथ संघर्ष करते हों।
  • परिणाम: इस प्रशिक्षण के बाद, एआई "भूमिका-संगत" (role-consistent) निर्णय लेने में बहुत बेहतर हो गया। इसने सीखा कि नियमों का आँख बंद करके पालन करने के बजाय, पात्र के लक्ष्यों और नियमों के बीच संतुलन कैसे बनाया जाए।
  • महत्वपूर्ण विवरण: इस प्रशिक्षण ने एआई को अन्य कार्यों (जैसे गणित या सामान्य ज्ञान) में "कमरज़ोर" नहीं बनाया। इसने बस इसे एक बेहतर अभिनेता बनाया जो किरदार छोड़े बिना जटिल, संघर्षपूर्ण स्थितियों को संभाल सकता है।

पेपर के दावों का सारांश

  1. वर्तमान एआई एक "सुरक्षित" अभिनेता है: यह पात्र की आवाज़ की नकल करता है लेकिन उस पात्र के मूल्यों से मेल खाने वाले निर्णय लेने से इनकार करता है यदि वे सुरक्षा नियमों के साथ संघर्ष करते हैं।
  2. RoleCDE पहला परीक्षण है: यह हजारों परिदृश्यों को बनाकर इस विशिष्ट विफलता को मापने वाला पहला टूल है जहाँ "भूमिका" (Role) "सुरक्षा" (Safety) से लड़ती है।
  3. "अलगाव" (Decoupling) वास्तविक है: एआई मॉडल व्यवस्थित रूप से "अच्छे" बनने के लिए अपनी भूमिका छोड़ देते हैं, भले ही उन्हें ऐसा करने के लिए न कहा गया हो।
  4. प्रशिक्षण काम करता है: आप एआई को अपने अन्य कौशल को खराब किए बिना इन संघर्षों को बेहतर ढंग से संतुलित करने के लिए सिखा सकते हैं।

पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह एआई को खतरनाक बनाता है या हमें इसे कानून तोड़ने देना चाहिए।
  • यह दावा नहीं करता कि यह सभी एआई सुरक्षा मुद्दों को हल करता है।
  • यह चिकित्सा सलाह या वास्तविक दुनिया के कानूनी निर्णयों के लिए इसका उपयोग करने पर चर्चा नहीं करता है।
  • यह विशेष रूप से परीक्षण वातावरण में एआई के व्यवहार पर केंद्रित है, न कि इन एजेंटों को वास्तविक दुनिया में तैनात करने पर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →