← नवीनतम पेपर
💬 NLP

Diversity-Enhanced Reasoning for Subjective Questions

यह शोध पत्र MultiRole-R1 को प्रस्तुत करता है, जो एक विविधता-वर्धित प्रशिक्षण ढांचा है जो सुदृढीकरण शिक्षण (reinforcement learning) सेटअप के भीतर अनसुपरवाइज्ड पर्सपेक्टिव सिंथेसिस और टोकन-स्तरीय विविधता का लाभ उठाकर बड़े रीजनिंग मॉडलों के व्यक्तिपरक कार्यों पर प्रदर्शन में उल्लेखनीय सुधार करता है और साथ ही उनकी वस्तुनिष्ठ तर्क क्षमताओं को भी बढ़ाता है।

मूल लेखक: Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (एक लार्ज रीजनिंग मॉडल) है जो गणित और कोडिंग में अविश्वसनीय रूप से कुशल है। यह समस्याओं को "सोचते हुए" (thinking out loud) एक लंबी विचार श्रृंखला के माध्यम से हल करता है, जैसे कोई जासूस हर सुराग को लिख रहा हो। यह गणित के लिए बहुत अच्छा काम करता है क्योंकि वहां केवल एक ही सही उत्तर होता है।

लेकिन क्या होता है जब आप रोबốt से एक व्यक्तिपरक (subjective) प्रश्न पूछते हैं, जैसे "शहर में रहना बेहतर है या गाँव में?" या "संसाधनों को वितरित करने का सबसे निष्पक्ष तरीका क्या है?"

यहाँ, कोई एक एकल "सही" उत्तर नहीं है। यह पूरी तरह से इस पर निर्भर करता है कि आप किसे पूछ रहे हैं। एक सिटी प्लानर, एक किसान, एक किशोर और एक सेवानिवृत्त व्यक्ति, सभी के अलग-अलग और समान रूप से वैध दृष्टिकोण होंगे।

यह शोध पत्र उस समस्या का समाधान करता है जहाँ वर्तमान AI प्रशिक्षण विधियाँ रोबोट को वह "एक सही उत्तर" खोजने के लिए मजबूर करती हैं (जैसे गणित में)। यह रोबोट को उबाऊ और दोहराव वाला बना देता है। यह विभिन्न दृष्टिकोणों को तलाशना बंद कर देता है और हर बार एक ही सुरक्षित, सामान्य उत्तर दे देता है। यह एक शेफ को खाना पकाने के लिए कहने जैसा है लेकिन उसे हर व्यंजन के लिए केवल नमक का उपयोग करने की अनुमति देना, चाहे व्यंजन कुछ भी हो।

समाधान: MultiRole-R1 (आवाजों की परिषद)

लेखक MultiRole-R1 नामक एक नई प्रशिक्षण विधि प्रस्तावित करते हैं। इसे एक अकेले जासूस को एक टाउन हॉल मीटिंग में बदलने के रूप में सोचें।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "आवाजों की परिषद" (दृष्टिकोण विविधता - Perspective Diversity)

रोबोट को अकेले सोचने देने के बजाय, शोधकर्ता उसे एक ही समय में तीन अलग-अलग लोगों की कल्पना करने के लिए कहते हैं।

  • उपमा: कल्पना कीजिए कि आप एक नया पार्क बनाने के निर्णय लेने की कोशिश कर रहे हैं।
    • भूमिका 1 (एक किशोर): "हमें स्केट रैम्प और वाई-फाई चाहिए!"
    • भूमिका 2 (एक दादाजी/दादी): "हमें शांत बेंच और सुरक्षित पैदल पथ चाहिए।"
    • भूमिका 3 (एक स्थानीय व्यवसायी): "हमें पार्किंग और लोगों की आवाजाही चाहिए।"
  • जादू: रोबोट को एक ऐसी रीजनिंग चेन (तर्क श्रृंखला) उत्पन्न करने के लिए प्रशिक्षित किया जाता है जहाँ वह स्पष्ट रूप से अलग-अलग भूमिकाएँ निभाता है, अंतिम निर्णय लेने से पहले इन विभिन्न दृष्टिकोणों से तर्क करता है। यह सुनिश्चित करता है कि उत्तर केवल "एक चीज़" नहीं है, बल्कि विभिन्न मानवीय दृष्टिकोणों का एक समृद्ध ताना-बाना है।

2. "एक्सप्लोरेशन रिवॉर्ड" (टोकन-स्तरीय विविधता - Token-Level Diversity)

मानक AI प्रशिक्षण में, यदि रोबोट को एक उत्तर मिल जाता है जो "सही" है, तो वह इसे कहने के अन्य तरीके खोजने की कोशिश करना बंद कर देता है। वह आलसी हो जाता है।

  • उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि उन्हें उत्तर "C" सही मिलता है, तो वे सोचना बंद कर देते हैं।
  • सुधार: शोधकर्ताओं ने एक विशेष "बोनस पॉइंट" प्रणाली जोड़ी है। यदि रोबोट की रीजनिंग चेन अलग-अलग शब्दों, अलग वाक्य संरचनाओं का उपयोग करती है, या अद्वितीय कोणों की खोज करती है (भले ही अंतिम उत्तर समान हो), तो उसे अतिरिक्त अंक मिलते हैं।
  • परिणाम: रोबोट सीखता है कि विविधता अच्छी है। यह एक ही वाक्यांशों को दोहराना बंद कर देता है और विचारों के एक व्यापक "सर्च स्पेस" को तलाशना शुरू कर देता है, ठीक वैसे ही जैसे एक मानव मंथन (brainstorming) सत्र में होता है।

यह क्यों महत्वपूर्ण है (अहा! मोमेंट्स)

शोध पत्र में तीन आश्चर्यजनक बातें सामने आईं:

  1. विविधता ही असली सफलता है, लंबाई नहीं:

    • पुरानी धारणा: "यदि AI लंबे समय तक सोचता है (अधिक शब्द लिखता है), तो वह अधिक स्मार्ट है।"
    • नई खोज: जरूरी नहीं! पेपर ने पाया कि विविधता (AI कितने अलग-अलग कोणों को देखता है) केवल लंबाई (वह कितने शब्द लिखता है) की तुलना में एक अच्छे उत्तर का बहुत बेहतर संकेतक है। एक छोटा, विविध उत्तर अक्सर एक लंबे, दोहराव वाले उत्तर से बेहतर होता है।
    • रूपक: एक व्यक्ति द्वारा 10 घंटे तक एक ही चीज़ को देखने के बजाय, 3 अलग-अलग कोणों से समस्या को देखते हुए 3 लोगों की टीम होना बेहतर है।
  2. यह गणित पर भी काम करता है ("ट्रांसफर" प्रभाव):

    • भले ही उन्होंने रोबोट को केवल व्यक्तिपरक प्रश्नों (विचार, नैतिकता, संस्कृति) पर प्रशिक्षित किया था, रोबोट गणित में भी बेहतर हो गया (जैसे AIME 2024 प्रतियोगिता)।
    • क्यों? क्योंकि रोबोट ने अधिक संभावनाओं को तलाशना सीख लिया। गणित में, इसका अर्थ है कि वह केवल पहले समाधान पर नहीं कूदा; उसने कई रास्तों की जाँच की, जिससे गलतियाँ कम हुईं। उसने केवल क्या सोचना है नहीं, बल्कि कैसे सोचना है सीखा।
  3. अनसुपरवाइज्ड लर्निंग (शोर से सीखना):

    • उन्हें हर एक उत्तर को ग्रेड करने के लिए किसी इंसान की आवश्यकता नहीं थी। उन्होंने एक "सेल्फ-कंसिस्टेंसी" (स्व-संगति) फ़िल्टर का उपयोग किया।
    • उपमा: कल्पना कीजिए कि आप रोबोट को एक समस्या को 10 बार हल करने के लिए कहते हैं। यदि वह 8 बार "C" कहता है और 2 बार "A" कहता है, तो वे मानते हैं कि "C" सबसे विश्वसनीय उत्तर है। उन्होंने बिना किसी सटीक मानव लेबल की आवश्यकता के अपने प्रशिक्षण डेटा को बनाने के लिए इस स्व-जाँच तंत्र का उपयोग किया।

निचोड़ (The Bottom Line)

MultiRole-R1 एक AI को कैलकुलेटर के बजाय एक डिप्लोमैट (राजनयिक) बनने की शिक्षा देने जैसा है। उसे अलग-अलग "टोपियाँ" (भूमिकाएं) पहनने और रचनात्मक होने (विविधता) के लिए पुरस्कृत करके, AI जटिल मानवीय प्रश्नों को संभालने में बेहतर हो जाता है।

और सबसे अच्छी बात? एक अच्छा राजनयिक बनने के दौरान, उसने अनजाने में एक बेहतर गणितज्ञ भी बनने की क्षमता हासिल कर ली। यह साबित करता है कि कई तरीकों से सोचना एक सुपरपावर है जो लगभग हर चीज़ पर लागू होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →