← नवीनतम पेपर
💻 computer science

Preference Optimization Drives Monoculture in LLM Prediction Markets

यह शोध पत्र प्रदर्शित करता है कि डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO), प्रेडिक्शन मार्केट्स में LLM एजेंटों में अत्यधिक सह-संबंधित त्रुटियों (correlated errors) को विकसित करता है, जिससे एक "मोनोकल्चर" (monoculture) बन जाता है जो स्वतंत्र पूर्वानुमानकर्ताओं की प्रभावी संख्या को नाटकीय रूप से कम कर देता है और बाजार की सामूहिक सटीकता को कमजोर करता है।

मूल लेखक: James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक प्रेडिक्शन मार्केट (भविष्यवाणी बाजार) "उत्तर का अनुमान लगाने" के एक विशाल, उच्च-दांव वाले खेल की तरह है। एक स्वस्थ खेल में, आप ऐसे लोगों की भीड़ चाहते हैं जो सभी अलग-अलग तरह से सोचते हों। यदि एक व्यक्ति गलत अनुमान लगाता है क्योंकि वह कोई तथ्य भूल गया, और दूसरा गलत अनुमान लगाता है क्योंकि उसने प्रश्न को गलत पढ़ लिया, तो उनकी गलतियाँ एक-दूसरे को काट देती हैं। भीड़ का औसत अनुमान अविश्वसनीय रूप से सटीक हो जाता है। यह इसलिए काम करता है क्योंकि सबकी गलतियाँ स्वतंत्र (independent) होती हैं—जैसे पक्षियों का एक झुंड जहाँ प्रत्येक पक्षी अपना स्वयं का रास्ता चुनता है।

यह शोध पत्र पूछता है: क्या होगा यदि पूरी भीड़ रोबोट्स से बनी हो (AI एजेंट) जिन्हें बिल्कुल एक ही ब्लूप्रिंट से बनाया गया है और एक ही शिक्षक द्वारा सिखाया गया है?

उत्तर आश्चर्यजनक है: सभी रोबोट बिल्कुल एक ही समय में ठीक एक जैसी गलतियाँ करते हैं।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के निष्कर्षों का विवरण दिया गया है:

1. "क्लोन आर्मी" की समस्या

शोधकर्ताओं ने 10 AI एजेंटों के साथ एक बाजार का परीक्षण किया। उन्हें उम्मीद थी कि बाजार किसी भी एकल एजेंट की तुलना में अधिक स्मार्ट होगा क्योंकि एक से बेहतर दस सिर होते हैं।

  • वास्तविकता: 10-AI वाला बाजार अकेले काम करने वाले एक एकल AI की तुलना में खराब प्रदर्शन करता है।
  • उपमा: कल्पना कीजिए कि आपके पास 10 एक जैसे जुड़वां भाई हैं जो एक ही स्कूल गए, एक ही किताबें पढ़ीं और एक ही सख्त शिक्षक से पढ़े। यदि आप उनसे गणित का एक सवाल पूछते हैं, और वे सभी उसमें गलत होते हैं, तो ऐसा इसलिए नहीं है कि वे गणित में खराब हैं; बल्कि इसलिए है क्योंकि उन सभी को एक ही गलत तरीके से सिखाया गया था।
  • परिणाम: भले ही वहां 10 एजेंट थे, लेकिन उन्होंने केवल 1.4 स्वतंत्र विचारकों की तरह व्यवहार किया। बाजार अधिक रोबोट जोड़कर स्मार्ट नहीं हुआ; वह बस अपनी साझा गलतियों में अधिक आश्वस्त हो गया।

2. अपराधी: "टीचर का प्रिय" (Preference Optimization)

रोबोट इतने एक जैसे क्यों थे? शोध पत्र एक विशिष्ट प्रशिक्षण तकनीक की ओर इशारा करता है जिसे डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) कहा जाता है।

  • उपमा: DPO को एक ऐसे शिक्षक के रूप में सोचें जो छात्र से कहता है, "मुझे केवल कोई भी उत्तर मत दो। मुझे वह उत्तर दो जो सुनने में सबसे विनम्र, सुरक्षित और वही हो जो मैं सुनना चाहता हूँ।"
  • प्रभाव: जब आप कई अलग-अलग AI मॉडल को इसी एक ही "शिक्षक" के साथ प्रशिक्षित करते हैं, तो वे सभी अपने अद्वितीय, विचित्र या रचनात्मक विचारों को दबा देते हैं और उत्तर देने के एक एकल, "सुरक्षित" तरीके पर केंद्रित हो जाते हैं।
  • शोध पत्र का प्रमाण: शोधकर्ताओं ने एक नियंत्रित प्रयोग चलाया। उन्होंने रोबोटों के दो समूह लिए। एक समूह को केवल तथ्य सिखाए गए थे (SFT)। दूसरे समूह को तथ्य साथ ही "सुरक्षित/विनम्र रहें" का नियम सिखाया गया था (DPO)।
    • "केवल तथ्यों" वाले समूह ने अलग-अलग गलतियाँ कीं (कम सहसंबंध/low correlation)।
    • "सुरक्षित रहें" वाले समूह ने एक ही गलतियाँ कीं (उच्च सहसंबंध/high correlation)।
    • निष्कर्ष: AI को "बेहतर" या "सुरक्षित" बनाने का कार्य ही वह कारण था जिसने उन्हें एक जैसा सोचने पर मजबूर कर दिया।

3. अधिक रोबोट जोड़ने से मदद नहीं मिलती

आप सोच सकते हैं, "यदि 10 रोबोट खराब हैं, तो चलिए 40 कोशिश करते हैं!"

  • वास्तविकता: अधिक रोबोट जोड़ने से कुछ नहीं हुआ। बाजार की सटीकता स्थिर रही।
  • उपमा: यदि आपके पास एक टूटा हुआ दिशा-सूचक यंत्र (compass) है जो थोड़ा पश्चिम की ओर संकेत करता है, तो आपके पास 100 दिशा-सूचक यंत्र होने से भी मदद नहीं मिलेगी। वे सभी मिलकर एक साथ थोड़ा पश्चिम की ओर ही संकेत करेंगे। शोध पत्र ने पाया कि चाहे आप कितने भी समान-मॉडल वाले रोबोट जोड़ दें, स्मार्ट विचारकों की "प्रभावी संख्या" लगभग 1.4 पर ही अटकी रही।

4. समाधान क्या है: ब्रांड बदलें (Mix the Brands)

शोध पत्र ने इस "मोनोकल्चर" (एक ऐसा क्षेत्र जहाँ केवल एक प्रकार की फसल उगती है) को तोड़ने के तरीकों का परीक्षण किया।

  • समाधान: विभिन्न प्रकार के AI मॉडल को एक साथ मिलाएं (जैसे, एक "Llama" रोबोट को "Qwen" रोबोट के साथ मिलाना)।
  • उपमा: समान पृष्ठभूमि, स्कूल और संस्कृति के लोगों से भरे कमरे के बजाय, अलग-अलग पृष्ठभूमि के लोगों को एक कमरे में रखें। भले ही वे सभी एक ही तथ्य जानते हों, वे समस्या के प्रति अलग दृष्टिकोण अपनाएंगे।
  • परिणाम: विभिन्न AI मॉडलों को मिलाने से "एक जैसापन" काफी कम हो गया। बाजार बहुत अधिक प्रभावी हो गया, और इसने लगभग 2.2 स्वतंत्र विचारकों की तरह काम किया, न कि 1.4 की तरह।

5. "स्व-नियमन" वाला बाजार (Self-Policing Market)

शोध पत्र ने यह भी देखा कि क्या होता है जब कोई "दुर्भावनापूर्ण अभिनेता" (bad actor) बाजार को धोखा देने की कोशिश करता है।

  • निष्कर्ष: क्योंकि ईमानदार रोबोट बहुत आश्वस्त हैं और एक-दूसरे से सहमत हैं, बाजार की कीमत बहुत तेजी से बदलती है। एक दुर्भावनापूर्ण अभिनेता को भीड़ के विरुद्ध कीमत बदलने के लिए बहुत अधिक धन खर्च करना होगा।
  • उपमा: कल्पना कीजिए कि 100 लोगों की भीड़ चिल्ला रही है "आसमान नीला है!" यदि एक व्यक्ति चिल्लाकर कहता है "नहीं, यह हरा है!", तो उसे सुनाई देने के लिए एक बहुत बड़े मेगाफोन (और बहुत सारे पैसे) की आवश्यकता होगी। सिस्टम स्वाभाविक रूप से दुर्भावनापूर्ण अभिनेता को प्रयास करने से ही हतोत्साहित करता है क्योंकि भीड़ से लड़ना बहुत महंगा है।

सारांश

यह शोध पत्र हमें चेतावनी देता है कि जैसे-जैसे हम व्यापार करने, भविष्यवाणी करने या निर्णय लेने के लिए अधिक AI एजेंट बना रहे हैं, हमें सावधान रहना चाहिए। यदि हम उन सभी को एक ही "सुरक्षा" नियमों के साथ प्रशिक्षित करते हैं, तो वे एक विविध भीड़ के बजाय एक मोनोकल्चर बन जाएंगे—एक ऐसा समूह जो एक ही ताल में सोचता है।

  • अच्छी खबर: हम विभिन्न AI मॉडलों को एक साथ मिलाकर इसे ठीक कर सकते हैं।
  • बुरी खबर: केवल एक ही प्रकार के AI मॉडलों को अधिक संख्या में जोड़ने से सिस्टम अधिक स्मार्ट नहीं होता, बल्कि वह केवल अधिक हठधर्मी रूप से गलत हो जाता है।

संक्षेप में: AI बाजारों के लिए विविधता केवल एक अच्छी चीज़ नहीं है; यह एकमात्र चीज़ है जो उन्हें एक साथ विफल होने से बचाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →