Preference Optimization Drives Monoculture in LLM Prediction Markets
यह शोध पत्र प्रदर्शित करता है कि डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO), प्रेडिक्शन मार्केट्स में LLM एजेंटों में अत्यधिक सह-संबंधित त्रुटियों (correlated errors) को विकसित करता है, जिससे एक "मोनोकल्चर" (monoculture) बन जाता है जो स्वतंत्र पूर्वानुमानकर्ताओं की प्रभावी संख्या को नाटकीय रूप से कम कर देता है और बाजार की सामूहिक सटीकता को कमजोर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक प्रेडिक्शन मार्केट (भविष्यवाणी बाजार) "उत्तर का अनुमान लगाने" के एक विशाल, उच्च-दांव वाले खेल की तरह है। एक स्वस्थ खेल में, आप ऐसे लोगों की भीड़ चाहते हैं जो सभी अलग-अलग तरह से सोचते हों। यदि एक व्यक्ति गलत अनुमान लगाता है क्योंकि वह कोई तथ्य भूल गया, और दूसरा गलत अनुमान लगाता है क्योंकि उसने प्रश्न को गलत पढ़ लिया, तो उनकी गलतियाँ एक-दूसरे को काट देती हैं। भीड़ का औसत अनुमान अविश्वसनीय रूप से सटीक हो जाता है। यह इसलिए काम करता है क्योंकि सबकी गलतियाँ स्वतंत्र (independent) होती हैं—जैसे पक्षियों का एक झुंड जहाँ प्रत्येक पक्षी अपना स्वयं का रास्ता चुनता है।
यह शोध पत्र पूछता है: क्या होगा यदि पूरी भीड़ रोबोट्स से बनी हो (AI एजेंट) जिन्हें बिल्कुल एक ही ब्लूप्रिंट से बनाया गया है और एक ही शिक्षक द्वारा सिखाया गया है?
उत्तर आश्चर्यजनक है: सभी रोबोट बिल्कुल एक ही समय में ठीक एक जैसी गलतियाँ करते हैं।
यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के निष्कर्षों का विवरण दिया गया है:
1. "क्लोन आर्मी" की समस्या
शोधकर्ताओं ने 10 AI एजेंटों के साथ एक बाजार का परीक्षण किया। उन्हें उम्मीद थी कि बाजार किसी भी एकल एजेंट की तुलना में अधिक स्मार्ट होगा क्योंकि एक से बेहतर दस सिर होते हैं।
- वास्तविकता: 10-AI वाला बाजार अकेले काम करने वाले एक एकल AI की तुलना में खराब प्रदर्शन करता है।
- उपमा: कल्पना कीजिए कि आपके पास 10 एक जैसे जुड़वां भाई हैं जो एक ही स्कूल गए, एक ही किताबें पढ़ीं और एक ही सख्त शिक्षक से पढ़े। यदि आप उनसे गणित का एक सवाल पूछते हैं, और वे सभी उसमें गलत होते हैं, तो ऐसा इसलिए नहीं है कि वे गणित में खराब हैं; बल्कि इसलिए है क्योंकि उन सभी को एक ही गलत तरीके से सिखाया गया था।
- परिणाम: भले ही वहां 10 एजेंट थे, लेकिन उन्होंने केवल 1.4 स्वतंत्र विचारकों की तरह व्यवहार किया। बाजार अधिक रोबोट जोड़कर स्मार्ट नहीं हुआ; वह बस अपनी साझा गलतियों में अधिक आश्वस्त हो गया।
2. अपराधी: "टीचर का प्रिय" (Preference Optimization)
रोबोट इतने एक जैसे क्यों थे? शोध पत्र एक विशिष्ट प्रशिक्षण तकनीक की ओर इशारा करता है जिसे डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) कहा जाता है।
- उपमा: DPO को एक ऐसे शिक्षक के रूप में सोचें जो छात्र से कहता है, "मुझे केवल कोई भी उत्तर मत दो। मुझे वह उत्तर दो जो सुनने में सबसे विनम्र, सुरक्षित और वही हो जो मैं सुनना चाहता हूँ।"
- प्रभाव: जब आप कई अलग-अलग AI मॉडल को इसी एक ही "शिक्षक" के साथ प्रशिक्षित करते हैं, तो वे सभी अपने अद्वितीय, विचित्र या रचनात्मक विचारों को दबा देते हैं और उत्तर देने के एक एकल, "सुरक्षित" तरीके पर केंद्रित हो जाते हैं।
- शोध पत्र का प्रमाण: शोधकर्ताओं ने एक नियंत्रित प्रयोग चलाया। उन्होंने रोबोटों के दो समूह लिए। एक समूह को केवल तथ्य सिखाए गए थे (SFT)। दूसरे समूह को तथ्य साथ ही "सुरक्षित/विनम्र रहें" का नियम सिखाया गया था (DPO)।
- "केवल तथ्यों" वाले समूह ने अलग-अलग गलतियाँ कीं (कम सहसंबंध/low correlation)।
- "सुरक्षित रहें" वाले समूह ने एक ही गलतियाँ कीं (उच्च सहसंबंध/high correlation)।
- निष्कर्ष: AI को "बेहतर" या "सुरक्षित" बनाने का कार्य ही वह कारण था जिसने उन्हें एक जैसा सोचने पर मजबूर कर दिया।
3. अधिक रोबोट जोड़ने से मदद नहीं मिलती
आप सोच सकते हैं, "यदि 10 रोबोट खराब हैं, तो चलिए 40 कोशिश करते हैं!"
- वास्तविकता: अधिक रोबोट जोड़ने से कुछ नहीं हुआ। बाजार की सटीकता स्थिर रही।
- उपमा: यदि आपके पास एक टूटा हुआ दिशा-सूचक यंत्र (compass) है जो थोड़ा पश्चिम की ओर संकेत करता है, तो आपके पास 100 दिशा-सूचक यंत्र होने से भी मदद नहीं मिलेगी। वे सभी मिलकर एक साथ थोड़ा पश्चिम की ओर ही संकेत करेंगे। शोध पत्र ने पाया कि चाहे आप कितने भी समान-मॉडल वाले रोबोट जोड़ दें, स्मार्ट विचारकों की "प्रभावी संख्या" लगभग 1.4 पर ही अटकी रही।
4. समाधान क्या है: ब्रांड बदलें (Mix the Brands)
शोध पत्र ने इस "मोनोकल्चर" (एक ऐसा क्षेत्र जहाँ केवल एक प्रकार की फसल उगती है) को तोड़ने के तरीकों का परीक्षण किया।
- समाधान: विभिन्न प्रकार के AI मॉडल को एक साथ मिलाएं (जैसे, एक "Llama" रोबोट को "Qwen" रोबोट के साथ मिलाना)।
- उपमा: समान पृष्ठभूमि, स्कूल और संस्कृति के लोगों से भरे कमरे के बजाय, अलग-अलग पृष्ठभूमि के लोगों को एक कमरे में रखें। भले ही वे सभी एक ही तथ्य जानते हों, वे समस्या के प्रति अलग दृष्टिकोण अपनाएंगे।
- परिणाम: विभिन्न AI मॉडलों को मिलाने से "एक जैसापन" काफी कम हो गया। बाजार बहुत अधिक प्रभावी हो गया, और इसने लगभग 2.2 स्वतंत्र विचारकों की तरह काम किया, न कि 1.4 की तरह।
5. "स्व-नियमन" वाला बाजार (Self-Policing Market)
शोध पत्र ने यह भी देखा कि क्या होता है जब कोई "दुर्भावनापूर्ण अभिनेता" (bad actor) बाजार को धोखा देने की कोशिश करता है।
- निष्कर्ष: क्योंकि ईमानदार रोबोट बहुत आश्वस्त हैं और एक-दूसरे से सहमत हैं, बाजार की कीमत बहुत तेजी से बदलती है। एक दुर्भावनापूर्ण अभिनेता को भीड़ के विरुद्ध कीमत बदलने के लिए बहुत अधिक धन खर्च करना होगा।
- उपमा: कल्पना कीजिए कि 100 लोगों की भीड़ चिल्ला रही है "आसमान नीला है!" यदि एक व्यक्ति चिल्लाकर कहता है "नहीं, यह हरा है!", तो उसे सुनाई देने के लिए एक बहुत बड़े मेगाफोन (और बहुत सारे पैसे) की आवश्यकता होगी। सिस्टम स्वाभाविक रूप से दुर्भावनापूर्ण अभिनेता को प्रयास करने से ही हतोत्साहित करता है क्योंकि भीड़ से लड़ना बहुत महंगा है।
सारांश
यह शोध पत्र हमें चेतावनी देता है कि जैसे-जैसे हम व्यापार करने, भविष्यवाणी करने या निर्णय लेने के लिए अधिक AI एजेंट बना रहे हैं, हमें सावधान रहना चाहिए। यदि हम उन सभी को एक ही "सुरक्षा" नियमों के साथ प्रशिक्षित करते हैं, तो वे एक विविध भीड़ के बजाय एक मोनोकल्चर बन जाएंगे—एक ऐसा समूह जो एक ही ताल में सोचता है।
- अच्छी खबर: हम विभिन्न AI मॉडलों को एक साथ मिलाकर इसे ठीक कर सकते हैं।
- बुरी खबर: केवल एक ही प्रकार के AI मॉडलों को अधिक संख्या में जोड़ने से सिस्टम अधिक स्मार्ट नहीं होता, बल्कि वह केवल अधिक हठधर्मी रूप से गलत हो जाता है।
संक्षेप में: AI बाजारों के लिए विविधता केवल एक अच्छी चीज़ नहीं है; यह एकमात्र चीज़ है जो उन्हें एक साथ विफल होने से बचाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।