Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
यह अध्ययन तर्क करने वाले (reasoning) और संवादात्मक (conversational) लार्ज लैंग्वेज मॉडल्स के बीच जोखिम भरे निर्णय लेने की प्रक्रिया में एक महत्वपूर्ण विचलन को प्रकट करता है, जिसमें यह पाया गया है कि रीजनिंग मॉडल्स इष्टतम एजेंटों के समान तर्कसंगत और संदर्भ-असंवेदनशील व्यवहार प्रदर्शित करते हैं, जबकि संवादात्मक मॉडल्स मानव जैसे पूर्वाग्रह और स्पष्ट विवरणों एवं परिणाम इतिहास के बीच एक बड़ा अंतर प्रदर्शित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक उच्च-जोखिम वाले निवेश निर्णय लेने में मदद के लिए दो अलग-अलग प्रकार के AI सहायकों को काम पर रख रहे हैं। आपके पास दो विकल्प हैं: एक मैथ व्हिज़ (Math Whiz) (एक "रीज़निंग मॉडल") और एक चैटी फ्रेंड (Chatty Friend) (एक "कन्वर्सेशनल मॉडल")।
यह पेपर मूल रूप से इस बात की रिपोर्ट कार्ड है कि ये दो प्रकार के AI जोखिम, अनिश्चितता और पेचीदा सवालों को कैसे संभालते हैं। शोधकर्ताओं ने उन्हें यह देखने के लिए परीक्षणों की एक श्रृंखला में डाला कि क्या वे ठंडे, गणना करने वाले रोबोट की तरह व्यवहार करते हैं, भावनात्मक मनुष्यों की तरह, या कुछ और।
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं का उपयोग किया गया है।
1. दो टीमें: अकाउंटेंट बनाम बरिस्ता
अध्ययन ने पाया कि परीक्षण किए गए सभी AI मॉडल स्वाभाविक रूप से दो स्पष्ट समूहों में विभाजित हो गए:
- रीज़निंग मॉडल्स (RMs): इन्हें कठोर, अति-तार्किक अकाउंटेंट के रूप में सोचें। इन्हें गणित और तर्क पर भारी प्रशिक्षण दिया जाता है। जब आप उनसे एक जोखिम भरे दांव और एक सुरक्षित दांव के बीच चयन करने के लिए कहते हैं, तो वे एक आदर्श कंप्यूटर प्रोग्राम की तरह कार्य करते हैं। वे विकर्षणों को अनदेखा करते हैं, इस बात से भ्रमित नहीं होते कि प्रश्न कैसे पूछा गया है, और हमेशा उस विकल्प को चुनते हैं जिसका औसत भुगतान सबसे अधिक होता है। वे सख्त अर्थों में "तर्कसंगत" हैं।
- कन्वर्सेशनल मॉडल्स (CMs): इन्हें बातूनी बरिस्ता या मिलनसार पड़ोसियों के रूप में सोचें। वे बातचीत करने, कहानियाँ लिखने और मानवीय लगने में माहिर हैं। हालाँकि, जब गणित और जोखिम की बात आती है, तो वे मानवीय खामियों के मामले में बहुत अधिक "मानव-समान" होते हैं। वे इस बात से प्रभावित हो जाते हैं कि सवाल कैसे पेश किया गया है, वे विकल्पों के क्रम से भ्रमित हो जाते हैं, और अक्सर ऐसे चुनाव करते हैं जो उनके मुनाफे को अधिकतम नहीं करते।
बड़ी आश्चर्य की बात: "चैटी" मॉडल वास्तव में वास्तविक मनुष्यों की तुलना में अधिक "मानव-समान" हैं। मैथ व्हिज़ इतने तार्किक हैं कि वे हमारे बहुत कम मिलते-जुलते हैं।
2. "डिस्क्रिप्शन बनाम एक्सपीरियंस" गैप
यह पेपर का सबसे दिलचस्प निष्कर्ष है, जिसे DH गैप कहा जाता है।
कल्पना कीजिए कि आपको एक जुआ खेलने का प्रस्ताव दिया जाता है:
- परिदृश्य A (डिस्क्रिप्शन/विवरण): मैं आपसे कहता हूँ, "70% संभावना है कि आप $100 जीतेंगे और 30% संभावना है कि आप कुछ भी नहीं जीतेंगे।"
- परिदृश्य B (एक्सपीरियंस/अनुभव): मैं आपको संभावनाएँ नहीं बताता। इसके बजाय, मैं आपको इस खेल के पिछले 20 बार के परिणाम दिखाता हूँ: "आप पंद्रह बार 0 मिले।"
मनुष्य कैसे प्रतिक्रिया देते हैं: मनुष्य आमतौर पर इन दोनों परिदृश्यों में अलग तरह से व्यवहार करते हैं। जब हम केवल संभावनाओं को पढ़ते हैं, तो हम अधिक सतर्क होते हैं, लेकिन जब हम जीत का इतिहास देखते हैं, तो हम अधिक जोखिम लेते हैं। यह एक ज्ञात मानवीय स्वभाव है।
AI ने कैसी प्रतिक्रिया दी:
- मैथ व्हिज़ (RMs): उन्हें कोई फर्क नहीं पड़ा। चाहे आपने उन्हें संभावनाएँ दी हों या इतिहास, उन्होंने गणित की गणना की और हर बार एक ही विजेता को चुना। वे इस "गैप" से मुक्त थे।
- चैटी मॉडल्स (CMs): वे सीधे जाल में फंस गए। जब उन्हें जीत का इतिहास दिखाया गया, तो उन्होंने बहुत अधिक मानवों की तरह व्यवहार करना शुरू कर दिया—उन्होंने ऐसे जोखिम उठाए जो वे नहीं उठाते यदि आपको केवल संख्याएँ दी गई होतीं। पढ़ने बनाम डेटा को "अनुभव" करने के बीच उनके सोचने के तरीके में एक बड़ा "गैप" है।
3. "एक्सप्लेन योरसेल्फ" (स्वयं को समझाएं) प्रभाव
शोधकर्ताओं ने AI से यह भी पूछा कि उन्होंने एक चुनाव क्यों किया।
- परिणाम: आश्चर्यजनक रूप से, एक संक्षिप्त, एक-वाक्य का स्पष्टीकरण माँगने से AI (विशेष रूप से चैटी मॉडल्स) ने बेहतर, अधिक तर्कसंगत निर्णय लिए। यह वैसा ही था जैसे किसी छात्र से गणित के टेस्ट पर "अपना काम दिखाने" (show their work) के लिए कहना; इसने उन्हें अधिक तार्किक रूप से सोचने के लिए मजबूर किया।
- हालाँकि, यदि उन्होंने एक लंबा, जटिल गणितीय स्पष्टीकरण माँगा, तो चैटी मॉडल्स कभी-कभी भ्रमित हो गए और खराब विकल्प चुने, क्योंकि वे वास्तव में स्मार्ट होने के बजाय "स्मार्ट दिखने" की कोशिश कर रहे थे।
4. अंतर क्यों है?
कुछ AI "मैथ व्हिज़" और कुछ "चैटी बरिस्ता" क्यों हैं?
अध्ययन ने पाया कि मुख्य बात केवल मॉडल का आकार (कितने "मस्तिष्क कोशिकाएं" हैं) नहीं है। मुख्य बात ट्रेनिंग (प्रशिक्षण) है।
- यदि किसी मॉडल को विशेष रूप से गणितीय तर्क के लिए फाइन-ट्यून किया जाता है, तो वह एक "रीज़निंग मॉडल" (RM) बन जाता है। वह एक ठंडा, कठोर कैलकुलेटर बन जाता है।
- यदि मॉडल को केवल चैट करने और बिना किसी विशिष्ट गणितीय फोकस के निर्देशों का पालन करने के लिए प्रशिक्षित किया जाता है, तो वह एक "कन्वर्सेशनल मॉडल" (CM) बना रहता है।
निष्कर्ष (The Takeaway)
यदि आप अपने पैसे का प्रबंधन करने, स्टॉक पोर्टफोलियो चलाने या महत्वपूर्ण सुरक्षा निर्णय लेने के लिए एक AI बना रहे हैं, तो आपको मैथ व्हिज़ (रीज़निंग मॉडल) चाहिए। वे सुसंगत, तार्किक हैं और प्रश्न पूछने के तरीके से धोखा नहीं खाएंगे।
यदि आप एक ऐसा AI चाहते है जो ग्राहकों से चैट करे, कहानियाँ लिखे, या किसी फिल्म की पटकथा के लिए मानवीय व्यवहार का अनुकरण करे, तो चैटी मॉडल बेहतरीन है। लेकिन सावधान रहें: यदि आप उन्हें वित्तीय निर्णय लेने के लिए कहते हैं, तो वे तर्कहीन व्यवहार कर सकते हैं, ठीक वैसे ही जैसे एक इंसान करता है।
संक्षेप में: यह पेपर चेतावनी देता है कि सभी AI समान नहीं होते हैं। कुछ को पूर्ण रोबोट बनाने के लिए बनाया गया है, जबकि अन्य को अपूर्ण मानव बनाने के लिए बनाया गया है। यह जानना कि कौन सा किस प्रकार का है, यह तय करने से पहले बहुत महत्वपूर्ण है कि वे आपके लिए निर्णय लें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।