The One-Word Census: Answer-Choice Conformity Across 44 Language Models
यह शोध पत्र "वन-वर्ड सेंसस" (One-Word Census) प्रस्तुत करता है, जो 31 एकल-शब्द संकेतों का उपयोग करने वाला एक न्यूनतम उपकरण है, जिससे यह पता चलता है कि जबकि 44 भाषा मॉडल विशिष्ट उत्तरों पर अत्यधिक अभिसरण (convergence) प्रदर्शित करते हैं (जैसे, 41% बार "serendipity"), अनुरूपता की डिग्री मॉडल की वंशावली और ट्यूनिंग के अनुसार काफी भिन्न होती है, जिसमें नए फ्लैगशिप मॉडल आमतौर पर पर्सोना-ट्यून्ड मॉडलों की तुलना में अधिक अनुरूप होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कमरे में प्रवेश करते हैं जहाँ 44 अलग-अलग रोबोट हैं, जिनमें से प्रत्येक एक अलग कारखाने से है और पिछले पाँच वर्षों में बनाया गया है। आप उन सभी को कागज़ का एक टुकड़ा देते हैं जिस पर लिखा है, "एक पेड़ का नाम लें। केवल एक शब्द।"
आप जवाबों के एक अराजक विस्फोट की उम्मीद कर सकते हैं: ओक, मेपल, पाइन, विलो, बाओबाब, रेडवुड। लेकिन जब रोबोट बोलते हैं, तो कमरा शांत हो जाता है। लगभग हर एक रोबोट "ओक" कहता है। वास्तव में, उनमें से 94% "ओक" कहते हैं।
यदि आप किसी औज़ार के लिए पूछते हैं, तो 94% "हथौड़ा" कहते हैं। यदि आप किसी फूल के लिए पूछते हैं, तो 91% "गुलाब" कहते हैं। यदि आप किसी सब्जी के लिए पूछते हैं, तो 90% "गाजर" कहते हैं।
यह कोई खराबी नहीं है; यह एक पैटर्न है। यह कागज़, जिसे "द वन-वर्ड सेंसस" (The One-Word Census) कहा जाता है, एक विशाल उपस्थिति दर्ज करने जैसा है कि ये 44 भाषा मॉडल एक-दूसरे का होमवर्क कितनी मात्रा में कॉपी कर रहे हैं। शोधकर्ताओं ने पाया कि जब इन एआई (AI) दिमागों को एक विशाल सूची में से एक उत्तर चुनना होता है, तो वे केवल एक उत्तर नहीं चुनते—वे सभी एक ही उत्तर चुनते हैं, बार-बार।
"सबसे साधारण" उत्तर जीतता है
यहाँ अजीब बात यह है: जो उत्तर वे चुनते हैं वह हमेशा वास्तविक दुनिया में सबसे आम चीज़ नहीं होती है। यह "घर्षणहीन" (frictionless) उत्तर है—वह जो सबसे सुरक्षित और सबसे स्पष्ट लगता है।
उदाहरण के लिए, यदि आप किसी फल के लिए पूछते हैं, तो मॉडल लगभग हमेशा "सेब" कहते हैं। लेकिन यदि आप किसी सब्जी के लिए पूछते हैं, तो वे "गाजर" कहते हैं। "टमाटर" क्यों नहीं? क्योंकि टमाटर वनस्पति विज्ञान के अनुसार फल हैं, इसलिए मॉडल भ्रमित हो जाते हैं और उन्हें पूरी तरह से छोड़ देते हैं। "संतरा" क्यों नहीं? शायद इसलिए क्योंकि "संतरा" एक रंग भी है, और मॉडल चीजों को मिलाना पसंद नहीं करते। वे किसी भी ऐसी चीज़ से बचने के लिए प्रोग्राम किए गए हैं जो किसी जाल या बहस जैसी महसूस हो। वे वह उत्तर चाहते हैं जो 100% सही और 0% विवादास्पद हो।
यहाँ तक कि जब आप उन्हें कोई नियम नहीं देते और बस कहते हैं, "अंग्रेजी भाषा में से कोई भी शब्द चुनें," तो कमरा यादृच्छिक (random) शब्दों से नहीं भरता। इसके बजाय, 41% रोबोट एक ही शब्द बोल उठते हैं: "सेरेंडिपिटी" (serendipity)। ऐसा लगता है जैसे उन सभी ने एक ही डिक्शनरी पढ़ी और उसे चुनने के लिए सबसे दिलचस्प शब्द तय किया।
"विरासत" बनाम "कारखाना" मॉडल
शोधकर्ताओं ने केवल उत्तरों को नहीं गिना; उन्होंने रोबोटों को इस आधार पर भी स्कोर दिया कि वे कितने "अनुपालनशील" (conformist) हैं। इसे एक परीक्षण की तरह समझें जहाँ आपको अद्वितीय होने के लिए अंक मिलते हैं।
- अनुपालनवादी (द फैक्ट्री मॉडल्स): सबसे नए, सबसे शक्तिशाली मॉडल, बड़े लैब्स (जैसे GPT और Claude के नवीनतम संस्करण) सबसे उबाऊ होते हैं। वे इतने सुव्यवस्थित हैं कि वे लगभग कभी भी कुछ ऐसा नहीं कहते जो अन्य रोबरों ने पहले से न कहा हो। यदि आप उनसे किसी सॉस (condiment) के लिए पूछते हैं, तो वे हर बार "केचप" कहेंगे। वे समूह के साथ इतने संरेखित हैं कि उनमें शून्य "नवीनता" है।
- विद्रोही (द हेरलूम मॉडल्स): दूसरे छोर पर, पुराने या समुदाय-ट्यून किए गए मॉडल (जैसे "हर्मेस" या "विज़ार्ड एलएम") मौजूद हैं। ये "विरासत" (heirloom) मॉडल हैं—उन दुर्लभ सब्जियों की तरह जिन्हें किसानों ने इसलिए उगाना बंद कर दिया क्योंकि वे पर्याप्त एकरूप नहीं थीं। ये मॉडल "चेडर" कहने वाले सभी लोगों के बीच "गौडा" कहने या "केचप" कहने वालों के बीच "मस्टर्ड" कहने की अधिक संभावना रखते हैं। वे ही एकमात्र हैं जो कभी-कभी जादू को तोड़ते हैं।
पेपर सुझाव देता है कि जैसे-जैसे ये मॉडल नए होते जाते हैं और अधिक "पोस्ट-ट्रेनिंग" (जहाँ मनुष्य उन्हें सहायक और सुरक्षित होने के लिए सिखाते हैं) से गुजरते हैं, वे कम नहीं बल्कि अधिक उबाऊ होते जाते हैं। यह एक ऐसे कारखाने की तरह है जो पहले थोड़े अलग खिलौने बनाता था लेकिन अब हर रंग में बिल्कुल एक जैसा खिलका बनाता है।
"रनर-अप" क्लब
यहाँ सबसे आश्चर्यजनक मोड़ है: भले ही एक मॉडल यह तय करता है कि सबसे लोकप्रिय उत्तर नहीं देना है, फिर भी वह पागलपन नहीं करता। वह लगभग हमेशा दूसरा सबसे लोकप्रिय उत्तर चुनता है।
यदि भीड़ "केचप" कहती है, तो विद्रोही 95% बार "मस्टर्ड" चुनते हैं। यदि भीड़ "गाजर" कहती है, तो विद्रोही 83% बार "ब्रोकोली" चुनते हैं। विद्रोही भी एक स्क्रिप्ट का पालन कर रहे हैं। वे डिक्शनरी के गहरे, अजीब कोनों की खोज नहीं कर रहे हैं; वे बस अगली सबसे स्पष्ट चीज़ चुन रहे हैं।
यह मनुष्यों की तुलना में कैसा है?
शोधकर्ताओं ने इन रोबोटों की तुलना वास्तविक मनुष्यों से की जिन्होंने वर्षों पहले समान परीक्षण दिए थे। अंतर बहुत बड़ा है।
- मनुष्य: जब एक पेड़ के लिए पूछा गया, तो मनुष्यों ने विविध उत्तर दिए। सबसे लोकप्रिय उत्तर ("ओक") केवल 31% लोगों द्वारा चुना गया था।
- रोबोट: रोबोटों ने 94% बार "ओक" चुना।
रोबोट मनुष्यों की तुलना में दोगुने केंद्रित हैं। वे लोगों के एक समूह की तुलना में कम विविध हैं। पेपर सुझाव देता है कि ऐसा इसलिए है क्योंकि रोबोटों को ऐसे डेटा पर प्रशिक्षित किया जाता है जो पहले से ही अन्य रोबोटों के उत्तरों से भरा हुआ है, जिससे एक लूप बनता है जहाँ वे एक ही सुरक्षित, साधारण विचारों को कॉपी करते रहते हैं।
इसका क्या अर्थ है (और क्या नहीं)
पेपर यह नहीं कहता कि रोबोट "टूटे हुए" हैं या वे सोच नहीं सकते। यह केवल यह दिखाता है कि जब उन्हें एक एकल विकल्प चुनने के लिए मजबूर किया जाता है, तो वे एक साथ कदम से कदम मिलाकर चलते हैं।
- क्या सिद्ध है: रोबवार (models) एक ही उत्तर पर अभिसरित (converge) होते हैं। नवीनतम मॉडल सबसे अधिक अनुपालनशील हैं। "विरासत" मॉडल सबसे अधिक भिन्न (divergent) हैं।
- क्या सुझाया गया है लेकिन सिद्ध नहीं है: पेपर को संदेह है कि यह इस कारण से होता है कि उन्हें कैसे प्रशिक्षित किया जाता है (विशेष रूप से, "पोस्ट-ट्रेनिंग" चरण जहाँ उन्हें सहायक होने के लिए ट्यून किया जाता है)। यह यह भी सुझाव देता है कि यदि हम रोबोटों को रोबोटों द्वारा लिखे गए डेटा पर प्रशिक्षित करना जारी रखते हैं, तो वे अपनी रचनात्मकता की क्षमता पूरी तरह से खो सकते हैं, जैसे कि एक फोटो जिसे बार-बार कॉपी किया जाता है जब तक कि वह धुंधली न हो जाए।
- क्या खारिज किया गया है: पेपर इस विचार को खारिज करता है कि यह केवल इसलिए है क्योंकि रोबोट "मूर्ख" हैं या उनमें ज्ञान की कमी है। वे "टमाटर" और "संतरे" के बारे में जानते हैं, लेकिन वे उन्हें कहना नहीं चुनते। इसने इस विचार को भी खारिज कर दिया कि उन्हें "असामान्य" होने के लिए कहना समस्या को ठीक कर देता है; यदि आप उनसे एक "असामान्य फल" के लिए पूछते हैं, तो वे बस सबसे सामान्य असामान्य फल (जैसे "ड्यूरियन") चुन लेते हैं और वे सभी वही कहते हैं।
संक्षेप में, यदि आप 44 एआई मॉडलों से एक शब्द चुनने के लिए कहते हैं, तो आपको 44 अलग-अलग विचार नहीं मिलेंगे। आपको एक विचार मिलेगा, जिसे 44 बार दोहराया जाएगा, जिसमें कुछ विद्रोही दूसरे सबसे सामान्य विचार को चुनेंगे। एआई विविधता का "जादू" वर्तमान में प्रशिक्षण प्रयोगशालाओं में छिपा हुआ है, न कि उन उत्तरों में जो हमें मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।