Can LLMs Rank? A Tale of Triads and Triage
यह शोध पत्र बेघरता आवंटन और आपातकालीन ट्राइएज जैसे उच्च-जोखिम वाले रैंकिंग कार्यों के लिए LLMs को तैनात करने से पहले उनकी विश्वसनीयता का मूल्यांकन करने के लिए एक मॉडल-मुक्त इंट्रा-रन निरंतरता माप (सर्कुलर ट्रायड्स) और इंटर-रन परिवर्तनशीलता मेट्रिक्स दोनों के उपयोग की वकालत करता है, जो यह प्रदर्शित करता है कि विभिन्न मॉडल इन अक्षों पर विशिष्ट प्रदर्शन प्रोफाइल प्रदर्शित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त आपातकालीन कक्ष (emergency room) या किसी आवास प्राधिकरण (housing authority) के प्रमुख हैं और आपको यह तय करना है कि किसे पहले मदद मिलनी चाहिए। आपके पास जरूरतमंद लोगों की एक लंबी सूची है, लेकिन उपलब्ध स्थान बहुत कम हैं। आपको उन्हें "सबसे अधिक तत्काल" से "सबसे कम तत्काल" के क्रम में रैंक (rank) करने की आवश्यकता है।
हाल ही में, लोगों ने पूछना शुरू कर दिया है: क्या हम इस रैंकिंग को करने के लिए एआई (विशेष रूप से लार्ज लैंग्वेज मॉडल्स, या LLMs) का उपयोग कर सकते हैं?
यह शोध पत्र एक बहुत ही विशिष्ट, व्यावहारिक प्रश्न पूछता है: यदि हम एआई को लोगों को रैंक करने के लिए कहते हैं, तो हम उस सूची पर कैसे भरोसा कर सकते हैं जो वह हमें देता है?
लेखकों का तर्क है कि हम केवल अंतिम सूची को देखकर यह मान नहीं सकते कि वह अच्छी है। इसके बजाय, हमें एआई के काम की जाँच दो अलग-अलग "रिपोर्ट कार्ड" का उपयोग करके करनी होगी। वे इन्हें इंट्रा-रन कंसिस्टेंसी (Intra-run Consistency) और इंटर-रन वेरिएंस (Inter-run Variance) कहते हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:
दो रिपोर्ट कार्ड
एआई को एक टूर्नामेंट में एक जज की तरह समझें जहाँ हर व्यक्ति की तुलना दूसरे व्यक्ति से की जाती है ताकि यह देखा जा सके कि कौन "अधिक तत्काल" है।
1. इंट्रा-रन कंसिस्टेंसी (तर्क की जाँच - The "Logic Check")
- यह क्या है: यह मापता है कि क्या एआई एक ही प्रयास के भीतर तार्किक रूप से सही निर्णय ले रहा है।
- उपमा: एक बॉक्सिंग टूर्नामेंट में एक जज की कल्पना करें।
- वह कहता है कि बॉक्सर A, बॉक्सर B से बेहतर है।
- वह कहता है कि बॉक्सर B, बॉक्सर C से बेहतर है।
- लेकिन फिर, वह कहता है कि बॉक्सर C, बॉक्सर A से बेहतर है।
- यह एक सर्कुलर ट्रायड (circular triad) (A > B > C > A) है। यह एक तार्किक लूप है। इसका कोई अर्थ नहीं है।
- शोध पत्र का निष्कर्ष: लेखक इन तार्किक लूपों को गिनने के लिए कोएफिशिएंट ऑफ कंसिस्टेंसी () नामक एक गणितीय उपकरण का उपयोग करते हैं।
- यदि यहाँ इसका स्कोर उच्च है, तो इसका अर्थ है कि एआई का तर्क सुदृढ़ है। वह अपने स्वयं के निर्णयों में विरोधाभास नहीं करता है।
- यदि स्कोर कम है, तो एआई भ्रमित है और अपने ही निर्णयों में उतार-चढ़ाव कर रहा है।
2. इंटर-रन वेरिएंस (स्थिरता की जाँच - The "Stability Check")
- यह क्या है: यह मापता है कि यदि आप एआई से एक ही प्रश्न दो बार पूछते हैं, तो क्या वह आपको एक ही उत्तर देता है।
- उपमा: कल्पना करें कि आप जज को बॉक्सर्स को रैंक करने के लिए कहते हैं। आप सूची लिख लेते हैं। फिर, आप जज से इसे दोबारा करने के लिए कहते हैं (शायद आपने पेज पर नामों का क्रम बदल दिया हो)।
- लो वेरिएंस (अच्छा): जज आपको दोनों बार बिल्कुल वही सूची देता है। वे स्थिर और विश्वसनीय हैं।
- हाई वेरिएंस (बुरा): जज आपको दूसरी बार बिल्कुल अलग सूची देता है। शायद वे थक गए थे, या शायद वे निर्णय लेने में असमर्थ थे।
- शोध पत्र का निष्कर्ष: वे इसे केंडल के (Kendall's ) का उपयोग करके मापते हैं। यह जाँचता है कि दो अलग-अलग सूचियाँ कितनी समान हैं।
सबसे बड़ा आश्चर्य: "दो-अक्ष" (Two-Axis) की समस्या
इस शोध पत्र की सबसे महत्वपूर्ण खोज यह है कि ये दो रिपोर्ट कार्ड स्वतंत्र हैं। आप यह मान नहीं सकते कि यदि एआई एक में अच्छा है, तो वह दूसरे में भी अच्छा होगा।
लेखकों ने वास्तविक दुनिया के डेटा (बेघर परिवारों और आपातकालीन कक्ष के रोगियों) पर तीन लोकप्रिय एआई मॉडल (LLaMA, Qwen, और DeepSeek) का परीक्षण किया। यहाँ उन्हें क्या मिला:
- LLaMA "लॉजिक मास्टर" था। इसने शायद ही कभी तार्किक लूप बनाए (उच्च कंसिस्टेंसी)। हालांकि, यदि आप इसे एक ही लोगों को दो बार रैंक करने के लिए कहते, तो यह आपको दो बहुत अलग सूचियाँ देता (कम स्थिरता)।
- Qwen "स्टेबल रॉक" था। यदि आप इसे दो बार पूछते, तो यह हर बार आपको एक ही सूची देता (उच्च स्थिरता)। हालांकि, उस सूची के भीतर, यह तार्किक लूप और विरोधाभास बना रहा था (कम कंसिस्टेंसी)।
- DeepSeek आमतौर पर दोनों के बीच में था।
रूपक (Metaphor):
कल्पना कीजिए कि आप एक शेफ को काम पर रख रहे हैं।
- शेफ A (LLaMA) हर बार रेसिपी का पूरी तरह से पालन करता है (कंसिस्टेंट), लेकिन यदि आप उनसे दो बार एक ही भोजन बनाने के लिए कहते हैं, तो वे पूरी तरह से अलग सामग्री का उपयोग करते हैं और दो बिल्कुल अलग व्यंजन बनाते हैं (अस्थिर)।
- शेफ B (Qwen) हमेशा वही सटीक व्यंजन बनाता है जब भी आप ऑर्डर देते हैं (स्थिर), लेकिन वह व्यंजन अजीब स्वाद का होता है क्योंकि वे रेसिपी में नमक और चीनी को आपस में मिला देते हैं (असंगत तर्क)।
यह वास्तविक जीवन के लिए क्यों मायने रखता है
यह शोध पत्र बेघर लोगों के आवास और आपातकालीन कक्ष ट्राइएज (emergency room triage) जैसे उच्च-दांव (high-stakes) वाले स्थितियों पर केंद्रित है। इन मामलों में, एक अविश्वसनीय रैंकिंग वास्तविक लोगों को नुकसान पहुँचा सकती है।
लेखक किसी भी ऐसे व्यक्ति के लिए एक सरल "सुरक्षा प्रोटोकॉल" प्रस्तावित करते हैं जो लोगों को रैंक करने के लिए एआई का उपयोग कर रहा है:
- केवल अंतिम सूची पर भरोसा न करें।
- पहले एक छोटा परीक्षण चलाएं: एआई को एक छोटे समूह (जैसे, 30 लोग) को पूरी तरह से रैंक करने के लिए कहें।
- "लॉजिक स्कोर" () की जाँच करें: यदि यह कम है, तो एआई मौलिक रूप से भ्रमित है। कितना भी अतिरिक्त डेटा क्यों न हो, यह ठीक नहीं होगा। आपको एक अलग मॉडल की आवश्यकता है।
- "स्टेबिलिटी स्कोर" () की जाँच करें: यदि लॉजिक स्कोर उच्च है लेकिन स्टेबिलिटी स्कोर कम है, तो एआई तार्किक है लेकिन उसे एक अंतिम उत्तर पर पहुँचने के लिए और अधिक तुलनाओं की आवश्यकता है। आपको नए मॉडल की आवश्यकता नहीं है; आपको बस उससे अधिक प्रश्न पूछने की आवश्यकता है।
मुख्य निष्कर्ष (The Bottom Line)
आप केवल एआई से "इन लोगों को रैंक करें" कहकर और उम्मीद करके काम नहीं चला सकते। आपको यह जाँचना होगा कि वह कैसे सोचता है (कंसिस्टेंसी) और वह कितना स्थिर है (स्टेबिलिटी)।
शोध पत्र निष्कर्ष निकालता है कि विभिन्न एआई मॉडलों के अलग-अलग "व्यक्तित्व" होते हैं। कुछ तार्किक लेकिन चंचल होते हैं; अन्य स्थिर लेकिन अतार्किक होते हैं। उच्च-दांव वाली स्थितियों में सुरक्षित और निष्पक्ष निर्णय लेने के लिए, पेशेवरों को एआई की रैंकिंग पर भरोसा करने से पहले दोनों रिपोर्ट कार्डों की जाँच करनी चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।