Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
यह अध्ययन स्लैक (Slack) संचार लॉग से व्यक्तिगत डोमेन ज्ञान का अनुमान लगाने की सात लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिसमें उनके ज़ीरो-शॉट अनुमानों की स्वयं-रिपोर्ट किए गए कौशल के साथ तुलना की गई है, जिससे यह पाया गया कि हालांकि जेमिनी 2.5 फ्लैश (Gemini 2.5 Flash) ने उच्चतम सटीकता प्राप्त की, फिर भी अनुमान लगाने का प्रदर्शन संदेश की मात्रा पर केवल बहुत कम रूप से निर्भर है और यह गोपनीयता-संरक्षण एवं संरचना-जागरूक दृष्टिकोणों की आवश्यकता को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरे ऑफिस में कदम रखते हैं। आपके पास एक पेचीदा समस्या है, लेकिन आपको नहीं पता कि किससे पूछना है। क्या वह कोने में बैठा व्यक्ति है जो दिन भर कोडिंग की बातें करता रहता है? या वह जो प्रोजेक्ट मैनेजमेंट के बारे में सब कुछ जानता है? आमतौर पर, आपको इधर-उधर भटकना होगा, कुछ लोगों से पूछना होगा और उम्मीद करनी होगी कि आपको सही विशेषज्ञ मिल जाए। यह "अनुमान लगाने का खेल" समय और पैसा दोनों बर्बाद करता है।
यह शोध पत्र एक सरल प्रश्न पूछता है: क्या एक AI एक अत्यंत सूक्ष्म अवलोकन करने वाले इंटर्न की तरह कार्य कर सकता है जो सभी के चैट इतिहास को पढ़ सके और तुरंत आपको बता सके कि कौन क्या जानता है?
यहाँ उनके प्रयोग का विवरण सरल भाषा में दिया गया है:
सेटअप: द "चैट डिटेक्टिव" (Chat Detective)
शोधकर्ताओं ने एक कंपनी के स्लैक (Slack) अकाउंट से वास्तविक चैट संदेशों का एक विशाल ढेर लिया (लगभग 43 लोगों के 27,000 संदेश, जो कई वर्षों के थे)। उन्होंने इन संदेशों को सात अलग-अलग "सुपर-ब्रेन" (लार्ज लैंग्वेज मॉडल्स जैसे GPT, Claude और Gemini) में डाला।
इन AI मॉडल्स को अलग-अलग प्रकार के जासूसों के रूप में सोचें:
- कुछ तेज़ हैं लेकिन शायद थोड़े सतही (जैसे एक त्वरित स्कैनर)।
- कुछ धीमे हैं लेकिन गहरे विचारक हैं (जैसे किसी किताब का विश्लेषण करने वाला प्रोफेसर)।
- कुछ सामान्यज्ञ (generalists) हैं, जबकि अन्य विशेषज्ञ (specialists) हैं।
AI का काम चैट को पढ़ना और प्रत्येक व्यक्ति के लिए एक "स्किल रिपोर्ट" तैयार करना था। उदाहरण के लिए, यदि कोई बार-बार "Python" और "Data Science" के बारे में बात करता है, तो AI अनुमान लगाएगा, "इस व्यक्ति को Python आता है।"
वास्तविकता की जाँच: "सेल्फ-रिपोर्ट" (Self-Report)
यह देखने के लिए कि क्या AI वास्तव में अपना काम अच्छी तरह से कर रहा था, शोधकर्ताओं ने वास्तविक मनुष्यों से खुद को ग्रेड करने के लिए कहा। उन्होंने एक सरल वेबसाइट बनाई जहाँ प्रत्येक व्यक्ति ने AI द्वारा खोजे गए कौशल की सूची देखी और कहा, "हाँ, मैं यह जानता हूँ," या "नहीं, मैं यह नहीं जानता।"
फिर, शोधकर्ताओं ने AI के अनुमान की तुलना मानव के वास्तविक उत्तर से की। यह एक शिक्षक द्वारा छात्र के टेस्ट के उत्तरों के अनुमान को वास्तविक उत्तर कुंजी (answer key) के विरुद्ध ग्रेड करने जैसा है।
परिणाम: प्रतियोगिता में कौन जीता?
शोधकर्ताओं ने सात अलग-अलग AI मॉडल्स का परीक्षण किया। यहाँ उनकी रैंकिंग दी गई है:
- विजेता: Gemini 2.5 Flash सबसे अच्छा अनुमान लगाने वाला था। यह 0–100 के पैमाने पर लगभग 21 अंकों से चूक गया। (यदि मानव ने कहा कि वह 80% विशेषज्ञ है, तो AI ने लगभग 59% या 101% का अनुमान लगाया)।
- उपविजेता: Gemini 2.5 Pro इसके ठीक पीछे था।
- मध्यम स्तर: Claude के मॉडल्स (Haiku और Sonnet) ठीक-ठाक थे, लेकिन Gemini मॉडल्स जितने तेज नहीं थे।
- संघर्ष करने वाले: GPT मॉडल्स (अत्यंत प्रसिद्ध GPT-4o और GPT-5 सहित) का प्रदर्शन सबसे खराब रहा। वे औसतन लगभग 33 अंकों से चूक गए।
बड़ी सीख: यहाँ तक कि सबसे अच्छा AI भी पूर्ण नहीं था। यह इस बात का सामान्य विचार प्राप्त कर सकता था कि कौन क्या जानता है, लेकिन यह उच्च सटीकता के साथ विशेषज्ञता के सटीक स्तर को नहीं पहचान सका।
चौंकाने वाला मोड़: अधिक टेक्स्ट ≠ बेहतर अनुमान
आप सोच सकते हैं, "यदि मैं AI को एक हज़ार के बजाय दस लाख संदेश दूँ, तो क्या वह और स्मार्ट हो जाएगा?"
ज़रूरी नहीं। शोधकर्ताओं ने पाया कि केवल अधिक चैट इतिहास होने से AI के अनुमान अपने आप सटीक नहीं हो जाते।
- क्यों? क्योंकि बहुत सारे चैट संदेश केवल "ठीक है," "समझ गया," या "लंच पर चलें?" जैसे होते हैं। ये नहीं बताते कि कोई व्यक्ति क्या जानता है।
- सीमा: एक बार जब AI के पास काम करने के लिए एक न्यूनतम मात्रा में चैट उपलब्ध हो गई, तो अधिक जोड़ने से ज्यादा मदद नहीं मिली। यह किसी के पसंदीदा मूवी का अनुमान लगाने के लिए उसकी किराने की सूची (grocery list) पढ़ने जैसा है; सूची कितनी भी लंबी क्यों न हो, वह आपकी सिनेमा की पसंद के बारे में बहुत कुछ नहीं बताएगी।
निचोड़ (The Bottom Line)
यह अध्ययन सिद्ध करता है कि AI हमारे चैट लॉग्स में झाँक सकता है और हमारे कौशल के बारे में एक उचित अनुमान लगा सकता है। यह कंपनी में "कौन क्या जानता है" का एक मोटा नक्शा प्राप्त करने के लिए एक उपयोगी उपकरण है।
हालाँकि, यह अभी कोई जादुई क्रिस्टल बॉल नहीं है। AI अभी भी गलतियाँ करता है, और प्रसिद्ध GPT मॉडल्स इस विशिष्ट परीक्षण में पहले स्थान पर भी नहीं आ पाए। शोधकर्ताओं ने यह भी नोट किया कि वास्तविक जीवन में इसके काम करने के लिए, कंपनियों को गोपनीयता के प्रति बहुत सावधान रहना होगा, क्योंकि निजी कंपनी चैट को बाहरी AI सर्वर पर भेजना एक संवेदनशील मुद्दा है।
संक्षेप में: AI कमरे के माहौल (reading the room) को समझने में बेहतर हो रहा है, लेकिन इसे अभी भी यह सीखने की आवश्यकता है कि किसी व्यक्ति की वास्तविक विशेषज्ञता और केवल उनकी दैनिक बातचीत के बीच अंतर कैसे किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।