← नवीनतम पेपर
💬 NLP

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

यह शोध पत्र Text2DistBench को प्रस्तुत करता है, जो वास्तविक दुनिया के यूट्यूब कमेंट्स का उपयोग करने वाला एक स्वचालित और निरंतर अपडेट होने वाला बेंचमार्क है, जो वितरण संबंधी ज्ञान (जैसे कि भावना अनुपात और विषय आवृत्तियाँ) को अनुमान लगाने की बड़े भाषा मॉडलों की क्षमता का मूल्यांकन करता है, जो विभिन्न वितरण प्रकारों के बीच प्रदर्शन के महत्वपूर्ण अंतर को प्रकट करता है।

मूल लेखक: Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। अधिकांश रीडिंग टेस्ट (जैसे Large Language Models के लिए) एक जासूस से एक विशिष्ट सुराग खोजने जैसा है: "कातिल कौन है?" या "अपराध किस समय हुआ?" उत्तर वहीं टेक्स्ट में मौजूद है, जो एक ही वाक्य में छिपा हुआ है।

लेकिन वास्तविक दुनिया में, हमें अक्सर ट्रेंड्स (प्रवृत्तियों) को समझने की आवश्यकता होती है, न कि केवल तथ्यों को। हम जानना चाहते हैं: "अधिकांश लोग इस नई फिल्म के बारे में कैसा महसूस कर रहे हैं?" या "लोग किन तीन मुख्य शिकायतों के बारे में बात कर रहे हैं?" यह एक विशिष्ट वाक्य खोजने के बारे में नहीं है; यह एक पूरी भीड़ को देखने और समूह के "वाइब" (भाव) को समझने के बारे में है।

यह पेपर एक नया टेस्ट पेश करता है जिसे TEXT2DISTBENCH कहा जाता है, ताकि यह देखा जा सके कि क्या AI इस "भीड़ को पढ़ने" के काम में सक्षम है।

बड़ा विचार: "तथ्य पहचानें" से "माहौल समझें" तक

फैक्टुअल नॉलेज (तथ्यात्मक ज्ञान) और डिस्ट्रीब्यूशनल नॉलेज (वितरण संबंधी ज्ञान) के बीच के अंतर को इस तरह समझें:

  • फैक्टुअल नॉलेज (पुराना तरीका): एक लाइब्रेरी की कल्पना करें। यदि मैं पूछूँ, "हैरी पॉटर किसने लिखा?", तो AI बस शेल्फ से किताब निकालता है और उसका कवर पढ़ लेता है। आसान है।
  • डिस्ट्रीबशनल नॉलेज (नया तरीका): एक विशाल कॉन्सर्ट हॉल की कल्पना करें जहाँ 10,000 लोग एक नए बैंड के लिए तालियाँ बजा रहे हैं, हूटिंग कर रहे हैं और बातें कर रहे हैं। यदि मैं पूछूँ, "भीड़ का कितना प्रतिशत तालियाँ बजा रहा है बनाम हूटिंग कर रहा है?" या "वह दूसरा सबसे लोकप्रिय गाना कौन सा है जिसके बारे में लोग बात कर रहे हैं?", तो AI केवल एक पेज नहीं देख सकता। उसे पूरे कमरे की आवाज़ों को सुनना होगा, शोर को गिनना होगा और प्रतिशत की गणना करनी होगी।

TEXT2DISTBENCH AI के लिए इस "भीड़ को सुनने" के कौशल का अभ्यास करने के लिए एक जिम है।

उन्होंने टेस्ट कैसे बनाया (रेसिपी)

शोधकर्ताओं ने केवल काल्पनिक प्रश्न नहीं बनाए। उन्होंने एक रोबोट फैक्ट्री बनाई जो स्वचालित रूप से टेस्ट बनाती है, ताकि AI अपने ट्रेनिंग डेटा से उत्तरों को रटकर नकल न कर सके।

  1. एक ताज़ा लक्ष्य चुनें: वे बिल्कुल नई फिल्में और गाने चुनते हैं जो AI के प्रशिक्षित होने के बाद आए हैं। यह एक छात्र को उस गणित की समस्या पर टेस्ट करने जैसा है जिसे उसने पिछले साल रटा नहीं है, बल्कि जो उसने पहले कभी नहीं देखी है।
  2. भीड़ इकट्ठा करें: वे इन नई फिल्मों और गानों के बारे में हजारों असली YouTube कमेंट्स एकत्र करते हैं।
  3. शोर को लेबल करें: वे हर एक कमेंट को पढ़ने और टैग करने के लिए अन्य AI का उपयोग करते हैं। क्या कमेंट सकारात्मक (Positive) है या नकारात्मक (Negative)? क्या यह अभिनय (Acting) के बारे में है, कहानी (Story) के बारे में है, या संगीत (Music) के बारे में है?
  4. प्रश्न बनाएं: अब वे टेस्ट AI से ऐसे प्रश्न पूछते हैं जैसे:
    • "कितने % लोगों को अभिनय पसंद आया?" (अनुमान - Estimation)
    • "सबसे अधिक चर्चा वाला विषय क्या है?" (सर्वाधिक बार - Most Frequent)
    • "दूसरा सबसे अधिक चर्चा वाला विषय क्या है?" (द्वितीय बार - Second Frequent)

उन्हें क्या मिला (परिणाम)

जब उन्होंने शीर्ष AI मॉडल्स को इस टेस्ट के माध्यम से परखा, तो यहाँ क्या हुआ:

  • AI बेहतर हो रहा है, लेकिन यह पूर्ण नहीं है: AI ने रैंडम अनुमान लगाने (जैसे एक बंदर द्वारा तीर फेंकना) से कहीं बेहतर प्रदर्शन किया, लेकिन वे अभी भी कठिन हिस्सों में संघर्ष कर रहे हैं।
  • "आसान" बनाम "कठिन" भीड़:
    • आसान: AI यह बताने में अच्छा है कि "मुख्य भावना" क्या है? (जैसे, "अधिकांश लोगों को यह पसंद आया")।
    • कठिन: AI भ्रमित हो जाता है जब उससे पूछा जाता है, "दूसरी सबसे आम भावना क्या है?" या जब उसे दो विचारों को जोड़ना होता है (जैसे, "कितने लोगों को अभिनय पसंद आया लेकिन कहानी से नफरत हुई?")। यह एक शोर भरे कमरे में एक विशिष्ट बातचीत को सुनने के साथ-साथ यह गिनने जैसा है कि कितने लोगों ने लाल टोपी पहनी है।
  • "अंतर्ज्ञान" (Gut Feeling) का कारक: शोधकर्ताओं ने कुछ दिलचस्प पाया। भले ही उन्होंने सभी कमेंट्स हटा दिए हों और AI को केवल फिल्म का शीर्षक और रिलीज की तारीख दी हो, फिर भी AI भीड़ की राय का अनुमान आश्चर्यजनक रूप से अच्छी तरह से लगा सका!
    • उपमा: यह बिना लोगों को सुने, बस यह देखकर कि वे सभी टक्सीडो पहने हुए हैं, कमरे में प्रवेश करने जैसा है और यह अनुमान लगाना कि, "ओह, यह शायद एक औपचारिक, खुशी का कार्यक्रम है।" AI अपने सामान्य ज्ञान का उपयोग एक "पूर्वाग्रह" (prior belief) बनाने के लिए करता है, और फिर कमेंट्स उस पूर्वाग्रह को परिष्कृत करने में मदद करते हैं।

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि जबकि AI तथ्य खोजने में महान है, वह अभी भी मानवीय राय के रुझानों (human opinion trends) को समझने के लिए सीख रहा है।

वास्तविक दुनिया में, व्यवसाय और सरकारें केवल यह नहीं जानना चाहतीं कि "क्या हुआ?" वे यह जानना चाहती हैं कि "जो हुआ उसके बारे में लोग कैसा महसूस कर रहे हैं?" और "सूक्ष्म रुझान क्या हैं?"

TEXT2DISTBENCH यह सुनिश्चित करने के लिए एक उपकरण है कि AI "माहौल को पढ़ना" सीख जाए, ताकि जब हम उससे जनमत का विश्लेषण करने के लिए कहें, तो वह हमें केवल एक तथ्य न दे—बल्कि वह भीड़ के बारे में सच बताए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →