← नवीनतम पेपर
🤖 AI

LLMbench: A Comparative Close Reading Workbench for Large Language Models

यह शोध पत्र LLMbench प्रस्तुत करता है, जो डिजिटल मानविकी (डिजिटल ह्यूमैनिटीज) के लिए डिज़ाइन किया गया एक ब्राउज़र-आधारित वर्कबेंच है, जो अद्वितीय विश्लेषणात्मक ओवरले और मोड के माध्यम से टोकन-स्तरीय लॉग-संभाव्यता (log-probabilities) और संभाव्य संरचनाओं को दृश्यमान बनाकर लार्ज लैंग्वेज मॉडल के आउटपुट के तुलनात्मक सूक्ष्म पठन (close reading) को सुगम बनाता है, जिससे उत्पन्न टेक्स्ट को इसकी प्रतितथ्यात्मक संभावनाओं (counterfactual possibilities) को प्रकट करने के लिए एक आलोचनात्मक शोध वस्तु के रूप में माना जाता है।

मूल लेखक: David M. Berry

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David M. Berry

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो अलग-अलग AI रोबोटों द्वारा लिखी गई एक कहानी पढ़ रहे हैं। आप दोनों से पूछते हैं, "इस पुरानी किताब के बारे में बताओ," और वे दोनों एक अनुच्छेद लिखते हैं। एक सामान्य पाठक के लिए, आपको पृष्ठ पर केवल अंतिम शब्द दिखाई देते हैं। लेकिन एक कंप्यूटर वैज्ञानिक के लिए, वे शब्द बर्फ के पहाड़ की केवल चोटी (tip of the iceberg) हैं।

यह शोध पत्र LLMbench प्रस्तुत करता है, जो एक विशेष डिजिटल "वर्कबेंच" (एक हाई-टेक माइक्रोस्कोप की तरह) है जो शोधकर्ताओं को यह देखने की अनुमति देता है कि AI कैसे लिखता है, इसके अंदरूनी हिस्से (under the hood) को। केवल कहानी पढ़ने के बजाय, यह आपको उन कहानियों के भूतों को देखने की अनुमति देता है जो लगभग घटित होने ही वाली थीं।

यहाँ इसका एक सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. मूल विचार: "वह रास्ता जो नहीं लिया गया" (The Road Not Taken)

जब एक AI एक वाक्य लिखता है, तो वह केवल अगला शब्द नहीं "जानता"। वास्तव में, वह एक भारित पासा (weighted dice) फेंक रहा होता है।

  • उपमा: कल्पना कीजिए कि आप एक रास्ते पर चल रहे हैं। हर कदम पर, AI रास्ते के मोड़ को देखता है। वह 10 अलग-अलग रास्ते देख सकता है। उनमें से 9 पथरीले और अनिश्चित हैं, लेकिन 1 बहुत स्पष्ट है। वह स्पष्ट वाले को चुन लेता है।
  • समस्या: अधिकांश उपकरण आपको केवल वही रास्ता दिखाते हैं जिसे AI ने चुना है। वे आपको उन 9 पथरीले रास्तों के बारे में नहीं बताते जिन्हें उसने अनदेखा कर दिया।
  • समाधान: LLMbench आपको सभी रास्ते दिखाता है। यह "संभाव्यता वितरण" (probability distribution) को प्रकट करता है—हर उस शब्द का मानचित्र जिसे AI ने विचार में लिया और प्रत्येक को चुनने की कितनी संभावना थी।

2. मुख्य विशेषता: अनिश्चितता का "हीट मैप" (Heat Map)

यह टूल दो AI प्रतिक्रियाओं को अगल-बगल रखता है (जैसे दो छात्रों के निबंधों की तुलना करना)। लेकिन यह एक विशेष "हीट मैप" ओवरले जोड़ता है।

  • उपमा: टेक्स्ट को एक सड़क के रूप में सोचें।
    • नीले/हरे क्षेत्र: AI 100% निश्चित था। वह एक पक्की हाईवे पर चल रहा था। "बिल्ली [मैट] पर बैठी है..." -> वह जानता था कि अगला शब्द "मैट" होगा।
    • लाल/नारंगी क्षेत्र: AI भ्रमित था या अनुमान लगा रहा था। वह एक ऐसे चौराहे पर खड़ा था जहाँ 50 अलग-अलग संकेत थे। "बिल्ली [?] पर बैठी है..." -> वह "मैट," "फर्श," "कुर्सी," "कालीन," और "सोफा" के बीच उलझा हुआ था।
  • यह क्यों महत्वपूर्ण है: यदि आप लाल धब्बा देखते हैं, तो इसका मतलब है कि AI वहां "पासा फेंक" (rolling the dice) रहा था। यदि आप नीला धब्बा देखते हैं, तो वह केवल एक तथ्य दोहरा रहा था। यह शोधकर्ताओं को यह खोजने में मदद करता है कि AI कहाँ रचनात्मक (या भ्रमित/hallucinating) हो रहा है और कहाँ वह केवल पैटर्न को दोहरा रहा है।

3. "टाइम मशीन" दृश्य (The "Time Machine" Views)

इस टूल में डेटा को देखने के विभिन्न तरीके हैं, जैसे किसी परिदृश्य को अलग-अलग कोणों से देखना:

  • स्पार्कलाइन (ग्राफ): एक टेढ़ी-मेढ़ी रेखा जो दिखाती है कि कहानी लिखते समय AI कितना "भ्रमित" था। ऊंचे शिखर (peaks) का अर्थ है कि AI निर्णय लेने में संघर्ष कर रहा था; सपाट रेखाएं मतलब वह सहजता से चल रहा था।
  • पिक्सेल मैप: रंगीन बिंदुओं का एक ग्रिड। यह हेलीकॉप्टर से शहर को देखने जैसा है। आप तुरंत देख सकते हैं कि निबंध के कौन से हिस्से "धुंधले" (अनिश्चित) थे और कौन से "स्पष्ट" थे।
  • 3D टेरेन (Terrain): कल्पना कीजिए कि टेक्स्ट एक पर्वत श्रृंखला है। समतल मैदान वे स्थान हैं जहाँ AI आश्वस्त था। ऊबड़-खाबड़, ऊंचे शिखर वे स्थान हैं जहाँ AI अनिश्चित था। आप इस 3D मानचित्र को AI की सोच के "आकार" को देखने के लिए घुमा सकते हैं।

4. दो रोबोटों की तुलना करना

यह टूल दो अलग-अलग AI (जैसे Gemini बनाम GPT-4) को एक ही प्रश्न का उत्तर देते हुए तुलना करने की अनुमति देता है।

  • उपमा: कल्पना कीजिए कि दो शेफ एक ही सूप बना रहे हैं।
    • शेफ A नमक के बारे में बहुत आश्वस्त है लेकिन जड़ी-बूटियों पर बेतहाशा अनुमान लगा रहा है।
    • शेफ B नमक के बारे में अनिश्चित है लेकिन जड़ी-बूटियों के बारे में बहुत आश्वस्त है।
    • LLMbench आपको ठीक से दिखाता है कि उनकी आश्वस्तता कहाँ भिन्न होती है। शायद एक शेफ एक महत्वपूर्ण शब्द पर "पासा फेंक" रहा है, जबकि दूसरा केवल एक रेसिपी का पालन कर रहा है।

5. हमें इसकी आवश्यकता क्यों है?

वर्तमान में, हम ज्यादातर AI को स्कोर (जैसे परीक्षा के ग्रेड) द्वारा या मनुष्यों से "कौन सा उत्तर बेहतर है?" पूछकर आंकते हैं।

  • शोध पत्र का तर्क: यह केवल अंतिम चित्र देखकर एक चित्रकार का न्याय करने जैसा है। LLMbench हमें ब्रशस्ट्रोक (brushstrokes) का अध्ययन करने की अनुमति देता है।
  • यह समझने में मदद करता है:
    • AI कहाँ झूठ बोल रहा है या अनुमान लगा रहा है।
    • AI कहाँ रचनात्मक हो रहा है।
    • कैसे AI का "व्यक्तित्व" (इसका प्रशिक्षण) उसके चुनाव करने के तरीके को बदल देता है।

सारांश

LLMbench एक ऐसा टूल है जो AI लेखन को एक "ब्लैक बॉक्स" (जहाँ हम केवल परिणाम देखते हैं) से बदलकर एक ग्लास बॉक्स (जहाँ हम गियर्स को घूमते हुए देख सकते हैं) में बदल देता है। यह AI के आउटपुट को केवल एक पूर्ण टेक्स्ट के रूप में नहीं, बल्कि एक मिलियन "क्या-होता-अगर" (what-ifs) के स्नैपशॉट के रूप में देखता है जो शब्द चुने जाने से ठीक पहले एक सेकंड के अंश में घटित हुए थे।

यह शोधकर्ताओं को यह कहने की अनुमति देता है: "आह, AI ने यह शब्द इसलिए नहीं चुना क्योंकि यह सबसे अच्छा था; इसने इसे इसलिए चुना क्योंकि पासा फेंकने के बाद मेज पर केवल यही एक विकल्प बचा था।" यह हमें AI को केवल एक उपकरण के रूप में नहीं, बल्कि एक जटिल, संभाव्य प्रणाली (probabilistic system) के रूप में समझने में मदद करता है जिसे हम वास्तव में पढ़ और आलोचना कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →