← नवीनतम पेपर
💬 NLP

Do BERT Embeddings Encode Narrative Dimensions? A Token-Level Probing Analysis of Time, Space, Causality, and Character in Fiction

यह अध्ययन प्रदर्शित करता है कि BERT एम्बेडिंग्स फिक्शन (कथा साहित्य) में समय, स्थान, कार्य-कारणता और पात्रों के संबंध में अर्थपूर्ण टोकन-स्तरीय जानकारी को एनकोड करती हैं, जैसा कि एक उच्च-सटीकता वाले लीनियर प्रोब द्वारा प्रमाणित होता है जो रैंडम बेसलाइन से काफी बेहतर प्रदर्शन करता है, हालांकि आयाम विविक्त रूप से विभाज्य नहीं हैं और "बाउंड्री लीकेज" से ग्रस्त हैं जहाँ दुर्लभ श्रेणियों को अक्सर "अन्य" के रूप में गलत वर्गीकृत किया जाता है।

मूल लेखक: Beicheng Bei, Hannah Hyesun Chun, Chen Guo, Arwa Saghiri

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Beicheng Bei, Hannah Hyesun Chun, Chen Guo, Arwa Saghiri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक उपन्यास पढ़ना सिखा रहे हैं, जैसे कि प्राइड एंड प्रेजुडिस। आप यह जानना चाहते हैं कि क्या रोबोट केवल शब्दों को रट रहा है, या वह वास्तव में उन शब्दों के पीछे की कहानी को समझ रहा है। क्या वह जानता है कि पात्र कौन हैं? क्या वह समझता है कि चीजें कब होती हैं (समय), कहाँ होती हैं (स्थान), चीजें क्यों होती हैं (कारणता/causality), और कौन क्या कर रहा है?

यह शोध पत्र एक प्रसिद्ध AI मस्तिष्क, BERT के लिए एक "पॉप क्विज़" की तरह है। शोधकर्ताओं ने यह देखना चाहा कि क्या BERT ने लाखों किताबें पढ़ने के दौरान गुप्त रूप से कहानी के "कंकाल" (skeleton) को सीख लिया है, भले ही उसे स्पष्ट रूप से ऐसा करने के लिए कभी नहीं सिखाया गया था।

यहाँ उनके प्रयोग की कहानी है, जिसे सरल भागों में विभाजित किया गया है:

1. सेटअप: एक कहानी का मानचित्र बनाना

शोधकर्ताओं ने प्राइड एंड प्रेजुडिस के पहले पांच अध्यायों को शब्द-दर-शब्द (या "टोकन-दर-टोकन") में तोड़ा। उन्होंने एक स्मार्ट AI सहायक से हर एक शब्द को चार कहानी श्रेणियों में से एक के साथ लेबल करने में मदद करने के लिए कहा:

  • पात्र (Character): कौन शामिल है? (जैसे, "मिस्टर डार्सी," "वह")
  • समय (Time): यह कब हो रहा है? (जैसे, "कल," "अब")
  • स्थान (Space): यह कहाँ हो रहा है? (जैसे, "बगीचे में," "लंदन")
  • कारणता (Causality): यह क्यों हो रहा है? (जैसे, "क्योंकि," "इसलिए")
  • अन्य (Others): बाकी सब कुछ (क्रियाएं, विशेषण, यादृच्छिक शब्द)।

चुनौती: यह डेटासेट बहुत असंतुलित था। यह M&Ms के एक जार की तरह था जहाँ 70% पीले रंग के ("अन्य") थे, और बहुत ही कम संख्या में दुर्लभ रंग जैसे कि "कारणता" मौजूद थे।

2. परीक्षण: एक "लीनियर प्रोब" (Linear Probe)

यह देखने के लिए कि क्या BERT इन श्रेणियों को समझता है, शोधकर्ताओं ने AI को फिर से प्रशिक्षित नहीं किया। इसके बजाय, उन्होंने एक लीनियर प्रोब का उपयोग किया।

उपमा: कल्पना कीजिए कि BERT एक विशाल पुस्तकालय है जहाँ हर किताब को उसके अर्थ के आधार पर एक विशिष्ट स्थान पर रखा गया है। शोधकर्ता पुस्तकालय को पुनर्गठित नहीं करना चाहते थे; वे बस यह देखना चाहते थे कि क्या वे "समय" की किताबों को "स्थान" की किताबों से अलग करने के लिए एक मानचित्र पर एक सरल रेखा खींच सकते हैं।

  • उन्होंने BERT के आंतरिक "विचारों" (एम्बेडिंग्स) को एक सरल क्लासिफायर में डाला।
  • परिणाम: क्लासिफायर ने 94% सटीकता प्राप्त की।
  • नियंत्रण (Control): उन्होंने उसी परीक्षण को यादृच्छिक, अर्थहीन संख्याओं (जैसे टीवी पर दिखने वाले स्टैटिक शोर) के साथ आजमाया। वह क्लासिफायर केवल 47% तक पहुँचा (जो कि लगभग तुक्का लगाने जैसा था)।

निष्कर्ष: यह साबित करता है कि BERT के पास कहानी के तत्वों का एक छिपा हुआ मानचित्र है। यह केवल अनुमान नहीं लगा रहा है; यह वास्तव में एक पात्र और समय के सूचक के बीच के अंतर को जानता है।

3. गड़बड़ी: "बाउंड्री लीकेज" (Boundary Leakage)

हालाँकि परीक्षण काफी सफल रहा, शोधकर्ताओं ने एक मजेदार खामी पाई। जब AI भ्रमित होता था, तो वह "समय" को "स्थान" के साथ नहीं मिलाता था। इसके बजाय, वह लगभग हमेशा भ्रमित करने वाले शब्दों को "अन्य" के ढेर में डाल देता था।

उपमा: कल्पना कीजिए कि एक क्लब का बाउंसर है। यदि कोई व्यक्ति थोड़ा बहुत VIP (पात्र) जैसा दिखता है, या थोड़ा बहुत टिकट वाले अतिथि (समय) जैसा दिखता है, तो बाउंसर उसे अंदर जाने देता है। लेकिन अगर कोई अजीब टोपी पहनकर और सैंडविच पकड़े हुए आता है (एक दुर्लभ "कारणता" शब्द), तो बाउंसर कहता है, "मुझे नहीं पता कि तुम क्या हो, जाओ 'अन्य' वाली लाइन में लग जाओ।"

  • दुर्लभ कहानी तत्व (जैसे "क्योंकि" या "इसलिए") को अक्सर "सामान्य शब्द" के रूप में गलत लेबल किया गया था क्योंकि AI पूरी तरह से सुनिश्चित नहीं था।

4. डेटा का आकार: एक बिखरा हुआ बादल

शोधकर्ताओं ने यह देखने के लिए कि BERT इन कहानी तत्वों को कैसे व्यवस्थित करता है, क्लस्टरिंग (समान चीजों को समूहबद्ध करना) नामक तकनीक का उपयोग किया।

उपमा: यदि आप सभी "पात्र" शब्दों और "समय" शब्दों को एक विशाल 3D कोहरे में फेंक देते हैं, तो आप उम्मीद कर सकते हैं कि वे दो अलग-अलग, स्पष्ट द्वीपों के रूप में बनेंगे।

  • उन्होंने जो पाया: द्वीपों के बजाय, यह एक घूमते हुए, मिश्रित स्मूदी की तरह था। "पात्र" शब्द हर जगह थे, और "समय" के शब्द उनके साथ ही मिले हुए थे।
  • AI ने इन श्रेणियों को साफ-सुथरे, अलग बक्सों में नहीं रखा। वे आपस में बहुत अधिक ओवरलैप करते थे। यह सुझाव देता है कि कहानी को समझना अलग-अलग दराजों में रखने के बारे में नहीं है, बल्कि एक जटिल, मिश्रित समझ के बारे में है जहाँ सब कुछ आपस में जुड़ा होता है।

5. यह कठिन क्यों था?

शोधकर्ताओं ने महसूस किया कि दो मुख्य चीजों ने काम को कठिन बना दिया:

  1. एक शब्द बनाम कई शब्द: कुछ कहानी विचार केवल एक शब्द के होते हैं (जैसे "वह"), लेकिन अन्य पूरे वाक्यांश होते हैं (जैसे "आधी रात के बीच में")। AI लंबे वाक्यांशों के साथ अधिक संघर्ष करता था क्योंकि उसे यह तय करना था कि वाक्यांश का कौन सा हिस्सा "समय" है और कौन सा हिस्सा सिर्फ "स्थान भरने वाला" है।
  2. पुरानी अंग्रेजी: यह पुस्तक 1813 की है। उस समय लोग जिस तरह से बोलते थे वह आज से अलग था, जिसने कभी-कभी AI के पैटर्न को भ्रमित कर दिया।

मुख्य निष्कर्ष

क्या BERT ने कहानी सीखी? हाँ।
यह अध्ययन साबित करता है कि जब आप पर्याप्त टेक्स्ट पर एक AI को प्रशिक्षित करते हैं, तो वह स्वाभाविक रूप से एक नैरेटिव (कथा) के "कंकाल" को पकड़ लेता है। वह जानता है कि पात्र कौन हैं, चीजें कब होती हैं, और वे क्यों होती हैं।

हालाँकि, यह अपने ज्ञान को साफ-सुथरे, अलग-अलग फोल्डरों में संग्रहीत नहीं करता है। यह इसे एक जटिल, ओवरलैपिंग वेब के रूप में संग्रहीत करता है। AI स्पष्ट चीजों (जैसे नाम) को पहचानने में बहुत अच्छा है, लेकिन यह अभी भी दुर्लभ, पेचीदा संबंधों (जैसे "क्योंकि") पर थोड़ा धुंधला रहता है जब तक कि आप इसे बहुत अधिक मदद न दें।

भविष्य की योजनाएं: शोधकर्ता इस परीक्षण को अधिक आधुनिक किताबों पर करना चाहते हैं, यह देखना चाहते हैं कि AI की "परतें" (layers) कितनी गहरी हैं (जैसे प्याज के छिलके उतारना), और AI को उन पेचीदा, बहु-शब्द वाक्यांशों को बेहतर ढंग से संभालने के लिए सिखाने की कोशिश करना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →