← नवीनतम पेपर
💬 NLP

ReFRAME or Remain: Unsupervised Lexical Semantic Change Detection with Frame Semantics

यह शोध पत्र ReFRAME को प्रस्तुत करता है, जो फ्रेम सिमेंटिक्स (frame semantics) पर आधारित एक अनसुपरवाइज्ड लेक्सिकल सिमेंटिक चेंज डिटेक्शन विधि है, जो न्यूरल एम्बेडिंग मॉडल्स का एक अत्यधिक व्याख्यात्मक विकल्प प्रदान करती है और प्रतिस्पर्धी या बेहतर प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Bach Phan-Tat, Kris Heylen, Dirk Geeraerts, Stefano De Pascale, Dirk Speelman

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bach Phan-Tat, Kris Heylen, Dirk Geeraerts, Stefano De Pascale, Dirk Speelman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

शब्द स्थिर वस्तुएं नहीं हैं; वे जीवित चीजें हैं जो उन लोगों के साथ बढ़ती, बदलती और अनुकूलित होती हैं जो उनका उपयोग करते हैं। भाषा के अध्ययन में, इस प्रक्रिया को 'सिमेंटिक चेंज' (अर्थगत परिवर्तन) के रूप में जाना जाता है। दशकों से, वैज्ञानिक कंप्यूटरों का उपयोग करके इन बदलावों को ट्रैक करने की कोशिश कर रहे हैं, जो अक्सर शब्दों के साथ उनके बदलते परिवेश को देखने के लिए टेक्स्ट के विशाल डेटाबेस पर निर्भर करते हैं। प्रचलित विचार यह है कि यदि कोई शब्द विभिन्न युगों में अलग-अलग प्रकार के शब्दों के पास दिखाई देता है, तो संभवतः उसका अर्थ विकसित हुआ है। आधुनिक कंप्यूटर प्रोग्राम इन पैटर्न को पहचानने में बहुत कुशल हैं, लेकिन वे अक्सर एक 'ब्लैक बॉक्स' की तरह काम करते हैं: वे आपको बता सकते हैं कि एक परिवर्तन हुआ है, लेकिन वे आसानी से यह नहीं समझा सकते कि क्यों हुआ या इसके पीछे के विशिष्ट कारण क्या थे। इसका परिणाम एक सही उत्तर होता है जो अपारदर्शी महसूस होता है, जिससे शोधकर्ता अर्थ के रूपांतरण की वास्तविक कार्यप्रणाली को समझने के लिए एक स्पष्ट खिड़की से वंचित रह जाते हैं।

केयू लूवेन (KU Leuven) और अन्य संस्थानों के भाषाविदों और कंप्यूटर वैज्ञानिकों की एक टीम ने एक अलग रास्ता अपनाने का निर्णय लिया। कंप्यूटर से केवल सांख्यिकीय पैटर्न के आधार पर किसी शब्द के अर्थ का अनुमान लगाने के बजाय, उन्होंने उससे उन विशिष्ट स्थितियों, या "फ्रेम्स" (frames) को देखने के लिए कहा, जिनमें उस शब्द का उपयोग किया जाता है। यह दृष्टिकोण 'फ्रेम सिमेंटिक्स' नामक एक सिद्धांत पर आधारित है, जो यह सुझाव देता है कि हम शब्दों को अलगाव में नहीं, बल्कि उन मानसिक दृश्यों के माध्यम से समझते हैं जिन्हें वे जागृत करते हैं। जब आप "खरीदना" (buy) शब्द सुनते हैं, तो आपका मन स्वतः ही एक खरीदार, एक विक्रेता, सामान और पैसे से जुड़े एक दृश्य की रचना करता है। जब आप "बेचना" (sell) सुनते हैं, तो दृश्य वही होता है, लेकिन परिप्रेक्ष्य विक्रेता की ओर झुक जाता है। शोधकर्ताओं ने परिकल्पना की कि यदि समय के साथ किसी शब्द का अर्थ बदलता है, तो उन दृश्यों के प्रकार भी बदलने चाहिए जिनमें वह शब्द भाग लेता है। छिपे हुए गणितीय पैटर्न पर निर्भर रहने के बजाय, वे इन स्पष्ट, संरचित दृश्यों का उपयोग एक पारदर्शी संकेत के रूप में करना चाहते थे ताकि यह पता लगाया जा सके कि कब किसी शब्द ने अपना स्वरूप बदला है।

इस विचार का परीक्षण करने के लिए, टीम ने अंग्रेजी भाषा पर ध्यान केंद्रित किया, जिसमें टेक्स्ट के एक बड़े संग्रह को दो विशिष्ट समय अवधियों में विभाजित किया गया: 19वीं शताब्दी के मध्य और 20वीं शताब्दी के अंत में। उन्होंने उन शब्दों की एक सूची चुनी जिनका अर्थ बदला हुआ ज्ञात था और उन शब्दों वाले प्रत्येक वाक्य का विश्लेषण करने के लिए एक कंप्यूटर प्रोग्राम का उपयोग किया। प्रोग्राम ने केवल यह नहीं गिना कि शब्द कितनी बार एक साथ आए; इसने यह भी पहचाना कि प्रत्येक वाक्य किस विशिष्ट वैचारिक फ्रेम (conceptual frame) से संबंधित था। उदाहरण के लिए, इसने निर्धारित किया कि "प्लेन" (plane) शब्द वाला वाक्य विमान के उड़ान भरने के बारे में था या ज्यामिति में एक समतल सतह के बारे में। इन दो समय अवधियों के बीच इन विभिन्न फ्रेम्स की आवृत्ति की तुलना करके, शोधकर्ता यह माप सके कि शब्द के उपयोग में कितना बदलाव आया था। उन्होंने एक स्कोर की गणना की कि एक युग से दूसरे युग में इन दृश्यों का वितरण कितना भिन्न था।

परिणाम आश्चर्यजनक रूप से सशक्त थे। यह विधि, जो पूरी तरह से इन स्पष्ट फ्रेम्स पर आधारित थी, उन कई उन्नत कंप्यूटर मॉडलों से बेहतर प्रदर्शन करती है जो जटिल, छिपे हुए गणितीय निरूपणों का उपयोग करते हैं। वास्तव में, उनकी प्रणाली एक प्रमुख अंतर्राष्ट्रीय प्रतियोगिता में शीर्ष प्रदर्शन करने वालों में शामिल रही, जिसे ठीक इसी तरह के कार्य का परीक्षण करने के लिए डिज़ाइन किया गया था। इससे भी महत्वपूर्ण बात यह है कि क्योंकि यह विधि स्पष्ट, मानव-समझने योग्य श्रेणियों पर निर्मित थी, शोधकर्ता परिणामों के भीतर देख सकते थे और सटीक रूप से देख सकते थे कि क्या बदला था। वे एक विशिष्ट शब्द की ओर इशारा कर सकते थे और कह सकते थे, "यह शब्द इसलिए बदला क्योंकि यह यात्रा और वाणिज्य के दृश्यों में दिखाई देने लगा, जबकि यह माप के दृश्यों में दिखाई देना बंद हो गया।" विवरण का यह स्तर वह है जिसे अधिक शक्तिशाली, लेकिन अपारदर्शी मॉडल अक्सर प्रदान नहीं कर पाते।

टीम ने अपनी सफलता की कार्यप्रणाली को समझने के लिए विशिष्ट उदाहरणों का परीक्षण किया। उन्होंने "प्रॉप" (prop) शब्द को देखा, जो 19वीं शताब्दी में मुख्य रूप से भौतिक सहायता या पारिवारिक स्थिरता से संबंधित संदर्भों में उपयोग किया जाता था। 20वीं शताब्दी के अंत तक, यह शब्द थिएटर और प्रदर्शन से संबंधित दृश्यों में बार-बार दिखाई देने लगा, जहाँ यह अभिनेताओं द्वारा उपयोग की जाने वाली वस्तुओं को संदर्भित करता था। कंप्यूटर ने इस बदलाव को पुराने फ्रेम्स के लुप्त होने और नए फ्रेम्स के उनके स्थान लेने को नोटिस करके पकड़ा। उन्होंने "ट्री" (tree/पेड़) शब्द को भी देखा, जिसने अपने फ्रेम उपयोग में बहुत कम परिवर्तन दिखाया, जिससे इसे एक स्थिर शब्द के रूप में सही ढंग से पहचाना गया। हालांकि, इस विधि ने अपनी सीमाएं भी प्रकट कीं। "क्विल्ट" (quilt/रजाई) शब्द के लिए, कंप्यूटर ने एक बड़ा बदलाव पाया क्योंकि यह शब्द कई नए भौतिक संदर्भों में दिखाई दिया, जैसे कि उसे मोड़ना या बिछाना, भले ही वस्तु का मूल अर्थ वास्तव में नहीं बदला था। इसने दिखाया कि हालांकि यह विधि उपयोग में बदलाव को पकड़ने में उत्कृष्ट है, लेकिन यह कभी-कभी संदर्भ में बदलाव को अर्थ में बदलाव समझ सकती है।

इन मामूली सीमाओं के बावजूद, यह अध्ययन दर्शाता है कि स्पष्ट भाषाई ज्ञान भाषा के विकास को समझने के लिए एक शक्तिशाली उपकरण हो सकता है। शोधकर्ताओं का उद्देश्य सबसे तेज़ या सबसे जटिल प्रणाली बनाना नहीं था, बल्कि एक ऐसी प्रणाली बनाना था जो स्पष्ट और व्याख्या योग्य हो। उन्होंने पाया कि संरचित दृश्यों पर ध्यान केंद्रित करके, वे न केवल उच्च सटीकता के साथ अर्थगत परिवर्तन का पता लगा सकते थे, बल्कि उस परिवर्तन की प्रकृति को सरल शब्दों में समझा भी सकते थे। यह दृष्टिकोण आधुनिक कृत्रिम बुद्धिमत्ता की कच्ची शक्ति और मानवीय भाषा की सूक्ष्म समझ के बीच के अंतर को पाटने का एक तरीका प्रदान करता है, जो यह सिद्ध करता है कि कभी-कभी, किसी शब्द के उपयोग के विशिष्ट विवरणों को देखना एक छिपे हुए गणितीय अनुमान पर भरोसा करने की तुलना में अधिक खुलासा करने वाला होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →