← नवीनतम पेपर
💬 NLP

Building a Multimodal Dataset of Academic Paper for Keyword Extraction

यह अध्ययन टेक्स्ट, इमेज और ऑडियो युक्त 1,000 शैक्षणिक शोध पत्रों का एक नया डेटासेट बनाकर कीवर्ड निष्कर्षण (keyword extraction) के लिए मल्टीमॉडल संसाधनों की कमी को संबोधित करता है, जो यह प्रदर्शित करता है कि इन विविध मोडैलिटीज से जानकारी को मिलाना केवल टेक्स्ट का उपयोग करने की तुलना में निष्कर्षण प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Jingyu Zhang, Xinyi Yan, Yi Xiang, Yingyi Zhang, Chengzhi Zhang

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingyu Zhang, Xinyi Yan, Yi Xiang, Yingyi Zhang, Chengzhi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल रेसिपी बुक में सबसे महत्वपूर्ण सामग्रियों को खोजने की कोशिश कर रहे हैं। आमतौर पर, जब लोग मुख्य सामग्रियों (जिन्हें शोधकर्ता "कीवर्ड्स" कहते हैं) को चुनने की कोशिश करते हैं, तो वे केवल रेसिपी के लिखित पाठ को ही पढ़ते हैं। वे तैयार व्यंजन की तस्वीरों या शेफ द्वारा चरणों को समझाने वाली ऑडियो रिकॉर्डिंग को अनदेखा कर देते हैं।

यह पेपर तर्क देता है कि तस्वीरों और ऑडियो को अनदेखा करके, हम बहुत सारा स्वाद खो रहे हैं। लेखकों ने यह परीक्षण करने के लिए एक नया "किचन" (एक डेटासेट) बनाया कि क्या पूरे भोजन को देखना—टेक्स्ट, इमेज और ऑडियो को एक साथ—हमें मुख्य सामग्रियों को बेहतर ढंग से पहचानने में मदद करता है।

यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या किया और उन्हें क्या मिला:

1. समस्या: एकतरफा बातचीत

लंबे समय से, कंप्यूटर कीवर्ड खोजने के लिए टेक्स्ट पढ़ने में बहुत अच्छे रहे हैं। लेकिन वास्तविक दुनिया में, जानकारी केवल टेक्स्ट नहीं होती। यह एक मिश्रण है:

  • टेक्स्ट: पन्ने पर लिखे वास्तविक शब्द।
  • इमेज: स्लाइड्स, चार्ट और तस्वीरें।
  • ऑडियो: वक्ता के बोलने की आवाज़।

लेखक कहते हैं कि केवल "टेक्स्ट" वाले हिस्से को सुनकर, हम तस्वीरों और आवाज़ में छिपे सुरागों को खो देते हैं। इसके अलावा, वास्तव में ऐसा कोई "रेसिपी बुक" उपलब्ध नहीं था जिसमें इन तीनों चीजों को शोधकर्ताओं के अध्ययन के लिए एक साथ व्यवस्थित किया गया हो।

2. समाधान: एक नई "रेसिपी बुक" बनाना

इसे ठीक करने के लिए, टीम ने एक नया डेटासेट बनाया जिसे मल्टीमॉडल डेटासेट (Multimodal Dataset) कहा जाता है।

  • इसके अंदर क्या है? उन्होंने अकादमिक सम्मेलनों (academic conferences) से 1,000 नमूने एकत्र किए।
  • सामग्रियाँ: प्रत्येक नमूने के लिए, उन्होंने एकत्र किया:
    1. लिखित पेपर (टेक्स्ट)।
    2. प्रेजेंटेशन स्लाइड्स (इमेज)।
    3. वक्ता की रिकॉर्डिंग (ऑडियो)।
    4. कीवर्ड्स की वह सूची जो लेखकों ने मूल रूप से चुनी थी (एक "उत्तर कुंजी")।

इसे इस तरह समझें जैसे आप एक स्टडी गाइड बना रहे हैं जहाँ हर पन्ने पर निबंध, आरेख और शिक्षक द्वारा उसे समझाने की रिकॉर्डिंग, सब कुछ पूरी तरह से सिंक (sync) किया हुआ है।

3. प्रयोग: टेस्ट टेस्ट (स्वाद परीक्षण)

एक बार जब उनके पास यह डेटासेट आ गया, तो उन्होंने यह देखने के लिए विभिन्न कंप्यूटर प्रोग्रामों (मॉडल्स) का उपयोग करके एक "टेस्ट टेस्ट" चलाया कि कौन सी विधि कीवर्ड्स को सबसे अच्छी तरह खोज सकती है। उन्होंने तीन परिदृश्य (scenarios) टेस्ट किए:

  1. केवल टेक्स्ट वाला आहार (The Text-Only Diet): कंप्यूटर को केवल लिखित पेपर खिलाना।
  2. ऑडियो और इमेज वाला आहार: केवल ऑडियो से ट्रांसक्राइब किया गया टेक्स्ट या इमेज से पहचाना गया टेक्स्ट (OCR का उपयोग करके, जो एक रोबोट द्वारा साइन पढ़ने जैसा है) फीड करना।
  3. बुफे (The Buffet): तीनों टेक्स्ट स्रोतों के मिश्रण को मिलाकर कंप्यूटर को खिलाना।

4. परिणाम: क्या सबसे अच्छा काम कर गया?

इस "टेस्ट टेस्ट" ने क्या खुलासा किया:

  • लिखित पेपर ही असली स्टार है: वास्तविक अकादमिक पेपर्स का टेक्स्ट सबसे विश्वसनीय स्रोत था। इसमें सबसे समृद्ध जानकारी थी, इसलिए कंप्यूटर ने यहाँ कीवर्ड्स खोजने में सबसे अच्छा काम किया।
  • ऑडियो एक अच्छा साइड डिश है: वक्ता की आवाज़ से ट्रांसक्राइब किया गया टेक्स्ट मददगार था, हालांकि यह लिखित पेपर जितना अच्छा नहीं था।
  • इमेज एक पेचीदा हिस्सा है: स्लाइड्स (इमेज) से निकाला गया टेक्स्ट सबसे खराब प्रदर्शन करने वाला था। लेखक बताते हैं कि यह एक धुंधले, मुड़े हुए नैपकिन पर लिखे मेनू को पढ़ने जैसा है; कंप्यूटर अक्सर बैकग्राउंड शोर या खराब रोशनी के कारण भ्रमित हो जाता था, जिससे टेक्स्ट पढ़ना कठिन हो जाता था।
  • बुफे की शक्ति (फ्यूजन): सबसे बड़ी खोज यह थी कि तीनों स्रोतों को मिलाना केवल एक का उपयोग करने से बेहतर काम करता था। भले ही इमेज का टेक्स्ट अव्यवस्थित था, लेकिन जब कंप्यूटर ने पेपर, ऑडियो और इमेज टेक्स्ट तीनों को एक साथ देखा, तो वह कमियों को भरने में सक्षम था। यदि कोई कीवर्ड पेपर में गायब था लेकिन ऑडियो में उल्लेखित था, तो "बुफे" पद्धति ने उसे पकड़ लिया।

5. निष्कर्ष (The Takeaway)

इस पेपर का मुख्य सबक यह है कि जबकि लिखित टेक्स्ट सबसे महत्वपूर्ण सामग्री है, प्रेजेंटेशन के अन्य हिस्सों (आवाज़ और स्लाइड्स) को अनदेखा करना जानकारी को हाथ से जाने देने जैसा है।

इस नए डेटासेट को बनाकर और यह सिद्ध करके कि अलग-अलग प्रकार की जानकारी को एक साथ मिलाने से कीवर्ड खोजने की कंप्यूटर की क्षमता में सुधार होता है, लेखकों ने शोधकर्ताओं को एक नया उपकरण दिया है। यह अंधेरे में रेसिपी पढ़ने के बजाय टॉर्च, व्यंजन की तस्वीर और शेफ की रिकॉर्डिंग के साथ पढ़ने के अपग्रेड जैसा है।

संक्षेप में: उन्होंने मिश्रित मीडिया वाले अकादमिक पेपर्स का एक नया पुस्तकालय बनाया और साबित किया कि जब कंप्यूटर टेक्स्ट पढ़ता है, ऑडियो सुनता है और स्लाइड्स को देखता है, तो उन्हें बहुत स्पष्ट तस्वीर मिलती है कि वास्तव में उस पेपर के बारे में क्या है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →