← नवीनतम पेपर
💬 NLP

Using Deep Learning to Generate Semantically Correct Hindi Captions

यह शोध एक डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है जो Flickr8k डेटासेट से अर्थपूर्ण रूप से सटीक हिंदी इमेज कैप्शन उत्पन्न करने के लिए प्री-ट्रेंड CNN (विशेष रूप से VGG16), अटेंशन मैकेनिज्म और बिडायरेक्शनल LSTM को संयोजित करता है, जिससे BLEU-1 और BLEU-4 स्कोर क्रमशः 0.59 और 0.19 के साथ सर्वश्रेष्ठ प्रदर्शन प्राप्त होता है।

मूल लेखक: Wasim Akram Khan, Anil Kumar Vuppala

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wasim Akram Khan, Anil Kumar Vuppala

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक ऐसा कैमरा है जो दुनिया की किसी भी चीज़ की तस्वीर ले सकता है, लेकिन वह पूरी तरह से मौन है। वह एक गेंद का पीछा करते हुए कुत्ते को देख सकता है, लेकिन वह आपको यह नहीं बता सकता कि, "देखो, पार्क में एक गोल्डन रिट्रीवर लाल गेंद का पीछा कर रहा है।" अब, कल्पना कीजिए कि आप इस कैमरे को हिंदी बोलना सिखाना चाहते हैं, जो करोड़ों लोगों द्वारा बोली जाने वाली भाषा है, लेकिन कैमरा केवल अंग्रेजी जानता है।

यह शोध पत्र उस मूक कैमरे को धाराप्रवाह और सटीक हिंदी बोलने के लिए प्रशिक्षित करने के बारे में है। लेखकों, वसीम अकरम खान और अनिल कुमार वुप्पला ने एक डिजिटल मस्तिष्क बनाया जो एक फोटो को देखता है और उसका वर्णन करते हुए हिंदी में एक वाक्य लिखता है।

यहाँ इस कहानी का विवरण दिया गया है कि उन्होंने इसे कैसे किया, जिसे सरल रूपकों और रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है।

1. बड़ी समस्या: भाषा का अंतर

सोचिए कि इंटरनेट एक विशाल पुस्तकालय है। अधिकांश किताबों (चित्रों) के विवरण अंग्रेजी में लिखे गए हैं। लेकिन उन 500 मिलियन लोगों का क्या जो हिंदी बोलते हैं? उन्हें अक्सर बाहर छोड़ दिया जाता है क्योंकि हिंदी विवरणों के साथ बहुत कम "पुस्तकें" (डेटासेट) उपलब्ध हैं।

शोधकर्ताओं ने इस अंतर को भरने का लक्ष्य रखा। उन्होंने पूछा: "क्या हम आर्टिफिशियल इंटेलिजेंस का उपयोग करके एक तस्वीर देख सकते हैं और उसके बारे में एक सटीक हिंदी वाक्य लिख सकते हैं?"

2. रेसिपी: "शेफ और अनुवादक"

इसे हल करने के लिए, उन्होंने एक सिस्टम बनाया जिसे एन्कोडर-डिकोडर (Encoder-Decoder) कहा जाता है। इसे एक रसोई में दो-सदस्यीय टीम की तरह समझें:

  • शेफ (इमेज एन्कोडर): यह वह हिस्सा है जो फोटो को देखता है। यह बोलता नहीं है; यह केवल देखता है। यह एक "सुपर-आंख" (एक प्री-ट्रेंड कंप्यूटर विजन मॉडल जैसे VGG16) का उपयोग करता है ताकि छवि को सामग्रियों में तोड़ सके: कुत्ता, गेंद, घास, दौड़ना।
  • अनुवादक (टेक्स्ट डिकोडर): यह वह हिस्सा है जो वाक्य लिखता है। यह शेफ से सामग्रियां लेता है और उन्हें एक हिंदी वाक्य में बदल देता है।

चुनौती: यदि शेफ अनुवादक को केवल सामग्रियों की एक सूची थमा देता है, तो अनुवादक एक उबाऊ वाक्य लिख सकता है जैसे "कुत्ता। गेंद। घास।" शोधकर्ताओं को चाहिए था कि अनुवादक छवि की केवल वस्तुओं को ही नहीं, बल्कि उस छवि की कहानी को भी समझे।

3. गुप्त नुस्खा: "स्पॉटलाइट" (अटेंशन मैकेनिज्म)

यह उनके काम का सबसे चतुर हिस्सा है। कल्पना कीजिए कि आप एक आदमी की पहाड़ पर चढ़ने की फोटो का वर्णन कर रहे हैं।

  • स्पॉटलाइट के बिना: अनुवादक भ्रमित हो सकता है। वह "आदमी," "पहाड़," और "बादल" देखता है। वह लिख सकता है, "एक आदमी बादल पर खड़ा है।"
  • स्पॉटलाइट के साथ (अटेंशन मैकेनिज्म): शोधकर्ताओं ने एक विशेष परत जोड़ी जिसे अटेंशन (Attention) कहा जाता है। इसे एक स्पॉटलाइट की तरह समझें जो अनुवादक के शब्द लिखने के ठीक उसी क्षण छवि के सबसे महत्वपूर्ण हिस्से पर रोशनी डालती है।
    • जब "आदमी" लिख रहा हो, तो स्पॉटलाइट व्यक्ति पर चमकती है।
    • जब "चढ़ना" लिख रहा हो, तो स्पॉटलाइट आदमी के हाथों और रस्सी पर चमकती है।
    • जब "पहाड़" लिख रहा हो, तो स्पॉटलाइट पथरीले बैकग्राउंड पर चमकती है।

यह सुनिश्चित करता है कि वाक्य अर्थपूर्ण हो और स्वाभाविक रूप से बहे, न कि केवल यादृच्छिक वस्तुओं की सूची मात्र हो।

4. प्रशिक्षण: एक "अनुवाद मशीन" से सीखना

शोधकर्ताओं को एक समस्या का सामना करना पड़ा: उनके पास मूल (native) हिंदी विवरणों के साथ 8,000 तस्वीरें नहीं थीं। उनके पास केवल अंग्रेजी विवरणों के साथ 8,000 तस्वीरें थीं (Flickr8k नामक एक डेटासेट से)।

इसलिए, उन्होंने एक डिजिटल अनुवादक (Google Cloud Translator) का उपयोग करके अंग्रेजी विवरणों को हिंदी में बदला।

  • उपमा: कल्पना कीजिए कि आप इतालवी खाना बनाना सीखने की कोशिश कर रहे हैं, लेकिन आपके पास केवल अंग्रेजी में लिखी हुई कुकबुक है। आप रेसिपी को इतालसीय में बदलने के लिए एक ट्रांसलेशन ऐप का उपयोग करते हैं। रेसिपी शायद एकदम सही न हो, लेकिन वे शुरुआत करने के लिए पर्याप्त हैं।
  • उन्होंने इन "मशीन-अनुवादित" हिंदी वाक्यों को अपने AI मॉडल को हिंदी बोलना सिखाने के लिए फीड किया।

5. प्रयोग: विभिन्न "मस्तिष्क" का परीक्षण करना

शोधकर्ताओं ने केवल यह अनुमान नहीं लगाया कि कौन सा "शेफ" या "अनुवादक" सबसे अच्छा है। उन्होंने कई प्रयोग किए, जैसे एक वैज्ञानिक कार के अलग-अलग इंजन का परीक्षण करता है:

  • इंजन A (LSTM): एक बुनियादी अनुवादक।
  • इंजन B (Bi-LSTM): एक अनुवादक जो संदर्भ को बेहतर ढंग से समझने के लिए वाक्य को आगे और पीछे दोनों दिशाओं में पढ़ता है।
  • इंजन C (Att-BiLSTM): वह अनुवादक जिसमें स्पॉटलाइट (Attention) को पीछे की ओर पढ़ने वाले इंजन के साथ जोड़ा गया है।

उन्होंने यह देखने के लिए अलग-अलग "सुपर-आंखों" (VGG16, ResNet50, InceptionV3) का भी परीक्षण किया कि कौन सा एक छवि के विवरण को सबसे अच्छी तरह देखता है।

6. परिणाम: कौन जीता?

उन्होंने सफलता को मापने के लिए BLEU नामक एक स्कोर का उपयोग किया। इसे एक "व्याकरण और प्रवाह परीक्षण" की तरह समझें।

  • कम स्कोर: वाक्य निरर्थक है या शब्द गायब हैं।
  • उच्च स्कोर: वाक्य ऐसा लगता है जैसे किसी इंसान ने लिखा हो।

विजेता: VGG16 सुपर-आंख + Bi-LSTM अनुवादक + स्पॉटलाइट (Attention) का संयोजन दौड़ जीत गया।

  • इसने 0.59 का स्कोर प्राप्त किया (जो इस प्रकार के कार्य के लिए बहुत अच्छा माना जाता है)।
  • इसके द्वारा उत्पन्न वाक्य केवल शब्दों की सूची नहीं थे; वे "एक लड़का सड़क पर चल रहा है" जैसे पूर्ण, अर्थपूर्ण वाक्य थे, न कि केवल "लड़का सड़क"।

यह क्यों मायने रखता है?

यह केवल एक कूल ऐप बनाने के बारे में नहीं है। इसके वास्तविक दुनिया के उपयोग हैं:

  • दृष्टिबाधित लोगों की मदद करना: कल्पना कीजिए कि एक दृष्टिबाधित व्यक्ति अपने फोन को सड़क के दृश्य की ओर करता है। यह तकनीक तुरंत उन्हें उनकी मातृभाषा हिंदी में बता सकती है, "एक बस आ रही है।"
  • आपदा प्रबंधन: यदि उपग्रह बाढ़ देखता है, तो यह AI तुरंत स्थानीय अधिकारियों को हिंदी में दृश्य का वर्णन कर सकता है, जिससे उन्हें तेजी से प्रतिक्रिया करने में मदद मिल सकती है।
  • सोशल मीडिया: यह सोशल मीडिया पर लाखों तस्वीरों को व्यवस्थित करने में मदद करता है ताकि लोग अपनी भाषा में उन्हें खोज सकें।

मुख्य निष्कर्ष

शोधकर्ताओं ने सफलतापूर्वक दृश्य दुनिया और हिंदी भाषा के बीच एक सेतु का निर्माण किया। उन्होंने साबित किया कि भले ही आप अपूर्ण, मशीन-अनुवादित डेटा से शुरुआत करें, आप एक स्मार्ट AI को सिमेंटिक रूप से सही (semantically correct) (अर्थपूर्ण और सटीक) हिंदी कैप्शन जेनरेट करने के लिए प्रशिक्षित कर सकते हैं।

उन्होंने केवल एक अनुवादक नहीं बनाया; उन्होंने एक कहानीकार बनाया जो एक तस्वीर देख सकता है और हिंदी में एक कहानी सुना सकता है, जिससे लाखों नए लोगों के लिए दृश्य दुनिया खुल जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →