← नवीनतम पेपर
🤖 AI

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

यह शोध पत्र AutoViVQA प्रस्तुत करता है, जो वियतनामी विजुअल क्वेश्चन अनसरिंग (Visual Question Answering) के लिए एक बड़े पैमाने पर स्वचालित रूप से निर्मित डेटासेट है, और वियतनामी संदर्भ में उनके प्रदर्शन और मानवीय निर्णय के साथ संरेखण का आकलन करने के लिए विभिन्न स्वचालित मेट्रिक्स के साथ ट्रांसफार्मर-आधारित मल्टीमॉडल मॉडलों का मूल्यांकन करता है।

मूल लेखक: Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपनी आँखों और कानों से दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आप उसे एक तस्वीर दिखाते हैं और पूछते हैं, "यहाँ क्या हो रहा है?" रोबोट को छवि को देखना होगा, प्रश्न को समझना होगा, और एक समझदारी भरा उत्तर देना होगा। इसे विजुअल क्वेश्चन अनस्विंग (Visual Question Answering - VQA) कहा जाता है।

लंबे समय तक, हमारे पास अंग्रेजी बोलने वाले रोबोटों के लिए बेहतरीन शिक्षक और पाठ्यपुस्तकें रही हैं। लेकिन वियतनामी बोलने वाले रोबोटों के लिए? लाइब्रेरी लगभग खाली थी। जो कुछ किताबें मौजूद थीं, वे या तो बहुत छोटी थीं, बहुत सरल थीं, या मशीनों द्वारा लिखी गई थीं जो तथ्य गढ़ लेती थीं (hallucinations)।

पेश है AutoViVQA। इस पेपर को एक विशाल, उच्च-गुणवत्ता वाली "वियतनामी VQA लाइब्रेरी" को शून्य से बनाने के ब्लूप्रिंट के रूप में समझें, लेकिन एक ट्विस्ट के साथ: हर एक प्रश्न लिखने के लिए हजारों मनुष्यों को काम पर रखने के बजाय (जो धीमा और महंगा है), लेखकों ने एक सुपर-स्मार्ट, स्वचालित फैक्ट्री बनाई।

इसे करने का तरीका यहाँ दिया गया है, जिसे रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. समस्या: "खाली बुकशेल्फ़"

कल्पना कीजिए कि आप एक बच्चे को मैगजीन के कुछ फटे हुए पन्नों का उपयोग करके पढ़ना सिखाने की कोशिश कर रहे हैं। वियतनामी VQA के साथ शोधकर्ता यही कर रहे थे। मौजूदा डेटासेट छोटे, दोहराव वाले थे, और अक्सर यह परीक्षण नहीं करते थे कि क्या रोबोट वास्तव में सोच रहा है या केवल अनुमान लगा रहा है।

2. समाधान: "AI असेंबली लाइन"

लेखकों ने केवल डेटा एकत्र नहीं किया; उन्होंने इसे बनाने के लिए एक फैक्ट्री (एक पाइपलाइन) बनाई।

  • कच्चा माल: उन्होंने वास्तविक दुनिया की तस्वीरें (MS COCO नामक एक प्रसिद्ध संग्रह से) लीं और उन्हें उच्च-गुणवत्ता वाले वियतनामी विवरणों के साथ जोड़ा।

  • फोरमैन (LLM): उन्होंने एक शक्तिशाली लार्ज लैंग्वेज मॉडल (एक सुपर-इंटेलिजेंट फोरमैन की तरह) का उपयोग किया ताकि वह प्रश्न लेखक के रूप में कार्य कर सके। लेकिन उन्होंने फोरमैन से सिर्फ यह नहीं कहा, "कुछ प्रश्न लिखें।" उन्होंने फोरमैन को एक सख्त नियम पुस्तिका (Rulebook) दी।

  • नियम पुस्तिका (तर्क के स्तर): यही असली सफलता का मंत्र है। उन्होंने फोरमैन को बताया:

    • स्तर 1: केवल वस्तु का नाम लें (जैसे, "कार का रंग क्या है?")।
    • स्तर 2: चीजें कहाँ हैं, इसका वर्णन करें (जैसे, "क्या कुत्ता मेज के नीचे है?")।
    • स्तर 3: दो चीजों को जोड़ें (जैसे, "व्यक्ति छाता क्यों पकड़े हुए है?")।
    • स्तर 4 और 5: कारण-और-प्रभाव या छवि के अंदर लिखे टेक्स्ट की गहराई में जाएँ।

    उन्होंने फैक्ट्री को आसान, मध्यम और कठिन प्रश्नों का एक संतुलित मिश्रण बनाने के लिए मजबूर किया, जिससे यह सुनिश्चित हुआ कि रोबोट तर्क करना सीखे, न कि केवल रटना।

3. गुणवत्ता नियंत्रण: "टेस्ट-टेस्ट पैनल"

एक सामान्य फैक्ट्री में, आप केवल यह देख सकते हैं कि उत्पाद ठीक दिखता है या नहीं। इस पेपर में, उन्होंने अन्य AI मॉडलों से बना एक क्वालिटी कंट्रोल पैनल बनाया।

  • जूरी: फैक्ट्री द्वारा उत्पन्न प्रत्येक प्रश्न और उत्तर को 5 से 10 अलग-अलग AI मॉडलों की एक "जूरी" के पास भेजा गया।
  • वोट: इन मॉडलों ने न्यायाधीशों के रूप में कार्य किया। उन्होंने पूछा: "क्या यह प्रश्न भ्रमित करने वाला है? क्या उत्तर वास्तव में चित्र में है? क्या वियतनामी भाषा स्वाभाविक है?"
  • फ़िल्टर: यदि जूरी ने इस नमूने को अच्छा मानकर सहमति नहीं दी, तो इसे कचरे में डाल दिया गया। केवल वे नमूने ही अंतिम डेटासेट में शामिल हुए जो एक सख्त "बहुमत वोट" में पास हुए।

यह एक शेफ द्वारा भोजन पकाने और फिर उसे 10 खाद्य आलोचकों के पैनल के पास भेजने जैसा है। यदि 10 में से 8 कहते हैं, "इसका स्वाद अजीब है," तो उस व्यंजन को हटा दिया जाता है। इसने सुनिश्चित किया कि अंतिम डेटासेट साफ, सटीक और उन "रोबोटिक मतिभ्रमों" (hallucinations) से मुक्त था जो आमतौर पर AI-जनरेटेड कंटेंट में होते हैं।

4. परिणाम: एक नया मानक

परिणाम AutoViVQA है, जिसमें लगभग 20,000 चित्र और 180,000 से अधिक उत्तर हैं।

  • यह क्यों महत्वपूर्ण है: जब शोधकर्ताओं ने अपने नए डेटासेट का विभिन्न AI मॉडलों पर परीक्षण किया, तो मॉडल काफी स्मार्ट हो गए। ऐसा इसलिए नहीं था क्योंकि उन्होंने रोबोट का दिमाग बदल दिया था; बल्कि इसलिए था क्योंकि आखिरकार उन्हें एक बेहतर पाठ्यपुस्तक मिल गई थी।
  • उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि अभ्यास प्रश्न अस्पष्ट और त्रुटियों से भरे हैं, तो छात्र असफल हो जाएगा। यदि अभ्यास प्रश्न स्पष्ट, विविध और चुनौतीपूर्ण हैं, तो छात्र वास्तविक परीक्षा में उत्कृष्ट प्रदर्शन करेगा। AutoViVQA वियतनामी AI के लिए वही सटीक अभ्यास प्रश्न सेट है।

निचोड़

यह पेपर एक "लो-रिसोर्स" समस्या (वियतनामी के लिए पर्याप्त डेटा की कमी) को हल करने के बारे में है, जिसे एक स्व-सुधार करने वाली, स्वचालित प्रणाली बनाकर हल किया गया है। उन्होंने साबित किया कि एक महान डेटासेट बनाने के लिए आपको लाखों मानव एनोटेटरों की आवश्यकता नहीं है; आपको बस एक स्मार्ट सिस्टम, एक सख्त नियम पुस्तिका और एक कठोर गुणवत्ता-जांच जूरी की आवश्यकता है।

उन्होंने केवल एक डेटासेट नहीं बनाया; उन्होंने बुद्धिमत्ता की एक फैक्ट्री बनाई जिसका उपयोग बेहतर, अधिक सांस्कृतिक रूप से जागरूक और अधिक तार्किक वियतनामी भाषा वाले AI को प्रशिक्षित करने के लिए किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →