← नवीनतम पेपर
💻 computer science

Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model

टीम मिया ने एक प्री-ट्रेंड T5-3B जनरेटिव मॉडल को विशेष प्री-ट्रेनिंग कार्यों—मास्क्ड लैंग्वेज मॉडलिंग और रिलेटिव पोजीशन प्रेडिक्शन—का उपयोग करके फाइन-ट्यून करके TextVQA चैलेंज 2021 जीता, ताकि छवियों में टेक्स्ट को पढ़ने और उसके बारे में तर्क करने के लिए मल्टी-मोडल फीचर्स को प्रभावी ढंग से संरेखित किया जा सके।

मूल लेखक: Yixuan Qiao, Hao Chen, Jun Wang, Shanshan Zhao, Yihao Chen, Xianbin Ye, Ziliang Li, Xianbiao Qi, Peng Gao, Guotong Xie

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yixuan Qiao, Hao Chen, Jun Wang, Shanshan Zhao, Yihao Chen, Xianbin Ye, Ziliang Li, Xianbiao Qi, Peng Gao, Guotong Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "I Spy" का एक हाई-स्टेक्स गेम खेल रहे हैं, लेकिन इसमें आपको केवल रंगों या आकृतियों को नहीं देखना है, बल्कि एक भीड़भाड़ वाली तस्वीर में छोटे, धुंधले संकेतों, मेनू और लेबल को पढ़ना है ताकि जटिल प्रश्नों के उत्तर दिए जा सकें।

उदाहरण के लिए, यदि कोई आपको एक व्यस्त कैफे की फोटो दिखाता है और पूछता है, "बाएं से तीसरे टेबल पर रखे ड्रिंक का नाम क्या है?" तो आप केवल एक "कप" नहीं देख सकते—आपको ज़ूम इन करना होगा, कप पर लिखे टेक्स्ट को पढ़ना होगा, और उसे स्थान से जोड़ना होगा।

यह TextVQA चैलेंज है, और यह पेपर बताता है कि कैसे टीम मिया (Team Mia) ने इस खेल को जीतने के लिए एक "सुपर-ब्रेन" बनाया। उन्होंने इसे कैसे किया, यहाँ सरल विचारों में दिया गया है।


1. दिमाग: "मास्टर ट्रांसलेटर" (T5 मॉडल)

अधिकांश AI मॉडल या तो देखने (विज़न) में अच्छे होते हैं या पढ़ने (लैंग्वेज) में, लेकिन वे अक्सर एक साथ दोनों करने में संघर्ष करते हैं। टीम मिया ने T5 नामक एक मॉडल का उपयोग किया, जो एक विश्व-स्तरीय अनुवादक की तरह है।

केवल एक इमेज को "एक किचन" के रूप में लेबल करने के बजाय, यह मॉडल एक डिज़ाइन किया गया है जो जानकारी के एक बिखरे हुए मिश्रण—प्रश्न, जो चीजें वह देख रहा है, और जो शब्द वह पढ़ रहा है—को ले सकता है और उस बिखराव को एक स्पष्ट, बोले गए उत्तर में "अनुवादित" कर सकता है।

2. ट्रेनिंग: "एक्सट्रीम लाइब्रेरी स्टडी सेशन"

इससे पहले कि मॉडल वास्तव में प्रतियोगिता के प्रश्नों को देखता, टीम ने इसे एक विशाल "स्टडी सेशन" से गुजारा।

  • विशाल लाइब्रेरी: उन्होंने इसे केवल कुछ किताबें नहीं दीं; उन्होंने इसे टेक्स्ट वाले 9 मिलियन चित्र दिए। यह एक छात्र को परीक्षा शुरू होने से पहले 9 मिलियन स्ट्रीट साइन, लेबल और पोस्टर पढ़ने के लिए मजबूर करने जैसा है।
  • दो विशेष ड्रिल: यह सुनिश्चित करने के लिए कि दिमाग तेज़ हो, उन्होंने इसे दो विशिष्ट प्रकार के होमवर्क दिए:
    • "रिक्त स्थान भरें" ड्रिल (MLM): वे एक वाक्य में एक शब्द छिपा देते थे और मॉडल को उसे पहचानने के लिए कहते थे। यह मॉडल को सिखाता है कि भाषा कैसे चलती है।
    • "यह कहाँ है?" ड्रिल (RPP): वे मॉडल को टेक्स्ट का एक टुकड़ा और एक वस्तु दिखाते थे और पूछते थे, "ये दोनों एक-दूसरे से कितनी दूर हैं?" यह मॉडल को यह सिखाता है कि "कोका-कोला" शब्द को मेज पर रखी वास्तविक लाल कैन से कैसे जोड़ा जाए।

3. सीक्रेट सॉस: "एडवर्सरियल ट्रेनिंग"

कल्पना कीजिए कि आप बास्केटबॉल का अभ्यास कर रहे हैं। यदि आप केवल उस बास्केट के खिलाफ अभ्यास करते हैं जो कभी हिलती नहीं है, तो आप वास्तविक खेल में बहुत खराब होंगे जहाँ डिफेंडर आपके सामने कूद रहे होते हैं।

टीम ने एडवर्सरियल ट्रेनिंग का उपयोग किया। उन्होंने अनिवार्य रूप से प्रशिक्षण के दौरान मॉडल के आंतरिक तर्क को "छेड़ा" और "धकेला", जिससे मॉडल के लिए सही उत्तर आसानी से पाना कठिन हो गया। इसने AI को "मजबूत" और स्थिर बनने के लिए मजबूर किया, ताकि वह वास्तविक प्रतियोगिता में धुंधले टेक्स्ट या अजीब रोशनी से भ्रमित न हो।

4. अंतिम पॉलिश: "स्पेल-चेकर"

भले ही सबसे बुद्धिमान छात्र भी छोटी सी टाइपो (वर्तनी की गलती) कर सकता है, जैसे "Apple" के बजाय "Appel" लिखना। इसे रोकने के लिए, टीम ने एक पोस्ट-प्रोसेसिंग मॉड्यूल (एक टूल जिसका नाम fuzzywuzzy है) जोड़ा।

इसे एक मिलनसार संपादक के रूप में सोचें जो AI के बगल में बैठा है। यदि AI एक ऐसा उत्तर देता है जो लगभग सही है लेकिन उसमें वर्तनी की एक छोटी सी गलती है, तो संपादक हस्तक्षेप करता है और कहता है, "मुझे लगता है कि आपका मतलब 'Apple' था, है ना?" और उत्तर सबमिट करने से पहले उसे ठीक कर देता है।


सारांश: जीतने की रेसिपी

जीतने के लिए, टीम मिया ने एक सरल तर्क का पालन किया:

  1. एक जीनियस से शुरुआत करें: एक विशाल, प्री-ट्रेन्ड लैंग्वेज मॉडल का उपयोग करें।
  2. इसे सब कुछ खिलाएं: इसे लाखों चित्र दें ताकि यह जानता हो कि दुनिया कैसी दिखती है।
  3. इसे कनेक्शन सिखाएं: सुनिश्चित करें कि यह जानता है कि एक शब्द और एक वस्तु वास्तव में एक ही चीज़ हैं।
  4. इसे सख्त बनाएं: इसे "डिस्ट्रैक्शंस" के खिलाफ प्रशिक्षित करें ताकि यह भ्रमित न हो।
  5. काम की दोबारा जाँच करें: अंतिम उत्तर को साफ करने के लिए एक स्पेल-चेकर का उपयोग करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →