Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
टीम मिया ने एक प्री-ट्रेंड T5-3B जनरेटिव मॉडल को विशेष प्री-ट्रेनिंग कार्यों—मास्क्ड लैंग्वेज मॉडलिंग और रिलेटिव पोजीशन प्रेडिक्शन—का उपयोग करके फाइन-ट्यून करके TextVQA चैलेंज 2021 जीता, ताकि छवियों में टेक्स्ट को पढ़ने और उसके बारे में तर्क करने के लिए मल्टी-मोडल फीचर्स को प्रभावी ढंग से संरेखित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप "I Spy" का एक हाई-स्टेक्स गेम खेल रहे हैं, लेकिन इसमें आपको केवल रंगों या आकृतियों को नहीं देखना है, बल्कि एक भीड़भाड़ वाली तस्वीर में छोटे, धुंधले संकेतों, मेनू और लेबल को पढ़ना है ताकि जटिल प्रश्नों के उत्तर दिए जा सकें।
उदाहरण के लिए, यदि कोई आपको एक व्यस्त कैफे की फोटो दिखाता है और पूछता है, "बाएं से तीसरे टेबल पर रखे ड्रिंक का नाम क्या है?" तो आप केवल एक "कप" नहीं देख सकते—आपको ज़ूम इन करना होगा, कप पर लिखे टेक्स्ट को पढ़ना होगा, और उसे स्थान से जोड़ना होगा।
यह TextVQA चैलेंज है, और यह पेपर बताता है कि कैसे टीम मिया (Team Mia) ने इस खेल को जीतने के लिए एक "सुपर-ब्रेन" बनाया। उन्होंने इसे कैसे किया, यहाँ सरल विचारों में दिया गया है।
1. दिमाग: "मास्टर ट्रांसलेटर" (T5 मॉडल)
अधिकांश AI मॉडल या तो देखने (विज़न) में अच्छे होते हैं या पढ़ने (लैंग्वेज) में, लेकिन वे अक्सर एक साथ दोनों करने में संघर्ष करते हैं। टीम मिया ने T5 नामक एक मॉडल का उपयोग किया, जो एक विश्व-स्तरीय अनुवादक की तरह है।
केवल एक इमेज को "एक किचन" के रूप में लेबल करने के बजाय, यह मॉडल एक डिज़ाइन किया गया है जो जानकारी के एक बिखरे हुए मिश्रण—प्रश्न, जो चीजें वह देख रहा है, और जो शब्द वह पढ़ रहा है—को ले सकता है और उस बिखराव को एक स्पष्ट, बोले गए उत्तर में "अनुवादित" कर सकता है।
2. ट्रेनिंग: "एक्सट्रीम लाइब्रेरी स्टडी सेशन"
इससे पहले कि मॉडल वास्तव में प्रतियोगिता के प्रश्नों को देखता, टीम ने इसे एक विशाल "स्टडी सेशन" से गुजारा।
- विशाल लाइब्रेरी: उन्होंने इसे केवल कुछ किताबें नहीं दीं; उन्होंने इसे टेक्स्ट वाले 9 मिलियन चित्र दिए। यह एक छात्र को परीक्षा शुरू होने से पहले 9 मिलियन स्ट्रीट साइन, लेबल और पोस्टर पढ़ने के लिए मजबूर करने जैसा है।
- दो विशेष ड्रिल: यह सुनिश्चित करने के लिए कि दिमाग तेज़ हो, उन्होंने इसे दो विशिष्ट प्रकार के होमवर्क दिए:
- "रिक्त स्थान भरें" ड्रिल (MLM): वे एक वाक्य में एक शब्द छिपा देते थे और मॉडल को उसे पहचानने के लिए कहते थे। यह मॉडल को सिखाता है कि भाषा कैसे चलती है।
- "यह कहाँ है?" ड्रिल (RPP): वे मॉडल को टेक्स्ट का एक टुकड़ा और एक वस्तु दिखाते थे और पूछते थे, "ये दोनों एक-दूसरे से कितनी दूर हैं?" यह मॉडल को यह सिखाता है कि "कोका-कोला" शब्द को मेज पर रखी वास्तविक लाल कैन से कैसे जोड़ा जाए।
3. सीक्रेट सॉस: "एडवर्सरियल ट्रेनिंग"
कल्पना कीजिए कि आप बास्केटबॉल का अभ्यास कर रहे हैं। यदि आप केवल उस बास्केट के खिलाफ अभ्यास करते हैं जो कभी हिलती नहीं है, तो आप वास्तविक खेल में बहुत खराब होंगे जहाँ डिफेंडर आपके सामने कूद रहे होते हैं।
टीम ने एडवर्सरियल ट्रेनिंग का उपयोग किया। उन्होंने अनिवार्य रूप से प्रशिक्षण के दौरान मॉडल के आंतरिक तर्क को "छेड़ा" और "धकेला", जिससे मॉडल के लिए सही उत्तर आसानी से पाना कठिन हो गया। इसने AI को "मजबूत" और स्थिर बनने के लिए मजबूर किया, ताकि वह वास्तविक प्रतियोगिता में धुंधले टेक्स्ट या अजीब रोशनी से भ्रमित न हो।
4. अंतिम पॉलिश: "स्पेल-चेकर"
भले ही सबसे बुद्धिमान छात्र भी छोटी सी टाइपो (वर्तनी की गलती) कर सकता है, जैसे "Apple" के बजाय "Appel" लिखना। इसे रोकने के लिए, टीम ने एक पोस्ट-प्रोसेसिंग मॉड्यूल (एक टूल जिसका नाम fuzzywuzzy है) जोड़ा।
इसे एक मिलनसार संपादक के रूप में सोचें जो AI के बगल में बैठा है। यदि AI एक ऐसा उत्तर देता है जो लगभग सही है लेकिन उसमें वर्तनी की एक छोटी सी गलती है, तो संपादक हस्तक्षेप करता है और कहता है, "मुझे लगता है कि आपका मतलब 'Apple' था, है ना?" और उत्तर सबमिट करने से पहले उसे ठीक कर देता है।
सारांश: जीतने की रेसिपी
जीतने के लिए, टीम मिया ने एक सरल तर्क का पालन किया:
- एक जीनियस से शुरुआत करें: एक विशाल, प्री-ट्रेन्ड लैंग्वेज मॉडल का उपयोग करें।
- इसे सब कुछ खिलाएं: इसे लाखों चित्र दें ताकि यह जानता हो कि दुनिया कैसी दिखती है।
- इसे कनेक्शन सिखाएं: सुनिश्चित करें कि यह जानता है कि एक शब्द और एक वस्तु वास्तव में एक ही चीज़ हैं।
- इसे सख्त बनाएं: इसे "डिस्ट्रैक्शंस" के खिलाफ प्रशिक्षित करें ताकि यह भ्रमित न हो।
- काम की दोबारा जाँच करें: अंतिम उत्तर को साफ करने के लिए एक स्पेल-चेकर का उपयोग करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।