← नवीनतम पेपर
💬 NLP

Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task

फ्लोरिडा विश्वविद्यालय के गेटर्स ने स्पेनिश मध्यवर्ती कैप्शनिंग के लिए Qwen2.5-VL को Gemini 2.5 Flash के साथ रिट्रीवल-ऑगमेंटेड मेनी-शॉट प्रॉम्प्टिंग के साथ संयोजित करने वाले एक दो-चरणीय पाइपलाइन का उपयोग करके स्वदेशी भाषाओं के लिए सांस्कृतिक छवि कैप्शनिंग पर AmericasNLP 2026 साझा कार्य (shared task) जीता, जिससे ब्राइब्री, गुआरानी और ओरिज़ाबा नहुआटल में बेसलाइन की तुलना में 120% से अधिक प्रदर्शन सुधार प्राप्त हुआ।

मूल लेखक: Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Daisy Zhe Wang, Christan Grant

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Daisy Zhe Wang, Christan Grant

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी समुदाय के लिए एक फोटो का छोटा, सांस्कृतिक रूप से सटीक विवरण लिखने की कोशिश कर रहे हैं जो एक दुर्लभ, प्राचीन भाषा बोलता है। चुनौती यह है कि आप उस भाषा को अच्छी तरह से नहीं बोलते हैं, और मदद के लिए बहुत कम किताबें या शब्दकोश उपलब्ध हैं।

यह पेपर बताता है कि कैसे यूनिवर्सिटी ऑफ फ्लोरिडा (द "गेटर्स") की एक टीम ने AmericasNLP 2026 नामक प्रतियोगिता के लिए इस समस्या को हल किया। उनका लक्ष्य एक तस्वीर लेना और उसका कैप्शन अमेरिका की पाँच स्वदेशी भाषाओं (जैसे गुआरानी या ब्रिब्रि) में लिखना था।

यहाँ उन्होंने इसे कैसे किया, इसे सरल चरणों और उपमाओं में विभाजित किया गया है:

दो-चरणों वाली रेसिपी

सीधे "चित्र" से "दुर्लभ भाषा" तक जाने की कोशिश करने के बजाय, टीम ने एक दो-चरणों वाली रिले रेस का उपयोग किया:

  1. चरण 1: अनुवादक (सेतु): सबसे पहले, उन्होंने एक सुपर-स्मार्ट AI (जिसे Qwen कहा जाता है) का उपयोग किया ताकि वह तस्वीर को देख सके और स्पेनिश में एक सरल विवरण लिख सके। स्पेनिश को एक "सेतु भाषा" के रूप में सोचें जिसमें AI बहुत अच्छा है।
  2. चरण 2: सांस्कृतिक विशेषज्ञ (फिनिशर): इसके बाद, उन्होंने उस स्पेनिश विवरण को लिया और एक अलग, यहाँ तक कि अधिक स्मार्ट AI (Gemini) से उसे अंतिम स्वदेशी भाषा में अनुवाद करने के लिए कहा।

गुप्त नुस्खा: "केवल बताओ मत, दिखाओ"

असली जादू केवल अनुवाद में नहीं था; यह इस बात में था कि उन्होंने AI को यह सिखाने में कि क्या "शैली" (style) का उपयोग करना है।

आमतौर पर, जब आप किसी AI से अनुवाद करने के लिए कहते हैं, तो वह आपको एक ऐसा वाक्य दे सकता है जो व्याकरण की दृष्टि से सही हो लेकिन सुनने में रोबोटिक या किसी पाठ्यपुस्तक जैसा लगे। टीम चाहती थी कि कैप्शन ऐसे हों जैसे कोई स्थानीय व्यक्ति स्वाभाविक रूप से बोल रहा हो।

इसे ठीक करने के लिए, उन्होंने रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) नामक तकनीक का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप उसी गाँव के एक मित्र को एक पत्र लिख रहे हैं जो एक विदेशी गाँव में रहता है। यह अनुमान लगाने के बजाय कि वे कैसे बोलते हैं, आप उन 100 पत्रों का एक बॉक्स निकालते हैं जो अन्य लोगों ने उसी गाँव को लिखे हैं। आप उनके लहजे, टोन और वाक्य संरचना को समझने के लिए उन्हें पढ़ते हैं। फिर, आप उस शैली की नकल करते हुए अपना पत्र लिखते हैं।
  • पेपर में: AI द्वारा स्पेनिश कैप्शन का अनुवाद करने से पहले, सिस्टम ने मौजूदा स्पेनिश-से-स्वदेशी-भाषा जोड़ों के एक विशाल पुस्तकालय की खोज की। इसने सबसे समान उदाहरणों को पकड़ा (जैसे कि वे "100 पत्र") और उन्हें गाइड के रूप में AI को दिखाया। इससे AI को प्रतियोगिता के लिए आवश्यक "रजिस्टर" (विशिष्ट सांस्कृतिक शैली) से मेल खाने में मदद मिली।

परिणाम: एक बड़ी जीत

टीम ने इस सिस्टम को प्रतियोगिता में उतारा और जीत हासिल की।

  • स्कोर: उन्होंने मानक बेसलाइन की तुलना में अपने स्कोर में भारी सुधार किया। उदाहरण के लिए, ब्रिब्रि (Bribri) भाषा में, उन्होंने स्कोर में 164% का सुधार किया। गुआरानी (Guaraní) में, उन्होंने 131% का सुधार किया।
  • मानवीय परीक्षण: जब मानव जजों ने कैप्शन देखे, तो टीम के प्रविष्टियों को पाँच फाइनलिस्टों में से दूसरे स्थान पर रखा गया, जिससे यह सिद्ध हुआ कि कैप्शन स्वाभाविक और सांस्कृतिक रूप से उपयुक्त थे।

उन्होंने क्या सीखा (उनके "अहा!" क्षण)

टीम ने कई प्रयोग चलाए यह देखने के लिए कि क्या काम करता है और क्या नहीं, जिससे तीन प्रमुख खोजें हुईं:

  1. सभी लाइब्रेरी समान नहीं होतीं: उनके द्वारा उपयोग किए गए उदाहरणों का "लाइब्रेरी" गुआरानी के लिए चमत्कारिक रहा क्योंकि उनके पास 53,000 उदाहरणों का एक बड़ा संग्रह था (जिसमें कुछ कंप्यूटर-जनरेटेड "नकली" उदाहरण भी शामिल थे जो बहुत मददगार साबित हुए)। हालाँकि, युकाटेक माया (Yucatec Maya) के लिए, उनके पास लगभग कोई उदाहरण नहीं था। उस स्थिति में, AI का अपना आंतरिक ज्ञान एक छोटे, शोर वाले लाइब्रेरी का उपयोग करने के बजाय बेहतर था।
  2. "नकली" डेटा का बूस्ट: गुआरानी के लिए, उनकी सफलता के लगभग 28 अंक विशेष रूप से उन कंप्यूटर-जनरेटेड उदाहरणों से आए थे। यह एक अभ्यास कोच रखने जैसा है जो आपके अध्ययन के लिए अतिरिक्त अभ्यास सत्र बनाता है।
  3. टोन मायने रखता है (विशेष रूप से ब्रिब्रि के लिए): ब्रिब्रि भाषा में जटिल ध्वनियाँ (टोन्स) होती हैं जो शब्दों के अर्थ को बदल देती हैं। टीम ने पाया कि केवल अनुवाद करना पर्याप्त नहीं था; उन्हें AI को इन ध्वनियों और शब्द क्रम को संभालने के लिए विशेष निर्देश देने पड़े। यह AI को यह बताने जैसा था, "याद रखें, इस भाषा में, क्रिया अंत में आती है, और अपनी संगीतमय स्वर-लहरियों को न भूलें!"

कमी (सीमाएँ)

टीम स्वीकार करती है कि उनका सिस्टम अभी भी पूरी तरह से परफेक्ट नहीं है:

  • चेन रिएक्शन: यदि पहला AI (स्पेनिश अनुवादक) तस्वीर का वर्णन करने में गलती करता है, तो दूसरा AI (अनुवादक) उस गलती का पूरी तरह से अनुवाद कर देगा। वहाँ कोई "अनडू" (Undo) बटन नहीं है।
  • टेस्ट स्कोर का जाल: उन्होंने AI को शैली सिखाने के लिए "अभ्यास परीक्षण" (डेवलपमेंट सेट) के उदाहरणों का उपयोग किया। यह अभ्यास स्कोर के लिए तो बहुत अच्छा था, लेकिन यह बिल्कुल वैसा ही है जैसे वास्तविक परीक्षा देने से पहले अभ्यास क्विज़ के सटीक उत्तरों को रट लेना। यह स्कोर को बढ़ा सकता है, इसलिए वे अपने परिणामों की व्याख्या करते समय सावधान रहते हैं।

सारांश

यूनिवर्सिटी ऑफ फ्लोरिडा की टीम ने एक पाइपलाइन बनाकर जीत हासिल की जो पहले स्पेनिश में एक चित्र का वर्णन करती है, फिर एक विशाल समान उदाहरणों के पुस्तकालय का उपयोग करके एक AI को यह सिखाती है कि उस विवरण को सही सांस्कृतिक स्वाद के साथ स्वदेशी भाषाओं में कैसे अनुवादित किया जाए। उन्होंने साबित किया कि कम-संसाधन वाली भाषाओं के लिए, अनुवाद से कहीं अधिक संदर्भ और शैली मार्गदर्शिका (style guides) महत्वपूर्ण होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →