← नवीनतम पेपर
💬 NLP

SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages

यह शोध पत्र SEATauBench प्रस्तुत करता है, जो दक्षिण-पूर्व एशियाई संप्रभु एआई (sovereign AI) के लिए पहला मूल्यांकन ढांचा है जो TauBench को पांच क्षेत्रीय भाषाओं के अनुकूल बनाता है, जिससे यह पता चलता है कि हालांकि अंग्रेजी एजेंट की क्षमताएं स्थानीयकृत बातचीत में अच्छी तरह से स्थानांतरित होती हैं, लेकिन जैसे-जैसे कार्य संदर्भ और टूल विशिष्टताएँ पूरी तरह से स्थानीयकृत होती हैं, उनका प्रदर्शन और मजबूती काफी कम हो जाती है।

मूल लेखक: My Chiffon Nguyen, Aulia Adila, Saksorn Ruangtanusak, Kittiphat Leesombatwathana, Vissuta Gunawan Lim, Patomporn Payoungkhamdee, Samuel Cahyawijaya

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: My Chiffon Nguyen, Aulia Adila, Saksorn Ruangtanusak, Kittiphat Leesombatwathana, Vissuta Gunawan Lim, Patomporn Payoungkhamdee, Samuel Cahyawijaya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, उच्च प्रशिक्षित रोबोट सहायक है। आपने अंग्रेजी में इसका व्यापक परीक्षण किया है, और यह उड़ान बुक करने, कपड़े खरीदने और फोन प्लान प्रबंधित करने में बेहतरीन है। यह एक सुपरहीरो जैसा लगता है।

लेकिन फिर, आप इसी रोबोट को दक्षिण-पूर्व एशिया में काम करने के लिए भेजते हैं, जहाँ लोग थाई, वियतनामी, इंडोनेशियाई, फिलिपिनो और मंदारिन बोलते हैं। आप खुद से पूछते हैं: "अगर यह अंग्रेजी में इतना अच्छा है, तो क्या यह इन अन्य भाषाओं में भी वैसे ही काम करेगा?"

यह शोध पत्र, SEATauBench, एक विशाल, वास्तविक तनाव परीक्षण (stress test) की तरह है जिसे इस उत्तर को खोजने के लिए बनाया गया है। शोधकर्ताओं ने एक विशेष "प्रशिक्षण मैदान" बनाया है ताकि यह देखा जा सके कि ये AI एजेंट वास्तव में स्थानीय भाषाओं में वास्तविक दुनिया के कार्यों को कितनी अच्छी तरह से संभालते हैं जब उनके आसपास की हर चीज़ का अनुवाद किया गया हो।

यहाँ इस कहानी का विवरण है जो उन्होंने पाया, जिसे सरल रूप में नीचे समझाया गया है:

1. सेटअप: कठिनाई का "तीन-परत वाला केक"

शोधकर्ताओं ने पूरी चीज़ को एक साथ अनुवादित नहीं किया। उन्होंने एक परीक्षण बनाया जिसमें चार स्तर थे, जैसे सीढ़ी चढ़ना, यह देखने के लिए कि रोबोट कहाँ लड़खड़ाना शुरू करता है।

  • स्तर 1 (अंग्रेजी बेसलाइन): रोबोट अंग्रेजी बोलता है, उपकरण अंग्रेजी में हैं, और नियम अंग्रेजी में हैं। यह "इजी मोड" है यह देखने के लिए कि रोबोट अपने मूल रूप में कितना अच्छा है।
  • स्तर 2 (बातचीत का स्विच): रोबोट और मानव उपयोगकर्ता एक स्थानीय भाषा (जैसे थाई) में बात करना शुरू करते हैं, लेकिन रोबोट के आंतरिक उपकरण और नियम पुस्तिकाएं अभी भी अंग्रेजी में हैं। यह एक दोस्त से स्पेनिश में बात करने जैसा है, लेकिन मानचित्र पर निर्देश अभी भी अंग्रेजी में हैं।
  • स्तर 3 (टूल का स्विच): अब, बातचीत अंग्रेजी में है, लेकिन रोबोट के उपकरण (जैसे "फ्लाइट खोजें" बटन या "बैलेंस चेक करें" मेनू) स्थानीय भाषा में वर्णित हैं। यह एक रिमोट कंट्रोल की तरह है जहाँ सभी बटन थाई में लेबल किए गए हैं।
  • स्तर 4 (पूर्ण विसर्जन/इमर्शन): सब कुछ स्थानीय भाषा में है। चैट, उपकरण, नियम और डेटाबेस सभी का अनुवाद किया गया है। यह "हार्ड मोड" है जहाँ रोबोट को पूरी तरह से एक नई भाषा में सोचना, पढ़ना और कार्य करना पड़ता है।

2. बड़ा आश्चर्य: "ग्लास सीलिंग" (कांच की छत)

शोधकर्ताओं ने कुछ बहुत ही दिलचस्प पाया।

  • स्तर 2 पर (केवल बातचीत): रोबोट ने काफी अच्छा प्रदर्शन किया! यदि आपने इसे वियतनामी या थाई में बात करने के लिए कहा, तो यह बातचीत को लगभग उतना ही अच्छी तरह से संभाल सकता था जितना कि इसने अंग्रेजी में किया। यह एक ऐसे पर्यटक की तरह था जिसने कुछ वाक्यांश सीख लिए हैं और अब वह खाना ऑर्डर कर सकता है।
  • स्तर 3 और 4 पर (उपकरण और नियम): यहीं पर रोबोट ने एक 'ग्लास सीलिंग' का सामना किया। जैसे ही उपकरण और नियम का अनुवाद किया गया, रोबोट का प्रदर्शन तेजी से गिर गया।
    • कल्पना कीजिए कि एक शेफ इतालवी भाषा में उत्तम संवाद कर सकता है लेकिन इतालवी रेसिपी बुक नहीं पढ़ सकता या इतालवी मापने वाले कपों का उपयोग नहीं कर सकता। वे अच्छी बातचीत कर सकते हैं, लेकिन वे भोजन नहीं बना सकते।
    • शोध पत्र में पाया गया कि जब "रेसिपी बुक" (टूल स्पेसिफिकेशन) और "रसोई के नियम" (डोमेन पॉलिसी) स्थानीय भाषा में थे, तो रोबोटों ने बहुत अधिक गलतियाँ कीं। वे भ्रमित हो गए, उड़ान बुक करने में विफल रहे, या गलत फोन प्लान दे दिया।

3. "लैंग्वेज ड्रिफ्ट" (भाषा का भटकाव) का रहस्य

शोधकर्ताओं ने यह भी जांचा कि क्या रोबोट "फिसल" रहे थे और अनजाने में अंग्रेजी बोल रहे थे जब उन्हें थाई या फिलिपिनो बोलने के लिए कहा गया था।

  • निष्कर्ष: रोबोट कभी-कभी फिसल गए और अंग्रेजी बोले, विशेष रूप से सबसे कठिन परिदृश्यों में।
  • ट्विस्ट: आश्चर्यजनक रूप से, यह "फिसलना" उनके विफल होने का मुख्य कारण नहीं था। यहाँ तक कि जब रोबोट ने सही स्थानीय भाषा में पूरी तरह से बात की, तब भी वे कार्य में विफल रहे यदि उपकरण भ्रमित करने वाले थे।
  • रूपक: यह एक ऐसे ड्राइवर की तरह है जो सड़क के दाईं ओर बिल्कुल सही ढंग से गाड़ी चला रहा है (सही भाषा बोल रहा है) लेकिन फिर भी दुर्घटनाग्रस्त हो जाता है क्योंकि वह स्थानीय ट्रैफिक संकेतों (उपकरणों) को नहीं पढ़ सकता। समस्या उनकी भाषा नहीं है; समस्या उनके स्थानीय वातावरण को समझने की क्षमता है।

4. "एक आकार सभी के लिए उपयुक्त नहीं है" की समस्या

शोध पत्र ने विभिन्न प्रकार के रोबोटों (विभिन्न AI मॉडल) को भी देखा।

  • कुछ रोबोट कुछ भाषाओं में दूसरों की तुलना में बेहतर थे। उदाहरण के लिए, एक रोबोट जो अंग्रेजी में बहुत अच्छा था, वह केवल इसलिए थाई में भी महान नहीं हो गया क्योंकि वह बुद्धिमान था।
  • उन्होंने पाया कि फिलिपिनो एक आश्चर्यजनक रूप से अच्छा "परीक्षण मामला" था। यदि कोई रोबोट फिलिपिनो में अच्छा प्रदर्शन करता था, तो इसकी संभावना थी कि वह अन्य दक्षिण-पूर्व एशियाई भाषाओं में भी अच्छा प्रदर्शन करेगा। यह पूरे क्षेत्र के लिए एक "कोयले की खान में कैनरी" (चेतावनी का संकेत) खोजने जैसा है।

5. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हम यह मानकर नहीं चल सकते कि अंग्रेजी में स्मार्ट AI स्वचालित रूप से दक्षिण-पूर्व एशिया के लिए तैयार है।

  • पुराना तरीका: हम सोचते थे, "यदि यह अंग्रेजी में काम करता है, तो यह हर जगह काम करता है।"
  • नई वास्तविकता: शोध पत्र दिखाता है कि "अंग्रेजी-ओनली" परीक्षण एक चिकनी हाईवे पर कार के परीक्षण जैसा है। जब आप उस कार को स्थानीय संकेतों (स्थानीयकृत उपकरणों और नियमों) वाले ऊबड़-खाबड़, बिना पक्की सड़क पर रखते हैं, तो वह टूट जाती है।

संक्षेप में: SEATauBench एक नैदानिक उपकरण (diagnostic tool) है जो साबित करता है कि हमें स्थानीय भाषाओं और उपकरणों के लिए विशेष रूप से AI बनाने और परीक्षण करने की आवश्यकता है, न कि केवल अंग्रेजी परीक्षणों का अनुवाद करने और उम्मीद करने की। "भाषा बोलने" और "भाषा में काम करने" के बीच का अंतर बहुत बड़ा है, और यह बेंचमार्क हमें मापने में मदद करता है कि वह अंतर वास्तव में कितना बड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →