← नवीनतम पेपर
💬 NLP

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS एक नया बहुभाषी बेंचमार्क सुइट है जो चार प्रमुख बेंचमार्क (GAIA, SWE-Bench, MATH, और Agent Security) से कार्यों का अनुवाद करके ग्यारह भाषाओं में एजेंटिक एआई प्रणालियों के प्रदर्शन और सुरक्षा का मूल्यांकन करता है, जिससे यह प्रकट होता है कि अंग्रेजी से अन्य भाषाओं में संक्रमण करने से अक्सर विश्वसनीयता में गिरावट आती है और सुरक्षा जोखिम बढ़ जाते हैं।

मूल लेखक: Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत कुशल व्यक्तिगत सहायक है—कोई ऐसा जो आपकी उड़ानें बुक कर सकता है, आपके कंप्यूटर कोड को ठीक कर सकता है, जटिल गणितीय समस्याओं को हल कर सकता है, और आपके डिजिटल जीवन को सुरक्षित रख सकता है। अब, कल्पना कीजिए कि यह सहायक अंग्रेजी में तो जीनियस है, लेकिन जैसे ही आप उससे स्पेनिश, हिंदी या जापानी में बात करते हैं, वह अचानक अनाड़ी, भुलक्कड़ और—सबसे बुरा—खतरनाक रूप से अप्रत्याशित हो जाता है।

यही वह समस्या है जिसे यह शोध पत्र, MAPS, हल करने की कोशिश कर रहा है।

समस्या: "भाषा की कांच की छत" (The Language Glass Ceiling)

वर्तमान AI "एजेंट्स" (ऐसे AI जो केवल बात नहीं करते, बल्कि वास्तव में काम भी करते हैं) मुख्य रूप से अंग्रेजी में प्रशिक्षित और परीक्षित किए जाते हैं। क्योंकि इन एजेंटों के अंतर्निहित "मस्तिष्क" (लार्ज लैंग्वेज मॉडल्स) अक्सर अंग्रेजी में बेहतर होते हैं, इसलिए एजेंट एक छिपी हुई कमजोरी विरासत में पा लेते हैं: जब निर्देश अन्य भाषाओं में आते हैं, तो वे संघर्ष करते हैं।

यह एक विश्व स्तरीय शेफ को काम पर रखने जैसा है जो अंग्रेजी में रेसिपी का पूरी तरह से पालन कर सकता है, लेकिन यदि आप उन्हें वही रेसिपी फ्रेंच में दें, तो वे गलती से नमक की जगह चीनी डाल सकते हैं या ओवन चालू करना भूल सकते हैं। डिजिटल दुनिया में, एक "भूला हुआ ओवन" का अर्थ यह हो सकता है कि कोई बैंक लेनदेन गलत हो गया या सुरक्षा का दरवाजा खुला छोड़ दिया गया।

समाधान: MAPS (बहुभाषी स्ट्रेस टेस्ट)

शोधकर्ताओं ने MAPS बनाया, जिसका अर्थ है "मल्टीलिंगुअल बेंचमार्क" (Multilingual Benchmark)। MAPS को AI एजेंटों के लिए एक "वैश्विक दक्षता परीक्षा" के रूप में समझें।

केवल AI से सरल प्रश्न पूछने के बजाय, उन्होंने एजेंटों को चार गहन "कार्य सिमुलेशन" (job simulations) के माध्यम से परखा:

  1. वास्तविक दुनिया का सहायक (GAIA): क्या एजेंट वास्तविक कार्य को हल करने के लिए वेब ब्राउज़ कर सकता है और जानकारी खोज सकता है?
  2. सॉफ्टवेयर इंजीनियर (SWE-Bench): क्या एजेंट कंप्यूटर कोड में बग ढूंढ सकता है और उन्हें ठीक कर सकता है?
  3. गणितज्ञ (MATH): क्या एजेंट उच्च-स्तरीय गणितीय समस्याओं को हल कर सकता है?
  4. सुरक्षा गार्ड (ASB): क्या एजेंट बुरे तत्वों द्वारा "धोखे" या "हैक" किए जाने का प्रतिरोध कर सकता है?

उन्होंने यह केवल अंग्रेजी में नहीं किया। उन्होंने इन परीक्षणों को 11 अलग-अलग भाषाओं (जैसे अरबी, चीनी, जर्मन और हिंदी) में अनुवादित किया ताकि वे देख सकें कि एजेंट वैश्विक स्तर पर कैसा प्रदर्शन करते हैं।

"अहा!" क्षण: उन्होंने क्या पाया

शोधकर्ताओं ने कुछ महत्वपूर्ण पाया: कार्य जितना अधिक "मानवीय" और "शब्दों वाला" होता है, AI उतना ही अधिक लड़खड़ाता है।

  • "मैथ एंड कोड" अपवाद: जब कार्य मुख्य रूप से संख्याओं या कंप्यूटर कोड से संबंधित थे (जो लगभग हर भाषा में समान दिखते हैं), तो एजेंट ठीक थे। यह एक संगीतकार द्वारा संगीत की शीट बजाने जैसा है—चाहे आप किसी भी भाषा में बोलें, स्वर वही रहते हैं।
  • "नेचुरल लैंग्वेज" का जाल: जब कार्यों के लिए सूक्ष्म मानवीय निर्देशों को समझने की आवश्यकता थी (जैसे, "मेरे लिए ऐसी उड़ान खोजें जो बहुत शोर वाली न हो"), तो एजेंटों का प्रदर्शन तेजी से गिर गया।
  • सुरक्षा जोखिम: सबसे चिंताजनक बात यह है कि उन्होंने पाया कि अन्य भाषाओं में एजेंट कम सुरक्षित हो जाते हैं। एक "जेलब्रेक" (AI को कुछ बुरा करने के लिए प्रेरित करने की चाल) जो अंग्रेजी में काम नहीं करेगी, वह दूसरी भाषा में पूरी तरह से काम कर सकती है। यह एक सुरक्षा गार्ड जैसा है जो सूट पहने हुए चोर को पहचानने में सक्षम है, लेकिन अगर चोर अलग शैली के कपड़े पहने हो, तो वह उसे आसानी से गुजर जाने देता है।

यह आपके लिए क्यों मायने रखता है

जैसे-जैसे हम एक ऐसी दुनिया की ओर बढ़ रहे हैं जहाँ AI एजेंट हमारे पैसे, हमारे शेड्यूल और हमारे डेटा को संभालेंगे, हम यह जोखिम नहीं उठा सकते कि उनमें "भाषा का पूर्वाग्रह" हो।

यह शोध पत्र AI डेवलपर्स के लिए एक चेतावनी है। यह कहता है: "यदि आप चाहते हैं कि आपका AI एक विश्वसनीय वैश्विक नागरिक बने, तो आप केवल इसे अंग्रेजी में जीनियस बनाना नहीं सिखा सकते; आपको यह सुनिश्चित करना होगा कि यह उन सभी भाषाओं में भी जीनियस बना रहे जिनमें इसके उपयोगकर्ता बात करते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →