← नवीनतम पेपर
💬 NLP

ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation

यह शोध पत्र ADAGE को पेश करता है, जो एक भाषा-तटस्थ पाइपलाइन है जो अरबी, अम्हारिक् और जापानी में अनुवाद-मुक्त सादृश्य तर्क (analogical reasoning) बेंचमार्क बनाता है, जो एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है जहाँ अंग्रेजी में कुशल मॉडल इन मूल भाषाओं में सांस्कृतिक रूप से आधारित तर्क करने में संघर्ष करते हैं।

मूल लेखक: Ahmed Haj Ahmed, Alvin Grissom II

प्रकाशित 2026-07-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmed Haj Ahmed, Alvin Grissom II

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंसानी चुटकुले समझना सिखाने की कोशिश कर रहे हैं। आप सोच सकते हैं कि सबसे अच्छा तरीका यह होगा कि अंग्रेजी में लिखे गए प्रसिद्ध चुटकुलों की एक किताब ली जाए, उसका स्पेनिश, जापानी या अरबी में अनुवाद किया जाए, और रोबोट से उन्हें समझाने के लिए कहा जाए। लेकिन यहाँ एक पेंच है: एक चुटकुला अक्सर उस विशिष्ट संस्कृति पर निर्भर करता है जिसमें वह पैदा हुआ है। यदि आप किसी विशिष्ट अमेरिकी अवकाश (holiday) के बारे में चुटकुले को ऐसी भाषा में अनुवाद करते हैं जहाँ वह अवकाश मौजूद ही नहीं है, तो वह चुटकुला अपना जादू खो देता है। रोबोट उत्तर का अनुमान लगा सकता है क्योंकि वह सुनने में मज़ेदार लगता है, लेकिन इसलिए नहीं कि वह वास्तव में अर्थ को समझता है। यह वह समस्या है जिसका सामना वैज्ञानिक "बहुभाषी" (multilingual) एआई का परीक्षण करते समय करते हैं। वे अक्सर केवल अंग्रेजी परीक्षणों को अन्य भाषाओं में अनुवाद कर देते हैं, जो एक नकली भ्रम पैदा करता है कि एआई उन भाषाओं में बुद्धिमान है।

यह वास्तव में देखने के लिए कि क्या एआई मानव की तरह सोच सकता है, हमें यह देखने की आवश्यकता है कि क्या वह संस्कृति के गहरे, अनकहे नियमों को समझ सकता है—जैसे यह जानना कि "मुर्गियाँ अंडे देने से पहले उन्हें गिनना नहीं चाहिए" का अर्थ यह है कि जब तक कुछ वास्तव में घटित न हो जाए, तब तक आप बहुत अधिक आत्मविश्वासी नहीं होने चाहिए। इस प्रकार की सोच को एनालॉजिकल रीजनिंग (analogical reasoning) कहा जाता है। यह एक पुराने विचार को लेने और उसे एक बिल्कुल नई स्थिति में लागू करने की क्षमता है। यदि एआई यह केवल अंग्रेजी में कर सकता है, लेकिन अलग संस्कृति में वही तर्क प्रस्तुत किए जाने पर विफल हो जाता है, तो उसने वास्तव में सोचना नहीं सीखा है; उसने केवल अंग्रेजी पैटर्न को याद किया है। यह शोध पत्र एक सरल लेकिन डरावना सवाल पूछता है: क्या हमारे एआई मॉडल वास्तव में अन्य भाषाओं में स्मार्ट हैं, या वे केवल अनुवाद करने में बहुत अच्छे हैं?

शोधकर्ता एक नया उपकरण पेश करते हैं जिसे ADAGE (Analogical Difficulty-by-design Assessment for Grounded Evaluation) कहा जाता है। ADAGE को एक मास्टर शेफ के रूप में समझें जो केवल एक फ्रांसीसी कुकबुक से रेसिपी का अनुवाद नहीं करता है; इसके बजाय, वे अरबी, अम्महारिक (Amharic) और जापानी स्थानीय बाजारों में ताज़ा, सबसे प्रामाणिक स्थानीय सामग्री (कहावतें) खोजने के लिए जाते हैं और नए व्यंजन (परिदृश्य) बनाते हैं जो यह परीक्षण करते हैं कि क्या एआई स्वाद के अंतर को पहचान सकता है।

यहाँ बताया गया है कि उन्होंने अपने प्रयोग को कैसे तैयार किया:

  1. सामग्री: उन्होंने अरबी, अम्महारिक और जापानी बोलने वाले मूल वक्ताओं से हजारों कहावतें (छोटी, बुद्धिमानी भरी बातें जैसे "जो बाज को नहीं जानता, वह उसे भून देगा") एकत्र कीं।
  2. रेसिपी: केवल एआई से कहावत समझाने के बजाय, उन्होंने एक चतुर तकनीक का उपयोग किया। उन्होंने कहावतों को उनके "स्वाद" या विषय (जैसे "धैर्य" या "सावधानी") के आधार पर समूहों में बांटा। फिर, उन्होंने एक एआई को प्रत्येक कहावत के लिए एक आधुनिक कहानी लिखने के लिए कहा।
  3. जाल: परीक्षण को कठिन बनाने के लिए, उन्होंने एक बहुविकल्पीय प्रश्न बनाया। उन्होंने एआई को एक कहानी दी और चार कहावतें दीं। एक एकदम सही मेल थी। अन्य तीन "डिस्ट्रैक्टर्स" (भटकाने वाले विकल्प) थे:
    • एक उसी विषय समूह से था (एक "फेक-आउट" जो सही लग रहा था लेकिन पूरी तरह सही नहीं था)।
    • एक अलग विषय का था लेकिन सुनने में समान था (एक "नियर-मिस")।
    • एक पूरी तरह से रैंडम (Random) था (गलत उत्तर का "आसान" विकल्प)।
  4. टेस्ट टेस्ट: उन्होंने इन परीक्षणों को 14 अलग-अलग एआई मॉडलों को दिया, जिनमें छोटे से लेकर विशाल मॉडल तक शामिल थे, और देखा कि वे कैसा प्रदर्शन करते हैं।

उन्हें क्या मिला

परिणाम थोड़े चौंकाने वाले थे, जैसे यह पता चलना कि एक छात्र जिसने अंग्रेजी परीक्षा में टॉप किया था, वह दूसरी भाषा में गणित की परीक्षा में फेल हो गया।

  • "ट्रांसलेशन ट्रैप" (अनुवाद का जाल) वास्तविक है: जब एआई मॉडलों का अंग्रेजी कहावतों पर परीक्षण किया गया, तो उन्होंने बहुत अच्छा प्रदर्शन किया, लगभग 80% या उससे अधिक स्कोर किया। लेकिन जब शोधकर्ताओं ने उन्हें मूल अरबी, अम्महारिक और जापानी बेंचमार्क पर परखा, तो स्कोर तेजी से गिर गया। सबसे अच्छे मॉडल भी 12 से 52 प्रतिशत अंक तक गिर गए। उदाहरण के लिए, एक मॉडल जो अंग्रेजी में 83% सही था, वह अरबी में केवल 70% सही हो सकता है, और अम्महारिक में मात्र 41%।
  • "लो-रिसोर्स" (कम संसाधन वाली भाषा) की वास्तविकता: अम्महारिक परीक्षण सबसे कठिन था। यहाँ तक कि सबसे बड़े, सबसे स्मार्ट मॉडल भी रैंडम अनुमान लगाने (जो चार विकल्पों वाले प्रश्न के लिए 25% होता है) से थोड़ा ही बेहतर स्कोर कर पाए। एआई मॉडल भाषा के कारण ही अटक गए, शब्दों को समझने में भी असमर्थ रहे, गहरा अर्थ तो दूर की बात है।
  • आकार सब कुछ नहीं है: शोधकर्ताओं को उम्मीद थी कि बड़े मॉडल (अधिक "ब्रेन पावर" वाले) बेहतर प्रदर्शन करेंगे। जबकि बड़े मॉडलों ने अरबी और जापानी में सुधार किया, लेकिन सुधार बहुत कम था। अम्महारिक पर, मॉडल को बड़ा बनाने से कोई मदद नहीं मिली। यह सुझाव देता है कि केवल अधिक डेटा या आकार जोड़ने से समस्या हल नहीं होती है यदि एआई के पास खड़ा होने के लिए एक गहरा सांस्कृतिक आधार नहीं है।
  • "डिस्ट्रैक्टर ट्रिक" सफल रही: चतुर "डिस्ट्रैक्टर" रणनीति पूरी तरह काम कर गई। एआई मॉडल ने सबसे अधिक गलतियाँ "नियर-मिस" उत्तरों पर कीं (वे जो समान लगते थे लेकिन गलत थे), जो यह साबित करता है कि वे वास्तव में तर्क करने की कोशिश कर रहे थे और केवल अनुमान नहीं लगा रहे थे।

बड़ी सीख

शोध पत्र निष्कर्ष निकालता है कि वर्तमान में हमारे द्वारा एआई का परीक्षण करने का तरीका—केवल अंग्रेजी परीक्षणों को अन्य भाषाओं में अनुवाद करके—हमें झूठ बोल रहा है। यह एआई को अन्य भाषाओं में वास्तव में जितना स्मार्ट है, उससे कहीं अधिक स्मार्ट दिखाता है। एआई मॉडल अंग्रेजी सांस्कृतिक तर्क में बहुत अच्छे हैं, लेकिन वे अरबी, अम्महारिक और जापानी की समृद्ध, जटिल संस्कृतियों को लागू करने में संघर्ष करते हैं।

लेखक सुझाव देते हैं कि जब तक हम प्रत्येक संस्कृति के लिए मूल परीक्षण नहीं बनाते, जो स्थानीय कहावतों और कहानियों का उपयोग करते हैं, तब तक हमें पता नहीं चलेगा कि हमारा एआई वास्तव में बहुभाषी है या केवल एक बहुत अच्छा अनुवादक है। उन्होंने अपनी नई "किचन" (ADAGE पाइपलाइन) और अपनी "रेसिपी" (बेंचमार्क) जारी कर दी है ताकि अन्य वैज्ञानिक दुनिया की किसी भी भाषा के लिए अपने स्वयं के परीक्षण तैयार कर सकें, यह सुनिश्चित करते हुए कि भविष्य का एआई वास्तव में हमें समझ सके, चाहे हम कहीं से भी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →