← नवीनतम पेपर
💬 NLP

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

यह शोध पत्र लिटमस (Re)Agent को प्रस्तुत करता है, जो एक DAG-संचालित एजेंटिक प्रणाली और 1,500 प्रश्नों का एक नियंत्रित बेंचमार्क है जिसे संरचित तर्क के माध्यम से अपूर्ण साक्ष्यों को संश्लेषित करके लक्षित भाषाओं में बहुभाषी मॉडल के प्रदर्शन का पूर्वानुमान लगाने के लिए डिज़ाइन किया गया है, जो उन परिदृश्यों में उत्कृष्ट सटीकता प्रदर्शित करता है जहाँ प्रत्यक्ष मूल्यांकन डेटा विरल होता है।

मूल लेखक: Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रोजेक्ट मैनेजर हैं जो एक दूरदराज के गाँव में एक पुल बनाने की कोशिश कर रहे हैं। आपके पास न्यूयॉर्क, लंदन और टोक्यो में पुल बनाने का ब्लूप्रिंट है, लेकिन आपके पास उस दूरदराज के गाँव के विशिष्ट भूभाग (terrain) में पुल बनाने का कोई डेटा नहीं है। आपको अनुमान लगाना होगा कि क्या आपका न्यूयॉर्क वाला ब्लूप्रिंट वहां काम करेगा, या आपको एक अलग डिज़ाइन की आवश्यकता है।

यह ठीक वही समस्या है जिसे पेपर "LITMUS (RE)AGENT" हल करने की कोशिश कर रहा है, लेकिन आर्टिफिशियल इंटेलिजेंस (AI) और भाषाओं के लिए।

समस्या: "गायब मानचित्र" की दुविधा (The "Missing Map" Dilemma)

AI मॉडल (जैसे कि वह जिससे आप अभी बात कर रहे हैं) कई भाषाएं बोलने में बेहतर होते जा रहे हैं। हालांकि, शोधकर्ताओं ने इन मॉडलों का परीक्षण केवल कुछ "लोकप्रिय" भाषाओं (जैसे अंग्रेजी, स्पेनिश या चीनी) पर किया है।

अन्य हजारों भाषाओं (जैसे ओरोमो, किरुंडी या नेपाली) के लिए, हमारे पास टेस्ट स्कोर नहीं हैं। हमें यह नहीं पता कि एक विशिष्ट AI मॉडल उन भाषाओं में स्मार्ट होगा या मूर्ख।

  • पुराना तरीका: इंतजार करना कि कोई इसका परीक्षण करे (जिसमें वर्षों और पैसा लगता है)।
  • नया तरीका (LITUS): उपलब्ध सुरागों का उपयोग करके स्कोर की भविकीति (predict) करना।

समाधान: LITMUS (RE)AGENT

लेखकों ने LITMUS (RE)AGENT नामक एक सिस्टम बनाया है। इसे एक अकेले स्मार्ट रोबोट के रूप में नहीं, बल्कि एक संरचित तरीके से काम करने वाली विशेषज्ञ जासूसों की एक टीम के रूप में समझें।

यहाँ बताया गया है कि वे कैसे काम करते हैं, एक रचनात्मक उपमा (analogy) का उपयोग करते हुए:

1. जासूसों की टीम (The Agentic System)

एक अकेले जासूस द्वारा पूरे रहस्य को सुलझाने के बजाय, यह सिस्टम काम को विभाजित करता है:

  • आर्किटेक्ट (मुख्य एजेंट): प्रश्न प्राप्त करता है ("मॉडल X भाषा Y में कैसे काम करेगा?") और इसे छोटे सुरागों में तोड़ देता है।
  • शोधकर्ता (थॉट एजेंट्स): ये जासूस हैं। एक मॉडल के बारे में शोध पत्र खोजता है, दूसरा भाषा के बारे में शोध पत्र खोजता है, और एक अन्य समान भाषाओं के बारे में।
  • लाइब्रेरियन (विशेषज्ञ ज्ञान): एक विशेष एजेंट जो "खेल के नियमों" (भाषाई तथ्य, जैसे "भाषा A, भाषा B के समान है") को जानता है।
  • गणितज्ञ (कोडर एजेंट): यह एजेंट सुरागों को लेता है और वास्तविक गणित (रिग्रेशन मॉडल) चलाकर संभावित स्कोर की गणना करता है।
  • रिपोर्टर: अंतिम उत्तर लिखता है, और सटीक रूप से उद्धृत करता है कि किन सुरागों से निष्कर्ष निकाला गया।

2. "DAG" (फ्लोचार्ट)

पेपर में एक "DAG-orchestrated" सिस्टम का उल्लेख है। एक फ्लोचार्ट या एक पेड़ (tree) की कल्पना करें।

  • यदि जासूसों को गतिरोध मिलता है (जैसे, "किसी ने इस मॉडल का इस भाषा में परीक्षण नहीं किया है"), तो फ्लोचार्ट स्वचालित रूप से एक नए पथ की ओर मुड़ जाता है (जैसे, "ठीक है, आइए एक समान भाषा की तलाश करें")।
  • यह टीम को फंसने या मतिभ्रम (hallucination/मनगढ़ंत बातें बनाने) से रोकता है। वे एक सख्त, तार्किक मानचित्र का पालन करते हैं।

3. "LITMUS" बेंचमार्क (परीक्षा)

यह सिद्ध करने के लिए कि उनका सिस्टम काम करता है, लेखकों ने बेंचमार्क नामक एक विशाल परीक्षा बनाई।

  • उन्होंने AI प्रदर्शन के बारे में 1,500 प्रश्न लिए।
  • चाल (The Trick): उन्होंने उत्तर छिपा दिए। उन्होंने AI सिस्टम को एक "कम पुस्तकालय" (direct answers के बिना) दिया और उससे परिणाम का अनुमान लगाने को कहा।
  • फिर, उन्होंने अपने अनुमानों की जांच उन "वास्तविक उत्तरों" से की जिन्हें उन्होंने छिपा कर रखा था।

परिणाम: दौड़ में कौन जीता?

लेखकों ने अपने जासूसों की टीम का अन्य तरीकों के विरुद्ध परीक्षण किया:

  1. "लोन वुल्फ" (सिंगल एजेंट): एक जासूस जो सब कुछ करने की कोशिश कर रहा है। (कड़ियों को जोड़ने में संघर्ष किया)।
  2. "चैट ग्रुप" (ग्रुप चैट): बिना किसी नेता के घेरे में बात करने वाले जासूसों की एक टीम। (भ्रमित और दोहरावपूर्ण हो गए)।
  3. "जनरलिस्ट" (Magentic-One): एक सामान्य AI टीम जो इस विशिष्ट कार्य के लिए प्रशिक्षित नहीं थी। (भाषाई सुरागों का उपयोग करने में विफल रही)।
  4. LITMUS (RE)AGENT: फ्लोचार्ट के साथ संरचित टीम।

विजेता: LITMUS (RE)AGENT ने बड़े अंतर से जीत हासिल की, विशेष रूप से उन कठिन परिदृश्यों में जहाँ प्रत्यक्ष साक्ष्य गायब थे।

  • क्यों? क्योंकि इसने केवल अनुमान नहीं लगाया; इसने तर्क (reasoned) किया। इसने इस तथ्य का उपयोग किया कि "भाषा A संरचनात्मक रूप से भाषा B के समान है" ताकि केवल रैंडम अनुमान लगाने के बजाय एक स्मार्ट भविष्यवाणी की जा सके।

यह क्यों महत्वपूर्ण है (इसका महत्व क्या है?)

कल्पना कीजिए कि आप एक ऐसी कंपनी हैं जो उस देश में उत्पाद लॉन्च करना चाहती है जहाँ आप भाषा नहीं बोलते।

  • LITMUS के बिना: आप 10 अलग-अलग AI मॉडलों का परीक्षण करने में $1 मिलियन खर्च कर सकते हैं, केवल यह पता लगाने के लिए कि वे सभी विफल हो गए।
  • LITMUS के साथ: आप सिस्टम से पूछते हैं, "इस भाषा के लिए कौन सा मॉडल सबसे अच्छा काम करेगा?" सिस्टम अपने "जासूसी फाइलों" को देखता है, देखता है कि मॉडल X ने एक समान भाषा पर अच्छा काम किया था, और भविष्यवाणी करता है, "मॉडल X आपका सबसे अच्छा विकल्प है।"

एक वाक्य में सारांश

LITMUS (RE)AGENT जासूसों की एक ऐसी AI टीम है जो एक संरचित फ्लोचार्ट और भाषाई सुरागों का उपयोग करती है ताकि यह भविष्यवाणी की जा सके कि एक AI उस भाषा में कैसा प्रदर्शन करेगा जिसका अभी तक परीक्षण नहीं किया गया है, जिससे दुनिया भर के डेवलपर्स का समय और पैसा बचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →