BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence
यह शोध पत्र BRIDGE को प्रस्तुत करता है, जो लंबे मल्टीमॉडल वैज्ञानिक दस्तावेजों में मल्टी-हॉप रीजनिंग का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो स्टेप-लेवल एनोटेशन प्रदान करता है जो साक्ष्य एकत्रीकरण (एविडेंस एग्रीगेशन) और ग्राउंडिंग में व्यवस्थित कमियों को उजागर करता है जिन्हें पारंपरिक उत्तर-मात्र मूल्यांकनों द्वारा अनदेखा कर दिया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक विशाल, 100 पन्नों की केस फ़ाइल (एक लंबा वैज्ञानिक शोध पत्र) है जिसमें सुराग हर जगह बिखरे हुए हैं: टेक्स्ट के पैराग्राफ, डेटा के घने स्प्रेडशीट्स और रंगीन चार्ट।
आपका काम केवल एक साधारण प्रश्न का उत्तर देना नहीं है जैसे कि "संदिग्ध की कार का रंग क्या है?" (जिसे आप पेज 1 पर पा सकते हैं)। इसके बजाय, आपको एक मल्टी-हॉप मिस्ट्री (बहु-चरणीय रहस्य) को सुलझाना है।
उदाहरण के लिए: "पेज 45 पर दिए गए चार्ट के आधार पर, जो अपराध दर दिखाता है, और पेज 78 के टेक्स्ट के आधार पर, जो नए कानून की व्याख्या करता है, क्या नए कानून ने वास्तव में उस विशिष्ट पड़ोस में अपराध को कम किया जिसका उल्लेख पेज 12 की तालिका में किया गया है?"
इसे हल करने के लिए, आपको:
- कानून को समझने के लिए टेक्स्ट को पढ़ना होगा।
- विशिष्ट पड़ोस को खोजने के लिए तालिका को देखना होगा।
- अपराध के आंकड़ों को देखने के लिए चार्ट की जांच करनी होगी।
- निष्कर्ष निकालने के लिए इन तीनों सूचनाओं के टुकड़ों को जोड़ना होगा।
समस्या: "स्मार्ट" जासूस जो कदम छोड़ देते हैं
हाल ही में, हमने बहुत स्मार्ट AI जासूस (लार्ज लैंग्वेज मॉडल्स) बनाए हैं। वे पढ़ने और उत्तर देने में बहुत अच्छे हैं। लेकिन हम उन्हें जो टेस्ट देते हैं, वे अक्सर "संदिग्ध का नाम क्या है?" जैसे होते हैं (जिसे वे आसानी से ढूंढ लेते हैं)।
समस्या यह है कि ये AI जासूस अक्सर चीटिंग (नकल) करते हैं। वे किसी ऐसे कीवर्ड के आधार पर अनुमान लगा सकते हैं जिसे उन्होंने देखा था, या वे डॉट्स को जोड़ने की कठिन मेहनत को छोड़ सकते हैं। वे भाग्य से सही अंतिम उत्तर तक पहुँच जाते हैं, लेकिन उन्होंने वास्तव में तर्क (reasoning) नहीं किया होता है।
इसके अलावा, जब सुराग किसी स्प्रेडशीट या चार्ट (मल्टीमॉडल) में होते हैं, तो AI अक्सर भ्रमित हो जाता है। वह चार्ट को पूरी तरह से अनदेखा कर सकता है और केवल टेक्स्ट के आधार पर अनुमान लगा सकता है, या वह 100 पन्नों के दस्तावेज़ में खो सकता है और पेज 90 पर छिपे सुराग को मिस कर सकता है।
समाधान: BRIDGE
शोधकर्ताओं ने एक नया टेस्ट बनाया जिसे BRIDGE कहा जाता है। BRIDGE को एक "सत्य की भूलभुलैया" (Maze of Truth) के रूप में सोचें, जिसे विशेष रूप से उन AI जासूसों को पकड़ने के लिए डिज़ाइन किया गया है जो चीटिंग करते हैं या कदम छोड़ देते हैं।
यहाँ बताया गया है कि BRIDGE क्या विशेष बनाता है:
- यह एक लंबा, उलझा हुआ केस फ़ाइल है: पिछले टेस्ट के विपरीत, जो छोटी, सरल कहानियों का उपयोग करते थे, BRIDGE वास्तविक, लंबे वैज्ञानिक शोध पत्रों का उपयोग करता है। सुराग गहराई में छिपे होते हैं, जिसके लिए AI को पूरा दस्तावेज़ पढ़ने की आवश्यकता होती है।
- यह क्लु (सुराग) के प्रकारों को मिलाता है: सुराग केवल शब्द नहीं हैं। वे टेक्स्ट, तालिकाओं (स्प्रेडशीट्स) और आकृतियों (चार्ट्स) का एक मिश्रण हैं। पहेली को सुलझाने के लिए AI को इन तीनों भाषाओं में कुशल होना चाहिए।
- यह केवल उत्तर को नहीं, बल्कि "सोचने की प्रक्रिया" को ग्रेड करता है: स्कूल में, यदि आप सही उत्तर देते हैं लेकिन कोई काम नहीं दिखाते हैं, तो भी आपको 'A' ग्रेड मिल सकता है। BRIDGE में, शिक्षक (मूल्यांकनकर्ता) आपके चरण-दर-चरण तर्क (step-by-step reasoning) की जांच करते हैं।
- क्या आपने वास्तव में चार्ट देखा?
- क्या आपने टेक्स्ट को तालिका से सही ढंग से जोड़ा?
- या क्या आपने बस एक संबंध बना लिया (hallucinate)?
- BRIDGE आपको इस बात के लिए ग्रेड देता है कि आप कैसे वहां पहुंचे, न कि केवल इस बात के लिए कि आप क्या लाए।
उन्होंने क्या पाया (प्लॉट ट्विस्ट)
शोधकर्ताओं ने इस नए BRIDGE भूलभुलैया पर अपने "सबसे स्मार्ट" AI जासूसों का परीक्षण किया। यहाँ क्या हुआ:
- "डायरेक्ट" दृष्टिकोण: जब AI को एक बार में पूरा दस्तावेज़ पढ़ने की अनुमति दी गई, तो इसने ठीक-ठाक प्रदर्शन किया, लेकिन डॉट्स जोड़ने में इसने अभी भी गलतियाँ कीं।
- "रिट्रीवल" दृष्टिकोण (RAG ट्रैप): आमतौर पर, जब दस्तावेज़ बहुत लंबे होते हैं, तो हम पहले प्रासंगिक पृष्ठों को "खोजने" के लिए एक सिस्टम का उपयोग करते हैं (जैसे कि एक लाइब्रेरियन आपके लिए सही किताब ढूंढता है)। शोधकर्ताओं ने ColPali नामक टूल के साथ इसे आजमाया।
- परिणाम: यह एक आपदा थी। AI का प्रदर्शन क्रैश हो गया।
- क्यों? लाइब्रेरियन (सर्च टूल) AI को गलत पृष्ठ दे रहा था या पूरे के पूरे पृष्ठ गायब कर रहा था। क्योंकि AI पेज 90 पर विशिष्ट सुराग नहीं ढूंढ सका, वह रहस्य को हल नहीं कर सका। इसने दिखाया कि हमारे सबसे अच्छे सर्च टूल्स भी लंबे, जटिल दस्तावेज़ों में विशिष्ट साक्ष्य खोजने में संघर्ष करते हैं।
मुख्य निष्कर्ष (Takeaway)
BRIDGE एक चेतावनी है। यह हमें बताता है कि सिर्फ इसलिए कि एक AI किसी प्रश्न का सही उत्तर दे सकता है, इसका मतलब यह नहीं है कि वह दस्तावेज़ को समझता है।
यह एक ऐसे छात्र की तरह है जो उत्तर कुंजी (answer key) रट लेता है लेकिन उसे गणित करना नहीं आता। BRIDGE AI को अपना "होमवर्क" दिखाने के लिए मजबूर करता है, जिससे यह साबित होता है कि वह वास्तव में जटिल सुरागों को जोड़ने वाले वास्तविक वैज्ञानिक अनुसंधान की उलझी हुई, बहु-पृष्ठीय और चार्ट-भरी दुनिया में नेविगेट कर सकता है।
संक्षेप में: हमने AI को चीटिंग करने से रोकने और यह समझने में मदद करने के लिए एक कठिन, अधिक यथार्थवादी टेस्ट बनाया है कि उनका "दिमाग" जटिल सुरागों को जोड़ने की कोशिश करते समय वास्तव में कहाँ टूट जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।