RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation
यह शोध पत्र रीजनिंग प्रोसेस ट्री स्कोर (RPTS) को प्रस्तुत करता है, जो मल्टीमॉडल रीजनिंग स्टेप्स की निष्ठा (faithfulness) का मूल्यांकन करने के लिए एक ट्री-स्ट्रक्चर्ड मेट्रिक है, और इसे एक नए बेंचमार्क (RPTS-Eval) के माध्यम से मान्य करता है जो इंटरमॉडल संबंधों और सही उत्तरों द्वारा छिपे हुए रीजनिंग दोषों के संबंध में वर्तमान लार्ज विजन-लैंग्वेज मॉडल्स की सीमाओं को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने के लिए एक जासूस को काम पर रख रहे हैं। अतीत में, हमें केवल अंतिम निर्णय की परवाह थी: "क्या उन्होंने सही संदिग्ध को पकड़ा?" यदि उत्तर "हाँ" था, तो हम उन्हें एक स्वर्ण स्टार (गोल्ड स्टार) देते थे, भले ही वे अनुमान लगाकर, सुरागों को अनदेखा करके, या तर्क के पूरी तरह से गलत रास्ते पर चलकर वहां पहुंचे हों जो संयोग से सही व्यक्ति तक ले गया।
यह शोध पत्र तर्क देता है कि यह "केवल गोल्ड स्टार" वाला दृष्टिकोण त्रुटिपूर्ण है, विशेष रूप से उन AI मॉडल्स के लिए जो चित्रों को देखते हैं और टेक्स्ट पढ़ते हैं (जिन्हें लार्ज विजन-लैंग्वेज मॉडल्स कहा जाता है)। कभी-कभी, ये AI जासूस गलत कारणों से सही उत्तर दे देते हैं।
यहाँ एक सरल विवरण दिया गया है कि लेखकों ने इसे ठीक करने के लिए क्या किया, जिसमें कुछ रोजमर्रा के उपमाओं का उपयोग किया गया है।
1. समस्या: "लकी गेस" (भाग्यशाली अनुमान लगाने वाला) जासूस
AI के वर्तमान परीक्षण बहुविकल्पीय प्रश्नोत्तरी (मल्टीपल चॉइस क्विज़) की तरह हैं।
- पुराना तरीका: AI अपराध स्थल की एक फोटो और एक पुलिस रिपोर्ट देखता है। वह कहता है, "बटलर (खानसामा) ने यह किया!" यदि उत्तर कुंजी में "बटलर" लिखा है, तो AI को 100% अंक मिलते हैं।
- दोष: हो सकता है कि AI ने फोटो में बंदूक को वास्तव में नहीं देखा हो या फिंगरप्रिंट रिपोर्ट को नहीं पढ़ा हो। शायद उसने सिर्फ इसलिए "बटलर" का अनुमान लगाया क्योंकि फिल्मों में यह एक आम बात है। उत्तर सही है, लेकिन सोचने का तरीका बेकार था।
लेखकों को एहसास हुआ कि हमें केवल परिणाम ही नहीं, बल्कि प्रक्रिया को भी ग्रेड देना होगा।
2. समाधान: "लॉजिक का पेड़" (RPTS)
इसे ठीक करने के लिए, लेखकों ने एक नया स्कोरिंग सिस्टम बनाया जिसे RPTS (रीजनिंग प्रोसेस ट्री स्कोर) कहा जाता है।
कल्पना कीजिए कि AI की सोचने की प्रक्रिया एक सीधी रेखा नहीं, बल्कि एक फैमिली ट्री या एक डिसीजन ट्री (निर्णय वृक्ष) है:
- जड़ें (लीफ नोड्स): ये कच्चे तथ्य हैं। "मैं एक गीला छाता देख रहा हूँ" (विजुअल) और "बारिश हो रही है" (टेक्स्ट)।
- शाखाएं: ये वे चरण हैं जिन्हें AI डॉट्स को जोड़ने के लिए लेता है। "चूंकि बारिश हो रही है, इसलिए छाता गीला है।"
- शीर्ष (निष्कर्ष): "संदेशवाहक बाहर था।"
RPTS कैसे काम करता है:
केवल पेड़ के शीर्ष की जाँच करने के बजाय, RPTS हर एक शाखा पर चलता है। यह पूछता है:
- क्या यह तथ्य सत्य है?
- क्या यह तथ्य वास्तव में अगले चरण की ओर ले जाता है?
- क्या AI किसी फर्जी सुराग से विचलित हो गया?
यदि AI एक छोटी शाखा (एक पत्ती/लीफ) पर गलती करता है, तो RPTS उसे पकड़ लेता है, भले ही पेड़ के शीर्ष पर अंतिम उत्तर सही हो। यह गणित के टेस्ट को केवल अंतिम संख्या पर नहीं, बल्कि समीकरण के हर चरण पर ग्रेड देने जैसा है। यदि आप 2 x 2 करते हैं और 5 प्राप्त करते हैं, लेकिन फिर 1 जोड़कर 6 प्राप्त करते हैं (सही उत्तर), तो RPTS आपको फेल कर देगा क्योंकि आपका गणित गलत था।
3. नया टेस्ट: "RPTS-Eval"
लेखकों ने केवल एक स्कोर का आविष्कार नहीं किया; उन्होंने इसे टेस्ट करने के लिए एक नया मैदान तैयार किया। उन्होंने चित्र और टेक्स्ट से जुड़े 390 नए पहेलियाँ बनाईं।
उन्होंने इन पहेलियों को चित्र और टेक्स्ट के बीच तीन विशिष्ट प्रकार के "टीमवर्क" को टेस्ट करने के लिए डिज़ाइन किया:
- गाइडेड (एक सहायक साथी): टेक्स्ट कहता है, "चित्र में लाल कार को देखें।" टेक्स्ट आपको चित्र में सुराग खोजने में मदद करता है।
- एडवर्सरियल (एक विचलित करने वाला): टेक्स्ट कहता है, "कार नीली है," लेकिन चित्र स्पष्ट रूप से एक लाल कार दिखाता है। AI को झूठ बोलने वाले टेक्स्ट को अनदेखा करना होगा और चित्र पर भरोसा करना होगा।
- इंडिपेंडेंट (समानांतर खेल): टेक्स्ट मौसम के बारे में बात करता है, और चित्र एक कुत्ते को दिखाता है। AI को एक पहेली सुलझाने के लिए दो असंबंधित चीजों को जोड़ना होगा।
4. उन्होंने क्या पाया: "ओपन-सोर्स" का संघर्ष
उन्होंने इस नए, कठिन टेस्ट पर प्रसिद्ध AI मॉडल्स (जैसे GPT-4o, Llama, और Llava) का परीक्षण किया। यहाँ उनकी खोजें हैं:
- "सही उत्तर, गलत कारण" की महामारी: कई ओपन-सोर्स AI मॉडल्स ने सही उत्तर प्राप्त किया, लेकिन उनका "लॉजिक ट्री" छेदों से भरा था। वे मूल रूप से ऐसे कनेक्शन बना रहे थे (हैलुसिनेशन) जो अस्तित्व में ही नहीं थे।
- इमेज ब्लाइंडनेस (चित्रों के प्रति अंधापन): जब AI को निर्णय लेने के लिए किसी चित्र को देखने की आवश्यकता थी, तो कई मॉडल्स विफल रहे। वे टेक्स्ट पढ़ने में बहुत अच्छे थे लेकिन चित्र को "देखने" और उसे समस्या सुलझाने के लिए उपयोग करने में बहुत खराब थे। यह एक ऐसे जासूस की तरह है जो रिपोर्ट तो पूरी तरह पढ़ सकता है लेकिन अपराध स्थल को देखते समय कानूनी रूप से अंधा है।
- भाषा का अंतर: मॉडल्स ने अंग्रेजी की तुलना में चीनी भाषा में बहुत बेहतर प्रदर्शन किया। ऐसा लगता है कि इन AI "जासूसों" के लिए ट्रेनिंग डेटा अंग्रेजी तर्क की ओर अत्यधिक झुका हुआ है, जिससे भाषा बदलते ही वे लड़खड़ा जाते हैं।
मुख्य निष्कर्ष
यह शोध पत्र एक चेतावनी है। हम अब AI से केवल यह नहीं पूछ सकते, "उत्तर क्या है?" हमें पूछना होगा, "मुझे अपना काम दिखाओ।"
RPTS स्कोर का उपयोग करके, शोधकर्ता अंततः यह देख सकते हैं कि AI कहाँ विफल हो रहा है। क्या वह पढ़ने में बुरा है? क्या वह देखने में बुरा है? क्या वह केवल अनुमान लगा रहा है? यह डेवलपर्स को स्मार्ट, अधिक ईमानदार AI बनाने में मदद करता है जो केवल भाग्यशाली अनुमान नहीं लगाता, बल्कि वास्तव में उस दुनिया को समझता है जिसे वह देख रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।