← नवीनतम पेपर
💬 NLP

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

यह शोध पत्र रीजनिंग प्रोसेस ट्री स्कोर (RPTS) को प्रस्तुत करता है, जो मल्टीमॉडल रीजनिंग स्टेप्स की निष्ठा (faithfulness) का मूल्यांकन करने के लिए एक ट्री-स्ट्रक्चर्ड मेट्रिक है, और इसे एक नए बेंचमार्क (RPTS-Eval) के माध्यम से मान्य करता है जो इंटरमॉडल संबंधों और सही उत्तरों द्वारा छिपे हुए रीजनिंग दोषों के संबंध में वर्तमान लार्ज विजन-लैंग्वेज मॉडल्स की सीमाओं को उजागर करता है।

मूल लेखक: Haofeng Wang, Yu Zhang

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haofeng Wang, Yu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने के लिए एक जासूस को काम पर रख रहे हैं। अतीत में, हमें केवल अंतिम निर्णय की परवाह थी: "क्या उन्होंने सही संदिग्ध को पकड़ा?" यदि उत्तर "हाँ" था, तो हम उन्हें एक स्वर्ण स्टार (गोल्ड स्टार) देते थे, भले ही वे अनुमान लगाकर, सुरागों को अनदेखा करके, या तर्क के पूरी तरह से गलत रास्ते पर चलकर वहां पहुंचे हों जो संयोग से सही व्यक्ति तक ले गया।

यह शोध पत्र तर्क देता है कि यह "केवल गोल्ड स्टार" वाला दृष्टिकोण त्रुटिपूर्ण है, विशेष रूप से उन AI मॉडल्स के लिए जो चित्रों को देखते हैं और टेक्स्ट पढ़ते हैं (जिन्हें लार्ज विजन-लैंग्वेज मॉडल्स कहा जाता है)। कभी-कभी, ये AI जासूस गलत कारणों से सही उत्तर दे देते हैं।

यहाँ एक सरल विवरण दिया गया है कि लेखकों ने इसे ठीक करने के लिए क्या किया, जिसमें कुछ रोजमर्रा के उपमाओं का उपयोग किया गया है।

1. समस्या: "लकी गेस" (भाग्यशाली अनुमान लगाने वाला) जासूस

AI के वर्तमान परीक्षण बहुविकल्पीय प्रश्नोत्तरी (मल्टीपल चॉइस क्विज़) की तरह हैं।

  • पुराना तरीका: AI अपराध स्थल की एक फोटो और एक पुलिस रिपोर्ट देखता है। वह कहता है, "बटलर (खानसामा) ने यह किया!" यदि उत्तर कुंजी में "बटलर" लिखा है, तो AI को 100% अंक मिलते हैं।
  • दोष: हो सकता है कि AI ने फोटो में बंदूक को वास्तव में नहीं देखा हो या फिंगरप्रिंट रिपोर्ट को नहीं पढ़ा हो। शायद उसने सिर्फ इसलिए "बटलर" का अनुमान लगाया क्योंकि फिल्मों में यह एक आम बात है। उत्तर सही है, लेकिन सोचने का तरीका बेकार था।

लेखकों को एहसास हुआ कि हमें केवल परिणाम ही नहीं, बल्कि प्रक्रिया को भी ग्रेड देना होगा।

2. समाधान: "लॉजिक का पेड़" (RPTS)

इसे ठीक करने के लिए, लेखकों ने एक नया स्कोरिंग सिस्टम बनाया जिसे RPTS (रीजनिंग प्रोसेस ट्री स्कोर) कहा जाता है।

कल्पना कीजिए कि AI की सोचने की प्रक्रिया एक सीधी रेखा नहीं, बल्कि एक फैमिली ट्री या एक डिसीजन ट्री (निर्णय वृक्ष) है:

  • जड़ें (लीफ नोड्स): ये कच्चे तथ्य हैं। "मैं एक गीला छाता देख रहा हूँ" (विजुअल) और "बारिश हो रही है" (टेक्स्ट)।
  • शाखाएं: ये वे चरण हैं जिन्हें AI डॉट्स को जोड़ने के लिए लेता है। "चूंकि बारिश हो रही है, इसलिए छाता गीला है।"
  • शीर्ष (निष्कर्ष): "संदेशवाहक बाहर था।"

RPTS कैसे काम करता है:
केवल पेड़ के शीर्ष की जाँच करने के बजाय, RPTS हर एक शाखा पर चलता है। यह पूछता है:

  1. क्या यह तथ्य सत्य है?
  2. क्या यह तथ्य वास्तव में अगले चरण की ओर ले जाता है?
  3. क्या AI किसी फर्जी सुराग से विचलित हो गया?

यदि AI एक छोटी शाखा (एक पत्ती/लीफ) पर गलती करता है, तो RPTS उसे पकड़ लेता है, भले ही पेड़ के शीर्ष पर अंतिम उत्तर सही हो। यह गणित के टेस्ट को केवल अंतिम संख्या पर नहीं, बल्कि समीकरण के हर चरण पर ग्रेड देने जैसा है। यदि आप 2 x 2 करते हैं और 5 प्राप्त करते हैं, लेकिन फिर 1 जोड़कर 6 प्राप्त करते हैं (सही उत्तर), तो RPTS आपको फेल कर देगा क्योंकि आपका गणित गलत था।

3. नया टेस्ट: "RPTS-Eval"

लेखकों ने केवल एक स्कोर का आविष्कार नहीं किया; उन्होंने इसे टेस्ट करने के लिए एक नया मैदान तैयार किया। उन्होंने चित्र और टेक्स्ट से जुड़े 390 नए पहेलियाँ बनाईं।

उन्होंने इन पहेलियों को चित्र और टेक्स्ट के बीच तीन विशिष्ट प्रकार के "टीमवर्क" को टेस्ट करने के लिए डिज़ाइन किया:

  • गाइडेड (एक सहायक साथी): टेक्स्ट कहता है, "चित्र में लाल कार को देखें।" टेक्स्ट आपको चित्र में सुराग खोजने में मदद करता है।
  • एडवर्सरियल (एक विचलित करने वाला): टेक्स्ट कहता है, "कार नीली है," लेकिन चित्र स्पष्ट रूप से एक लाल कार दिखाता है। AI को झूठ बोलने वाले टेक्स्ट को अनदेखा करना होगा और चित्र पर भरोसा करना होगा।
  • इंडिपेंडेंट (समानांतर खेल): टेक्स्ट मौसम के बारे में बात करता है, और चित्र एक कुत्ते को दिखाता है। AI को एक पहेली सुलझाने के लिए दो असंबंधित चीजों को जोड़ना होगा।

4. उन्होंने क्या पाया: "ओपन-सोर्स" का संघर्ष

उन्होंने इस नए, कठिन टेस्ट पर प्रसिद्ध AI मॉडल्स (जैसे GPT-4o, Llama, और Llava) का परीक्षण किया। यहाँ उनकी खोजें हैं:

  • "सही उत्तर, गलत कारण" की महामारी: कई ओपन-सोर्स AI मॉडल्स ने सही उत्तर प्राप्त किया, लेकिन उनका "लॉजिक ट्री" छेदों से भरा था। वे मूल रूप से ऐसे कनेक्शन बना रहे थे (हैलुसिनेशन) जो अस्तित्व में ही नहीं थे।
  • इमेज ब्लाइंडनेस (चित्रों के प्रति अंधापन): जब AI को निर्णय लेने के लिए किसी चित्र को देखने की आवश्यकता थी, तो कई मॉडल्स विफल रहे। वे टेक्स्ट पढ़ने में बहुत अच्छे थे लेकिन चित्र को "देखने" और उसे समस्या सुलझाने के लिए उपयोग करने में बहुत खराब थे। यह एक ऐसे जासूस की तरह है जो रिपोर्ट तो पूरी तरह पढ़ सकता है लेकिन अपराध स्थल को देखते समय कानूनी रूप से अंधा है।
  • भाषा का अंतर: मॉडल्स ने अंग्रेजी की तुलना में चीनी भाषा में बहुत बेहतर प्रदर्शन किया। ऐसा लगता है कि इन AI "जासूसों" के लिए ट्रेनिंग डेटा अंग्रेजी तर्क की ओर अत्यधिक झुका हुआ है, जिससे भाषा बदलते ही वे लड़खड़ा जाते हैं।

मुख्य निष्कर्ष

यह शोध पत्र एक चेतावनी है। हम अब AI से केवल यह नहीं पूछ सकते, "उत्तर क्या है?" हमें पूछना होगा, "मुझे अपना काम दिखाओ।"

RPTS स्कोर का उपयोग करके, शोधकर्ता अंततः यह देख सकते हैं कि AI कहाँ विफल हो रहा है। क्या वह पढ़ने में बुरा है? क्या वह देखने में बुरा है? क्या वह केवल अनुमान लगा रहा है? यह डेवलपर्स को स्मार्ट, अधिक ईमानदार AI बनाने में मदद करता है जो केवल भाग्यशाली अनुमान नहीं लगाता, बल्कि वास्तव में उस दुनिया को समझता है जिसे वह देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →