PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
PaLMR एक नवीन फ्रेमवर्क है जो एक धारणा-संरेखित (perception-aligned) डेटा परत और एक पदानुक्रमित पुरस्कार संलयन (hierarchical reward fusion) योजना के माध्यम से तर्क प्रक्रिया और परिणामों दोनों को संरेखित करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की निष्ठा (faithfulness) को बढ़ाता है, जिससे विजुअल Hallucinations (दृश्य मतिभ्रम) को महत्वपूर्ण रूप से कम करते हुए प्रमुख बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े शरारती छात्र को पहेली सुलझाना सिखा रहे हैं। यह छात्र एक AI मॉडल है (जैसे कि वे जो आपसे चैट करते हैं या तस्वीरें देखते हैं)।
समस्या: "किस्मत से सही अनुमान लगाने वाला" छात्र
अतीत में, जब हम इन AI छात्रों को पढ़ाते थे, तो हमें केवल अंतिम उत्तर की परवाह होती थी।
- परिदृश्य: आप छात्र को तीन सेबों की एक तस्वीर दिखाते हैं और पूछते हैं, "वहाँ कितने सेब हैं?"
- पुराना तरीका: यदि छात्र एक लंबा, भ्रमित करने वाला निबंध लिखता है जिसमें वह दावा करता है कि वहाँ "पाँच सेब और एक केला" है (ऐसी चीजें होने का भ्रम पैदा करना जो वहां नहीं हैं) लेकिन फिर जादुई रूप से अंत में "3" लिख देता है, तो हम उन्हें A+ देंगे।
- परिणाम: छात्र ने धोखाधड़ी करना सीख लिया। उन्होंने उन टेक्स्ट पैटर्न को याद करके उत्तर का अनुमान लगाना सीख लिया जिन्हें उन्होंने रटा था, और वास्तविक तस्वीर को अनदेखा कर दिया। यदि आप उनसे पूछते कि उन्होंने उत्तर कैसे प्राप्त किया, तो वे मनगढ़ंत बातें बनाते। इसे Hallucination (भ्रम/मृगतृष्णा) कहा जाता है।
समाधान: PaLMR (द "ईमानदार शिक्षक")
यह शोध पत्र एक नई विधि पेश करता है जिसे PaLMR (प्रोसेस अलाइनमेंट फॉर मल्टीमॉडल रीजनिंग) कहा जाता है। PaLMR को केवल एक ऐसे शिक्षक के रूप में न सोचें जो केवल अंतिम परीक्षा का ग्रेड देता है, बल्कि एक सख्त कोच के रूप में सोचें जो छात्र की सोचने की प्रक्रिया के हर एक कदम पर नज़र रखता है।
यहाँ बताया गया है कि PaLMR कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करके:
1. "तथ्य-जांच" नोटबुक (डेटा लेयर)
छात्र को प्रशिक्षित करने से पहले, PaLMR एक विशेष "फैक्ट-चेक नोटबुक" बनाता है।
- केवल छात्र को एक प्रश्न और एक उत्तर देने के बजाय, PaLMR एक अत्यंत बुद्धिमान AI (जैसे Gemini) का उपयोग करता है जो पहले तस्वीर का एक विस्तृत, वस्तुनिष्ठ विवरण लिखता है।
- उपमा: कल्पना कीजिए कि छात्र के पहेली देखने से पहले, शिक्षक लिख देता है: "वहाँ ठीक 3 लाल सिलेंडर और 1 नीला गोला है।" यह "ग्राउंड ट्रुथ" (वास्तविक सत्य) बन जाता है। छात्र केवल अनुमान नहीं लगा सकता; उसे अपने विचारों को इस नोटबुक के साथ मिलाना होगा।
2. "दो-चरणीय" ग्रेडिंग प्रणाली (ऑप्टिमाइज़ेशन लेयर)
यही असली जादू है। जब छात्र किसी समस्या को हल करने की कोशिश करता है, तो PaLMR केवल अंतिम संख्या को नहीं देखता। यह एक पदानुक्रमित पुरस्कार प्रणाली (Hierarchical Reward System) का उपयोग करता है:
चरण A: "क्या आपने देखा?" गेटकीपर।
शिक्षक द्वारा उत्तर की जाँच करने से पहले, वे छात्र के तर्क के चरणों की जाँच करते हैं।- छात्र कहता है: "मैं 5 सिलेंडर देख रहा हूँ..."
- शिक्षक नोटबुक की जाँच करता है: "रुको, नोटबुक कहती है कि यहाँ केवल 3 हैं।"
- दंड (Penalty): शिक्षक तुरंत "स्टॉप" बटन दबा देता है। भले ही छात्र अंत में सही संख्या का अनुमान लगा ले, उसे शून्य अंक मिलते हैं क्योंकि उसने तस्वीर को सही ढंग से नहीं देखा।
- उपमा: यह गणित के एक टेस्ट की तरह है जहाँ यदि आप अपने हल करने के भाग (working-out section) में गलत संख्याएँ लिखते हैं, तो आपको कोई क्रेडिट नहीं मिलता, भले ही आपका अंतिम उत्तर सही हो। आपको अपना काम सही तरीके से दिखाना ही होगा।
चरण B: "क्या यह सही है?" जाँच।
केवल तभी जब छात्र चरण A को पार कर लेता है (यानी उन्होंने चित्र का सटीक वर्णन किया है), शिक्षक यह जाँचता है कि क्या अंतिम उत्तर सही है।
3. "पेयरवाइज" जज (तुलना)
यह सुनिश्चित करने के लिए कि ग्रेडिंग निष्पक्ष है, PaLMR केवल शिक्षक से यह नहीं पूछता, "क्या यह सही है?" इसके बजाय, यह पूछता है: "इन दो उत्तरों में से कौन सा अधिक ईमानदार है?"
- यह शिक्षक को छात्र द्वारा समस्या को हल करने के दो अलग-अलग तरीके दिखाता है।
- शिक्षक "फैक्ट-चेक नोटबुक" के विरुद्ध उनकी तुलना करता है और उस तरीके को चुनता है जो वास्तविकता के अधिक करीब रहा।
- इससे छात्र यह सीखने में मदद मिलती है कि जो वे देखते हैं उसके बारे में ईमानदार होना, भाग्यशाली होने से अधिक महत्वपूर्ण है।
यह क्यों मायने रखता है?
PaLMR के बिना, AI मॉडल भाग्य बताने वालों (fortune tellers) की तरह हैं: वे गलती से सही उत्तर दे सकते हैं, लेकिन वे बीच में बहुत सी चीजें मनगढ़ंत बना रहे होते हैं। यदि आप उनसे स्पष्टीकरण मांगते हैं, तो वे झूठ बोलते हैं।
PaLMR के साथ, AI मॉडल जासूसों (detectives) की तरह बन जाते हैं:
- वे सबूतों (छवि) की सावधानीपूर्वक जांच करते हैं।
- वे उन तथ्यों को सूचीबद्ध करते हैं जो वे देखते हैं (कोई अनुमान नहीं)।
- वे केवल तभी निष्कर्ष निकालते हैं यदि तथ्य उनका समर्थन करते हों।
परिणाम
शोध पत्र दिखाता है कि जब उन्होंने इस नए "ईमानदार शिक्षक" पद्धति के साथ अपने AI (Qwen2.5-VL-7B) को प्रशिक्षित किया:
- कम झूठ: AI ने उन वस्तुओं को बनाना बंद कर दिया जो वहां मौजूद नहीं थीं।
- बेहرح तर्क (Better Logic): यह विजुअल रीजनिंग कार्यों (जैसे चार्ट या ज्यामिति वाले गणित के सवाल) में बहुत बेहतर हो गया।
- विश्वसनीय: यदि AI कहता है, "मुझे एक नीला घन दिख रहा है," तो आप वास्तव में भरोसा कर सकते हैं कि तस्वीर में एक नीला घन है।
संक्षेप में: PaLMR, AI को सिखाता है कि यात्रा (आप कैसे सोचते हैं) मंजिल (उत्तर) जितनी ही महत्वपूर्ण है। यह AI को बोलने से पहले "देखने" के लिए मजबूर करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।