← नवीनतम पेपर
🤖 machine learning

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

यह शोध पत्र ViPSy का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा (two-stage framework) है जो विजुअली ग्राउंडेड और पॉलिसी-अलाइन्ड प्रेफरेंस डेटा को सिंथेसाइज करता है ताकि विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को महत्वपूर्ण रूप से कम किया जा सके, जिससे मतिभ्रम बेंचमार्क पर नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है और साथ ही सामान्य दृश्य क्षमताओं में वृद्धि होती है।

मूल लेखक: Yunhun Nam, Jongheon Jeong

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunhun Nam, Jongheon Jeong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विजन-लैंग्वेज मॉडल (VLM) की कल्पना एक बहुत ही बुद्धिमान, विद्वान कला समीक्षक के रूप में करें जो आंखों पर पट्टी बांधे हुए है और उसका एक दोस्त उसे पेंटिंग का वर्णन करके बता रहा है। समस्या यह है कि यह समीक्षक कभी-कभी कला के इतिहास के अपने ज्ञान में इतना खो जाता है कि वह ऐसी चीजों का वर्णन करने लगता है जो वास्तव में पेंटिंग में मौजूद ही नहीं हैं—जैसे कि एक शांत बगीचे की तस्वीर में "स्वर्ण ईगल" होने का दावा करना, सिर्फ इसलिए क्योंकि उसके ट्रेनिंग डेटा में "बगीचों में आमतौर पर ईगल होते हैं"। इसे हैलुसिनेशन (Hallucination) कहा जाता है।

यह पेपर एक नई विधि पेश करता है जिसे ViPSy (विज़न-ड्रिवन प्रेफरेंस सिंथेसिस) कहा जाता है ताकि इसे ठीक किया जा सके। ViPSy को एक चतुर प्रशिक्षण शिविर (training camp) के रूप में समझें जिसे समीक्षक को अपनी कल्पना पर भरोसा करने के बजाय वास्तविक पेंटिंग को देखने के लिए प्रशिक्षित करने के लिए डिज़ाइन किया गया है।

ViPSy कैसे काम करता है, यहाँ दो सरल चरणों में दिया गया है:

चरण 1: "वास्तविकता की जांच" (सेल्फ-कैप्शन्ड सिमेंटिक सिंथेसिस)

कल्पना कीजिए कि आप जानना चाहते हैं कि किसी फोटो में वास्तव में क्या है, लेकिन आप सुनिश्चित नहीं हैं कि आपकी याददाश्त आपके साथ धोखा तो नहीं कर रही है।

  1. विवरण (The Description): सबसे पहले, AI मूल फोटो को देखता है और उसका एक विस्तृत विवरण लिखता है (जैसे कि एक कैप्शन)।
  2. पुनः कल्पना (The Re-Imagination): फिर, वह उस विवरण को लेता है और एक अलग AI (एक टेक्स्ट-टू-इमेज जनरेटर) से पूछता है कि क्या वह केवल उन शब्दों के आधार पर एक नया चित्र बना सकता है।
  3. तुलना (The Comparison): यह प्रक्रिया कई बार दोहराई जाती है, जिससे मूल फोटो के कुछ थोड़े अलग "पुनः कल्पित" संस्करण बनते हैं।
  4. समान आधार खोजना (Finding the Common Ground): सिस्टम फिर इन नए चित्रों की मूल फोटो के साथ तुलना करता है। यह पूछता है: "कौन सी वस्तुएं मूल फोटो में भी मौजूद हैं और लगभग सभी नए चित्रों में भी दिखाई देती हैं?"
    • यदि मूल फोटो में एक लाल ट्रक है, और नए चित्र (जो विवरण पर आधारित हैं) भी एक लाल ट्रक को बनाए रखते हैं, तो यह एक ठोस तथ्य है।
    • यदि मूल फोटो में एक पेड़ है, लेकिन नए चित्र उसे भूल जाते हैं या बदल देते हैं, तो सिस्टम समझ जाता है कि वह विवरण संदिग्ध हो सकता है।

इस चरण का परिणाम एक "विजुअल क्यू" (Visual Cue) होता है। इस क्यू को एक भरोसेमंद चेकलिस्ट के रूप में समझें जो छवि की सबसे निर्विवाद और ठोस वस्तुओं (जैसे, "लाल ट्रक," "पेड़," "नीला आकाश") की सूची है। यह अनुमान लगाने की गुंजाइश को खत्म कर देता है।

चरण 2: "निर्देशित अभ्यास" (क्यू-कंडीशन्ड सेल्फ-डिस्टिलेशन)

अब जब AI के पास अपनी भरोसेमंद चेकलिस्ट है, तो वह फोटो का वर्णन करने के लिए वापस जाता है।

  1. अभ्यास सत्र (The Practice Run): AI फिर से फोटो का वर्णन करने की कोशिश करता है, लेकिन इस बार, उसे उस "विजुअल क्यू" चेकलिस्ट को ध्यान में रखने के लिए मजबूर किया जाता है। यह एक समीक्षक को यह बताने जैसा है कि, "आपको लाल ट्रक और पेड़ का उल्लेख करना होगा, और कुछ भी मनगढ़ंत नहीं बनाना है।"
  2. विकल्प उत्पन्न करना (Generating Options): AI इस मार्गदर्शन के आधार पर कई अलग-अलग विवरण तैयार करता है। कुछ बहुत सटीक होंगे; कुछ में अभी भी गलती हो सकती है और वे कोई फर्जी वस्तु (जैसे कि "नीली कार" जो वहां नहीं है) जोड़ सकते हैं।
  3. निर्णायक (The Judge): एक सुपर-स्मार्ट "जज" AI इन सभी विकल्पों को देखता है। वह मूल फोटो के साथ तुलना करता है और चुनता है:
    • विजेता (The Winner): वह विवरण जिसने चेकलिस्ट और फोटो का पूरी तरह से पालन किया।
    • हारने वाला (The Loser): वह विवरण जिसने हैलुसिनेशन किया (चीजें मनगढ़ंत बनाईं)।

अंतिम सबक (प्रेफरेंस अलाइनमेंट)

सिस्टम इन "विजेता बनाम हारने वाले" जोड़ों को मुख्य AI मॉडल को सिखाता है: "अगली बार, तुम्हें विजेता की तरह बात करनी चाहिए, न कि हारने वाले की तरह।"

ऐसा करके, AI दृश्य साक्ष्य (चेकलिस्ट) पर अपने आंतरिक पूर्वाग्रहों (वह क्या सोचता है कि वहां होना चाहिए) के बजाय भरोसा करना सीख जाता है।

यह पुराने तरीकों से बेहतर क्यों है?

पेपर तर्क देता है कि पिछले तरीकों में दो मुख्य खामियां थीं:

  • "एडिट" (Edit) विधि: कुछ तरीके बस एक गलत उत्तर लेते थे और उसे मैन्युअल रूप से सही करते थे। पेपर कहता है कि यह एक शिक्षक द्वारा छात्र के निबंध को फिर से लिखने जैसा है; छात्र यह नहीं सीख पाता कि इसे खुद कैसे लिखना है, और अंतिम परिणाम अप्राकृतिक लगता है।
  • "रैंडम गेस" (Random Guess) विधि: अन्य तरीके बस AI को कई बार अनुमान लगाने के लिए कहते थे और सबसे अच्छे को चुन लेते थे। पेपर कहता है कि यह अक्सर विफल हो जाता है क्योंकि AI अभी भी अपनी कल्पना पर निर्भर करता है बजाय इसके कि वह चित्र को करीब से देखे।

ViPSy विशेष है क्योंकि यह AI की अपनी "कल्पना" (उसके बोलने का स्वाभाविक तरीका) का उपयोग करता है लेकिन उसे एक सख्त, विजुअल चेकलिस्ट के साथ निर्देशित करता है। यह AI को स्वाभाविक रूप से बोलने देते हुए भी सत्यवादी बनाए रखता है।

परिणाम

पेपर का दावा है कि इस विधि का उपयोग करने से, AI बेहतर तरीके से चीजें बनाने से बच गया।

  • इसने एक टेस्ट में "हैलुसिनेशन" (वस्तुओं को मनगढ़ंत बनाना) को लगभग 35% और दूसरे टेस्ट में 24% कम कर दिया, जो सभी पिछले तरीकों को पछाड़ देता है।
  • यह सामान्य कार्यों में भी बेहतर हुआ, जैसे जटिल दृश्यों को समझना और वस्तुओं को पहचानना, जो यह साबित करता है कि AI को चित्र को ध्यान से देखने के लिए मजबूर करने से वास्तव में उसकी "आंखें" तेज हुईं, न कि केवल उसका "मुंह" शांत हुआ।

संक्षेप में, ViPSy AI को अनुमान लगाना बंद करने और देखना शुरू करने के लिए सिखाता है, जो वर्णन करने, पुनः चित्रित करने और सत्य खोजने के एक चतुर लूप का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →