When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
यह शोध पत्र HalluScope प्रस्तुत करता है, जो यह प्रकट करता है कि लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) मुख्य रूप से टेक्स्टुअल इंस्ट्रक्शन प्रायर्स (textual instruction priors) द्वारा संचालित होते हैं, और HalluVL-DPO का प्रस्ताव करता है जो एक प्रिफरेंस ऑप्टिमाइज़ेशन फ्रेमवर्क है जो विजुअल क्षमताओं को संरक्षित करते हुए इन प्रॉम्प्ट-प्रेरित मतिभ्रमों को प्रभावी ढंग से कम करता है।