Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
यह शोध पत्र AVES-DPO का प्रस्ताव करता है, जो एक स्व-सुधारित प्राथमिकता शिक्षण ढांचा (self-corrected preference learning framework) है जो एक सर्वसम्मति-आधारित सत्यापन तंत्र के माध्यम से इन-डिस्ट्रीब्यूशन प्राथमिकता युग्मों को उत्पन्न करके लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे प्रोप्रायटरी मॉडल्स पर निर्भरता के कारण होने वाले वितरण संबंधी बेमेल (distributional mismatch) को दूर किया जा सके।