VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
यह शोध पत्र VL-Calibration का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो अंतर्निहित दृश्य निश्चितता अनुमान (intrinsic visual certainty estimation) और टोकन-स्तरीय लाभ पुन: भारण (token-level advantage reweighting) का उपयोग करके आत्मविश्वास को दृश्य और तर्क घटकों में अलग करता है ताकि लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को प्रभावी ढंग से कम किया जा सके और अंशांकन (calibration) में सुधार किया जा सके।