Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization
تقدم هذه الورقة البحثية C3PO، وهو إطار عمل قائم على التدريب يعمل على تخفيف الهلوسة في نماذج الاستدلال متعددة الوسائط من خلال ضغط سلسلة الأفكار لتقليل الرموز النصية الزائدة، وتوظيف تحسين التفضيل التبايني مع إشارات سلبية محفزة للهلوسة لتعزيز الاعتماد البصري.