Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
تُعد Vision-OPD إطار عمل للتقطير الذاتي يعمل على تعزيز الفهم البصري دقيق التفاصيل في النماذج اللغوية الكبيرة متعددة الوسائط من خلال تدريب سياسة الصورة الكاملة على محاكاة الأداء المتفوق لمعلم مشروط بالقصاصات (crop-conditioned) على مخرجاته الخاصة، مما يُمكّن النموذج من استيعال فوائد التركيز على الأدلة ذات الصلة دون إشراف خارجي أو أدوات.