LVLM-Aided Alignment of Task-Specific Vision Models
تقدم هذه الورقة LVLM-VA، وهي طريقة مبتكرة تسخر نموذج لغة رؤية لغوي كبير لمحاذاة نماذج رؤية صغيرة متخصصة في مهام معينة مع المعرفة البشرية في المجال عبر ترجمة سلوك النموذج إلى لغة طبيعية ورسم خرائط للمواصفات البشرية إلى انتقادات على مستوى الصورة، مما يقلل الاعتماد على الارتباطات الزائفة دون الحاجة إلى تعليقات دقيقة التفاصيل.