VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?
تقدم هذه الورقة VisEditBench، وهو معيار شامل يتكون من 1,395 مهمة مشروحة بشرياً صُممت لتقييم قدرة نماذج الرؤية واللغة على تحرير كود التصور البياني بناءً على تغذية راجعة متعددة الوسائط، مما يكشف عن فجوات أداء كبيرة في النماذج الحالية ويقترح VisEditAgent، وهو إطار عمل قائم على الرندرة (الصيرورة) يحسن دقة التحرير بشكل كبير.