When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning
تقدم هذه الورقة البحثية "دلالات المهام المرئية" (VTS) للكشف عن فجوة أداء كبيرة في النماذج متعددة الوسائط عندما تُدمج التعليمات كبكسلات بدلاً من نصوص، وتقترح طريقة لربط منطقة التلقين (prompt-region grounding) تسد بفعالية فجوة القناة الدلالية هذه دون الحاجة إلى التعرف الضوئي على الحروف (OCR) أو بيانات وصف المناطق أثناء الاستدلال.