Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models
من خلال سبر أغوار نماذج اللغات الكبيرة متعددة الوسائط (LVLMs) باستخدام مجموعة بيانات رسوم بيانية موجهة اصطناعية، تكشف هذه الدراسة أنه بينما يتم ترميز معلومات العقد والبنية خطياً في مرحلة مبكرة في المشفر البصري، فإن تمثيلات الحواف لا تظهر إلا لاحقاً في الرموز النصية للنموذج اللغوي، مما يفسر معاناة هذه النماذج المستمرة مع الفهم العلاقاتي.