GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs
يُعد GraFT إطار عمل لا يتطلب تدريباً يعمل على تعزيز الاستدلال المكاني في النماذج اللغوية الكبيرة متعددة الوسائط من خلال الاستفادة من مخطط مشهد ثلاثي الأبعاد لتوفير هندسة حتمية، وتخطيطات متمحورة حول الشيء، وتأريضاً للسمات البصرية، محققاً مكاسب أداء كبيرة في معايير مثل ScanQA وVSI-Bench دون الحاجة إلى ضبط دقيق مكلف أو مشفرات مخصصة.