GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs
GraFT एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में स्थानिक तर्क (spatial reasoning) को बढ़ाने के लिए एक 3D सीन ग्राफ का लाभ उठाता है ताकि नियत ज्यामिति (deterministic geometry), एलोसेंट्रिक लेआउट (allocentric layouts) और विजुअल-एट्रिब्यूट ग्राउंडिंग प्रदान की जा सके, जिससे बिना किसी महंगी फाइन-ट्यूनिंग या समर्पित एनकोडर की आवश्यकता के ScanQA और VSI-Bench जैसे बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।