HumanCLAW: Can Vision-Language Models Act Through a Body?
यह शोधपत्र HumanCLAW प्रस्तुत करता है, जो एम्बोडीड इंटेलिजेंस (embodied intelligence) के मूल्यांकन के लिए विजन-लैंग्वेज मॉडल के निर्णय लेने की प्रक्रिया को मोटर निष्पादन (motor execution) से अलग करता है, जिससे यह पता चलता है कि वर्तमान मॉडल मुख्य रूप से पहचान क्षमताओं के बजाय एम्बोडीड आत्म-जागरूकता (embodied self-awareness) की कमी के कारण लंबी अवधि के भौतिक कार्यों में विफल होते हैं।