Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
यह शोधपत्र TouchSafeBench प्रस्तुत करता है, जो Habitat 3.0 में एक भौतिकी-आधारित बेंचमार्क है जो सुरक्षित मानव-रोबोट सहयोग के लिए टकराव के जोखिमों का अनुमान लगाने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल्स में सुरक्षित, टकराने वाली और आसन्न संपर्क अवस्थाओं के बीच विश्वसनीय रूप से अंतर करने के लिए आवश्यक भौतिक जवाबदेही और स्पष्ट ज्यामितीय तर्क का अभाव है।