Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction
تقدم هذه الورقة نموذجاً لغوياً-بصرياً مضبوطاً بدقة يستفيد من الصور اللونية أحادية العدسة (RGB)، واللغة الطبيعية، وحالات الروبوت لتقدير مواضع الأجسام ثلاثية الأبعاد للتفاعل بين الإنسان والروبوت، محققاً متوسط خطأ قدره 13 ملم ومتفوقاً بشكل كبير على النماذج المرجعية غير المضبوطة بدقة.