VL-KnG: Persistent Spatiotemporal Knowledge Graphs from Egocentric Video for Embodied Scene Understanding
يُعد VL-KnG إطار عمل لا يتطلب تدريباً، يقوم ببناء رسوم بيانية معرفية مكانية-زمانية مستمرة من فيديوهات أحادية المنظور من منظور الشخص الأول باستخدام ربط الكائنات القائم على النماذج اللغوية الكبيرة والاسترجاع الهجين، مما يتيح فهماً واستدلالاً فعالاً للمشاهد المجسدة في وقت ثابت دون الحاجة إلى إعادة بناء ثلاثي الأبعاد أو إعادة معالجة الفيديو.