ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
يُعد ViSAGE إطار عمل ذاكرة وكيلية متعددة الوسائط يعزز فهم الفيديو طويل المدى من خلال بناء ذكريات ذاتية التصحيح ومركزة حول الكيانات عبر الربط عبر الوسائط، والتحسين ثنائي الاتجاه، والتحقق المتقاطع متعدد الوكلاء لمنع خلط الهوية والهلوسة، محققاً تحسناً بنسبة 5.9% في الدقة مقارنة بالنماذج المرجعية الرائدة.