Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces
تقترح الورقة البحثية إطار عمل SVAE، وهو إطار تعلم كامن يعتمد على الهندسة أولاً، يستخدم توزيعات القوة الكروية (Power Spherical) ضمن محول مرئي مرتكز على الهندسة (Visual Geometry Grounded Transformer) للتفوق على عنق الزجاجة الغاوسي التقليدي في الحفاظ على الهندسة ثلاثية الأبعاد وديناميكيات الكاميرا تحت ضغط عالي.