Semantic Visual Representations Emerge from Embodied Self-Supervised Learning
Dieses Paper führt Embodied Self-Supervised Learning (E-SSL) ein, ein Modell, das zeitliche Konsistenz und sensorimotorische Kontingenzen aus natürlicher menschlicher Interaktion nutzt, um hochgradige semantische visuelle Repräsentationen zu generieren, die bestehende Modelle übertreffen, enger mit dem visuellen Kortex präverbaler Kinder übereinstimmen und neue Einblicke in die Ursprünge der menschlichen visuellen Entwicklung und Stromspezialisierung bieten.