Semantic Visual Representations Emerge from Embodied Self-Supervised Learning
Cet article introduit l'Apprentissage Auto-Supervisé Incarné (E-SSL), un modèle qui exploite la cohérence temporelle et les contingences sensorimotrices issues de l'interaction humaine naturelle pour générer des représentations visuelles sémantiques de haut niveau qui surpassent les modèles existants, s'alignent plus étroitement avec le cortex visuel des enfants pré-verbaux, et offrent de nouvelles perspectives sur les origines du développement visuel humain et de la spécialisation des flux.