Semantic Visual Representations Emerge from Embodied Self-Supervised Learning
Este artigo introduz o Aprendizado Autorsupervisionado Incorporado (E-SSL), um modelo que aproveita a consistência temporal e as contingências sensoriomotoras da interação humana natural para gerar representações visuais semânticas de alto nível que superam os modelos existentes, alinham-se mais estreitamente com o córtex visual de crianças pré-verbais e oferecem novas percepções sobre as origens do desenvolvimento visual humano e da especialização de fluxos.