← Derniers articles
💻 computer science

XPASS-Vis: A Dataset for Cross-Domain Personalized Image Aesthetic Assessment

Cet article présente XPASS-Vis, le premier ensemble de données conçu pour l'évaluation esthétique d'images personnalisée et transdomaine, comprenant 6 526 stimuli à travers les domaines de l'art, de la mode et du paysage notés par 129 annotateurs, et établit des modèles de base d'adaptation de domaine non supervisée qui démontrent la transférabilité partielle des préférences esthétiques personnalisées tout en soulignant la nécessité de recherches supplémentaires pour combler l'écart de performance restant.

Auteurs originaux : Takato Hayashi, Hiroaki Takahara, Candy Olivia Mawalim, Hiromi Narimatsu, Akisato Kimura, Shiro Kumano, Shogo Okada

Publié 2026-06-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Takato Hayashi, Hiroaki Takahara, Candy Olivia Mawalim, Hiromi Narimatsu, Akisato Kimura, Shiro Kumano, Shogo Okada

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un ami qui est un immense fan d'art minimaliste. Vous pourriez supposer qu'il aimerait aussi la mode minimaliste ou la photographie de paysages minimalistes. Mais est-ce vraiment le cas ? Peut-être aime-t-il l'art mais trouve-t-il la mode ennuyeuse, ou vice versa.

C'est le cœur du puzzle que le papier XPASS-VIS tente de résoudre : Pouvons-nous apprendre à un ordinateur à comprendre votre goût spécifique dans un domaine (comme l'art) et utiliser cette connaissance pour deviner ce que vous aimerez dans un domaine totalement différent (comme la mode), même si l'ordinateur n'a jamais vu vos réactions sur la mode ?

Voici une décomposition du parcours du papier, en utilisant des analogies simples.

1. Le problème : Le piège du "taille unique"

Actuellement, les ordinateurs qui jugent la beauté (Évaluation Esthétique) sont comme des critiques généraux. Ils regardent un tableau et disent : « La plupart des gens trouvent cela beau. » Mais vous et votre meilleur ami pourriez avoir des opinions totalement différentes.

Pour corriger cela, les chercheurs ont construit des modèles « personnalisés » qui apprennent votre goût spécifique. Cependant, ces modèles ne fonctionnent généralement que dans une seule voie. Si vous entraînez un ordinateur à connaître votre goût pour l'Art, il ne sait pas comment appliquer cela à la Mode ou aux Paysages. C'est comme enseigner à un chef comment faire des sushis parfaits, puis lui demander de cuisiner un gâteau sans nouvelles instructions. Il pourrait échouer parce qu'il ne sait pas comment transférer ses compétences.

2. La solution : Un nouveau jeu de données de "test de goût"

Pour étudier cela, les auteurs ont créé XPASS-Vis, le premier jeu de données conçu spécifiquement pour tester ce transfert « cross-domain » (trans-domaine).

  • Les participants : Ils ont réuni 129 personnes (annotateurs).
  • Le menu : Ils ont montré à ces personnes 6 526 images réparties en trois « plats » très différents :
    1. Art : Peintures et sculptures.
    2. Mode : Vêtements et tenues.
    3. Paysage : Vues de paysages (originellement des clips vidéo, transformés en photos fixes).
  • La notation : Chaque personne a noté chaque image non seulement sur « À quel point est-ce joli ? » (de 1 à 7), mais aussi sur des sentiments spécifiques comme « Est-ce que cela me rend nostalgique ? » ou « Est-ce intellectuellement stimulant ? ».

La caractéristique clé : Contrairement aux jeux de données précédents où les gens ne notaient qu'un seul type d'image, ici, les mêmes 129 personnes ont noté les trois types d'images. C'est la « pierre de Rosette » qui permet aux chercheurs de voir si votre amour pour les lignes simples dans l'art se traduit par un amour pour les lignes simples dans la mode.

3. L'expérience : Le défi « non supervisé »

Les chercheurs ont mis en place un jeu complexe pour tester si les ordinateurs pouvaient apprendre ces connexions sans aide.

  • La configuration : Ils ont donné à l'ordinateur des données étiquetées (notes) pour l'Art (la Source).
  • Le défi : Ils ont demandé à l'ordinateur de prédire les notes pour la Mode (la Cible), mais ils ne lui ont donné aucune note de Mode pour apprendre. L'ordinateur devait découvrir la connexion par lui-même.
  • La méthode : Ils ont essayé diverses techniques d'« adaptation de domaine ». Considérez cela comme différentes stratégies pour traduire un livre d'une langue à une autre sans dictionnaire.
    • Méthodes adverses : Essayer de tromper l'ordinateur pour qu'il oublie quel domaine il est en train d'observer.
    • Alignement de caractéristiques : Essayer d'aligner mathématiquement la « forme » des données d'Art avec la « forme » des données de Mode.

4. Les résultats : Un « oui » nuancé

Les résultats sont encourageants, bien que non parfaits.

  • La référence (Baseline) : Si l'ordinateur se contente de deviner en se basant sur les données d'Art et les applique à la Mode sans aucune astuce particulière, il performe très mal (comme une mauvaise traduction).
  • L'amélioration : Les meilleures méthodes de « traduction » (spécifiquement celles conçues pour les tâches de régression, appelées RSD et DARE-GRAM) ont réussi à récupérer environ 60 % de la performance potentielle.
    • Analogie : Imaginez que le score parfait est 100. Sans aide, l'ordinateur obtient 15. Avec les meilleures nouvelles astuces, il grimpe à 45. Ce n'est pas parfait, mais c'est un bond massif, prouvant que votre goût pour l'Art partage effectivement un certain ADN avec votre goût pour la Mode.

Résultat clé : L'ordinateur a appris que si vous aimez l'art « simple et épuré », vous avez probablement tendance à aimer la mode « simple et épurée », même sans qu'on lui dise explicitement.

5. Qui en bénéficie ? (Le mystère)

Les chercheurs ont creusé plus loin pour voir quels types de personnes bénéficiaient le plus de ce transfert. Ils ont examiné l'âge, le genre, la nationalité et les traits de personnalité (comme l'« ouverture aux nouvelles expériences »).

  • La surprise : Ils n'ont trouvé aucun schéma.
    • Ce n'était pas seulement les « experts en art » qui en bénéficiaient.
    • Ce n'était pas seulement les « jeunes » ou les « hommes ».
    • Le bénéfice semblait être aléatoire parmi ces groupes.
  • La conclusion : La capacité de transférer le goût ne dépend pas de qui vous êtes sur le papier (vos données démographiques) ; c'est la structure spécifique et invisible de vos préférences personnelles qui compte. L'ordinateur ne peut pas prédire qui bénéficiera du transfert simplement en regardant un profil ; cela fonctionne de manière large pour tout le monde, à un certain degré.

6. Limites : Ce que le papier n'a pas dit

Les auteurs sont honnêtes sur ce qu'ils n'ont pas fait :

  • Biais culturel : Presque tous les participants étaient d'Asie de l'Est. Nous ne savons pas si cela fonctionne pour les personnes d'autres cultures.
  • Portée : Ils n'ont examiné que l'Art, la Mode et les Paysages. Ils n'ont pas testé l'Architecture ou le Design de produits.
  • Vidéo vs Photo : Les données de paysage étaient originellement des vidéos, mais ils ont utilisé des images fixes. Ils admettent qu'ils ont pu manquer le « sentiment » du mouvement.
  • Travaux futurs : Ils n'ont pas testé l'apprentissage « few-shot » (où l'on donne à l'ordinateur seulement 5 exemples de votre goût pour la mode) ou d'autres méthodes avancées. Ils ont laissé cela pour les futurs chercheurs.

Résumé

Ce papier introduit un nouveau jeu de données (XPASS-Vis) qui prouve que le goût personnel est transférable. Bien qu'un ordinateur ne puisse pas prédire parfaitement votre goût pour la mode en connaissant simplement votre goût pour l'art, il peut y parvenir à environ 60 % en utilisant des astuces mathématiques intelligentes, sans avoir besoin de voir vos notes de mode au préalable. Cela suggère que nos âmes esthétiques possèdent un noyau cohérent qui traverse différents types de beauté.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →