Predicting Human Visual Attention on Words in Source Code
Cet article introduit un nouveau modèle computationnel qui surpasse de manière significative les modèles de référence existants et les systèmes d'IA avancés dans la prédiction de l'attention visuelle humaine sur le code source en utilisant une fonction de perte spécialisée pour aligner l'attention interne du réseau neuronal avec les données empiriques d'oculométrie à travers les langages de programmation Java et C.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de comprendre comment fonctionne le cerveau humain lorsqu'une personne lit un livre. Vous ne pouvez pas simplement lui demander : « À quoi penses-tu en ce moment ? », car elle ne le sait peut-être pas, ou bien elle pourrait mentir. C'est pourquoi les scientifiques utilisent une caméra spéciale pour observer leurs yeux. C'est ce qu'on appelle l'eye-tracking (l'oculométrie). C'est comme avoir un minuscule projecteur qui suit le regard d'une personne, nous montrant exactement sur quels mots elle s'attarde, lesquels elle saute et combien de temps elle fait une pause. Dans le monde de l'informatique, c'est un sujet majeur car les ingénieurs logiciels passent leur vie à fixer du code source — les instructions textuelles qui disent aux ordinateurs quoi faire. Mais le code n'est pas seulement une histoire ; c'est un puzzle. Les ingénieurs ne le lisent pas comme un roman ; ils font des allers-retours, relisant des lignes et traquant des indices. Comprendre où ils regardent nous aide à construire de meilleurs outils, à concevoir des écrans plus clairs et même à apprendre aux ordinateurs à penser davantage comme des humains.
Maintenant, voici la partie délicate : les ordinateurs sont généralement très mauvais pour deviner ce que les humains regardent. Ils pourraient penser qu'un mot long et compliqué est le plus important, alors qu'un ingénieur humain sait que le mot court et ennuyeux juste à côté est en réalité la clé de tout le programme. Cet article traite de la manière d'apprendre à un ordinateur à arrêter de deviner et à commencer à « voir » comme un programmeur humain. Les chercheurs ont construit un type spécial de cerveau informatique (un modèle) qui a appris en observant de vrais humains lire du code. Ils ne se sont pas contentés de dire à l'ordinateur : « Voici le code, devine le mot suivant ». Au lieu de cela, ils lui ont donné un aide-mémoire secret : une carte de l'endroit où les yeux humains se sont réellement posés. Ils ont appris à l'ordinateur à comparer son propre « regard » interne avec le regard réel de l'humain, en ajustant sa pensée jusqu'à ce que les deux correspondent.
La découverte principale est que ce nouveau modèle informatique est étonnamment doué pour imiter l'attention humaine. Lorsque les chercheurs l'ont testé contre trois groupes différents de programmeurs (certains lisant du code Java, d'autres du code C), les prédictions de l'ordinateur étaient beaucoup plus proches de ce que les humains faisaient réellement que n'importe quel modèle informatique précédent. En fait, lors de certains tests, l'ordinateur était 64 % et même 467 % meilleur pour deviner où un humain regarderait que les anciennes méthodes standards. Il n'a pas seulement obtenu les bons chiffres ; il a appris le schéma de la pensée humaine.
Mais les chercheurs ne se sont pas arrêtés là. Ils voulaient voir si cette attention « humaine » pouvait aider l'ordinateur à accomplir un travail plus difficile : prédire la séquence exacte de mouvements oculaires, connue sous le nom de scanpath (chemin de balayage). Imaginez essayer de prédire le chemin exact qu'un randonneur prendra dans une forêt, étape par étape. L'ordinateur, entraîné avec des données oculaires humaines, a pu prédire ces chemins mieux que d'autres modèles d'IA célèbres (comme GPT-5 et Claude) et mieux que le précédent meilleur programme informatique sur la tâche de lecture. Bien qu'il ait également montré des améliorations sur la tâche d'écriture, les chercheurs ont noté que ces gains spécifiques n'étaient pas statistiquement significatifs par rapport au précédent meilleur programme informatique, bien qu'ils aient tout de même surpassé les modèles commerciaux. Cela suggère que lorsque nous apprenons aux ordinateurs à prêter attention de la même manière que les humains, ils ne font pas que mieux lire ; ils commencent à comprendre le processus même de la pensée.
Cependant, les auteurs prennent garde à ne pas dire qu'ils ont résolu le mystère de l'esprit humain. Ils admettent que leur modèle est un « estimateur » de ce qu'un groupe de personnes fait habituellement, et non une copie parfaite du cerveau d'une seule personne. Il a aussi des limites ; il fonctionne mieux sur de petits fragments de code et pourrait être confus si le code est trop vaste pour tenir dans sa mémoire à la fois. Mais les résultats sont un indice fort que, en observant la façon dont nos yeux bougent, nous pouvons apprendre aux machines à voir le monde un peu plus comme nous le faisons.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.