User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models
Cet article examine le potentiel de l'utilisation des modèles de langage de grande taille pour analyser les avis des utilisateurs en vue de l'identification des exigences d'utilisabilité, démontrant, grâce à un jeu de données codé et à l'ingénierie de prompts, que les modèles de langage de grande taille peuvent atteindre des performances comparables à celles des humains dans la détection des problèmes d'utilisabilité, à condition que les prompts soient soigneusement conçus.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes le chef d'un restaurant très fréquenté. Vous souhaitez savoir exactement ce que vos clients pensent de votre cuisine afin d'améliorer votre carte. Vous pourriez engager une équipe de critiques gastronomiques professionnels pour déguster chaque plat et rédiger des rapports détaillés, mais cela coûte cher et prend du temps. Alternativement, vous pourriez simplement lire les milliers d'avis désordonnés, émotionnels et parfois confus que les gens laissent sur votre site web.
Ce document traite de la tentative d'enseigner à un ordinateur ultra-intelligent (appelé Modèle de Langage à Grande Échelle, ou LLM) à lire ces avis désordonnés et à identifier ceux qui concernent réellement l'utilisabilité—c'est-à-dire la facilité ou la difficulté d'utilisation de l'application.
Voici l'histoire de leur expérience, décomposée simplement :
Le Problème : Trop de Bruit, Pas Assez de Temps
Les entreprises de logiciels sont submergées par les avis des utilisateurs. Les gens écrivent des choses comme : « Cette application est un cauchemar ! » ou « J'ai cliqué trois fois et cela ne fonctionne toujours pas ! » ou encore « J'adore la nouvelle fonctionnalité, mais le bouton est trop petit. »
- L'Ancienne Méthode : Pour trouver les plaintes utiles, les chercheurs entraînaient autrefois des ordinateurs en utilisant l'apprentissage automatique (Machine Learning). Mais c'était comme essayer d'enseigner à un chien à rapporter en lui lançant des milliers de bâtons et en espérant qu'il apprenne. Cela nécessitait une quantité massive de travail humain pour étiqueter les données au préalable.
- La Nouvelle Idée : Et si nous demandions simplement à un ordinateur sur-intelligent (le LLM) de lire les avis et de nous dire lesquels concernent « l'utilisabilité » ? Ces ordinateurs sont déjà entraînés sur l'ensemble d'Internet, ils pourraient donc comprendre le contexte sans que nous ayons besoin de les enseigner depuis zéro.
L'Expérience : Le « Test de Dégustation »
Les chercheurs allemands ont mis en place un test contrôlé pour voir si l'ordinateur pouvait faire le travail aussi bien qu'un expert humain.
Les Ingrédients : Ils ont rassemblé 300 avis réels d'utilisateurs provenant de trois types d'applications très différents :
- Une application de trafic/radar (pour les conducteurs).
- Une application de magasin d'alimentation (pour les acheteurs).
- Une application de création musicale (pour les musiciens).
- Pourquoi ces trois-là ? Pour s'assurer que l'ordinateur n'était pas simplement bon avec un seul type de langage spécifique.
Les Juges Humains : Deux experts humains ont lu les 300 avis. Ils ont utilisé une célèbre liste de contrôle (les 10 Heuristiques d'Utilisabilité de Nielsen) pour décider si un avis concernait « l'utilisabilité » (Vrai) ou non (Faux). Ils ont débattu des cas difficiles jusqu'à ce qu'ils s'accordent. Cela a créé la « clé de réponse » de référence (Gold Standard).
L'Étudiant Ordinateur : Ils ont donné au LLM un ensemble d'instructions (appelé un Prompt). Considérez ce prompt comme une recette.
- Première tentative : La recette était vague. L'ordinateur s'est perdu.
- Deuxième et troisième tentatives : Les chercheurs ont affiné la recette, ajoutant des étapes plus spécifiques et des exemples (comme dire à l'ordinateur : « Si quelqu'un dit que l'application est 'lourde', cela compte comme un problème d'utilisabilité »).
- Le Test Final : Ils ont donné à l'ordinateur la recette finale, polie, et lui ont demandé de noter les 300 avis.
Les Résultats : Un Étudiant Prometteur, Mais Imparfait
Les chercheurs ont comparé les notes de l'ordinateur à la clé de réponse des experts humains.
- La Bonne Nouvelle : L'ordinateur était étonnamment bon pour trouver les avis « Vrais ». Il ne manquait pas beaucoup de plaintes concernant l'utilisabilité. Si un humain disait : « C'est un problème d'utilisabilité », l'ordinateur était généralement d'accord.
- La Mauvaise Nouvelle : L'ordinateur était un peu trop enthousiaste. Il signalait parfois des avis comme des « problèmes d'utilisabilité » alors que les humains pensaient qu'il s'agissait simplement de plaintes générales ou de bugs.
- La Vérification de Fiabilité : Lorsqu'ils ont mesuré la fréquence à laquelle l'ordinateur et les humains s'accordaient sur la même réponse exacte, les résultats étaient mitigés.
- Pour l'application musicale, ils s'accordaient assez bien.
- Pour les applications de trafic et d'épicerie, ils étaient en désaccord plus souvent.
- Crucialement, les erreurs de l'ordinateur ne se produisaient pas aux mêmes endroits où les humains étaient incertains. L'ordinateur commettait ses propres erreurs uniques, ce qui signifie qu'il ne « pensait » pas encore parfaitement comme un expert humain.
La Conclusion : Un Assistant Utile, Pas un Remplacement
Le document conclut que, bien que l'ordinateur ne soit pas prêt à remplacer entièrement les experts humains, c'est un outil très utile.
Considérez le LLM comme un stagiaire ultra-rapide.
- Si vous demandez au stagiaire de lire 1 000 avis, il trouvera presque chaque plainte concernant l'utilisabilité.
- Il pourrait aussi signaler quelques éléments qui ne sont pas réellement des problèmes d'utilisabilité (fausses alertes), mais les chercheurs soutiennent qu'il vaut mieux avoir quelques avis supplémentaires à vérifier que de manquer un vrai problème.
- La clé pour faire fonctionner ce stagiaire efficacement était le Prompt (les instructions). Une instruction vague a conduit à de mauvais résultats ; une instruction détaillée et soigneusement élaborée a conduit à de bons résultats.
En bref : Vous n'avez plus besoin de passer des mois à entraîner un ordinateur à lire des avis. Vous avez juste besoin de donner à un ordinateur intelligent un ensemble d'instructions très claires, et il peut faire un excellent travail pour vous aider à trouver ce dont vos utilisateurs ont vraiment besoin. Cependant, vous avez toujours besoin d'un humain pour vérifier le travail, en particulier pour les cas délicats.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.