← Derniers articles
💬 NLP

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

Cet article présente un ensemble de données partagé de 1 446 textes de recherche désordonnés avec des scores de qualité UK et un défi correspondant consistant à concevoir des invites de modèles de langage de grande taille optimales qui extraient avec précision des scores valides ou identifient les valeurs manquantes, visant à dépasser une précision initiale de base de 72,6 % tout en faisant progresser la compréhension de l'ingénierie d'invite pour des tâches numériques complexes.

Auteurs originaux : Mike Thelwall

Publié 2026-01-27
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Mike Thelwall

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un bibliothécaire essayant d'organiser une pile massive de lettres. Chaque lettre a été écrite par un robot différent (une IA) pour décrire la qualité d'un article de recherche. Les robots étaient censés donner une note simple, comme un score d'étoiles de 1 à 4.

Les robots sont des écrivains désordonnés. Certaines lettres commencent par le score, d'autres cachent le score au milieu d'un paragraphe, certaines donnent trois scores différents et oublient de les combiner, et d'autres ne font que divaguer sans donner de score du tout. Pire encore, certains robots inventent même de faux scores comme « 95 % » ou « 4/5 » alors que les règles n'autorisent que de 1 à 4 étoiles.

Le Problème
Mike Thelwall, l'auteur de ce document, a rassemblé 1 446 de ces lettres désordonnées. Il appelle cela un « ensemble de données partagé ». Son objectif est de mettre au défi d'autres chercheurs de construire un « manuel d'instructions magique » (appelé prompt) pour un nouveau robot plus intelligent.

Le travail de ce nouveau robot est de lire les lettres désordonnées et d'en extraire le bon nombre. Mais il doit suivre deux règles strictes :

  1. Être un Détective : Il doit trouver le bon score même si la lettre est confuse. Si la lettre mentionne séparément l'« Originalité », la « Signification » et la « Rigueur », le robot doit savoir qu'il doit en faire la moyenne. Si la lettre n'a pas de score, il doit dire « -1 » (ce qui signifie « Je ne sais pas »).
  2. Être un Robot, Pas un Bavard : Le robot doit uniquement recracher le nombre (comme « 3* » ou « -1 »). Il ne peut pas dire : « Je pense que le score est 3 parce que... ». S'il ajoute des mots supplémentaires, la réponse est fausse.

Le Défi
Voyez cela comme une partie de « Jacques a dit » jouée avec un robot très littéral mais légèrement confus.

  • Le Score Actuel : L'auteur a essayé un manuel d'instructions simple, et le robot a eu raison environ 73 % du temps.
  • L'Objectif : Le défi est que quiconque conçoive un meilleur manuel d'instructions pour obtenir un score plus élevé.

Pourquoi Faire Cela ?
Cet article ne porte pas sur l'utilisation de cela pour noter de vraies dissertations d'étudiants ou corriger des diagnostics médicaux pour le moment. Au lieu de cela, c'est un exercice d'entraînement. En forçant les chercheurs à découvrir comment faire en sorte que les robots extraient des nombres spécifiques à partir de textes désordonnés, nous apprenons :

  • Comment parler aux robots pour qu'ils écoutent mieux (Conception de Prompt).
  • Où les robots se confondent et comment corriger ces instructions.
  • Comment gérer les situations où le robot est incertain (savoir quand dire « -1 » au lieu de deviner).

L'Essentiel
Cet article est une invitation à un concours. Il dit : « Voici une pile de notes de robots désordonnées et une liste des bonnes réponses. Pouvez-vous écrire l'ensemble d'instructions parfait pour qu'un robot lise ces notes et vous donne juste le bon nombre, à chaque fois ? » Le vainqueur est la personne qui parvient à obtenir le pourcentage de bonnes réponses le plus élevé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →