Researchers waste 80% of LLM annotation costs by classifying one text at a time
Cette étude démontre que le regroupement de plusieurs textes et variables dans une seule requête de modèle de langage peut réduire les coûts d'annotation de plus de 80 % sans compromettre la précision, car l'erreur de mesure introduite reste inférieure aux désaccords habituels entre codeurs humains.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
🚚 Le problème : Le livreur qui ne fait qu'un seul colis à la fois
Imaginez que vous êtes un chercheur qui veut analyser 100 000 tweets (des petits messages sur les réseaux sociaux) pour y trouver des informations précises, comme :
- Est-ce que ce tweet parle de politique ?
- Est-ce qu'il propose une solution à un problème ?
- Quel est le ton (positif ou négatif) ?
- De quel sujet précis parle-t-il ?
Jusqu'à présent, les chercheurs utilisaient les intelligences artificielles (les "LLM", comme des robots très intelligents) d'une manière très inefficace. C'était comme si vous engagiez un livreur de colis pour lui donner un seul petit paquet à la fois.
- Vous lui donnez le tweet n°1 et vous lui demandez : "C'est politique ?" -> Il répond.
- Vous lui donnez le tweet n°2 et vous lui demandez : "C'est politique ?" -> Il répond.
- Vous recommencez pour chaque question (4 questions par tweet).
Le résultat ? Pour 100 000 tweets, vous devez appeler le livreur 400 000 fois. C'est lent, et surtout, c'est extrêmement cher. Vous payez le "trafic" (les frais de connexion) à chaque fois, même si le livreur a juste fait un pas de plus.
💡 La solution : Le camion de déménagement (Le "Batching" et le "Stacking")
Les auteurs de cette étude (Christian Pipal et son équipe) se sont dit : "Pourquoi ne pas charger le camion ?"
Ils ont testé deux astuces simples :
- Le "Batching" (Regrouper) : Au lieu d'envoyer un tweet, on en envoie 25 ou 100 ensemble dans le même message au robot.
- Le "Stacking" (Empiler) : Au lieu de demander une seule chose par message, on demande au robot de répondre aux 4 questions (politique, solution, ton, sujet) pour les 25 tweets en même temps.
C'est comme passer d'un scooter qui livre un seul café à la fois, à un gros camion qui livre 100 cafés et répond à 4 questions sur chaque café en un seul trajet.
🧪 L'expérience : Est-ce que ça casse les choses ?
La grande peur des chercheurs était : "Si on met trop de choses dans le camion, le robot va-t-il devenir confus et faire des erreurs ?"
Pour le savoir, ils ont pris 3 962 tweets déjà analysés par des humains experts (la "référence") et ils ont demandé à 8 robots différents (de Google, OpenAI, Anthropic, Alibaba) de les analyser de différentes manières :
- Un par un (la méthode lente).
- Par paquets de 25, 50, 100, jusqu'à 1 000 tweets.
- Avec 4 questions, 10 questions, ou même 25 questions empilées.
🏆 Les résultats : La surprise !
Les résultats sont excellents et très rassurants :
- Jusqu'à 100 tweets par paquet, c'est parfait : Pour la plupart des robots, la qualité des réponses reste identique à celle du "un par un". On économise plus de 80 % de l'argent sans perdre en précision.
- On peut empiler jusqu'à 10 questions : Demander au robot de faire 10 tâches différentes en même temps ne le rend pas confus. La qualité baisse très légèrement, mais pas à cause de la longueur du message, mais simplement parce que la tâche devient un peu plus complexe (comme un cuisinier qui doit préparer 10 plats en même temps : il reste excellent, mais il faut qu'il soit concentré).
- Les exceptions : Certains robots très spécialisés (les modèles de "raisonnement" d'OpenAI) ont eu du mal quand le paquet était trop gros (plus de 250), mais les autres modèles (comme Claude ou les modèles chinois) ont tenu le coup même avec 1 000 tweets.
💰 Pourquoi c'est une révolution ?
Imaginez que vous vouliez analyser 100 000 tweets.
- Ancienne méthode : Ça vous coûterait environ 337 $.
- Nouvelle méthode (avec les astuces) : Ça vous coûterait moins de 50 $ (voire moins de 10 $ avec des robots moins chers).
Et le plus important : L'erreur commise en utilisant cette méthode rapide est plus petite que les erreurs que font les humains entre eux.
C'est-à-dire que si deux humains experts analysent le même tweet, ils ne sont pas toujours d'accord. L'erreur du robot, même en mode "super rapide", est plus faible que cette hésitation humaine naturelle.
🎯 En résumé
Cette étude nous dit : "Arrêtez de faire les choses une par une !"
Les chercheurs peuvent désormais utiliser les intelligences artificielles comme des usines à haute vitesse plutôt que comme des artisans lents. En regroupant les tâches (batching) et en empilant les questions (stacking), on peut analyser des millions de textes pour une fraction du prix, sans sacrifier la qualité. C'est comme passer d'un vélo à un TGV : on va beaucoup plus vite, on consomme moins d'énergie par passager, et on arrive à destination au même moment.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.