← Derniers articles
🤖 machine learning

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

Cet article passe en revue l'évolution sur huit ans des modèles de langage, de BERT aux agents spécialisés de pointe d'ici 2026, soulignant une amélioration annuelle par six des capacités de codage, un effondrement spectaculaire des coûts d'inférence illustré par le modèle économique GPT 5.6 Luna, et un passage vers des modèles ciblant des tâches spécifiques qui excellent dans des domaines particuliers tels que le codage frontend, la gestion de dépôts et les opérations de terminal.

Auteurs originaux : Pranav Kumar Kaliaperumal

Publié 2026-08-17
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pranav Kumar Kaliaperumal

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Évolution de l'IA : Des lunettes de lecture aux super-ordinateurs

Imaginez un monde où les ordinateurs étaient comme des bibliothécaires brillants mais timides. Pendant longtemps, si vous vouliez qu'ils comprennent une phrase, vous deviez leur donner une paire de lunettes de lecture spécifique pour cette phrase exacte. Si vous vouliez qu'ils écrivent une histoire, vous deviez échanger les lunettes contre une autre paire. Ils étaient incroyablement intelligents pour la lecture, mais ils ne pouvaient pas vraiment faire quoi que ce soit par eux-mêmes. C'était l'ère précoce des « modèles de langage », ces programmes informatiques qui apprennent à comprendre et à générer le langage humain.

Au cours des dernières années, les scientifiques ont trouvé comment rendre ces bibliothécaires beaucoup plus grands et leur donner un « cerveau » capable d'apprendre à partir de seulement quelques exemples, sans avoir besoin de nouvelles lunettes pour chaque tâche. Soudain, ces ordinateurs pouvaient discuter, écrire du code et résoudre des énigmes. Mais voici la grande question que tout le monde se pose : deviennent-ils plus intelligents chaque jour, ou deviennent-ils simplement meilleurs pour mémoriser les questions d'examen ? Et s'ils deviennent plus intelligents, cela signifie-t-il qu'ils deviennent plus coûteux, ou deviennent-ils une aubaine ? Ce document explore précisément ce mystère, retraçant la course folle des progrès de l'IA de 2018 jusqu'à une date future en 2026 pour voir ce qui se passe réellement sous le capot.


Des lunettes de lecture aux super-ordinateurs : Les huit années de montagnes russes

Ce document est comme une histoire de détective voyageant dans le temps qui suit la vie de l'intelligence artificielle de 2018 à 2026. Il pose trois grandes questions : Comment sommes-nous passés d'ordinateurs capables de peine écrire une phrase à des ordinateurs capables de corriger des bugs logiciels et de résoudre des problèmes d'olympiades de mathématiques ? À quelle vitesse le prix de cette « puissance cérébrale » a-t-il chuté ? Et, surtout, avons-nous besoin d'un seul géant super-ordinateur coûteux pour tout faire, ou l'avenir appartient-il plutôt à une équipe d'experts spécialisés ?

Les quatre ères de la croissance de l'IA
L'auteur divise les huit dernières années en quatre chapitres distincts, comme des saisons dans un jeu vidéo :

  1. L'ère des « Lunettes de lecture » (2018–2019) : Cela a commencé avec des modèles comme BERT. Voyez-les comme des étudiants qui étaient excellents pour lire un livre et répondre à des questions dessus, mais si vous leur demandiez d'écrire une histoire, ils se figeaient. Ils avaient besoin d'un « ajustement fin » (fine-tuning) spécifique (comme un camp d'entraînement spécial) pour chaque tâche.
  2. L'ère du « Gros Cerveau » (2020–2021) : Puis sont venus les modèles comme GPT-3. C'étaient des bibliothèques géantes qui avaient lu presque tout sur Internet. Au lieu d'avoir besoin d'un entraînement spécial, il suffisait de leur donner quelques exemples dans une fenêtre de chat, et ils comprenaient le schéma. Ils étaient incroyables, mais ils inventaient encore des faits et ne pouvaient pas toujours suivre les instructions parfaitement.
  3. L'ère de l'« Assistant Poli » (2022–2023) : Les scientifiques ont appris à ces gros cerveaux à être polis et à suivre des ordres en utilisant une technique appelée « alignement ». Soudain, ils sont devenus ChatGPT et ses semblables — excellents pour discuter, écrire des e-mails et suivre des règles complexes.
  4. L'ère de l'« Agent » (2024–2026) : C'est là que les choses deviennent sauvages. Les modèles ont cessé de simplement parler pour commencer à agir. Ils sont devenus des « agents » capables d'utiliser des outils, de réparer du code cassé sur GitHub et de résoudre des problèmes mathématiques en réfléchissant par étapes. En 2026, les meilleurs modèles résolvaient des problèmes des Olympiades Internationales de Mathématiques et réparaient des projets logiciels entiers.

La vitesse du progrès : Un mystère mathématique
Le document mesure la vitesse à laquelle ces modèles s'améliorent pour corriger des bugs logiciels réels (en utilisant un test appelé SWE-bench). Le résultat est époustouflant : les chances qu'un modèle réussisse à corriger un bug augmentent d'environ 5,8 fois chaque année. C'est comme si un coureur devenait 5,8 fois plus rapide chaque année ; il courrait plus vite que le son en seulement quelques années. Cependant, le document note également que les anciens « tests de connaissances » (comme MMLU) atteignent un plafond. Les modèles sont désormais si bons qu'ils rendent ces tests inutiles pour les distinguer. Le domaine est passé à des défis plus difficiles et plus pratiques.

L'effondrement des prix : La surprise du « niveau budget »
Voici la partie la plus surprenante de l'histoire : le coût de cette intelligence a chuté.

  • En 2020, obtenir un million de mots de réflexion de l'IA coûtait 60 $.
  • En 2026, la version « budget » de l'IA coûte seulement 1 $ pour la même quantité de réflexion.
    C'est une chute de prix de 60 fois.

Mais ce n'est pas tout. Le document a découvert que les modèles « budget » bon marché de 2026 sont en fait aussi performants que les modèles « fleuron » (flagship) très coûteux d'il y a seulement quelques mois. C'est comme si une voiture à 100 $ aujourd'hui pouvait conduire aussi bien qu'une voiture à 500 $ de l'année dernière. Le « milieu » du marché a disparu ; vous avez soit le niveau budget intelligent et bon marché, soit le niveau premium ultra-coûteux. Le juste milieu n'existe plus.

L'équipe de « Spécialistes » contre le « Touche-à-tout »
Pendant longtemps, on a pensé qu'un seul modèle géant finirait par être le meilleur en tout. Le document soutient qu'en 2026, cette idée est morte. La « frontière » (le meilleur de l'IA) est désormais fragmentée.

  • Si vous voulez construire un site web, Claude Opus 5 est le champion.
  • Si vous devez réparer un immense dépôt de code, Claude Fable 5 l'emporte.
  • Si vous avez besoin qu'un ordinateur agisse comme un humain dans un terminal, GPT-5.6 Sol est le patron.
  • Si vous avez besoin de résoudre un nouveau type de puzzle logique, Opus 5 est le détenteur du record.

Aucun modèle ne gagne sur tous les tableaux. Le document suggère que la manière la plus intelligente d'utiliser l'IA est d'être un « routeur » — un agent de circulation qui envoie différentes tâches au modèle expert spécifique qui est le meilleur pour cette tâche. Un système simple qui bascule entre deux modèles peut en fait battre le meilleur modèle unique en choisissant l'expert approprié pour la tâche.

Peut-on rendre un modèle fixe plus intelligent ?
Le chercheur a également mené une petite expérience pour voir s'il pouvait rendre un modèle plus petit et fixe plus intelligent simplement en changeant la façon dont il pose les questions, sans changer le modèle lui-même.

  • Ils ont demandé à un petit modèle (Qwen2.5-1.5B) de résoudre des problèmes mathématiques.
  • Lorsqu'ils l'ont interrogé une seule fois (la méthode « gourmande » ou greedy), il a réussi à 58 %.
  • Lorsqu'ils l'ont interrogé quatre fois et ont choisi la réponse la plus commune (une technique appelée « vote »), il a réussi à 62 %.
  • Le « plafond » (s'ils pouvaient magiquement choisir la meilleure réponse parmi les quatre essais) était de 79 %.

Cela suggère que le modèle connaît la bonne réponse la plupart du temps, mais qu'il a juste besoin d'une meilleure façon de la sélectionner. Le document a également construit un « détecteur de confiance » qui pouvait deviner quelles réponses étaient probablement correctes. Il a découvert que si l'on ne fait confiance qu'aux réponses pour lesquelles le détecteur était le plus sûr, on peut obtenir une précision de 94 % sur ce groupe restreint. Cela suggère qu'à l'avenir, nous n'aurons peut-être pas besoin de modèles plus grands ; nous aurons peut-être juste besoin de meilleures façons de vérifier leur travail et de choisir les meilleurs.

L'essentiel
Le document conclut que l'ère du « un seul modèle pour tous les gouverner » est terminée. Nous entrons dans une ère de spécialisation et de routage. Les modèles deviennent incroyablement doués pour des tâches spécifiques, le prix chute rapidement, et la manière la plus intelligente de les utiliser est de les traiter comme une équipe de spécialistes plutôt que comme un seul super-cerveau. Bien que les modèles deviennent incroyables, le document avertit qu'ils deviennent aussi très doués pour « tricher » avec les tests, nous devons donc être prudents quant à ce que nous leur confions. L'avenir ne concerne pas seulement des cerveaux plus gros, mais des moyens plus intelligents d'utiliser les cerveaux que nous avons.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →