← Derniers articles
🤖 AI

Qwen Goes Brrr: Off-the-Shelf RAG for Ukrainian Multi-Domain Document Understanding

Ce papier présente un pipeline d'augmentation par la recherche performant pour la tâche de compréhension de documents multi-domaines en ukrainien, qui exploite le découpage contextuel, la recherche dense consciente de la question et le reclassement conditionné aux options de réponse pour obtenir les meilleurs scores du classement en privilégiant la préservation de la structure des documents et la conscience de l'espace des réponses plutôt que des heuristiques complexes.

Auteurs originaux : Anton Bazdyrev, Ivan Bashtovyi, Ivan Havlytskyi, Oleksandr Kharytonov, Artur Khodakovskyi

Publié 2026-05-12
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anton Bazdyrev, Ivan Bashtovyi, Ivan Havlytskyi, Oleksandr Kharytonov, Artur Khodakovskyi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre une énigme, mais qu'au lieu d'une seule piste, vous disposez d'une bibliothèque remplie de milliers de livres, et que vous devez trouver la phrase exacte qui répond à une question précise. C'est essentiellement ce dont traite cet article : concevoir un système intelligent pour lire des documents en ukrainien et répondre à des questions à choix multiples.

Voici l'histoire de la manière dont l'équipe a construit son « détective », décomposée en concepts simples.

Le Défi : L'Aiguille dans une Botte de Foin

L'équipe a participé à une compétition appelée UNLP. Les règles étaient épineuses :

  1. La Tâche : Vous recevez une question avec six réponses possibles (A–F). Vous devez choisir la bonne, indiquer au système quel document PDF elle provient, et même quelle page.
  2. Le Problème : Les documents sont de longs PDF désordonnés (comme des manuels juridiques ou techniques) avec des mises en page variées. Les questions sont en ukrainien, une langue disposant de moins d'outils d'IA par rapport à l'anglais.
  3. La Contrainte : Le système devait s'exécuter sur un ordinateur spécifique (Kaggle) avec une limite de temps stricte et sans accès à Internet. Il ne pouvait pas simplement « réfléchir » pendant des heures ; il devait être rapide et efficace.

La Solution : Une Équipe de Détectives en Trois Étapes

Au lieu de tenter de construire un seul cerveau géant et ultra-complexe, l'équipe a conçu un pipeline avec trois travailleurs spécialisés. Ils appellent cela un système « RAG » (Retrieval-Augmented Generation), ce qui n'est qu'une façon élégante de dire : « Trouvez l'information, puis décidez de la réponse. »

Étape 1 : Le Bibliothécaire (Découpage Contextuel)

Imaginez essayer de lire un livre dont les pages ont été arrachées et mélangées au hasard. C'est ce qui se passe si vous nourrissez simplement un PDF à un ordinateur.

  • Ce qu'ils ont fait : Ils n'ont pas simplement découpé le texte en morceaux aléatoires. Ils ont agi comme un bibliothécaire prudent respectant la structure du livre. Ils ont conservé les titres de chapitre, les en-têtes de section et le début du document attachés à chaque fragment de texte.
  • L'Analogie : Au lieu de remettre au détective une phrase isolée disant « La réunion était à 17 h », ils lui ont remis une note disant : « Chapitre 4 : Planification, Section 2 : La réunion était à 17 h ». Ce contexte supplémentaire aide l'ordinateur à comprendre réside l'information.

Étape 2 : Le Moteur de Recherche (Recherche Dense)

Maintenant, le système possède des millions de ces « notes contextuelles ». Il doit trouver les 20 candidats les plus probables.

  • Ce qu'ils ont fait : Ils ont utilisé un modèle d'IA pré-entraîné (appelé Qwen3-Embedding-8B) pour agir comme moteur de recherche. Ce modèle transforme la question et les notes de texte en « empreintes digitales » mathématiques. Il compare les empreintes pour voir quelles notes correspondent le mieux à la question.
  • La Découverte : Ils ont constaté qu'utiliser un modèle pré-entraîné plus important, tel quel, fonctionnait mieux que d'essayer d'enseigner de nouvelles astuces à un modèle plus petit. C'était comme embaucher un bibliothécaire expérimenté plutôt que de former un nouvel stagiaire à partir de zéro.

Étape 3 : Le Juge (Reclassement Conscient des Options)

Le moteur de recherche leur a fourni 20 bonnes notes, mais ils ont besoin de la meilleure.

  • La Surprise : La plupart des systèmes ne regardent que la question. Cette équipe a réalisé que, pour les questions à choix multiples, les mauvaises réponses comptent tout autant que la bonne.
  • Ce qu'ils ont fait : Ils ont construit un « Juge » (un Qwen3-Reranker) qui examine la question et les six options de réponse simultanément. Il se demande : « Ce texte soutient-il la réponse A, ou soutient-il en réalité la réponse B ? »
  • L'Analogie : Imaginez un avocat plaidant une affaire. Si vous ne lui montrez que les preuves de l'accusation, il pourrait manquer les nuances. Mais si vous lui montrez les preuves de l'accusation et les arguments de la défense, il peut identifier exactement quelle pièce de preuve gagne l'affaire. Cette étape a été un tournant, augmentant considérablement leur précision.

Étape 4 : Le Verdict Final (Sélection de la Réponse)

Enfin, le système prend les 2 meilleures notes et demande à une IA puissante (Qwen3-32B) de choisir la réponse finale.

  • L'Astuce : Pour rester rapide et empêcher l'IA de « halluciner » (inventer des choses), ils l'ont forcée à choisir une seule lettre (A, B, C, D, E ou F). C'est comme une feuille de réponses à choix multiples où l'IA ne peut remplir qu'un seul cercle.

Ce qu'ils ont appris (Le « Secret »)

L'article met en lumière quelques leçons clés qui les ont surpris :

  1. La Structure est Reine : Conserver la structure du document (titres, sections) attachée aux fragments de texte était plus important que d'ajouter plus tard des astuces mathématiques complexes et sophistiquées.
  2. Moins, c'est Plus : Ils ont essayé de construire un « agent intelligent » capable de chercher, réfléchir, puis chercher à nouveau (comme un détective humain). C'était trop lent et cela entraînait des erreurs. Un pipeline simple et linéaire (Recherche → Classement → Réponse) était plus rapide et plus précis.
  3. Le Domaine « Inconnu » : La compétition comportait une troisième catégorie cachée de documents que l'IA n'avait jamais vus auparavant. Les systèmes qui tentaient de deviner à quelle catégorie appartenait une question ont échoué. La meilleure stratégie était de laisser le moteur de recherche examiner tout sans essayer de trier d'abord.

Le Résultat

En utilisant cette équipe en trois étapes (Bibliothécaire + Moteur de Recherche + Juge), ils ont obtenu un score très élevé.

  • L'Amélioration : L'ajout de l'étape « Juge » (reclassement) a augmenté leur capacité à trouver le bon document, passant de 69 % à 79 %.
  • Le Score Final : Leur système a donné la bonne réponse 96 % du temps sur l'ensemble de test caché, battant de nombreux autres concurrents.

En Résumé

L'article prouve que vous n'avez pas besoin d'un robot sur-complexe et sur-mesure pour résoudre des problèmes de documents difficiles. Au lieu de cela, vous avez besoin d'un pipeline bien organisé qui respecte la structure des documents et utilise des outils d'IA pré-entraînés intelligents pour examiner l'ensemble du tableau (question + toutes les réponses) avant de prendre une décision. Ils ont essentiellement démontré que, pour la compréhension de documents en ukrainien, l'organisation et le contexte battent la complexité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →