← Derniers articles
💻 computer science

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

Ce papier présente TorchSight, un système local open source exploitant un modèle Qwen 3.5 27B affiné et entraîné sur plus de 78 000 échantillons, qui atteint une précision nettement supérieure (95,0 %) dans la classification de documents de sécurité par rapport aux alternatives commerciales basées sur le cloud, tout en garantissant que les données restent sous contrôle local.

Auteurs originaux : Ivan Dobrovolskyi

Publié 2026-05-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ivan Dobrovolskyi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Grand Problème : Le « Cloud » vs la « Salle Sûre »

Imaginez que vous travaillez pour une banque ou un hôpital. Vous avez des milliers de documents et vous devez trouver ceux qui contiennent des mots de passe secrets, des numéros de carte de crédit ou des plans militaires classifiés.

Actuellement, les entreprises disposent de deux méthodes principales pour faire cela :

  1. La Méthode du « Livre de Règles » : Elles utilisent un programme informatique qui recherche des motifs spécifiques, comme une chaîne de chiffres ressemblant à un numéro de carte de crédit. C'est rapide, mais c'est bête. Si vous écrivez une histoire sur un faux numéro de carte de crédit dans un tutoriel, le programme crie « ALERTE ! » même si c'est sans danger. Il manque les éléments qui ne ressemblent pas à des motifs mais qui sont pourtant dangereux.
  2. La Méthode du « Cloud » : Elles envoient tous leurs documents à une immense IA intelligente dans le cloud (comme un assistant sur-intelligent chez une grande entreprise technologique) pour les lire. Cette IA est très intelligente et comprend le contexte. Mais, pour l'utiliser, vous devez envoyer vos documents secrets hors de votre bâtiment vers celui de quelqu'un d'autre. Pour une banque ou l'armée, c'est un risque énorme. Ils ne peuvent pas permettre que leurs secrets quittent le bâtiment.

La Solution du Document : L'auteur a construit un système appelé TorchSight. C'est comme engager un garde de sécurité sur-intelligent qui vit à l'intérieur de votre bâtiment. Ce garde est assez intelligent pour comprendre le contexte (contrairement au livre de règles) mais ne quitte jamais le bâtiment (contrairement au service cloud).

Le « Garde » (Le Modèle d'IA)

L'auteur a pris un très grand cerveau d'IA pré-entraîné (appelé Qwen 3.5) et lui a donné un « camp d'entraînement » spécial.

  • L'Entraînement : Ils ne lui ont pas simplement montré des documents au hasard. Ils lui ont fait ingérer 78 358 exemples de documents. Certains étaient de vraies fuites, d'autres étaient de faux exemples créés par une autre IA, et certains étaient des « pièges » astucieux (des documents qui ressemblent dangereux mais sont en fait sûrs, ou l'inverse).
  • Le Résultat : Cela a créé une version spécialisée de l'IA appelée Beam. Elle a appris à faire la différence entre un vrai secret et un exemple inoffensif, quelque chose que le « Livre de Règles » et même les IA du « Cloud » avaient du mal à faire.

Le Grand Test : Qui est le Meilleur Garde ?

L'auteur a mis le nouveau garde Beam en compétition avec les meilleurs gardes « Cloud » (comme GPT-5, Claude et Gemini) et les anciens gardes « Livre de Règles ». Il leur a donné à tous les mêmes 1 000 documents à trier.

Les Résultats :

  • Les Gardes Cloud : Ils ont eu raison environ 75 % à 80 % du temps. Ils étaient corrects, mais ils ont fait beaucoup d'erreurs.
  • Le Livre de Règles : Il n'a eu raison qu'environ 53 % du temps. Il était trop facilement confus.
  • Le Garde Beam (Local) : Il a eu raison à 95 %.

Le Problème des « Faux Positifs » :
La partie la plus importante d'un système de sécurité n'est pas seulement d'attraper les méchants, mais de ne pas crier « Au feu ! » quand quelqu'un tient simplement une bougie.

  • Lorsque les gardes Cloud ont examiné des documents sûrs (comme une recette de cuisine ou un article d'actualité public), ils paniquaient souvent. Ils pensaient que 22 % à 63 % des documents sûrs étaient dangereux. Cela rendrait une équipe de sécurité folle car ils devraient vérifier chaque fichier sûr.
  • Beam n'a paniqué que sur 2 % des documents sûrs. Il savait faire la différence entre une vraie menace et un fichier inoffensif bien mieux que les autres.

Pourquoi Beam était-il si Bon ?

Le document explique que le secret n'était pas seulement la taille de l'IA, mais la façon dont elle a été enseignée.

  • L'auteur a créé un ensemble de « règles » spécifique (une taxonomie) avec 51 types différents de secrets (comme « Dossiers Médicaux », « Plans Militaires », « Mots de passe »).
  • Les IA Cloud ont reçu l'ordre de « trouver des secrets », mais elles inventaient leurs propres catégories ou se perdaient.
  • Beam a été affiné pour suivre strictement les 51 catégories. Il a appris à parler le même langage que l'équipe de sécurité. C'était comme apprendre à un chien à s'asseoir, rester et rapporter des objets spécifiques, plutôt que de simplement lui dire « sois sage ».

Le Test du « Monde Extérieur »

Pour s'assurer que Beam ne faisait pas que mémoriser le test d'entraînement, l'auteur l'a testé sur un ensemble complètement différent de 500 documents qu'il n'avait jamais vus auparavant (comme de vrais courriels de hameçonnage et des dossiers médicaux provenant de bases de données publiques).

  • Beam a toujours obtenu 93,8 %.
  • Les IA Cloud ont chuté de manière significative, certaines obtenant aussi bas que 65 %.
  • Cela prouve que Beam a réellement appris le concept de sécurité, et non pas seulement les réponses spécifiques du test d'entraînement.

La Conclusion

Le document montre que vous n'avez pas besoin d'envoyer vos secrets dans le cloud pour obtenir une IA intelligente qui les protège. En entraînant une IA locale sur un ensemble de données massif et soigneusement sélectionné, vous pouvez obtenir un système qui est :

  1. Plus Précis : Il trouve plus de vraies menaces.
  2. Moins Agaçant : Il génère beaucoup moins de fausses alarmes sur les fichiers sûrs.
  3. Privé : Les documents ne quittent jamais votre ordinateur.

L'auteur a rendu l'ensemble du système (le code, les données d'entraînement et le modèle d'IA) disponible gratuitement afin que n'importe qui puisse l'utiliser pour construire son propre garde de sécurité « Salle Sûre ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →