← Derniers articles
💻 computer science

Parser-Free Querying of Security Logs

L'article présente Sieve, un système qui exploite des modèles de langage de grande taille ancrés dans un contexte de format de journal extrait automatiquement pour générer du code exécutable à partir de requêtes de sécurité en langage naturel, réduisant considérablement les taux d'erreur dans l'analyse complexe de journaux temporels et inter-événements par rapport à la scriptisation manuelle.

Auteurs originaux : Evan Luo, Julien Piet, David Wagner

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Evan Luo, Julien Piet, David Wagner

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective de la sécurité tentant de résoudre un crime. Vous avez une pile massive de preuves : des millions de pages de notes manuscrites, de reçus et de journaux laissés par différentes personnes (serveurs, pare-feu, comptes utilisateurs). Le problème est que chacun écrit avec sa propre écriture désordonnée et incohérente. L'un écrit les dates sous la forme « 1 jan », un autre sous la forme « 01/01 », et un troisième écrit simplement « Lundi ». Certaines notes sont sur des post-it, d'autres sur des serviettes, et les couleurs d'encre varient.

Pour résoudre une affaire, vous devez poser des questions spécifiques comme : « Montrez-moi chaque fois que quelqu'un a tenté de pénétrer dans le bâtiment entre 2 h et 4 h du matin. »

L'ancienne méthode : Le bibliothécaire surmené

Traditionnellement, les équipes de sécurité tentent de résoudre ce problème en engageant une équipe de bibliothécaires (analyseurs syntaxiques) pour lire chaque note individuelle, déterminer le style d'écriture, et réécrire tout dans un table parfait et uniforme.

  • Le positif : Une fois le table terminé, poser des questions est rapide et facile.
  • Le négatif : La construction du table prend une éternité. Chaque fois qu'une nouvelle personne commence à écrire des notes d'une manière légèrement différente, les bibliothécaires doivent s'arrêter, apprendre le nouveau style et réécrire les règles. Si un nouveau type de note apparaît que personne n'a jamais vu auparavant, tout le système s'effondre jusqu'à ce que les bibliothécaires le réparent.

L'alternative : Le détective Grep

L'autre option consiste à se passer entièrement des bibliothécaires. Vous prenez simplement une loupe (un outil comme grep) et vous examinez vous-même les notes brutes et désordonnées.

  • Le positif : Vous pouvez commencer immédiatement. Pas d'attente pour les bibliothécaires.
  • Le négatif : Vous devez connaître exactement à quoi ressemble chaque style d'écriture possible. Si vous manquez une variation du mot « intrusion », vous manquez l'indice. De plus, poser des questions complexes comme « Trouvez les personnes qui sont entrées par deux portes différentes dans un délai de 60 secondes » est incroyablement difficile à faire en se contentant de parcourir manuellement des lignes de texte.

La nouvelle solution : Sieve (Le traducteur intelligent)

L'article présente Sieve, un système qui agit comme un traducteur surdoué capable d'écrire instantanément un outil personnalisé pour vous.

Voici comment Sieve fonctionne, en utilisant une analogie simple :

  1. La demande : Vous posez une question à Sieve en anglais courant : « Trouvez toutes les adresses IP qui ont tenté d'intrusion plus de 10 fois dans une fenêtre de 5 minutes. »
  2. Le scan rapide : Au lieu de lire tout le livre d'un million de pages, Sieve feuillette rapidement les premières pages pour voir à quoi ressemble l'écriture. Il crée un minuscule « mémo » des différentes manières dont les notes sont écrites (par exemple : « Oh, parfois ils disent 'Échec du mot de passe', parfois ils disent 'Échec d'authentification' »).
  3. L'écrivain de code : Sieve envoie votre question et ce minuscule mémo à une intelligence artificielle très intelligente (un grand modèle de langage). L'IA ne lit pas tout le livre ; elle utilise simplement le mémo pour écrire un script informatique personnalisé (comme un petit programme robot) spécifiquement conçu pour traquer votre réponse.
  4. L'exécution : Ce script personnalisé s'exécute sur les notes brutes. Parce qu'il a été écrit par l'IA sur la base du mémo, il sait exactement comment trouver « Échec du mot de passe » et « Échec d'authentification » et comment les compter.
  5. Le résultat : Le script vous donne la réponse. Si le script fait une erreur (comme une faute de frappe), Sieve détecte l'erreur, le signale à l'IA et lui demande de réécrire le script. Il essaie jusqu'à quatre fois jusqu'à ce qu'il obtienne le bon résultat.

Pourquoi c'est une grande nouvelle

L'article a testé cela sur 133 questions de sécurité différentes couvrant 5 types de journaux distincts. Voici ce qu'ils ont découvert :

  • C'est plus intelligent que les humains pour les cas difficiles : Lorsque les questions étaient simples (comme « trouver le mot 'erreur' »), Sieve était aussi performant qu'un expert humain écrivant un script rapide. Mais lorsque les questions étaient difficiles (comme « trouver des modèles à travers le temps et différentes personnes »), Sieve a fait 3 fois moins d'erreurs que des humains essayant d'écrire des scripts à partir de zéro.
  • Il n'a pas besoin d'un bibliothécaire parfait au préalable : Sieve n'a pas besoin d'un table préfabriqué. Il fonctionne directement sur les notes brutes et désordonnées.
  • Le simple est mieux : L'article a montré que vous n'avez pas besoin d'une IA sophistiquée et coûteuse pour déterminer les styles d'écriture au préalable. Un algorithme simple et rapide qui compte simplement la fréquence d'apparition de certaines phrases fonctionne aussi bien que les méthodes complexes.
  • C'est sûr et fiable : L'IA ne devine pas simplement la réponse ; elle écrit du code qui s'exécute comme un programme informatique normal. Cela signifie que le résultat est déterministe (la même question donne toujours la même réponse) et vous pouvez examiner le code pour voir exactement comment il a fonctionné.

En résumé

Sieve comble le fossé entre la rapidité de la recherche de texte brut et la puissance des bases de données structurées. Il permet aux analystes de la sécurité de poser des questions complexes en anglais courant et d'obtenir des réponses précises immédiatement, sans attendre que des ingénieurs construisent un nouveau schéma de base de données ou luttent pour écrire eux-mêmes des scripts complexes. Il transforme le « cahier désordonné » en une base de données consultable à la volée, une question à la fois.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →