← Derniers articles
💻 computer science

Using LLMs for Ontology generation by video summarization

Cet article présente un algorithme en deux phases qui exploite les modèles de langage de grande taille pour générer automatiquement des ontologies RDF à partir d'URL de vidéos YouTube en créant d'abord un résumé textuel puis en le convertissant en une représentation de domaine structurée, atteignant une précision de 90 % sur un ensemble de données sportives.

Auteurs originaux : Khaled Omar

Publié 2026-09-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Khaled Omar

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le vaste paysage de l'information numérique, il existe un défi persistant : apprendre aux ordinateurs non seulement à stocker des données, mais aussi à comprendre les relations entre les idées. Imaginez une bibliothèque où chaque livre serait classé par la couleur de sa couverture plutôt que par son sujet ; trouver une histoire spécifique serait presque impossible. Dans le monde de l'informatique, ce problème est résolu par la création d'« ontologies ». Considérez une ontologie comme une carte structurée du savoir pour un domaine spécifique, tel que le sport ou la médecine. Elle définit les concepts clés au sein de ce domaine et, surtout, trace les lignes qui les relient. Cette carte permet aux machines de raisonner, de chercher et de partager des informations d'une manière qui imite la compréhension humaine. Cependant, la construction de ces cartes a traditionnellement été un processus lent et coûteux, nécessitant des équipes d'experts humains pour définir manuellement chaque terme et chaque connexion. À mesure que le volume de contenus numériques explose, particulièrement sous les formats vidéo, les anciennes méthodes de construction manuelle peinent à suivre le rythme.

Une nouvelle approche, détaillée dans des recherches récentes du Dr Khaled Omar de l'Université de Damas, tente de contourner le goulot d'étranglement de la main-d'œuvre humaine en utilisant l'intelligence artificielle avancée pour construire ces cartes de connaissances directement à partir de la vidéo. L'étude se concentre sur un type spécifique d'intelligence artificielle connu sous le nom de grands modèles de langage — des systèmes entraînés sur des quantités massives de texte capables de lire, de comprendre et de générer le langage humain avec une fluidité remarquable. Bien que ces modèles aient été précédemment utilisés pour résumer du texte, cette recherche pose une question plus audacieuse : peuvent-ils regarder une vidéo, comprendre son message central et construire automatiquement une carte de connaissances formelle du sujet traité ? La réponse, selon l'étude, est un « oui » prometteur. Les chercheurs ont développé un système en deux étapes qui transforme d'abord une vidéo en un résumé écrit concis, puis transforme ce résumé en un format de données structuré que les ordinateurs peuvent utiliser pour raisonner sur le contenu de la vidéo.

Le processus commence par une entrée simple : un lien vers une vidéo sur YouTube. Le système ne regarde pas la vidéo comme un humain le ferait, en traitant des images en mouvement. Au lieu de cela, il extrait d'abord les paroles prononcées dans la vidéo, créant ainsi une transcription textuelle. Cette transcription est ensuite injectée dans un modèle d'intelligence artificielle puissant appelé Llama 3.2, que les chercheurs ont fait fonctionner sur leurs propres ordinateurs locaux afin d'éviter les coûts liés au cloud. Le modèle agit comme un éditeur qualifié, lisant la transcription et la découpant en segments gérables. Il résume chaque section, puis combine ces résumés en un récit cohérent unique. Ce récit n'est pas seulement une collection aléatoire de phrases ; il est soigneusement structuré pour mettre en évidence le thème principal de la vidéo, identifier les personnes ou objets les plus importants mentionnés, et extraire les conclusions clés. Le résultat est un récit textuel propre qui capture l'essence de la vidéo originale.

Une fois ce résumé textuel prêt, le système passe à sa seconde phase : transformer l'histoire en une carte formelle. Ici, un autre modèle d'intelligence artificielle, Gemini Pro 002, prend le relais. Les chercheurs fournissent à ce modèle un ensemble d'instructions spécifiques, ou « prompt », lui demandant d'agir en tant qu'architecte de la connaissance. Le modèle est chargé d'examiner le résumé, d'identifier le domaine de la vidéo et de lister les concepts clés qui s'y trouvent. Il prend ensuite ces concepts et commence à dessiner les connexions entre eux, définissant comment ils se rapportent les uns aux autres. Enfin, le modèle produit cette structure dans un format standard connu sous le nom de RDF, qui est une façon d'écrire des données permettant à différents systèmes informatiques d'échanger et de comprendre l'information de manière fluide. L'ensemble du flux de travail, du lien vidéo brut à la carte de connaissances structurée, se déroule automatiquement, sans aucune intervention humaine pour définir les termes ou les relations.

Pour tester si cette méthode automatisée fonctionne réellement, les chercheurs l'ont appliquée à un ensemble de cent vidéos axées sur le sport. Ils ne se sont pas contentés de laisser le système tourner en espérant le meilleur ; ils ont mesuré sa performance par rapport à une norme élevée. Pour la première partie du processus, le résumé de la vidéo, ils ont comparé le résumé généré par l'IA au titre original de la vidéo pour voir à quel point ils concordaient en termes de sens. Le système a atteint un haut niveau d'accord, les résumés s'alignant avec les titres environ quatre-vingt-quinze pour cent du temps. Pour la seconde partie, la création de la carte de connaissances, les chercheurs ont comparé la carte générée par l'IA à une carte créée par un expert humain. C'est le véritable test pour savoir si la machine comprend la structure de la connaissance, et pas seulement les mots. Dans cette comparaison, le système automatisé a recréé avec succès la carte de l'expert humain avec un taux de précision de quatre-vingt-cinq pour cent. En examinant l'ensemble du processus, les chercheurs ont calculé une précision globale de quatre-vingt-dix pour cent.

Les implications de ce travail sont significatives pour la gestion de l'océan croissant de contenus vidéo sur Internet. En automatisant la création de ces cartes de connaissances, le système réduit la lourde dépendance aux experts humains, rendant possible l'organisation et la compréhension des données vidéo à une échelle qui était auparavant impossible. Les chercheurs notent que, bien qu'ils aient testé cela sur des vidéos de sport, la méthode n'est pas limitée à ce domaine ; elle pourrait être appliquée à des conférences médicales, des tutoriels éducatifs ou tout domaine où la vidéo est une source primaire d'information. L'étude suggère que l'avenir de l'organisation de la connaissance numérique réside dans ces systèmes hybrides, où l'intelligence artificielle gère le travail massif d'extraction et de structuration, permettant aux humains de se concentrer sur la validation et l'application de haut niveau. Cette recherche démontre qu'avec les bons outils, la tâche complexe consistant à transformer une image animée en une compréhension structurée et lisible par machine du monde n'est plus seulement une possibilité théorique, mais une réalité pratique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →