← Nieuwste papers
💻 computer science

Using LLMs for Ontology generation by video summarization

Dit artikel presenteert een tweefasig algoritme dat gebruikmaakt van Large Language Models om automatisch RDF-ontologieën te genereren uit YouTube-video-URL's door eerst een tekstuele samenvatting te maken en deze vervolgens om te zetten in een gestructureerde domeenrepresentatie, waarbij een nauwkeurigheid van 90% op een sportdataset wordt bereikt.

Oorspronkelijke auteurs: Khaled Omar

Gepubliceerd 2026-09-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Khaled Omar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het uitgestrekte landschap van digitale informatie bestaat een hardnekkige uitdaging: hoe leer je computers niet alleen om gegevens op te slaan, maar ook om de relaties tussen ideeën te begrijpen. Stel je een bibliotheek voor waar elk boek wordt gearchiveerd op basis van de kleur van de kaft in plaats van het onderwerp; het vinden van een specifiek verhaal zou dan bijna onmogelijk zijn. In de wereld van de computerwetenschap wordt dit probleem opgelost door het creëren van "ontologieën". Beschouw een ontologie als een gestructureerde kaart van kennis voor een specif evenement, zoals sport of geneeskunde. Het definieert de kernconcepten binnen dat veld en trekt cruciaal genoeg de lijnen die hen met elkaar verbinden. Deze kaart stelt machines in staat om te redeneren, te zoeken en informatie te delen op een manier die het menselijk begrip nabootst. Het bouwen van deze kaarten is echter traditioneel een traag, kostbaar proces gebleken dat teams van menselijke experts vereist om elke term en verbinding handmatig te definiëren. Naarmate het volume aan digitale content explodeert, met name in videoformaten, hebben de oude methoden van handmatige constructie moeite om het tempo bij te houden.

Een nieuwe benadering, gedetailleerd in recent onderzoek van Dr. Khaled Omar van de Universiteit van Damascus, probeert de flessenhals van menselijke arbeid te omzeilen door geavanceerde kunstmatige intelligentie te gebruiken om deze kenniskaarten direct vanuit video op te bouwen. De studie richt zich op een specifiek type kunstmatige intelligentie dat bekend staat als large language models — systemen die getraind zijn op enorme hoeveelheden tekst en die menselijke taal met opmerkelijke vloeiendheid kunnen lezen, begrijpen en genereren. Hoewel deze modellen eerder zijn gebruikt om teksten samen te vatten, stelt dit onderzoek een dapperdere vraag: kunnen ze een video bekijken, de kernboodschap begrijpen en automatisch een formele kenniskaart van de onderwerpen construeren? Het antwoord is, volgens de studie, een veelbelovend ja. De onderzoekers ontwikkelden een tweestapsysteem dat eerst een video omzet in een beknopte schriftelijke samenvatting en vervolgens die samenvatting transformeert naar een gestructureerd dataformaat dat computers kunnen gebruiken om over de inhoud van de video te redeneren.

Het proces begint met een eenvoudige input: een link naar een video op YouTube. Het systeem bekijkt de video niet zoals een mens dat doet, door bewegende beelden te verwerken. In plaats daarvan extraheert het eerst de gesproken woorden uit de video, waardoor een tekstueel transcript wordt gemaakt. Dit transcript wordt vervolgens gevoed aan een krachtig kunstmatige intelligentiemodel genaamd Llama 3.2, dat de onderzoekers op hun eigen lokale computers draaiden om cloudkosten te vermijden. Het model fungeert als een bekwame redacteur, die het transcript leest en in hanteerbare stukken opbreekt. Het vat elk deel samen en combineert die samenvattingen vervolgens tot één samenhangend narratief. Dit narratief is niet zomaar een willekeurige verzameling zinnen; het is zorgvuldig gestructureerd om het hoofdonderwerp van de video te benadrukken, de belangrijkste mensen of objecten te identificeren en de belangrijkste conclusies te extraheren. Het resultaat is een helder, tekstgebaseerd verhaal dat de essentie van de oorspronkelijke video vangt.

Zodra deze tekstuele samenvatting gereed is, gaat het systeem over naar de tweede fase: het omzetten van het verhaal in een formele kaart. Hier neemt een ander kunstmatig intelligentiemodel, Gemini Pro 002, het stokje over. De onderzoekers voorzien dit model van een specifieke set instructies, of een prompt, waarbij het wordt gevraagd te fungeren als een kennisarchitect. Het model krijgt de opdracht om de samenvatting te analyseren, het domein van de video te identificeren en de belangrijkste concepten die daarin voorkomen op te sommen. Vervolgens neemt het deze concepten en begint het de verbindingen tussen hen te tekenen, waarbij het definieert hoe zij zich tot elkaar verhouden. Ten slotte geeft het model deze structuur uit in een standaardformaat dat bekend staat als RDF, een manier om data te schrijven die ervoor zorgt dat verschillende computersystemen de informatie naadloos kunnen uitwisselen en begrijpen. De volledige workflow, van een ruwe videolink tot een gestructureerde kenniskaart, vindt automatisch plaats, zonder dat er menselijke tussenkomst nodig is om de termen of relaties te definiëren.

Om te testen of deze geautomatiseerde methode daadwerkelijk werkt, pasten de onderzoekers het toe op een dataset van honderd video's die gericht waren op sport. Ze lieten het systeem niet alleen draaien en hoopten op het beste; ze maten de prestaties tegen een hoge standaard. Voor het eerste deel van het proces, de videosamenvatting, vergeleken ze de door AI gegenereerde schriftelijke samenvatting met de oorspronkelijke titel van de video om te zien hoe goed ze in betekenis overeenkwamen. Het systeem bereikte een hoog niveau van overeenstemming, waarbij de samenvattingen in ongeveer negentig vijf procent van de gevallen overeenkwamen met de titels. Voor het tweede deel, de creatie van de kenniskaart, vergeleken de onderzoekers de door AI gegenereerde kaart met een kaart die door een menselijke expert was gemaakt. Dit is de echte test om te zien of de machine de structuur van de kennis begrijpt, en niet alleen de woorden. In deze vergelijking slaagde het geautomatiseerde systeem erin de kaart van de menselijke expert met een nauwkeurigheid van tachtig vijf procent te reproduceren. Bij het bekijken van het gehele proces als geheel, berekenden de onderzoekers een algehele nauwkeurigheid van negentig procent.

De implicaties van dit werk zijn aanzienlijk voor hoe we de groeiende oceaan van videocontent op het internet beheren. Door de creatie van deze kenniskaarten te automatiseren, vermindert het systeem de zware afhankelijkheid van menselijke experts, waardoor het mogelijk wordt om video-data te organiseren en te begrijpen op een schaal die voorheen onmogelijk was. De onderzoekers merken op dat hoewel ze dit op sportvideo's hebben getest, de methode niet beperkt is tot dat veld; het zou kunnen worden toegepast op medische lezingen, educatieve tutorials of elk domein waar video een primaire informatiebron is. De studie suggereert dat de toekomst van het organiseren van digitale kennis kan liggen in deze hybride systemen, waarbij kunstmatige intelligentie het zware werk van extractie en structurering afhandelt, waardoor mensen zich kunnen concentreren op validatie en toepassing op een hoger niveau. Het onderzoek dient als een demonstratie dat, met de juiste instrumenten, de complexe taak om een bewegend beeld om te zetten in een gestructureerd, door machines leesbaar begrip van de wereld niet langer slechts een theoretische mogelijkheid is, maar een praktische realiteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →