← Neueste Arbeiten
💻 computer science

Using LLMs for Ontology generation by video summarization

Dieses Paper präsentiert einen zweiphasigen Algorithmus, der Large Language Models nutzt, um automatisch RDF-Ontologien aus YouTube-Video-URLs zu generieren, indem er zuerst eine textuelle Zusammenfassung erstellt und diese anschließend in eine strukturierte Domänenrepräsentation umwandelt, wobei eine Genauigkeit von 90 % auf einem Sport-Datensatz erreicht wird.

Ursprüngliche Autoren: Khaled Omar

Veröffentlicht 2026-09-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Khaled Omar

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der weiten Landschaft der digitalen Informationen gibt es eine beständige Herausforderung: wie man Computern nicht nur beibringt, Daten zu speichern, sondern auch die Beziehungen zwischen Ideen zu verstehen. Stellen Sie sich eine Bibliothek vor, in der jedes Buch nach seiner Einbandfarbe statt nach seinem Thema einsortiert wird; das Auffinden einer bestimmten Geschichte wäre nahezu unmöglich. In der Welt der Computertechnik wird dieses Problem durch die Erstellung von „Ontologien“ gelöst. Betrachten Sie eine Ontologie als eine strukturierte Wissenslandkarte für ein bestimmtes Fachgebiet, wie etwa Sport oder Medizin. Sie definiert die Schlüsselkonzepte innerhalb dieses Feldes und zieht entscheidend die Linien, die sie miteinander verbinden. Diese Karte ermöglicht es Maschinen, auf eine Weise zu schlussfolgern, zu suchen und Informationen zu teilen, die das menschliche Verständnis nachahmt. Der Aufbau dieser Karten war jedoch traditionell ein langsamer, kostspieliger Prozess, der Teams von menschlichen Experten erforderte, um jeden Begriff und jede Verbindung manuell zu definieren. Da das Volumen digitaler Inhalte explodiert, insbesondere in Videoformaten, kommen die alten Methoden der manuellen Konstruktion kaum noch hinterher.

Ein neuer Ansatz, der in einer aktuellen Forschungsarbeit von Dr. Khaled Omar von der Universität Damaskus detailliert beschrieben wird, versucht, den Engpass der menschlichen Arbeit durch den Einsatz fortschrittlicher künstlicher Intelligenz zu umgehen, indem er diese Wissenskarten direkt aus Videos erstellt. Die Studie konzentriert sich auf eine spezifische Art der künstlichen Intelligenz, die als Large Language Models bekannt ist – Systeme, die auf massiven Mengen von Text trainiert wurden und in der Lage sind, menschliche Sprache mit bemerkenswerter Flüssigkeit zu lesen, zu verstehen und zu generieren. Während diese Modelle zuvor dazu verwendet wurden, Texte zusammenzufassen, stellt diese Forschung eine kühnere Frage: Können sie ein Video ansehen, dessen Kernbotschaft verstehen und automatisch eine formale Wissenslandkarte des Themas erstellen? Die Antwort la, laut der Studie, ist ein vielversprechendes Ja. Die Forscher entwickelten ein zweistufiges System, das zuerst ein Video in eine prägnante schriftliche Zusammenfassung verwandelt und anschließend diese Zusammenfassung in ein strukturiertes Datenformat transformiert, das Computer nutzen können, um über den Inhalt des Videos zu schlussfolgern.

Der Prozess beginnt mit einer einfachen Eingabe: einem Link zu einem Video auf YouTube. Das System sieht sich das Video nicht so an, wie ein Mensch es tun würde, indem es bewegte Bilder verarbeitet. Stattdessen extrahiert es zuerst die gesprochenen Worte aus dem Video und erstellt so ein Texttranskript. Dieses Transkript wird dann in ein leistungsfähiges KI-Modell namens Llama 3.2 eingespeist, welches die Forscher auf ihren eigenen lokalen Computern ausführten, um Cloud-Kosten zu vermeiden. Das Modell fungiert als geschickter Editor, der das Transkript liest und es in handhabbare Stücke zerlegt. Es fasst jeden Abschnitt zusammen und führt diese Zusammenfassungen dann zu einer einzigen, kohärenten Erzählung zusammen. Diese Erzählung ist nicht nur eine zufällige Sammlung von Sätzen; sie ist sorgfältig strukturiert, um das Hauptthema des Videos hervorzuheben, die wichtigsten genannten Personen oder Objekte zu identifizieren und die wesentlichen Schlussfolgerungen zu extrahieren. Das Ergebnis ist eine saubere, textbasierte Geschichte, die das Wesen des ursprünglichen Videos einfängt.

Sobald diese textliche Zusammenfassung bereit ist, wechselt das System in seine zweite Phase: die Verwandlung der Geschichte in eine formale Karte. Hier übernimmt ein anderes Modell der künstlichen Intelligenz, Gemini Pro 002, das Kommando. Die Forscher geben diesem Modell eine spezifische Anweisung, oder einen Prompt, die es anweist, als Wissensarchitekt zu agieren. Das Modell wird aufgefordert, die Zusammenfassung zu betrachten, das Fachgebiet des Videos zu identifizieren und die darin enthaltenen Schlüsselkonzepte aufzulisten. Es nimmt diese Konzepte und beginnt dann, die Verbindungen zwischen ihnen zu zeichnen, indem es definiert, wie sie zueinander in Beziehung stehen. Schließlich gibt das Modell diese Struktur in einem Standardformat namens RDF aus, was eine Art der Datenschreibung ist, die es verschiedenen Computersystemen ermöglicht, Informationen nahtlos auszutauschen und zu verstehen. Der gesamte Arbeitsablauf, vom rohen Videolink bis hin zur strukturierten Wissenslandkarte, geschieht automatisch und erfordert keine menschliche Intervention zur Definition der Begriffe oder Beziehungen.

Um zu testen, ob diese automatisierte Methode tatsächlich funktioniert, wandten die Forscher sie auf einen Datensatz von einhundert Videos an, die sich auf Sport konzentrierten. Sie ließen das System nicht einfach laufen und hofften auf das Beste; sie maßen seine Leistung an einem hohen Standard. Für den ersten Teil des Prozesses, die Videozusammenfassung, verglichen sie die schriftliche Zusammenfassung der KI mit dem Originaltitel des Videos, um zu sehen, wie gut sie in der Bedeutung übereinstimmten. Das System erreichte ein hohes Maß an Übereinstimmung, wobei die Zusammenfassungen in etwa neunzig-fünf Prozent der Fälle mit den Titeln übereinstimmten. Für den zweiten Teil, die Erstellung der Wissenslandkarte, verglichen die Forscher die KI-generierte Karte mit einer Karte, die von einem menschlichen Experten erstellt wurde. Dies ist der wahre Test dafür, ob die Maschine die Struktur des Wissens versteht, und nicht nur die Wörter. In diesem Vergleich rekonstruierte das automatisierte System die Karte des menschlichen Experten mit einer Genauigkeitsrate von 85 Prozent. Bei der Betrachtung des gesamten Prozesses als Ganzes berechneten die Forscher eine Gesamtgenauigkeit von 90 Prozent.

Die Auswirkungen dieser Arbeit sind bedeutend für die Art und Weise, wie wir die wachsende Flut an Videoinhalten im Internet verwalten. Durch die Automatisierung der Erstellung dieser Wissenskarten reduziert das System die starke Abhängigkeit von menschlichen Experten, was es möglich macht, Videodaten in einem Ausmaß zu organisieren und zu verstehen, das zuvor unmöglich war. Die Forscher merken an, dass sie dies zwar an Sportvideos getestet haben, die Methode jedoch nicht auf dieses Feld beschränkt ist; sie könnte auf medizinische Vorlesungen, Bildungstutorials oder jedes andere Gebiet angewendet werden, in dem Video eine primäre Informationsquelle darstellt. Die Studie legt nahe, dass die Zukunft der Organisation digitalen Wissens in diesen Hybridsystemen liegen könnte, in denen künstliche Intelligenz die schwere Arbeit der Extraktion und Strukturierung übernimmt, sodass Menschen sich auf die höherwertige Validierung und Anwendung konzentrieren können. Die Forschung steht als Beweis dafür, dass mit den richtigen Werkzeugen die komplexe Aufgabe, ein bewegtes Bild in ein strukturiertes, maschinenlesbares Verständnis der Welt zu verwandeln, nicht mehr nur eine theoretische Möglichkeit, sondern eine praktische Realität ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →