← Últimos artículos
💻 computer science

Using LLMs for Ontology generation by video summarization

Este artículo presenta un algoritmo de dos fases que aprovecha los Modelos de Lenguaje de Gran Escala para generar automáticamente ontologías RDF a partir de URLs de videos de YouTube mediante la creación primero de un resumen textual y luego su conversión en una representación de dominio estructurada, logrando un 90% de precisión en un conjunto de datos de deportes.

Autores originales: Khaled Omar

Publicado 2026-09-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Khaled Omar

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje de la información digital, existe un desafío persistente: cómo enseñar a las computadoras no solo a almacenar datos, sino a comprender las relaciones entre las ideas. Imagine una biblioteca donde cada libro se archiva por el color de su portada en lugar de por su tema; encontrar una historia específica sería casi imposible. En el mundo de la informática, este problema se resuelve mediante la creación de "ontologías". Piense en una ontología como un mapa estructurado del conocimiento para un campo específico, como los deportes o la medicina. Esta define los conceptos clave dentro de ese campo y, lo que es crucial, traza las líneas que los conectan. Este mapa permite que las máquinas razonen, busquen y compartan información de una manera que imita la comprensión humana. Sin embargo, la construcción de estos mapas ha sido tradicionalmente un proceso lento y costoso que requiere equipos de expertos humanos para definir manualmente cada término y conexión. A medida que el volumen de contenido digital explota, particularmente en formatos de video, los métodos antiguos de construcción manual están luchando por mantener el ritmo.

Un nuevo enfoque, detallado en una investigación reciente del Dr. Khaled Omar de la Universidad de Damasco, intenta sortear el cuello de botella de la mano de obra humana utilizando inteligencia artificial avanzada para construir estos mapas de conocimiento directamente a partir de video. El estudio se centra en un tipo específico de inteligencia artificial conocida como modelos de lenguaje extensos, sistemas entrenados en cantidades masivas de texto que pueden leer, comprender y generar lenguaje humano con una fluidez notable. Si bien estos modelos se han utilizado anteriormente para resumir texto, esta investigación plantea una pregunta más audaz: ¿pueden observar un video, comprender su mensaje central y construir automáticamente un mapa de conocimiento formal sobre el tema? La respuesta, según el estudio, es un prometedor sí. Los investigadores desarrollaron un sistema de dos pasos que primero convierte un video en un resumen escrito conciso y luego transforma ese resumen en un formato de datos estructurado que las computadoras puedan usar para razonar sobre el contenido del video.

El proceso comienza con una entrada simple: un enlace a un video en YouTube. El sistema no ve el video de la misma manera que lo hace un humano, procesando imágenes en movimiento. En su lugar, primero extrae las palabras habladas del video, creando una transcripción de texto. Esta transcripción se introduce luego en un potente modelo de inteligencia artificial llamado Llama 3.2, que los investigadores ejecutaron en sus propias computadoras locales para evitar costos de la nube. El modelo actúa como un editor experto, leyendo la transcripción y dividiéndola en fragmentos manejables. Resume cada sección y luego combina esos resúmenes en una narrativa única y coherente. Esta narrativa no es solo una colección aleatoria de frases; está cuidadosamente estructurada para resaltar el tema principal del video, identificar a las personas u objetos más importantes mencionados y extraer las conclusiones clave. El resultado es una historia basada en texto limpia que captura la esencia del video original.

Una vez que este resumen textual está listo, el sistema pasa a su segunda fase: convertir la historia en un mapa formal. Aquí, un modelo de inteligencia artificial diferente, Gemini Pro 002, toma el control. Los investigadores proporcionan a este modelo un conjunto específico de instrucciones, o "prompt", diciéndole que actúe como un arquitecto del conocimiento. Se le pide al modelo que observe el resumen, identifique el dominio del video y enumere los conceptos clave que se encuentran en él. Luego, toma estos conceptos y comienza a trazar las conexiones entre ellos, definiendo cómo se relacionan entre sí. Finalmente, el modelo entrega esta estructura en un formato estándar conocido como RDF, que es una forma de escribir datos que permite que diferentes sistemas informáticos intercambien y comprendan la información sin problemas. Todo el flujo de trabajo, desde un enlace de video bruto hasta un mapa de conocimiento estructurado, ocurre automáticamente, sin requerir intervención humana para definir los términos o las relaciones.

Para probar si este método automatizado realmente funciona, los investigadores lo aplicaron a un conjunto de datos de cien videos centrados en los deportes. No se limitaron a dejar que el sistema se ejecutara y esperar lo mejor; midieron su rendimiento frente a un alto estándar. Para la primera parte del proceso, la síntesis del video, compararon el resumen escrito de la IA con el título original del video para ver qué tan bien coincidían en significado. El sistema logró un alto nivel de acuerdo, con los resúmenes alineándose con los títulos aproximadamente el noventa y cinco por ciento de las veces. Para la segunda parte, la creación del mapa de conocimiento, los investigadores compararon el mapa generado por la IA contra un mapa creado por un experto humano. Esta es la verdadera prueba de si la máquina comprende la estructura del conocimiento, no solo las palabras. En esta comparación, el sistema automatizado recreó con éxito el mapa del experto humano con una tasa de precisión del ochenta y cinco por ciento. Al observar todo el proceso como un todo, los investigadores calcularon una precisión general del noventa por ciento.

Las implicaciones de este trabajo son significativas para la gestión del creciente océano de contenido de video en internet. Al automatizar la creación de estos mapas de conocimiento, el sistema reduce la fuerte dependencia de los expertos humanos, haciendo posible organizar y comprender los datos de video a una escala que antes era imposible. Los investigadores señalan que, aunque probaron esto en videos de deportes, el método no se limita a ese campo; podría aplicarse a conferencias médicas, tutoriales educativos o cualquier dominio donde el video sea una fuente primaria de información. El estudio sugiere que el futuro de la organización del conocimiento digital podría residir en estos sistemas híbridos, donde la inteligencia artificial se encarga del trabajo pesado de extracción y estructuración, permitiendo que los humanos se concentren en la validación y aplicación de alto nivel. La investigación es una demostración de que, con las herramientas adecuadas, la compleja tarea de convertir una imagen en movimiento en una comprensión estructurada y legible por máquinas del mundo ya no es solo una posibilidad teórica, sino una realidad práctica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →