← Últimos artículos
🤖 AI

Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits

Este artículo presenta Baobab, un marco de aprendizaje neurosimbólico que compila ontologías completas de OWL 2 DL en Diagramas de Decisión Sentencial diferenciables para entrenar redes de percepción bajo supervisión parcial, superando eficazmente los atajos de razonamiento y logrando un rendimiento Bayes-óptimo en tareas de lógica de descripción no-Horn.

Autores originales: Olga Mashkova, Asaad Mohammedsaleh, Fernando Zhapa-Camacho, Robert Hoehndorf

Publicado 2026-08-19
📖 9 min de lectura🧠 Análisis profundo

Autores originales: Olga Mashkova, Asaad Mohammedsaleh, Fernando Zhapa-Camacho, Robert Hoehndorf

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje de la inteligencia artificial, dos tradiciones distintas han competido durante mucho tiempo para que las máquinas comprendan el mundo. Una tradición, conocida como aprendizaje profundo (deep learning), destaca en el reconocimiento de patrones en datos brutos, como identificar un gato en una fotografía o leer un número escrito a mano. Aprende ajustando millones de perillas internas hasta obtener la respuesta correcta, pero lo hace sin una comprensión clara de las reglas que gobiernan el mundo. La otra tradición, arraigada en la lógica y la representación del conocimiento, construye sistemas que razonan con reglas estrictas, como una enciclopedia digital que sabe que un "caniche" es un tipo de "perro" y que los "perros" son "mamíferos". Este sistema es preciso y fiable, pero a menudo tiene dificultades para conectarse con la realidad desordenada y no estructurada de las imágenes y los sonidos. Durante años, los investigadores han intentado fusionar estos dos enfoques, creando sistemas "neuro-simbólicos" que pueden tanto ver como razonar. El desafío ha sido que los lenguajes lógicos más potentes utilizados para describir el conocimiento complejo son increíblemente difíciles de traducir al lenguaje matemático que utilizan las redes neuronales para aprender.

Un equipo de investigadores de la Universidad de Ciencia y Tecnología Rey Abdalá ha desarrollado un nuevo método llamado Baobab que cierra con éxito esta brecha para un tipo específico y altamente complejo de sistema lógico. Crearon un compilador que toma una descripción lógica detallada de un mundo —completa con reglas sobre cómo se relacionan las cosas, cuántas cosas pueden existir y cómo se solapan las categorías— y la traduce a una estructura que una red neuronal pueda utilizar para aprender. A diferencia de intentos anteriores que simplificaban demasiado las reglas lógicas o las abandonaban por completo, este método preserva la complejidad total de las reglas originales. Los investigadores probaron su sistema pidiéndole a una red neuronal que observara imágenes de dígitos escritos a mano y determinara no solo los números, sino también propiedades lógicas ocultas, como si un número es primo o par, basándose únicamente en un conjunto de reglas lógicas proporcionadas a la máquina. El sistema aprendió a identificar estos conceptos ocultos con alta precisión, incluso cuando las imágenes mismas no proporcionaban pistas directas sobre ellos.

El núcleo de este logro reside en cómo los investigadores manejaron el proceso de traducción. Tomaron una base de conocimientos lógicos, que es esencialmente una colección de afirmaciones sobre cómo se relacionan los conceptos entre sí, y la compilaron en un tipo específico de diagrama de circuito. Este diagrama actúa como un filtro, comprobando si las predicciones realizadas por la red neuronal tienen sentido de acuerdo con las reglas lógicas. Si la red predice que un número es tanto par como primo (lo cual es cierto solo para el número dos), el circuito lo permite. Si predice que un número es tanto par como impar, el circuito rechaza esa posibilidad. Al ejecutar esta comprobación millones de veces, el sistema puede guiar a la red neuronal para que aprenda las relaciones lógicas correctas, incluso cuando las imágenes que ve no etiquetan explícitamente dichas relaciones. Los investigadores demostraron que esta traducción es matemáticamente sólida, lo que significa que el circuito refleja fielmente las reglas lógicas originales sin perder ninguna información ni introducir errores.

Uno de los hallazgos más significativos del estudio se refiere a un problema común en estos sistemas híbridos conocido como un "atajo de razonamiento". Cuando se le da a una máquina una tarea con múltiples respuestas posibles correctas, a menudo encuentra una forma de resolver el problema eligiendo solo una respuesta e ignorando las demás, eludiendo efectivamente el sistema lógico. Por ejemplo, si una regla permite varias configuraciones diferentes de una escena, una red neuronal estándar podría fijarse en una única configuración y no reconocer que existen otras configurasiones válidas. Los investigadores descubrieron que su nuevo método, combinado con una técnica específica de sembrar la red con todas las configuraciones válidas posibles, podía superar este atajo. En lugar de colapsar sobre una única respuesta potencialmente errónea, el sistema aprendió a mantener una distribución de probabilidad sobre todas las posibilidades correctas, logrando un nivel de precisión que ningún método anterior había alcanzado para este tipo de lógica compleja.

El equipo demostró el poder de su enfoque utilizando dos conjuntos de datos distintos. En un experimento, utilizaron imágenes de dígitos escritos a mano del conjunto de datos MNIST. Establecieron un sistema lógico donde los dígitos estaban vinculados en una cadena, de tal manera que si un número era seguido por otro, debía cumplirse una relación específica. La red neuronal recibió pares de imágenes, pero nunca se le dijo los números reales. En su lugar, se le dieron algunas pistas lógicas, como saber que un número era par y el otro era primo. A través del circuito lógico, la red aprendió a inferir la identidad exacta de los dígitos con una precisión casi perfecta, pasando de una tasa de acierto aleatoria del 25 por ciento al 99 por ciento. En un segundo experimento, aplicaron el mismo método a un conjunto de datos de imágenes sintéticas de pizzas. El sistema aprendió a identificar categorías ocultas de pizzas, como "vegetariana" o "picante", basándose en los ingredientes visibles en la imagen y en las reglas lógicas que definen esas categorías, superando nuevamente a los sistemas que no utilizaban el circuito lógico.

Los investigadores también demostraron que su método funciona con la versión completa y compleja del lenguaje lógico utilizado en las bases de datos biomédicas y en la Web Semántica, que incluye características como reglas sobre cuántos elementos pueden estar conectados y reglas sobre la dirección de las relaciones. Intentos anteriores de usar redes neuronales con este nivel de complejidad tuvieron que simplificar tanto las reglas que perdieron su significado. Baobab, sin embargo, manejó la complejidad total sin simplificaciones. El equipo verificó la correza de su compilador utilizando un sistema de prueba formal, una rigurosa comprobación matemática que asegura que la traducción de la lógica al circuito es impecable. También compararon su sistema con métodos existentes y encontraron que una parte significativa de las reglas lógicas utilizadas en sus experimentos no podía ser manejada por esos métodos antiguos, que estaban limitados a formas de lógica más simples y menos expresivas.

Una parte crítica del estudio consistió en abordar el problema de las múltiples respuestas válidas. En muchos escenarios del mundo real, la información proporcionada no es suficiente para determinar una solución única. Por ejemplo, si una regla establece que una persona es o bien hombre o bien mujer, y sabemos que está casada con alguien del sexo opuesto, todavía existen dos posibilidades válidas para el género de la pareja. Las redes neuronales estándar suelen fallar aquí, eligiendo arbitrariamente una posibilidad y tratándola como la única verdad. Los investigadores descubrieron que, mediante el uso de una mezcla de diferentes rutas lógicas, cada una correspondiente a una posibilidad válida, su sistema podía representar todas las respuestas correctas simultáneamente. Esto permitió que el sistema proporcionara una probabilidad calibrada para cada resultado, reflejando la verdadera incertidumbre en los datos en lugar de forzar una falsa certeza. Esta capacidad es esencial para aplicaciones en campos como la medicina, donde comprender el rango de posibles diagnósticos es tan importante como identificar uno solo.

El trabajo también destacó los límites prácticos de tales sistemas. Aunque el método es potente, el tamaño del circuito lógico crece rápidamente a medida que aumenta la complejidad del problema. En una prueba que involucraba una ontología completa de tipos de pizza, los investigadores descubrieron que compilar el conjunto completo de reglas en un circuito requería más memoria de la disponible en una computadora estándar, lo que los obligó a utilizar un subconjunto simplificado de las reglas para el entrenamiento final. Esto sugiere que, si bien el método es teóricamente sólido y efectivo para muchos problemas, escalar su aplicación a las bases de conocimiento más grandes y complejas requerirá avances adicionales en ingeniería. No obstante, la aplicación exitosa al conjunto de datos de pizza simplificado y a la tarea de reconocimiento de dígitos demuestra que el enfoque es viable y efectivo para datos del mundo real.

Las implicaciones de esta investigación se extienden más allá de un mejor reconocimiento de imágenes. Ofrece un camino para que la inteligencia artificial integre el conocimiento rico y estructurado que se encuentra en las bases de datos científicas directamente en el proceso de aprendizaje. Esto significa que los futuros sistemas de IA podrían aprender de las imágenes mientras cumplen simultáneamente con las reglas estrictas y verificadas de la biología, la química o la física. Al asegurar que las predicciones de la máquina sean siempre consistentes con el conocimiento científico establecido, este enfoque podría conducir a una IA más fiable y digna de confianza, particularmente en campos de alto riesgo donde los errores pueden tener consecuencias graves. Los investigadores han puesto su código y herramientas a disposición del público, invitando a otros a construir sobre esta base y explorar hasta dónde puede llegar esta integración de la lógica y el aprendizaje.

En última instancia, el estudio demuestra que la brecha entre el reconocimiento de patrones y el razonamiento lógico puede cerrarse sin sacrificar las fortalezas de ninguno de los dos enfoques. Al traducir las reglas lógicas complejas a un formato que las redes neuronales puedan procesar, los investigadores han creado un sistema que aprende no solo de los datos, sino de la estructura misma del conocimiento. La capacidad de recuperar conceptos ocultos, evitar atajos de razonamiento y manejar la complejidad total de los lenguajes lógicos modernos marca un paso significativo en la búsqueda de la construcción de máquinas que realmente comprendan el mundo que observan. Los resultados sugieren que, con las herramientas adecuadas, la inteligencia artificial puede ir más allá del simple reconocimiento de patrones para razonar genuinamente sobre las relaciones y las reglas que los gobiernan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →