← Últimos artículos
💻 computer science

DKSE: Automated Extraction of Structured Domain Ontologies from Software Requirement Documents via Large Language Models

Este artículo presenta DKSE, una herramienta basada en Rust que aprovecha los modelos de lenguaje de gran tamaño para convertir automáticamente documentos de requisitos de software no estructurados del sector bancario chino en ontologías legibles por máquina y con trazabilidad de procedencia, demostrando una alta precisión y utilidad práctica para tareas derivadas como la generación de pruebas y la construcción de grafos de conocimiento.

Autores originales: Yahua Ruan

Publicado 2026-08-11
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yahua Ruan

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrando en una biblioteca masiva y antigua donde cada uno de los libros está escrito en un lenguaje que solo los humanos pueden entender. Puedes leer las historias, las reglas y las instrucciones, pero si intentas pedirle a un robot que encuentre un dato específico, construya una nueva máquina basada en esas instrucciones o verifique si se cumplió una regla, el robot simplemente se queda mirando fijamente. Él ve párrafos de texto, no los datos estructurados que necesita para hacer su magia. Esta es la realidad diaria del mundo de la ingeniería de software. Durante décadas, el "código fuente" de cómo funcionan las empresas —sus requisitos, reglas y procesos— ha estado encerrado en documentos no estructurados como archivos de Word y PDFs. Si bien la Inteligencia Artificial se ha vuelto increíblemente buena leyendo y escribiendo código, le ha costado comprender los documentos desordenados de lenguaje natural que le dicen qué construir en primer lugar. La gran pregunta ha sido: ¿Cómo transformamos estas historias humanas en un formato que las máquinas realmente puedan usar para pensar, construir y verificar?

Presentamos DKSE (Domain Knowledge Structuring Engine, Motor de Estructuración de Conocimiento de Dominio), una nueva herramienta que actúa como un traductor y bibliotecario superpotente. Piensa en esto como un escáner mágico que no solo lee un documento de requisitos; entiende la historia que hay dentro de él e instantáneamente la reescribe en un plano perfectamente organizado y legible por máquinas. En lugar de dejar la información como un muro de texto, el DKSE la desglosa en seis categorías específicas y útiles: Entidades (los personajes de la historia, como "Cliente" o "Cuenta"), Relaciones (cómo se conectan, como "Cliente posee Cuenta"), Reglas (las leyes del universo, como "Si el saldo es bajo, bloquear transacción"), Procesos (las danzas paso a paso, como "Cómo aprobar un préstamo"), APIs (las puertas y ventanas para que los datos entren o salgan) y Diccionarios (las listas oficiales de palabras y códigos permitidos).

Los investigadores probaron esta herramienta con una enorme pila de documentos bancarios del mundo real —unos 800,000 caracteres chinos de complejas reglas financieras. El resultado fue impresionante: el DKSE extrajo automáticamente 3,439 piezas distintas de conocimiento estructurado, incluyendo más de 1,200 reglas y casi 600 interfaces de datos. Cuando los expertos humanos revisaron el trabajo, encontraron que era un 96% preciso, con cero "alucinaciones" (donde una IA inventa cosas). Pero la verdadera magia no es solo la extracción; es lo que sucede después. Debido a que la información ahora está estructurada, el equipo la utilizó para generar instantáneamente 1,214 preguntas de prueba para evaluar otros modelos de IA, construyó un enorme conjunto de datos de entrenamiento de aproximadamente 2 millones de tokens para enseñar a nuevos cerebros de IA, e incluso la alimentó en un sistema de grafo de conocimiento para ayudar a las computadoras a recuperar hechos precisos sin inventar cosas. El artículo presenta esto como una prueba de concepto exitosa específicamente para la industria bancaria, demostrando que finalmente podemos convertir esos polvorientos documentos de requisitos en el "cerebro" vivo y palpitante que impulsa el desarrollo de software moderno.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →