← Últimos artículos
💻 computer science

Supporting System Testing with a Multi-Agent LLM-based Framework for Knowledge Graph Extraction: A Case Study with Ethernet Switch Systems

Este artículo presenta un marco basado en LLM multiagente que extrae y refina iterativamente grafos de conocimiento a partir de manuales de configuración de conmutadores Ethernet semiestructurados para apoyar la generación automatizada de especificaciones precisas de casos de prueba de sistemas.

Autores originales: Rongqi Pan, Mahboubeh Dadkhah, Jean Baptiste Minani, Hussein Al Osman, Lionel Briand, Haiwei Dong

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Rongqi Pan, Mahboubeh Dadkhah, Jean Baptiste Minani, Hussein Al Osman, Lionel Briand, Haiwei Dong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Panorama General: Transformar un Manual Desordenado en un Mapa Inteligente

Imagina que tienes un manual de instrucciones masivo de 500 páginas para una pieza de maquinaria compleja (en este caso, un conmutador Ethernet, que es como un controlador de tráfico para los datos de internet). Este manual está escrito para que lo lean los humanos, no para que las computadoras lo entiendan. Está lleno de texto "semi-estructurado", lo que significa que tiene encabezados y listas, pero los detalles importantes a menudo están ocultos en párrafos, mezclados con notas o implícitos en lugar de estar claramente enunciados.

¿El problema? Una computadora que intenta probar automáticamente si esta máquina funciona correctamente se confunde. No puede averiguar fácilmente: "Si hago el paso A, ¿significa eso que necesito hacer el paso B a continuación? ¿Y cómo debería verse exactamente la máquina después de terminar?"

Los autores de este documento construyeron un equipo de robots inteligentes (un Marco de LLM Multi-Agente) para leer estos manuales desordenados y convertirlos en un mapa perfectamente organizado (un Grafo de Conocimiento). Este mapa permite a las computadoras generar automáticamente scripts de prueba para verificar si la máquina funciona, ahorrando a los humanos el trabajo aburrido y repetitivo de hacerlo manualmente.


El Reparto de Personajes: Un Equipo de Robots Especializados

En lugar de un solo robot gigante que intente hacerlo todo a la vez, los autores crearon un equipo de tres "agentes" especializados (asistentes de IA), cada uno con un trabajo específico, más dos supervisores.

  1. El Agente de la Hoja de Ruta: Este robot lee la sección de "panorama general" del manual. Determina los objetivos de alto nivel (por ejemplo: "Necesitamos detectar bucles en la red").
  2. El Agente de Procedimientos: Este robot lee la sección de "detalles minuciosos". Extrae los comandos exactos, los botones que hay que pulsar y los resultados esperados (por ejemplo: "Escribe este código específico y deberías ver este mensaje de error específico").
  3. El Agente de Mapeo: Este es el eslabón crucial. Conecta los objetivos de "panorama general" con los pasos de "detalles minuciosos". Responde a la pregunta: "¿Qué comandos específicos logran realmente ese objetivo de alto nivel?"

Los Supervisores:

  • El Juez (EvalAgent): Después de que el equipo hace su trabajo, el Juez revisa sus tareas. Compara la salida del robot con el manual original para ver si se les escapó algo o si lo hicieron mal.
  • El Entrenador (ImprovAgent): Si el Juez encuentra errores, el Entrenador no solo corrige la respuesta; reescribe las instrucciones (prompts) dadas a los robots para que no cometan el mismo error la próxima vez.

El Proceso: El Bucle de "Intentar, Verificar, Corregir"

El sistema utiliza un ciclo inteligente llamado Bucle Extraer-Evaluar-Mejorar (EEI). Piénsalo como un estudiante que hace un examen de práctica:

  1. Extraer: El equipo de robots lee el manual y construye el mapa (Grafo de Conocimiento).
  2. Evaluar: El Juez examina el mapa y dice: "Te faltó un detalle aquí" o "Pusiste esta nota en la caja equivocada". Otorga una puntuación.
  3. Mejorar: Si la puntuación es demasiado baja, interviene el Entrenador. Examina la retroalimentación del Juez y dice: "Vale, la próxima vez, ten más cuidado al distinguir entre un 'objetivo' y una 'nota'". Actualiza las instrucciones del robot.
  4. Repetir: Los robots lo intentan de nuevo con las nuevas instrucciones. Siguen haciendo esto hasta que el mapa es perfecto o han intentado suficientes veces.

Los Resultados: ¿Qué tan bien funcionó?

El equipo probó este sistema en 50 manuales del mundo real de una gran empresa tecnológica (Huawei).

  • El "Primer Intento" ya era increíble: Incluso sin la ayuda del "Entrenador" para mejorar, los robots dieron la respuesta correcta entre el 97% y el 99% de las veces en el primer intento.
  • El "Entrenador" ayudó en los casos difíciles: Para los pocos manuales que eran particularmente complicados o confusos, entró en acción el bucle EEI. Refinó las instrucciones y la precisión aumentó aún más, alcanzando puntuaciones casi perfectas.
  • Los humanos están de acuerdo con los Robots: Los autores también hicieron que expertos humanos revisaran el trabajo. Descubrieron que el robot "Juez" y los expertos humanos coincidían entre el 72% y el 80% de las veces. La mayoría de los desacuerdos eran cosas pequeñas (como un espacio faltante o una forma ligeramente diferente de categorizar una nota), no errores graves.
  • Utilidad en el Mundo Real: El equipo entregó los mapas generados a cinco probadores humanos experimentados. Los probadores dijeron que los mapas eran muy útiles, claros y precisos. Sintieron que los mapas podían guiarlos con éxito en la creación de casos de prueba, aunque notaron que a veces los "pre-requisitos" (lo que necesita configurarse antes de comenzar) necesitaban un pequeño pulido humano para ser perfectamente claros.

La Conclusión

Este documento demuestra que podemos utilizar un equipo de robots de IA para leer manuales técnicos complejos y desordenados y convertirlos en datos limpios y estructurados. Estos datos son tan buenos que pueden ayudar a automatizar las pruebas de equipos de red, una tarea que suele ser lenta, costosa y realizada completamente a mano. El sistema es lo suficientemente inteligente como para aprender de sus propios errores y mejorar en la lectura de tipos específicos de manuales, convirtiéndolo en una herramienta poderosa para el futuro de las pruebas de software.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →