← Últimos artículos
🤖 AI

Knowledge-Centric Agents for Workflow Generation

Este artículo propone un marco centrado en el conocimiento que mejora la generación de flujos de trabajo en sistemas de creación visual mediante el aprendizaje para invertir, inyectar e inferir conocimiento jerárquico a partir de ejemplos del mundo real, logrando así una coherencia estructural y tasas de éxito de ejecución superiores en comparación con los enfoques actuales de texto directo a JSON.

Autores originales: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

Publicado 2026-07-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir una máquina compleja con piezas de LEGO, pero en lugar de encajarlas con tus manos, tienes que describir todo el plano a un robot usando solo palabras. Este es el mundo de ComfyUI, una herramienta popular para la creación de imágenes con inteligencia artificial. En este sistema, cada paso del proceso creativo —como cambiar un color, perfeccionar un rostro o hacer una imagen más grande— es un "bloque" o "nodo" separado. Para obtener un gran resultado, tienes que conectar cientos de estos bloques en un orden muy específico, como un circuito impreso gigante e intrincado. Si conectas los dos bloques equivocados, o si olvidas enchufar un cable de alimentación (un parámetro), toda la máquina tose y se detiene.

Durante mucho tiempo, la gente intentó usar Modelos de Lenguaje Extensos (LLM) —el mismo tipo de IA inteligente que escribe historias o responde preguntas— para construir automáticamente estos planos. La idea era simple: decirle a la IA: "Hazme una imagen de un dirigible steampunk", y que esta escupiera las instrucciones perfectas de LEGO. Pero aquí está el problema: estos modelos de IA son excelentes escribiendo frases, pero son terribles construyendo estructuras complejas. A menudo olvidan cómo se conectan los bloques, mezclan las instrucciones o crean planos que se ven bien en el papel pero que se desmoronan cuando intentas construirlos. Carecen de la "experiencia" de un experto humano que sabe por qué conectas el Bloque A al Bloque B, no solo que debes hacerlo.

Esto nos lleva a un nuevo artículo de Zhendong Li y su equipo, quienes proponen una nueva y astuta forma de enseñar a la IA a ser un maestro constructor. En lugar de solo pedirle a la IA que adivine el plano final, le enseñan a pensar como un diseñador humano experto. Lo llaman un enfoque Centrado en el Conocimiento (Knowledge-Centric). Piensa en esto como si quisieras enseñar a un estudiante a hornear un pastel perfecto: no solo le muestras el pastel terminado y le dices: "Copia esto". Le enseñas la estrategia (por qué mezclamos los huevos primero), el esqueleto (la lista de pasos sin las medidas exactas) y finalmente la receta (los gramos exactos de harina).

Los autores descubrieron que los métodos de IA existentes estaban fallando porque intentaban saltar directamente desde la petición del usuario al código final y desordenado. Para solucionar esto, inventaron un proceso de tres pasos que llaman Inversión, Inyección e Inferencia de Conocimiento.

Primero, tomaron miles de planos reales y funcionales creados por humanos y los sometieron a un proceso de "ingeniería inversa". Despojaron los detalles desordenados para encontrar los patrones ocultos. Es como desarmar mil coches diferentes para entender las reglas generales de cómo funcionan los motores, en lugar de simplemente memorizar la forma de un coche específico. Destilaron estos planos en tres capas:

  1. Estrategia de Alto Nivel: El plan de la "visión general" (por ejemplo, "Primero debemos arreglar el rostro, luego cambiar el estilo").
  2. Pseudo-código de Esqueleto: El esquema aproximado de los pasos, sin los números específicos.
  3. Pseudo-código Completo: Las instrucciones detalladas y completas listas para ser construidas.

Después, inyectaron este conocimiento destilado en un modelo de IA. No solo le alimentaron con datos; le enseñaron a razonar a través de estas capas. Le mostraron al modelo: "Aquí hay una tarea, aquí está la estrategia que usaría un experto y aquí es cómo esa estrategia se convierte en un esqueleto". Esto es como darle al estudiante un libro de cocina que explica la lógica de la cocina, no solo las recetas.

Finalmente, cuando un usuario pide una nueva imagen, la IA no solo adivina. Infiere la solución trabajando hacia atrás a través de las capas que aprendió. Primero determina la estrategia de alto nivel, luego construye el esqueleto y finalmente rellena los detalles específicos. El artículo también incluye un paso de "autorrefinamiento", donde la IA verifica su propio trabajo, preguntándose: "¿Conecté estos bloques correctamente?", antes de finalizar el plan.

Los resultados son impresionantes. El equipo probó su método contra otras herramientas de IA en un conjunto de datos de más de 900 tareas del mundo real. Mientras que otros métodos lograron crear planos funcionales menos de la mitad de las veces, este nuevo agente "Centrado en el Conocimiento" tuvo éxito en el 86.9% de los casos. En términos de construir estructuras complejas y diversas, su método obtuvo una puntuación de 152 en una escala de diversidad, mientras que el siguiente mejor método solo alcanzó 42. Incluso cuando se probó en tareas nuevas y difíciles que la IA nunca había visto, logró tener éxito el 66.7% de las veces, superando con creces a la competencia.

Los autores sugieren que, al enseñar a la IA a comprender la estructura y el razonamiento detrás del trabajo, en lugar de solo memorizar patrones, podemos crear agentes que sean mucho más fiables. Admiten que el sistema todavía tiene dificultades cuando se le pide usar bloques muy raros o inusuales que no estaban en sus datos de entrenamiento, pero en general, han demostrado que darle a la IA un "modelo mental" de cómo piensan los expertos es la clave para construir herramientas creativas mejores y más complejas. Es un cambio de pedirle a un robot que "adivine la respuesta" a enseñarle "cómo pensar", convirtiendo un proceso frágil y propenso a errores en un oficio robusto de nivel experto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →