← Últimos artículos
🤖 AI

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

Este estudio piloto cualitativo demuestra que los modelos de IA agéntica exhiben firmas distintas y específicas de cada canal en sus log-probabilidades al encontrarse con respuestas de herramientas inconsistentes frente a incompletas, revelando que la robustez ante estos diferentes tipos de fallos es asimétrica y requiere mecanismos de detección adaptados en lugar de un enfoque universal.

Autores originales: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

Publicado 2026-08-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el panorama moderno de la inteligencia artificial, ha surgido un nuevo tipo de trabajador digital: el agente de lenguaje. A diferencia de los programas anteriores que simplemente respondían preguntas basadas en una base de datos estática, estos agentes están diseñados para actuar. Pueden navegar por la web, consultar bases de datos y utilizar herramientas de software para resolver problemas complejos, de forma muy parecida a un asistente humano que toma el teléfono para hacer una reserva o consulta una hoja de cálculo para verificar el inventario. Sin embargo, estos trabajadores digitales no son infalibles. Cuando recurren a una herramienta, esperan una respuesta limpia y precisa. En el mundo real, las herramientas a veces fallan, devolviendo mensajes de error, o devuelven datos que parecen perfectos en la superficie pero contienen una mentira sutil. El desafío central para los investigadores no es solo construir agentes que funcionen cuando todo sale bien, sino construir otros que puedan reconocer cuándo algo ha ido mal y responder adecuadamente. Si un agente no puede distinguir entre una herramienta rota y una engañosa, aplicará la solución incorrecta, lo que podría hacer perder tiempo o empeorar la situación.

Un equipo de investigadores de la Universidad de Aalborg y la Universidad de Zhejiang se propuso investigar este momento exacto de decisión. Querían saber si una inteligencia artificial podía distinguir instantáneamente entre una herramienta que ha fallado al no devolver ningún dato y una herramienta que ha devuelto una respuesta bien formada pero falsa. Para probar esto, crearon un entorno controlado que simulaba un escenario de servicio al cliente minorista. En este mundo digital, un agente actúa como un representante de soporte, utilizando un conjunto de dieciséis herramientas diferentes para buscar detalles de pedidos, verificar métodos de pago y actualizar información de usuario. Los investigadores tomaron una secuencia de acciones estándar y exitosa y, en un punto específico, sustituyeron la respuesta normal de la herramienta por una defectuosa. Crearon tres tipos de fallos: un fallo completo donde la herramienta devolvió un mensaje de error, un estado de pedido falsificado que cambió las reglas de lo que el agente tenía permitido hacer a continuación, y un identificador de pago falsificado que parecía correcto pero no pertenecía al cliente.

Los investigadores no se limitaron a observar al agente intentar completar la tarea y ver si tenía éxito. En su lugar, detuvieron el proceso en el instante en que llegaron los datos defectuosos. Examinaron el "proceso de pensamiento" interno del modelo, observando específicamente qué tan probable era que generara la siguiente palabra en su respuesta. Midieron dos cosas distintas. Primero, comprobaron qué tan bien los datos devueltos se ajustaban al formato esperado de la propia herramienta. Segundo, comprobaron qué tan bien esos datos se ajustaban a todo lo que el agente ya había visto en la conversación, incluyendo la solicitud original del usuario y los resultados previos de las herramientas. También observaron el plan del agente para el siguiente paso, midiendo qué tan seguro estaba de qué acción tomar y si esa acción implicaba volver a verificar el estado del sistema o avanzar con un cambio.

Los resultados revelaron una diferencia marcada e inmediata en cómo reaccionó el agente a estos diferentes tipos de errores. Cuando la herramienta devolvió un mensaje de error roto, el agente reconoció inmediatamente que los datos no se ajustaban al formato básico de la herramienta. Esta fue una señal clara de que la herramienta había fallado. En consecuencia, el plan del agente cambió drásticamente; se volvió altamente probable que eligiera una acción que consistiera en volver a leer el estado del sistema, esencialmente decidiendo intentar de nuevo o verificar los hechos. Por el contrario, cuando la herramienta devolvió una respuesta bien formada pero falsa, el agente no vio ningún problema con el formato. Los datos parecían perfectos. Sin embargo, la comparación interna del agente de los nuevos datos frente al historial de la conversación reveló un conflicto. Los datos falsos chocaban con lo que el usuario había declarado previamente o con lo que la política del sistema dictaba.

Crucialmente, los investigadores descubrieron que la reacción del agente a estas respuestas falsas dependía enteramente de la naturaleza de la mentira. Cuando la información falsificada era un simple desajuste, como un ID de pago que no pertenecía al usuario, el plan del agente permaneció prácticamente sin cambios. No se confundió ni mostró incertidumbre; simplemente aceptó los datos falsos y continuó, porque la mentira no alteraba las reglas fundamentales de la interacción. Pero cuando la información falsificada era un estado de pedido que cambiaba las reglas de lo que se permitía hacer, el comportamiento del agente cambió. Se volvió incierto sobre qué hacer a continuación, y su plan cambió para reflejar la nueva y errónea realidad. Esto demostró que el agente podía distinguir entre una herramienta rota y una herramienta mentirosa, pero no siempre podía distinguir entre una mentira inofensiva y una trascendental que descarrilaría la tarea.

El estudio también analizó qué sucedía después del error inicial. Los investigadores encontraron que el tipo de error dejaba una huella duradera en el comportamiento futuro del agente. La herramienta rota hizo que el agente siguiera intentando releer el estado del sistema en los pasos posteriores, una señal de que estaba atrapado en un bucle de verificación. El estado de pedido falsificado, sin embargo, llevó al agente por un camino completamente diferente, llevándolo a realizar acciones que cambiaban el estado del sistema basándose en la información falsa. El ID de pago falsificado, que el agente aceptó inicialmente sin problemas, continuó siendo aceptado en los pasos posteriores, sin señales de que el agente se hubiera dado cuenta de que había sido engañado. Esto demostró que la capacidad del agente para reconocer un error no era una alarma única y universal. En cambio, era una colección de diferentes señales. Una señal le decía al agente que la herramienta estaba rota, otra le decía que los datos eran inconsistentes con el pasado y una tercera le decía que los datos eran inconsistentes con las reglas. Ninguna señal individual podía detectar todos los tipos de error.

Los investigadores concluyeron que la robustez en estos agentes no consiste en tener una métrica única que señale todos los datos malos. En su lugar, requiere leer múltiples canales de información simultáneamente. Un agente debe ser capaz de ver cuando los datos no coinciden con la forma de una herramienta, cuando contradicen el historial de la conversación y cuando contradicen las reglas del dominio. El estudio mostró que estos diferentes tipos de errores producen firmas distintas en los cálculos internos del agente. Una herramienta rota es inmediatamente obvia porque rompe el formato. Una herramienta mentirosa es más difícil de detectar porque encaja en el formato pero rompe la historia. Las mentiras más peligrosas son aquellas que cambian las reglas del juego, ya que pueden enviar al agente por un camino completamente equivocado sin activar ninguna confusión. Al comprender estas firmas específicas, los desarrolladores pueden construir agentes que estén mejor equipados para diagnosticar sus propios errores y elegir el remedio correcto, ya sea reintentar una herramienta, verificar un hecho o detenerse para pedir una aclaración.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →