← Últimos artículos
🤖 AI

Measuring Agents in Production

Autores originales: Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Dav
Publicado 2026-06-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que acabas de construir una flota de asistentes robóticos increíblemente inteligentes (Agentes de IA) que pueden realizar tareas complejas como escribir código, gestionar finanzas o diagnosticar problemas médicos. El mundo tecnológico está rebosante de entusiasmo, imaginando a estos robots dirigiendo el mundo de forma autónoma.

Pero aquí está el giro: los robots que están operando en el mundo real ahora mismo no son los robots súper autónomos y de "todo propósito" de las películas de ciencia ficción. Son más bien como pasantes cautelosos y altamente supervisados.

Este artículo, titulado "Measuring Agents in Production" (MAP), es la primera gran hoja de evaluación de lo que estos asistentes de IA están haciendo realmente en las empresas reales. Los investigadores no solo conjeturaron; entrevistaron a 20 equipos que construyen estos sistemas y encuestaron a 86 implementaciones del mundo real.

Aquí está lo que encontraron, explicado de forma sencilla:

1. ¿Por qué las empresas están construyendo estos robots?

El Objetivo: Ahorrar tiempo y lograr hacer más trabajo.
La Analogía: Imagina una fábrica. El jefe no intenta construir un robot que pueda inventar un nuevo motor de coche desde cero. Quiere un robot que pueda ensamblar las piezas 10 veces más rápido que un humano.

  • El 80% de los equipos dijo que construyó estos agentes para aumentar la productividad.
  • No están intentando reemplazar a los humanos por completo todavía; principalmente están ayudando a los empleados humanos (como médicos, ingenieros o representantes de servicio al cliente) a hacer sus trabajos más rápido.
  • Sorpresa: No los están construyendo para "mitigar riesgos" o "reducir la experiencia" tanto como uno podría pensar. El principal motor es simplemente hacer las cosas más rápido.

2. ¿Cómo se construyen realmente? (La "Receta Secreta")

Si observas a los laboratorios de investigación, intentan construir los robots más complejos y autónomos posibles. Pero en el mundo real, las empresas están haciendo exactamente lo contrario. Están eligiendo la simplicidad y el control.

  • La Regla de "Listo para Usar": El 70% de estos agentes no tienen cerebros propios personalizados. Simplemente usan modelos de IA potentes y prefabricados (como los que podrías haber escuchado hablar) y les dan instrucciones muy específicas. No están reentrenando el cerebro; solo están escribiendo mejores manuales para él.
  • La Regla del "Turno Corto": En la investigación, los agentes podrían intentar resolver un problema tomando 100 pasos por su cuenta. En producción, el 68% de los agentes se detienen después de 10 pasos y piden esperar a que un humano revise su trabajo.
    • Analogía: Piensa en ello como un GPS. Un robot de investigación podría intentar conducir todo el camino hacia el destino sin un conductor. Un robot de producción conduce durante 10 minutos, luego se detiene y pregunta: "¿Es este el giro correcto?" antes de continuar.
  • La Regla del "Humano en el Bucle": El 74% de las veces, un humano es el juez final. El robot sugiere una respuesta, pero un humano tiene que decir "Sí, es correcto" antes de que se envíe.

3. ¿Cómo saben si el robot está haciendo un buen trabajo?

Este es uno de los mayores dolores de cabeza.

  • Sin Pruebas Estándar: Aún no existe un "examen de ingreso" para los agentes de IA. El 75% de los equipos no utiliza evaluaciones formales porque son demasiado difíciles de crear o no existen para su trabajo específico.
  • El "Método del Juez Humano": En lugar de que una computadora califique al robot, los humanos son los calificadores. Los expertos revisan el trabajo del robot y dicen: "Buen trabajo" o "Inténtalo de nuevo".
  • El "Método de la Prueba A/B": A veces simplemente ejecutan el robot junto a un humano o un sistema de software antiguo para ver cuál termina la tarea más rápido.

4. ¿Cuál es el mayor problema?

La confiabilidad.

  • El Problema: El mayor temor no es que el robot sea "tonto"; es que pueda cometer un error y hacer algo extraño o peligroso.
  • La Solución: Las empresas no están tratando de solucionar esto haciendo que el robot sea "más inteligente" (lo cual es difícil). Lo están solucionando mediante la colocación de barreras de seguridad (guardrails).
    • Limitan cuántos pasos puede tomar el robot.
    • Obligan al robot a pedir permiso antes de hacer algo arriesgado.
    • Ejecutan al robot en un "entorno de pruebas" (un entorno seguro y ficticio) antes de dejarlo tocar datos reales.

5. ¿Qué tan rápido necesitan ser?

  • La Analogía: No necesitas un coche de Fórmula 1 para cortar el césped.
  • La Realidad: La mayoría de estos agentes son sorprendentemente lentos. El 66% de ellos puede tardar minutos (o incluso horas) en completar una tarea.
  • ¿Por qué? Porque generalmente están realizando trabajo de fondo (como procesar reclamos de seguros u organizar archivos). Mientras terminen el trabajo más rápido de lo que lo haría un humano (aunque tome 5 minutos), se consideran un éxito. No necesitan ser instantáneos como un asistente de voz.

La Gran Conclusión

El artículo concluye que el éxito de la IA en el mundo real no consiste en construir la IA más autónoma y compleja. Se trata de construir herramientas simples y controlables que funcionen bien con los humanos.

Las empresas están eligiendo deliberadamente ser "aburridas" y seguras. Intercambian el "factor genial" de un robot que puede hacer cualquier cosa por sí solo por la confiabilidad de un robot que hace una pequeña parte del trabajo perfectamente y pide ayuda a un humano cuando se queda atascado.

En resumen: Los agentes de IA de hoy son menos como "Jarvis" (la IA totalmente autónoma de Iron Man) y más como un asistente muy útil y ligeramente nervioso que verifica todo con su jefe antes de enviar un correo electrónico. Y eso es exactamente lo que los hace exitosos en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →