← Últimos artículos
🤖 machine learning

On Randomness in Agentic Evals

Este artículo demuestra que la evaluación de sistemas agénticos basada en una sola ejecución es inherentemente inestable debido a una variabilidad significativa, por lo que recomienda adoptar múltiples corridas y análisis estadísticos rigurosos para distinguir el progreso real del ruido experimental.

Autores originales: Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

Publicado 2026-03-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás en una carrera de coches, pero en lugar de medir quién gana en una sola vuelta, decides que el campeón es el que gana solo en la primera vuelta que intentas.

Este es el problema que descubrieron los autores de este paper (publicado en ICLR 2026). Han estudiado cómo funcionan los "agentes de IA" (programas inteligentes que resuelven tareas complejas, como arreglar código de software) y han llegado a una conclusión sorprendente: la suerte juega un papel enorme en sus resultados.

Aquí te lo explico con analogías sencillas:

1. El problema de la "foto única"

Hasta ahora, la mayoría de los investigadores medían el éxito de una IA con una sola prueba (llamada pass@1). Es como si un arquero disparara una flecha, diera en el blanco, y gritaran: "¡Es el mejor arquero del mundo!".

Pero, ¿y si esa flecha dio en el blanco por pura suerte? ¿Y si la próxima vez, con el mismo arquero y la misma flecha, se le fuera a la izquierda?

Los autores hicieron un experimento masivo: en lugar de disparar una flecha, hicieron que los agentes tiraran 10 veces contra el mismo objetivo (arreglar 500 problemas de software). El resultado fue caótico:

  • A veces, el agente acertaba el 30% de las veces.
  • Otras veces, con el mismo agente y el mismo problema, acertaba el 36%.
  • ¡Esa diferencia de 6 puntos es enorme! Significa que si solo miras una vez, podrías creer que un agente es mucho mejor que otro, cuando en realidad es solo una cuestión de "suerte" en ese momento.

2. El efecto "Mariposa" en el cerebro de la IA

¿Por qué pasa esto? ¿Acaso la IA es un dado? No exactamente, pero tiene un comportamiento similar.

Imagina que dos agentes empiezan a resolver un problema. Los primeros segundos piensan exactamente lo mismo. Pero, en el tercer segundo (o incluso antes), uno piensa: "Voy a buscar en la carpeta A" y el otro piensa: "Voy a buscar en la carpeta B".

Esa pequeña diferencia, tan pequeña como un susurro, es como el aleteo de una mariposa. Como la IA funciona encadenando una idea tras otra (si digo esto, entonces diré aquello), esa pequeña diferencia inicial se amplifica.

  • El agente A busca en la carpeta A, encuentra un error, lo arregla y gana.
  • El agente B busca en la carpeta B, se confunde, hace un mal arreglo y pierde.

Los autores descubrieron que estas "mariposas" ocurren muy al principio, a veces en el primer 1% de lo que la IA piensa. Y lo más curioso: incluso si les pedimos que sean 100% lógicos y sin "suerte" (temperatura 0), siguen fallando o teniendo resultados diferentes. ¡La propia computadora tiene pequeños "temblores" que cambian el resultado!

3. La diferencia entre "lo mejor que podría hacer" y "lo que siempre hace"

El paper nos dice que debemos mirar dos cosas, no solo una:

  • El "Sueño Dorado" (Pass@k): Si le das al agente 5 oportunidades para resolver un problema, ¿cuántas veces lo arregla al menos una vez? Esto nos dice cuánto podría llegar a ser bueno si le damos muchas chances.
  • El "Mínimo Garantizado" (Pass^k): Si le das 5 oportunidades, ¿cuántas veces lo arregla todas las veces? Esto nos dice si es confiable.

Imagina un médico:

  • El "Sueño Dorado" sería: "Si le das 5 intentos, este médico cura al paciente al menos una vez".
  • El "Mínimo Garantizado" sería: "Este médico cura al paciente en el 100% de los casos, sin importar qué".

El paper encontró que algunos agentes tienen un "Sueño Dorado" brillante (arreglan mucho si les das muchas oportunidades), pero su "Mínimo Garantizado" es terrible (son muy inconsistentes). Si solo miramos una vez, no vemos esta inestabilidad.

4. ¿Qué debemos hacer? (La receta)

Los autores dicen que la ciencia y la industria están tomando decisiones importantes (qué IA usar, qué modelos lanzar) basándose en una sola prueba, lo cual es peligroso. Es como comprar un coche solo porque le gustó a un conductor en un día soleado, sin probarlo bajo la lluvia.

Sus recomendaciones son simples:

  1. No confíes en una sola prueba: Si quieres saber si una IA es mejor, hazla correr muchas veces (al menos 10) y saca el promedio.
  2. Usa las matemáticas: Calcula cuántas pruebas necesitas para estar seguro de que una mejora es real y no suerte.
  3. Mira el rango completo: No digas solo "acierta el 30%". Di: "Acierta entre un 28% y un 34%, y si le das 5 intentos, puede llegar al 50%, pero a veces falla en todos".

En resumen

Este paper es una advertencia amable pero firme: La IA es más volátil de lo que creemos. Lo que parece un gran avance tecnológico podría ser solo un "día de suerte" en los resultados. Para saber quién es realmente el mejor, necesitamos dejar de mirar una sola foto y empezar a ver la película completa, con todas sus repeticiones y variaciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →