Measuring AI Ability to Complete Long Software Tasks
Este artículo introduce la métrica del "horizonte de tiempo de finalización de la tarea al 50%" para cuantificar las capacidades de la IA al compararlas con el esfuerzo humano, encontrando que los modelos de vanguardia ya pueden completar tareas en 50 minutos que los humanos típicamente tardan 50 minutos en terminar, con una tendencia de duplicación que sugiere que la IA podría automatizar tareas de software de un mes dentro de cinco años.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás viendo una carrera entre un humano y un robot, pero en lugar de correr en una pista, ambos intentan resolver una pila gigante y siempre creciente de acertijos de software. Durante años, hemos estado tratando de medir qué tan buenos son estos robots de IA usando pruebas complicadas, pero esas pruebas a menudo se sienten como niveles artificiales de un videojico que no te dicen realmente qué tan rápido puede trabajar el robot en el mundo real.
Para solucionar esto, un equipo de investigadores de METR decidió medir algo mucho más intuitivo: ¿Cuánto tiempo puede trabajar una IA antes de empezar a fallar?
Llamaron a esto el "Horizonte Temporal" (Time Horizon). Piensa en esto como la duración de la batería de la inteligencia. Si una IA puede resolver un acertijo que a un humano le toma 10 minutos terminar, su horizonte temporal es de 10 minutos. Si puede manejar una tarea que a un humano le toma 4 horas, su horizonte es de 4 horas. Los investigadores querían encontrar el punto específico donde la IA tiene un 50% de probabilidad de completar el trabajo correctamente.
El Gran Descubrimiento: La Explosión Exponencial
El equipo reunió una colección masiva de 170 tareas diferentes, que van desde diminutos chequeos de 1 segundo (como detectar un nombre de archivo específico) hasta proyectos de investigación masivos de 8 horas. Contrataron a expertos humanos capacitados para cronometrar cuánto tiempo les tomaba a ellos terminar estas tareas. Luego, dejaron que 12 modelos de IA diferentes, desde el antiguo GPT-2 (lanzado en 2019) hasta el nuevo o3 (lanzado en 2025), intentaran resolverlas.
Aquí está la parte salvaje: La "duración de la batería" de la IA se está duplicando cada siete meses.
En 2019, la mejor IA solo podía manejar de manera confiable tareas que a un humano le tomaban unos 2 segundos terminar. Para 2025, los modelos superiores (como o3) podrían manejar tareas que a un humano le toman unos 110 minutos (casi dos horas) con una tasa de éxito del 50%.
Los investigadores descubrieron que este crecimiento no es solo un poco más rápido; es una curva exponencial. Es como observar una bola de nieve rodando por una colina, haciéndose el doble de grande cada vez que pasa junto a un árbol. Midieron esta tendencia de 2019 a 2025 y encontraron que el "tiempo de duplicación" es de aproximadamente 207 días (aproximadamente siete meses).
¿Por qué están mejorando?
El artículo sugiere que la IA no solo se está volviendo "más inteligente" de una manera vaga; se está volviendo mejor en habilidades específicas y prácticas. Cuando los investigadores analizaron por qué los modelos antiguos fallaban y los nuevos tenían éxito, descubrieron que los modelos más recientes eran:
- Mejores usando herramientas: Saben cómo usar una calculadora o un editor de código sin romperlos.
- Mejores corrigiendo errores: Si una IA antigua cometía un error, a menudo repetía el mismo error una y otra vez. Los nuevos modelos pueden detectar el error, decir "Ups", e intentar un camino diferente.
- Mejores en razonamiento lógico: Pueden seguir una cadena de pensamiento sin perderse.
La Advertencia "Desordenada": La Vida Real es Difícil
Sin embargo, el artículo es muy cuidadoso de no decir que los robots ya han ganado la guerra. Los investigadores argumentan explícitamente que estas pruebas podrían ser demasiado "limpias".
Imagina que la IA está jugando un videojuego donde las reglas están escritas en un manual claro, los enemigos son predecibles y no hay cortes de energía repentinos. Los investigadores llaman al trabajo del mundo real "desordenado" (messy). En el mundo real, las tareas suelen tener instrucciones poco claras, requieren hablar con otras personas o involucran recursos que se agotan.
Cuando el equipo probó la IA en tareas que eran más "desordenadas" (menos estructuradas, más caóticas), el rendimiento de la IA cayó significamente. El artículo sugiere que, si bien la IA se está volviendo excelente en los acertijos "limpios", todavía podría tener dificultades con la naturaleza caótica e impredecible del día a día de un ingeniero de software real. Encontraron que no hay evidencia de que la mejora de la IA se ralentice en tareas desordenadas todavía, pero advierten que la brecha entre la "prueba limpia" y la "realidad desordenada" es una gran incógnita.
¿Qué significa esto para el futuro?
Los investigadores hicieron algunos cálculos para ver hacia dónde conduce esta curva. Si la tendencia de duplicarse cada siete meses continúa, predicen que dentro de 5 años (en algún momento entre mediados de 2028 y mediados de 2031), los sistemas de IA podrían ser capaces de completar autónomamente tareas de software que actualmente le toman a un humano un mes (unas 167 horas de trabajo) terminar.
Enfatizan que esto es una proyección, no una garantía. Depende de si la IA sigue mejorando a esta velocidad exacta y de si esos resultados de "pruebas limpias" se aplican al mundo real "desordenado". Si la tendencia se mantiene, podríamos ver agentes de IA que pueden trabajar esencialmente como empleados de tiempo completo en proyectos complejos en un futuro cercano. Pero si la tendencia se ralentiza o si la "desordenosidad" de la vida real resulta ser demasiado difícil, ese cronograma podría cambiar.
La Conclusión
El artículo no afirma que la IA lo haya resuelto todo. En cambio, nos ofrece una nueva regla para medir el progreso. Muestra que, durante los últimos seis años, la capacidad de la IA para manejar tareas largas y complejas ha crecido a un ritmo aterradoramente rápido, duplicando su "jornada laboral" aproximadamente cada siete meses. Aunque todavía existen grandes brechas en cómo manejan el caos desordenado del mundo real, la trayectoria sugiere que el día en que una IA pueda trabajar un turno de un mes completo por su cuenta podría estar más cerca de lo que pensamos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.