← Últimos artículos
🤖 AI

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

El artículo presenta ReASearch, un marco unificado donde un único agente impulsado por el razonamiento gestiona autónomamente todo el proceso de optimización para prompts, programas y flujos de trabajo de ML, internalizando eficazmente políticas de búsqueda complejas y superando a sistemas especializados en diversas tareas.

Autores originales: Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

Publicado 2026-08-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a resolver un rompecabezas, escribir un poema o entrenar a un personaje de un videojuego para ganar. En el mundo de la inteligencia artificial, esto se llama "optimización". Por lo general, los humanos actúan como entrenadores estrictos en la banda: diseñan un plan de juego rígido: "Prueba esto, luego prueba aquello, y si falla, vuelve atrás y prueba algo más". El robot (un modelo de lenguaje extenso) es solo el jugador, siguiendo ciegamente órdenes para realizar pequeños cambios mientras el entrenador humano decide la gran estrategia. Pero, ¿y si el robot también pudiera ser el entrenador? ¿Qué pasaría si pudiera mirar el marcador, entender por qué perdió, decidir cambiar las reglas del juego o incluso darse cuenta de que está estancado y necesita un enfoque completamente nuevo, todo por su cuenta? Este artículo explora exactamente esa pregunta: ¿Puede un único agente de IA inteligente aprender a gestionar su propia búsqueda de la mejor solución, sin que un guion escrito por un humano le diga cómo pensar?

Los investigadores detrás de este estudio, publicado en la conferencia COLM 2026, presentan un nuevo sistema llamado ReASearch. Piensa en ello como entregarle al robot una navaja suiza en lugar de solo un martillo. En el pasado, los optimizadores de IA eran como una línea de ensamblaje de una fábrica con una cinta transportadora fija: un algoritmo diseñado por un humano decidía qué siguiente solución candidata probar, cuánto tiempo dedicar y cuándo rendirse. El único trabajo de la IA era susurrar una pequeña edición a la solución actual. ReASearch cambia el guion. Le otorga al agente de IA un conjunto de herramientas —como un intérprete de Python para ejecutar código, un archivo de memoria para recordar errores pasados y la capacidad de realizar experimentos— y luego deja que el agente decida todo. El agente se pregunta a sí mismo: "¿Debería probar esta idea primero en una muestra pequeña? ¿Acabo de cometer el mismo error dos veces? ¿Debería desechar mi plan actual y volver a uno mejor que probé anteriormente?". El agente no solo está adivinando; está razonando a través del proceso, construyendo una estrategia sobre la marcha.

El equipo puso a prueba este agente de "autocoaching" en 14 desafíos diferentes, que van desde retocar instrucciones de texto para hacerlas más inteligentes, hasta evolucionar programas informáticos para resolver acertijos matemáticos e incluso optimizar flujos de trabajo de entrenamiento de aprendizaje automático. Los resultados fueron sorprendentemente sólidos. En muchos casos, ReASearch superó a sistemas especializados que habían sido construidos por expertos humanos con reglas específicas y codificadas. Por ejemplo, en una tarea llamada "Empaquetamiento de Círculos" (ajustar círculos dentro de un cuadrado de la forma más apretada posible), el agente descubrió soluciones que fueron mejores que los mejores resultados conocidos que los humanos habían encontrado antes. En otras tareas, mejoró el rendimiento entre un 2% y un masivo 40%.

Lo que es verdaderamente fascinante es cómo lo hizo el agente. Los investigadores descubrieron que el agente comenzó a actuar naturalmente como un científico experimentado o un gran maestro de ajedrez, a pesar de que nadie se lo ordenó. Comenzó a "verificar dos veces" las ideas prometedoras antes de comprometerse con ellas. Aprendió a "revertir" a versiones anteriores y más seguras de una solución cuando un nuevo camino conducía a un callejón sin salida. Empezó a llevar un diario de "lecciones aprendidas" para evitar repetir los mismos errores. Lo más impresionante es que comprendió que, a veces, es necesario combinar dos técnicas diferentes para resolver un problema, un descubrimiento que normalmente requiere una profunda visión humana. El artículo sugiere que cuando le das a una IA las herramientas adecuadas y la dejas razonar a través del proceso, puede interiorizar estrategias de búsqueda complejas que antes pensábamos que requerían un algoritmo diseñado por humanos para gestionarlas. Resulta que el optimizador no necesita ser un controlador separado y rígido; el optimizador puede ser el propio agente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →