← Últimos artículos
🤖 AI

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

El artículo presenta daVinci-Agency, un marco de trabajo eficiente en datos que aprovecha secuencias auténticas de Pull Requests para sintetizar datos de entrenamiento de alta calidad y de largo horizonte para modelos de lenguaje extensos, permitiendo ganancias de rendimiento significativas en flujos de trabajo agénticos complejos sin costos de anotación prohibitivos.

Autores originales: Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: La "capacidad de atención corta" de la IA

Imagina que tienes a un estudiante brillante que es increíble respondiendo preguntas individuales, como "¿Cuánto es 2+2?" o "Escribe un poema sobre un gato". Este estudiante es un Modelo de Lenguaje Extenso (LLM).

Sin embargo, si le pides a este estudiante que construya una casa, tendrá dificultades. Podría poner los cimientos, luego olvidar que necesita un techo, o podría construir una pared en el lugar equivamente y no darse cuenta hasta el final. En el mundo de la IA, esto se llama una tarea de largo horizonte. Es un trabajo que requiere muchos pasos, donde los errores cometidos al principio pueden arruinar todo el proyecto más adelante.

El artículo argumenta que los modelos de IA actuales fallan en estos trabajos largos porque no han sido entrenados con datos que les enseñen cómo planificar con antelación, mantener la consistencia y corregir sus propios errores durante un periodo prolongado.

La solución: Aprender de la "evolución del software"

Los autores (de SII, SJTU y GAIR) se dieron cuenta de que la mejor manera de enseñar a una IA a manejar proyectos largos y complejos es observar cómo construyen el software los humanos reales.

La analogía: La cadena de "Pull Requests"
En el desarrollo de software, cuando un programador quiere añadir una funcionalidad o corregir un error, no simplemente entrega el código terminado. Envía un "Pull Request" (PR).

  1. Paso 1: Envía un pequeño cambio (PR #15).
  2. Paso 2: Los revisores dicen: "Esto se ve bien, pero te faltó una red de seguridad".
  3. Paso 3: El programador corrige esto y envía un nuevo cambio (PR #21) que se construye sobre el primero.
  4. Paso 4: Esto continúa durante varias rondas hasta que la funcionalidad es perfecta.

Los autores llaman a esto una "Cadena de Pull Requests". Es como una historia donde cada capítulo depende del anterior, y los personajes (el código) evolucionan y mejoran con el tiempo.

La innovación: daVinci-Agency

El equipo creó un nuevo sistema llamado daVinci-Agency. En lugar de inventar escenarios falsos o pagar a humanos para que escriban historias largas para que la IA aprenda (lo cual es costoso y lento), fueron a GitHub (una biblioteca gigante de proyectos de software reales) y recolectaron estas "Cadenas de Pull Requests" naturales.

Convirtieron estas historias de desarrollo del mundo real en datos de entrenamiento.

  • El entrenamiento: Tomaron un modelo (GLM-4.6) y le mostraron estas cadenas.
  • La lección: La IA aprendió que para tener éxito, debe:
    • Descomponer: Dividir un objetivo enorme en pasos pequeños y manejables.
    • Mantener la consistencia: Recordar el objetivo original incluso después de 50 pasos.
    • Refinar: Observar sus propios errores (bugs) y corregirlos sin empezar de cero.

El resultado "mágico": Pocos datos, grandes ganancias

Normalmente, para hacer una IA más inteligente, necesitas alimentarla con millones de ejemplos.

  • La forma antigua: Entrenar con 66,000 ejemplos (como otros conjuntos de datos en el artículo).
  • La forma daVinci: Entrenar con solo 239 ejemplos.

El resultado:
A pesar de usar 200 veces menos datos, el modelo entrenado con daVinci-Agency funcionó significativamente mejor que los modelos entrenados con conjuntos de datos masivos.

  • En una prueba llamada Toolathlon (donde la IA tiene que usar herramientas para resolver problemas), el modelo mejoró un 47%.
  • En SWE-bench (una prueba para corregir errores de software reales), también obtuvo una puntuación mucho más alta.

¿Por qué? Porque los 239 ejemplos eran de alta calidad. No eran aleatorios; eran historias reales de cómo se resuelven problemas complejos a lo largo del tiempo. La IA no solo memorizó hechos; aprendió el hábito de la persistencia y la corrección.

Lo que la IA realmente aprendió (Las "meta-habilidades")

El artículo muestra que la IA no solo se volvió mejor programando; se volvió mejor pensando.

  • Antes: Si la IA cometía un error, se confundía, se desviaba hacia temas irrelevantes o se rendía (llamado "escapismo").
  • Después: Cuando la IA cometía un error, hacía una pausa, se daba cuenta de: "Espera, estoy haciendo esto mal", y lo corregía. Aprendió a planificar y a mantenerse en el camino.

Eficiencia: Hacer más con menos

El artículo también encontró que la nueva IA es más eficiente.

  • Analogía: Imagina a dos personas intentando resolver un laberinto.
    • Persona A (IA antigua): Choca contra cada callejón sin salida, grita e intenta 100 caminos equivocados.
    • Persona B (IA daVinci): Mira el mapa, ve los callejones sin salida y toma el camino directo.
  • La IA entrenada con daVinci utilizó menos palabras (tokens) y menos clics de herramientas para resolver los mismos problemas. No desperdició energía en la confusión.

El descubrimiento del "Escalamiento"

Finalmente, los autores probaron qué sucede si hacen las historias de entrenamiento aún más largas.

  • Descubrieron que si entrenaban a la IA con cadenas con más pasos (cadenas de Pull Request más largas), la IA se volvía aún mejor.
  • Esto sugiere que cuanto más practica el pensamiento de "larga distancia" la IA, mejor se vuelve para resolver problemas muy largos y complejos.

Resumen

daVinci-Agency es una nueva forma de entrenar agentes de IA. En lugar de obligarlos a memorizar millones de tareas cortas y falsas, les enseña mostrándoles historias reales y largas de cómo los humanos construyen software. Al aprender de estas "cadenas de eventos" naturales, la IA aprende a planificar, mantener la consistencia y corregir sus propios errores, volviéndose mucho más inteligente y eficiente con mucha menos información de la que se requería anteriormente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →