← Últimos artículos
💻 computer science

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

Este artículo introduce un marco de "competir-luego-colaborar" donde los modelos de IA de vanguardia son clasificados mediante verificación basada en la ejecución para construir conjuntamente un currículo que, cuando se utiliza para el aprendizaje por refuerzo con recompensas verificables, mejora significativamente el desempeño de un estudiante de programación en problemas difíciles, mientras que el aprendizaje por imitación tradicional sobre las mismas soluciones lo degrada.

Autores originales: Miseong Shawn Kim

Publicado 2026-07-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Miseong Shawn Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un aula de programación donde cuatro superestrellas de la enseñanza de diferentes gigantes tecnológicos —llamémoslas los escuadrones de Anthropic, OpenAI, xAI y Google— han sido contratadas para enseñar a un único estudiante muy inteligente (un modelo llamado Qwen2.5-Coder). ¿El objetivo? Ver cuál es el mejor profesor y cómo combinar sus lecciones para convertir al estudiante en un mago de la programación.

Los investigadores organizaron un gigantesco torneo de programación de alto riesgo. En lugar de dejar que los profesores se califiquen entre sí (lo que a menudo lleva a que se den un A+ solo por ser amigos), utilizaron un árbitro estricto y robótico: la propia computadora. Si el código que el profesor escribió realmente se ejecutaba y pasaba las pruebas ocultas, era una victoria. Si fallaba, era una pérdida.

El Torneo: ¿Quién es el mejor profesor?

Primero, los profesores se enfrentaron en dos tipos de desafíos:

  1. Lo fácil: Problemas de programación estándar. Aquí, los cuatro profesores eran tan buenos que, tras una pequeña "autocorrección" (obtener una segunda oportunidad para corregir errores), todos obtuvieron puntuaciones casi perfectas del 99–100%. El artículo sugiere que esto no se debe a que todos sean genios por igual, sino a que todos han visto estos problemas específicos anteriormente en sus datos de entrenamiento. Es como un estudiante que saca una nota excelente en un examen de práctica que ya ha memorizado.
  2. Lo difícil: Problemas complicados de nivel de competición. Aquí es donde aparecieron las verdaderas diferencias.
    • Gemini tomó la delantera, resolviendo el 77% de los problemas difíciles.
    • Claude y Codex (OpenAI) estuvieron muy reñidos, ambos resolviendo el 69%.
    • Grok quedó rezagado con un 50%.

El artículo es cuidadoso al señalar que, aunque Gemini lideró, la brecha no fue masiva, y la clasificación se basa estrictamente en lo que el código hizo, no en lo que los profesores dijeron que hicieron.

La Gran Sorpresa: Copiar a los Profesores Realmente Perjudica

Aquí está el giro que rompe las reglas habituales de la escuela. Normalmente, si tienes un grupo de profesores inteligentes, piensas que la mejor manera de aprender es copiar su tarea. Los investigadores intentaron esto: tomaron el código verificado y funcional de todos los profesores e hicieron que el modelo estudiante simplemente lo imitara (un método llamado SFT).

El resultado fue que el estudiante empeoró.

  • En las pruebas estándar, la puntuación del estudiante cayó del 76.7% al 72.7%.
  • En los problemas difíciles de competición, se desplomó del 5.9% al 2.9%.

El artículo argumenta que para un estudiante que ya es competente, simplemente copiar las respuestas no ayuda; de hecho, lo confunde. Es como un talentoso jugador de baloncesto que intenta aprender viendo un video de jugadas destacadas de cuatro profesionales diferentes y luego intenta imitar sus movimientos todos a la vez: simplemente arruina su propio ritmo. El "conflicto de conocimiento" de intentar ser todos los demás lo hizo peor en ser él mismo.

La Estrategia Ganadora: Aprender Haciendo, No Copiando

Entonces, si copiar falla, ¿qué funciona? Los investigadores probaron un enfoque diferente llamado RLVR (Aprendizaje por Refuerzo con Recompensas Verificables).

En lugar de entregarle al estudiante las respuestas finales de los profesores para que las copie, utilizaron los problemas verificados de los profesores como un campo de práctica. Se le permitió al estudiante intentar resolver los problemas por su cuenta.

  • Si el código del estudiante se ejecutaba y pasaba las pruebas, recibía una "recompensa" (un choque de palmas de la computadora).
  • Si fallaba, no recibía recompensa y tenía que intentarlo de nuevo.

¡Esto funcionó!

  • La puntuación del estudiante en los problemas difíciles de competición saltó del 5.9% al 8.8% en su punto máximo.
  • Esto es una mejora relativa del 49%.

El artículo sugiere que el valor de tener múltiples profesores no es reunir sus respuestas para que el estudiante las copie, sino construir un "gimnasio" masivo y verificado donde el estudiante aprenda haciendo el trabajo y recibiendo retroalimentación sobre si realmente funciona.

La Conclusión

El artículo concluye que, si bien podemos clasificar a estos profesores de IA basándonos en qué tan bien se ejecuta su código, la verdadera magia ocurre cuando dejamos de pedirle al estudiante que imite a los profesores y empezamos a usar el trabajo de los profesores para crear un entorno desafiante donde el estudiante aprenda mediante el ensayo y error.

No se trata de tener al profesor más inteligente en la sala; se trata de construir un patio de recreo donde el estudiante pueda practicar, fallar, obtener una señal clara de qué salió mal e intentarlo de nuevo hasta que tenga éxito. Los investigadores publicaron todo su código y datos para que cualquiera pueda realizar estas pruebas por sí mismo y ver que los números se mantienen, demostiendo que, a veces, la mejor manera de aprender es dejar de copiar y empezar a hacer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →