← Últimos artículos
💬 NLP

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

Este artículo identifica que el aprendizaje por refuerzo centrado en la corrección con verificadores (RLVR) estándar conduce a generaciones de código redundantes y propone un enfoque de RLVR consciente de la redundancia que utiliza recompensas contra la redundancia basadas en JPlag, mejorando significativamente el rendimiento de la generación de código con presupuesto finito al mantener soluciones candidatas diversas.

Autores originales: Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

Publicado 2026-05-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando un equipo de programadores para resolver un único acertijo de codificación complicado. Tienes un presupuesto limitado: solo puedes solicitar 10 soluciones (este es tu "presupuesto de muestreo"). Tu objetivo es simple: solo necesitas que una de esas 10 soluciones funcione perfectamente.

En el mundo de la IA, esto se llama Pass@k (Aprobado en k). Si le pides a una IA que escriba código 10 veces, y al menos una de esas 10 intentos funciona, ganas.

El Problema: El Equipo "Copión"

El artículo descubre un defecto oculto en cómo se entrenan actualmente los modelos de IA para ganar este juego.

Cuando los investigadores entrenan a la IA para mejorar en la codificación, usualmente la recompensan solo por obtener la respuesta correcta. La IA aprende rápidamente un atajo: "Si escribo exactamente el mismo código correcto 10 veces, obtengo una recompensa cada vez".

Así, la IA se convierte en un copión. En lugar de probar 10 formas diferentes de resolver el problema (como usar un martillo, un destornillador o una llave inglesa), elige un método exitoso y simplemente lo copia 10 veces.

  • El Resultado: Si ese único método tiene un pequeño error, las 10 copias fallan. Desperdiciaste tu presupuesto en duplicados.
  • La Herramienta del Artículo: Para detectar esto, los autores utilizan una herramienta llamada JPlag. Piensa en JPlag como un "detector de plagio" para código. No le importa si cambiaste el color del texto o renombraste una variable; examina la estructura del código. Si dos programas están construidos de la misma manera, JPlag dice: "Estos son casi duplicados".

La Solución: El Entrenador "Anti-Redundancia"

Los autores se hicieron una pregunta sencilla: ¿Y si entrenáramos a la IA no solo para ser correcta, sino para ser diferente de sus intentos anteriores?

Introdujeron un nuevo método de entrenamiento llamado Redundancy-Aware RLVR.

  • La Analogía: Imagina a un entrenador diciéndole a un equipo de 10 corredores: "Todos necesitan terminar la carrera. Pero aquí está la regla: Si dos de ustedes corren exactamente el mismo camino, ambos reciben una penalización. Deben encontrar rutas únicas hacia la meta".
  • Cómo funciona: La IA sigue siendo recompensada por escribir código correcto. Pero ahora, también recibe una "penalización" (o una recompensa negativa) si genera un fragmento de código que se parece demasiado a otro que acaba de escribir.

Los Resultados: Mejor Trabajo en Equipo

Cuando probaron este nuevo "Entrenador Anti-Redundancia" contra el antiguo "Entrenador Copión", los resultados fueron claros:

  1. Menos Desperdicio: La nueva IA dejó de bombardear con la misma solución. Generó una variedad mucho más amplia de código correcto.
  2. Mayor Tasa de Éxito: Como el equipo estaba probando diferentes enfoques, era mucho más probable que encontraran una solución funcional dentro del presupuesto limitado de 10 intentos.
  3. Superando a los Expertos: Este simple truco de "no te copies a ti mismo" funcionó tan bien como, o incluso mejor que, los métodos complejos y especializados que los investigadores habían diseñado previamente solo para manejar este problema específico.

La Conclusión

El artículo argumenta que cuando le pedimos a una IA que intente muchas veces resolver un problema, no deberíamos preocuparnos solo por con qué frecuencia obtiene la respuesta correcta. También debemos preocuparnos por cuántas formas diferentes intenta llegar allí.

Al enseñarle a la IA a evitar ser un copión, hacemos que sus intentos limitados sean mucho más valiosos. Es la diferencia entre pedirle a un amigo 10 intentos para adivinar una contraseña donde todos adivinan "123456", versus pedirle que adivine 10 números completamente diferentes. El segundo enfoque tiene muchas más probabilidades de tener éxito.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →