← Últimos artículos
💬 NLP

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

El artículo presenta N-GRPO, una novedosa estrategia de exploración para la Optimización de Política Relativa de Grupo que mejora el razonamiento matemático al mezclar dinámicamente las incrustaciones de tokens ancla con sus vecinos semánticos más cercanos para inyectar diversidad preservando al mismo tiempo la consistencia semántica, superando así a los modelos de referencia existentes tanto en tareas de distribución interna como de distribución externa.

Autores originales: Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

Publicado 2026-06-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un estudiante muy inteligente (un Modelo de Lenguaje Grande) cómo resolver problemas matemáticos difíciles. Para volverse realmente bueno en ello, el estudiante necesita practicar intentando muchas formas diferentes de resolver el mismo problema. Esta fase de práctica se llama "rollout".

El artículo presenta una nueva forma de ayudar a este estudiante a practicar, llamada N-GRPO. Así es como funciona, desglosado en conceptos simples:

El Problema: Dos Malas Formas de Practicar

Actualmente, cuando los modelos de IA practican, suelen intentar ser diversos de una de estas dos maneras, pero ambas tienen fallos:

  1. El enfoque del "Loro" (Muestreo a nivel de token):
    Imagina pedirle al estudiante que reescriba una frase. Podría decir: "El gato se sentó en la alfombra" o "La alfombra tenía al gato sentado sobre ella".

    • El problema: Estas son solo paráfrasis. La lógica subyacente es exactamente la misma. El estudiante no está aprendiendo nuevas formas de resolver el problema matemático; solo está diciendo lo mismo con otras palabras. Es como practicar una pieza de piano pero solo cambiando el volumen, no las notas.
  2. El enfoque del "Ruido Estático" (Ruido de incrustación aleatorio):
    Imagina darle al estudiante una sacudida eléctrica aleatoria para agitar su pensamiento.

    • El problema: Esto es demasiado caótico. Es como lanzar una llave inglesa en los engranajes. El estudiante podría empezar de repente a hablar de "plátanos" cuando debería estar hablando de "álgebra". El ruido aleatorio rompe el significado, hace que el estudiante se desvíe del camino y falle.

La Solución: N-GRPO (El Método del "Vecino Inteligente")

Los autores proponen un punto medio llamado Mezcla de Vecinos Semánticos. Piensa en esto como una "Lluvia de ideas grupal guiada".

En lugar de elegir una palabra al azar o simplemente parafrasear, el modelo busca la palabra que más probablemente quiere decir (el "Ancla"). Luego, encuentra los 3 "vecinos" más cercanos a esa palabra en su diccionario interno.

  • La analogía: Imagina que el estudiante está a punto de decir la palabra "Cuadrado".
    • El enfoque del "Loro" podría decir "Cuadrilátero" (solo un sinónimo).
    • El enfoque del "Ruido Estático" podría decir "Plátano" (aleatorio e incorrecto).
    • N-GRPO mira a "Cuadrado" y encuentra sus vecinos: "Rectángulo", "Diamante" y "Cubo". Luego, crea un pensamiento mezclado que es una mezcla de estas cuatro ideas.

Esta mezcla es un pensamiento "continuo". No es una sola palabra todavía; es un concepto difuso que se sitúa justo en medio de estas ideas relacionadas.

Por qué esto funciona

  1. Mantenerse en el camino: Debido a que los vecinos se eligen basándose en qué tan similares son a la palabra original, el nuevo "pensamiento mezclado" sigue siendo matemática y lógicamente relevante. No se desvía hacia el sinsentido (como el ejemplo del "Plátano").
  2. Encontrar nuevos caminos: Debido a que es una mezcla, permite al modelo explorar un ángulo ligeramente diferente del problema que haría con una sola palabra. Es como tomar una ruta ligeramente diferente por un bosque para encontrar un atajo oculto, en lugar de simplemente caminar por el mismo camino más rápido o más lento.

Cómo se utiliza

El artículo integra esto en un marco de entrenamiento llamado GRPO.

  • Durante el entrenamiento: El modelo practica. A veces (aproximadamente el 10% de las veces), utiliza esta mezcla de "Vecino Inteligente" para generar una solución. Si esa solución conduce a una respuesta correcta, el modelo recibe una recompensa y aprende que ese camino "mezclado" fue bueno.
  • Durante las pruebas (Inferencia): Curiosamente, el artículo encontró que mientras esta mezcla ayuda al aprendizaje, en realidad perjudica el rendimiento cuando el modelo está respondiendo una pregunta por su cuenta. Por lo tanto, apagan la mezcla cuando el modelo está realizando la prueba final, manteniéndose fiel a las respuestas claras y estándar.

Los Resultados

Los investigadores probaron esto en problemas matemáticos (como los bancos de pruebas AIME y MATH) utilizando diferentes tamaños de modelos de IA.

  • El resultado: Los modelos que utilizan N-GRPO resolvieron más problemas correctamente que los modelos que utilizaban los métodos antiguos.
  • La conclusión: Al mezclar los "pensamientos" de palabras similares, la IA puede explorar soluciones más creativas sin confundirse ni perder el rumbo.

Limitaciones

El artículo señala dos desventajas principales:

  1. Velocidad: Encontrar estos "vecinos" y mezclarlos requiere potencia de cómputo adicional, lo que hace que el proceso de entrenamiento sea un poco más lento.
  2. Alcance: Solo probaron esto en matemáticas y ciencias. No lo han probado aún en programación, donde las reglas son muy estrictas (no puedes realmente "mezclar" la sintaxis de un código sin romperlo).

En resumen, N-GRPO enseña a la IA a pensar mezclando ideas similares, lo que le permite explorar nuevas soluciones sin perder la cabeza.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →