← Últimos artículos
🤖 machine learning

LeRoPE: Learnable RoPE Frequencies Improve Language Modeling

Este artículo presenta LeRoPE, un método que trata las frecuencias del Codificación Posicional Rotatoria (RoPE) como parámetros aprendibles en lugar de hiperparámetros fijos, demostrando a través del entrenamiento de modelos desde 52M hasta 2.5B de parámetros que este enfoque supera consistentemente al RoPE estándar y parcial, requiriendo significativamente menos cómputo para lograr un rendimiento comparable.

Autores originales: Petros Karypis, Sean O'Brien, Shreyas Kadekodi, Rui Zhu, Julian McAuley

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Petros Karypis, Sean O'Brien, Shreyas Kadekodi, Rui Zhu, Julian McAuley

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot superinteligente a leer y escribir. Para ayudar al robot a entender el orden de las palabras en una oración, le das un "rastreador de posición" especial. Durante mucho tiempo, el mejor rastreador utilizado fue una receta fija y preestablecida llamada RoPE (Codificaciones Posicionales Rotatorias). Piensa en esta receta como un enorme dial de radio preajustado con 32 estaciones diferentes (frecuencias). Cada estación gira a una velocidad específica e inalterable. Algunas estaciones giran superrápido, otras muy lento. La regla era: "No toques los diales; están grabados en piedra".

Pero los autores de este artículo se hicieron una pregunta simple: ¿Qué pasaría si dejamos que el propio robot sintonice los diales?

Presentaron LeRoPE (RoPE Aprendido). En lugar de bloquear las frecuencias, dejaron que el robot aprendiera un pequeño "control de volumen" para cada una de las 32 estaciones durante el entrenamiento. El robot puede decidir exactamente qué tan rápido o lento debe girar cada estación para que el texto tenga el mejor sentido posible.

El Gran Descubrimiento: Una Estación lo Gobierna Todo

Cuando los investigadores entrenaron robots de diferentes tamaños (desde un modelo diminuto de 52 millones de parámetros hasta uno masivo de 2.5 mil millones de parámetros), descubrieron algo fascinante. El robot no solo ajustó los diales de forma aleatoria. De manera constante hizo dos cosas:

  1. Silenció las estaciones más lentas. El robot se dio cuenta de que las estaciones más lentas (que apenas giran) no ayudaban mucho con la posición. Redujo su volumen a casi cero.
  2. Encontró una "Estación Súper". El robot descubrió una estación específica que se convirtió en la estrella del espectáculo. Esta "banda dominante" giraba a una velocidad muy específica, aproximadamente 2.2 veces la longitud de la ventana de entrenamiento. Por ejemplo, si el robot fue entrenado con oraciones de 2,048 tokens, esta estación especial giraba con una longitud de onda de unos 4,170 tokens.

Esta "Estación Súper" actuó como un latido rítmico gigante para la atención del robot. Ayudó al robot a entender mejor la distancia entre las palabras de lo que la antigua receta fija podría haberlo hecho.

Los Resultados: Un Robot Más Inteligente con Menos Esfuerzo

El equipo probó este nuevo método en una escala de modelos, desde el tamaño diminuto de 52M hasta el gigante de 2.5B. Los resultados fueron consistentes:

  • Mejor Rendimiento: En cada tamaño, el robot que usa LeRoPE cometió menos errores (menor pérdida) que el robot que usa el antiguo RoPE fijo.
  • La Victoria del 3.4%: Para igualar el rendimiento del robot LeRoPE a la mayor escala (2.5B de parámetros), el antiguo robot RoPE habría necesitado 3.4% más de potencia de cómputo (FLOPs). Eso es como tener que correr un 3.4% más de la distancia para terminar una carrera a la misma velocidad.
  • Aguja en un Pajar: También probaron la capacidad del robot para encontrar una pieza específica de información escondida en un texto largo (la prueba de "Aguja en un Pajar"). El robot LeRoPE fue mejor encontrando la aguja, incluso cuando había muchas piezas de texto distractoras (hasta 31 distractores) en el camino.

Lo Que Descartaron

El artículo es cuidadoso al decir qué no funcionó o qué no fue la razón principal del éxito:

  • No se trata solo de apagar las estaciones lentas. Probaron un método llamado "RoPE parcial" (p-RoPE), que simplemente apaga las estaciones más lentas. Aunque esto ayudó un poco, solo capturó aproximadamente el 10.4% de la mejora que logró LeRoPE. LeRoPE es mejor porque no solo apaga las estaciones, sino que remodela cómo giran.
  • No se trata solo de los ajustes finales. Probaron congelar los diales aprendidos del robot después del entrenamiento y usarlos en un nuevo robot. Este "LeRoPE Fijo" capturó aproximadamente el 63.6% de la mejora. Esto sugiere que, si bien los ajustes finales son excelentes, el proceso de que el robot aprenda esos ajustes junto con el resto de su cerebro también juega un papel crucial.

¿Qué Tan Seguros Están?

Los autores están muy seguros de estos hallazgos porque no solo realizaron una prueba.

  • Probaron en cinco tamaños de modelo diferentes.
  • Realizaron experimentos con múltiples semillas aleatorias (diferentes puntos de partida) para asegurar que los resultados no fueran solo suerte. Incluso con diferentes puntos de partida, el robot siempre encontraba esa misma "Estación Súper".
  • Probaron con diferentes tipos de texto, incluyendo código (Python), y vieron patrones similares.

Sin embargo, señalan un pequeño límite: sus modelos más grandes (2.5B) aún son mucho más pequeños que los modelos gigantes utilizados en el mundo real hoy en día. Así que, aunque los resultados son fuertes y consistentes, están observando este comportamiento en un rango específico de tamaños de modelo.

La Conclusión

El artículo sugiere que la antigua regla de "frecuencias fijas" para el seguimiento de la posición no es lo mejor que podemos hacer. Al dejar que el modelo aprenda sus propias frecuencias, descubre naturalmente una forma altamente eficiente de manejar la posición, creando un único y poderoso "latido" que le ayuda a entender el texto mejor y más rápido. Es un pequeño cambio en las matemáticas, pero le da al robot una ventaja notable, ahorrando potencia de cómputo y mejorando su capacidad para encontrar información en historias largas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →