← Últimos artículos
💬 NLP

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

Este artículo introduce RAD (Routing Agreement Decoding), una novedosa estrategia de inferencia que aprovecha los distintos patrones de enrutamiento de Mixture-of-Experts de tokens idénticos para seleccionar trayectorias de razonamiento de alta calidad sin depender del análisis de cadenas de respuestas o de la votación, permitiendo así una selección efectiva de pass@1 para tareas de código y agentes donde la votación por mayoría tradicional falla.

Autores originales: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

Publicado 2026-06-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Pregunta: ¿Es un "Hola" siempre el mismo "Hola"?

Imagina que estás escuchando a un coro de 100 cantantes diferentes (los "Expertos" dentro de un modelo de IA de gran tamaño). Cuando el coro canta la palabra "Hola", podrías asumir que todos la cantan exactamente de la misma manera, usando las mismas técnicas vocales y emociones.

La pregunta del artículo es: Si la IA genera exactamente la misma palabra (token) en dos situaciones diferentes, ¿significa eso que la "maquinaria" interna que produjo esa palabra fue también la misma?

La respuesta es: No.

Incluso si la IA escribe la misma palabra exacta (como "Hola" o "La respuesta es 42"), el grupo específico de "cantantes" (expertos) dentro del modelo que la produjo puede ser completamente diferente dependiendo del contexto. Un "Hola" podría ser cantado por un grupo de expertos pensando en matemáticas, mientras que otro "Hola" es cantado por un grupo pensando en programación. La palabra es la misma, pero el estado interno es diferente.

El Problema: ¿Cómo elegimos la respuesta correcta?

Normalmente, cuando queremos que una IA resuelva un problema difícil (como un acertijo matemático o un error de código), le pedimos que lo intente 64 veces (64 "rollouts"). Luego, observamos las respuestas finales. Si 50 de ellas dicen "42" y 14 dicen "43", elegimos "42" porque es la mayoría de los votos.

El inconveniente: Este "voto sobre la respuesta final" funciona de maravilla para las matemáticas (donde la respuesta es un número claro). Pero falla para:

  1. Código: Dos programas pueden hacer exactamente lo mismo pero verse totalmente diferentes (diferentes nombres de variables, diferente formato). No puedes simplemente contar cuántas veces aparece la palabra "print".
  2. Agentes: A veces, la IA intenta corregir un error de software. La "respuesta" es un parche de código. No hay una única "cadena de texto correcta" sobre la cual votar; el código es único para cada intento.

Necesitamos una forma de elegir el mejor intento sin necesidad de leer o comparar las respuestas finales.

La Solución: RAD (Decodificación de Acuerdo de Enrutamiento)

Los autores descubrieron una señal secreta escondida dentro de la IA: el Router (Enrutador).

Imagina la IA como un enorme edificio de oficinas con miles de trabajadores especializados (expertos). Antes de que un trabajador realice cualquier tarea, un Router (un gerente) decide qué equipo de trabajadores se encargará del trabajo.

  • El descubrimiento: El artículo encontró que cuando la IA está a punto de escribir el inicio de una respuesta (como el símbolo \boxed{ en matemáticas o las comillas triples ``` en código), el patrón de decisión del Router revela mucho sobre la calidad de la respuesta.
  • La analogía: Imagina que intentas adivinar qué equipo en un torneo deportivo ganará. En lugar de esperar al marcador final (que aún no puedes ver), observas qué jugadores eligió el entrenador para empezar el juego.
    • Si los entrenadores eligen la misma alineación de "equipo ideal" para 50 juegos diferentes, es probable que esos juegos terminen con el mismo resultado.
    • Si los entrenadores eligen alineaciones aleatorias y desparejadas, los resultados serán muy variados.

RAD funciona así:

  1. Genera 64 intentos diferentes para un problema.
  2. Ignora las respuestas finales por completo. No las lee.
  3. Observa la alineación del Router (qué expertos fueron elegidos) justo en el momento en que comienza la respuesta.
  4. Pregunta: "¿Qué 64 intentos tuvieron las alineaciones más similares?"
  5. Elige el intento que pertenece al grupo más grande de alineaciones similares.

Si 50 intentos utilizaron el mismo "equipo de expertos" para comenzar su respuesta, RAD asume que ese grupo es el más confiado y probablemente correcto, incluso sin saber cuál es la respuesta en realidad.

Por qué esto es importante

  1. Funciona donde la votación falla: En tareas de programación, donde no puedes simplemente contar palabras coincidentes, RAD sigue funcionando. Elige el mejor parche de código mirando el "equipo interno" que lo escribió, no el código en sí.
  2. Es rápido y sencillo: No necesita entender el significado del código o las matemáticas. Solo observa el patrón de los "interruptores" internos que se activan.
  3. No es un detector de verdad mágica: El artículo es honesto al respecto. Si 50 personas coinciden en la respuesta incorrecta (una "cuenca errónea densa"), RAD también elegirá esa respuesta incorrecta. Elige el camino más popular, no necesariamente el camino verdadero. Es una "señal de consenso", no un "verificador de verdad".

Resumen en una frase

El artículo demuestra que incluso si una IA dice la misma palabra dos veces, el "equipo" interno que la dijo puede ser diferente; al elegir la respuesta que proviene de la "alineación de equipo" más consistente al inicio de la respuesta, podemos elegir el mejor resultado sin necesidad de leer jamás la respuesta final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →