← Últimos artículos
🤖 machine learning

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

Este artículo demuestra que el fracaso de los modelos de lenguaje grandes para contar tokens repetidos no se debe a una incapacidad para representar internamente la cantidad correcta, sino a un mecanismo específico de la MLP activado por el formato que sobrescribe la representación precisa con una respuesta fija incorrecta durante la generación de la salida.

Autores originales: Sohan Venkatesh

Publicado 2026-05-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Sohan Venkatesh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un bibliotecario muy inteligente y bien leído (el modelo de IA). Le pides a este bibliotecario que cuente cuántas veces aparece la palabra "manzana" en una lista larga. Esperarías que lo hiciera bien, pero en su lugar dice con confianza: "Hay 8 manzanas", aunque claramente hay 10.

Durante mucho tiempo, la gente pensó que el bibliotecario simplemente era malo contando. Asumieron que el cerebro del bibliotecario no tenía un "contador" integrado, por lo que no podía llevar la cuenta de los números.

Este artículo dice que esa suposición es incorrecta.

Aquí tienes una explicación sencilla de lo que realmente descubrieron los investigadores, usando algunas analogías cotidianas:

1. El bibliotecario sabe la respuesta

Los investigadores miraron profundamente dentro del cerebro del bibliotecario (las capas internas del modelo) en cada paso individual del proceso de pensamiento. Descubrieron que el número correcto (10) estaba escrito de forma clara y perfecta desde el primer paso hasta el último.

  • La analogía: Imagina que el bibliotecario camina por un pasillo sosteniendo una pizarra en la mano. En cada paso de la caminata, la pizarra dice claramente "10". La información está ahí, fuerte y clara. El bibliotecario no está confundido; en realidad sabe la respuesta.

2. El escriba de letreros "defectuoso"

Entonces, si el bibliotecario sabe que la respuesta es 10, ¿por qué dice "8"?

Los investigadores encontraron un "defecto" específico en medio del pasillo. Aproximadamente en el 90% del proceso de pensamiento, hay un trabajador específico (una parte del código informático llamada bloque MLP) que ve el formato de la lista (palabras separadas por espacios) y decide ignorar la pizarra.

  • La analogía: Imagina que el bibliotecario camina por el pasillo sosteniendo el letrero "10". De repente, un trabajador específico (llamémosle "Fred-Formato") salta hacia afuera. Fred ve que la lista está escrita con espacios (como "manzana manzana manzana"). Tiene una regla preprogramada: "Si veo una lista de palabras con espacios, debo cambiar el letrero para que diga '8'".
  • Fred toma la pizarra, borra el "10" y escribe "8" en ella.
  • Aunque el cerebro del bibliotecario aún sabe que es 10 (la señal original sigue ahí en el fondo), la salida final ahora es "8" porque Fred la sobrescribió.

3. No se trata de las palabras, sino del formato

Este defecto solo ocurre con palabras (como "manzana" o "gato"), no con números (como "1" o "2").

  • La analogía: Si le das al bibliotecario una lista de números ("1 1 1 1..."), a Fred-Formato no le importa. Solo reacciona a las palabras. El bibliotecario cuenta los números perfectamente. Pero si le das palabras, Fred se activa.
  • Además, si cambias el formato para usar comas en lugar de espacios (por ejemplo, "manzana, manzana, manzana"), Fred no salta. La regla del "8" no se activa y el bibliotecario lo hace bien. Esto demuestra que el problema no es la capacidad de contar; es una reacción específica a cómo se ve la lista.

4. El problema de "enrutamiento", no de "representación"

El artículo hace una gran distinción entre dos tipos de fallos:

  • Fallo de representación: El bibliotecario no sabe contar. (Este artículo dice que esto NO está ocurriendo).

  • Fallo de enrutamiento: El bibliotecario sabe contar, pero la señal es secuestrada antes de llegar a la boca. (Esto es lo que está ocurriendo).

  • La analogía: Es como una estación de radio que reproduce la canción correcta (la cuenta), pero un DJ en la cabina (el bloque MLP) decide cortar la música y reproducir una canción diferente (el número incorrecto) justo antes de que salga a los altavoces. La música está bien; el enrutamiento está roto.

5. Los modelos más grandes tienen un defecto diferente

Los investigadores también observaron modelos más grandes y inteligentes. Estos modelos suelen obtener la cuenta correcta, pero fallan si introduces sigilosamente un "plátano" en la lista de manzanas.

  • El defecto: Estos modelos más grandes ven el plátano. Su sistema de atención lo nota. Pero, al igual que los modelos más pequeños, no logran permitir que esa información cambie la respuesta final. Ven la anomalía pero no pueden "enrutar" esa nueva información hacia la salida final.

La conclusión

El artículo concluye que estos modelos de IA no son "malos en matemáticas". En realidad, son muy buenos siguiendo los números internamente. El problema es que una parte específica de su cerebro se activa por la forma en que está escrita la lista (espacios frente a comas, palabras frente a números) y fuerza una respuesta incorrecta sobre la salida final, sobrescribiendo la correcta que ya estaba ahí.

Para solucionar esto, no necesitamos enseñar a la IA a contar (ya lo sabe). Necesitamos arreglar al "policía de tráfico" (el mecanismo de enrutamiento) que actualmente está bloqueando que la respuesta correcta salga.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →