← Últimos artículos
💬 NLP

Function-Vector Heads Are Two Populations: Writers and Cancellers in In-Context Learning

Este artículo desafía la suposición de que las cabezas de vector-función son un grupo homogéneo al revelar que consisten en dos subpoblaciones opuestas —escritores que promueven reglas correctas y canceladores que las suprimen— que son invisibles para el ranking basado únicamente en magnitud, pero que impactan significativamente el rendimiento del modelo cuando son identificadas y abladas.

Autores originales: Han-yu Wang

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Han-yu Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un modelo de lenguaje grande (como los que charlan contigo) como una enorme orquesta intentando resolver un rompecabezas basado en unos pocos ejemplos. En esta orquesta, hay músicos específicos llamados cabezales de atención (attention heads). Durante mucho tiempo, los investigadores creyeron que los músicos más importantes eran simplemente aquellos que tocaban las notas más fuertes. Asumían que si un músico tocaba muy fuerte, definitivamente estaba ayudando a la orquesta a tocar la melodía correcta.

Este artículo, sin embargo, descubre que esta suposición es errónea. Resulta que los músicos más "fuertes" pertenecen en realidad a dos grupos completamente diferentes y opuestos: Los Escritores y Los Canceladores.

Aquí está el desglose de lo que el artículo descubrió, utilizando analogías sencillas:

1. El gran malentendido: Volumen vs. Dirección

Anteriormente, los investigadores observaban a estos músicos y los clasificaban por su volumen (cuánto contribuían a la respuesta). Asumían que los 20 músicos más fuertes eran todos "ayudantes".

Los autores de este artículo se dieron cuenta de que el volumen no es suficiente; necesitas conocer la dirección.

  • Los Escritores: Estos músicos tocan una nota fuerte que empuja a la orquesta hacia la respuesta correcta.
  • Los Canceladores: Estos músicos también tocan una nota fuerte, pero están empujando a la orquesta hacia la respuesta incorrecta. Están intentando cancelar activamente la respuesta correcta.

La Analogía: Imagina un juego de tirar de la cuerda (tug-of-war).

  • Los Escritores son el equipo que tira de la cuerda hacia la línea de meta.
  • Los Canceladores son un segundo equipo que tira de la cuerda con la misma fuerza, pero en la dirección opuesta.
  • Si solo miras qué tan fuerte tiran (magnitud), piensas que ambos son igualmente importantes "tiradores". Pero si miras la dirección, ves que se están combatiendo entre sí.

2. El descubrimiento: Dos poblaciones

Los investigadores probaron esto en varios modelos diferentes (desde pequeños hasta grandes) y diferentes tipos de acertijos de lógica. Descubrieron que, en casi todos los casos, los "mejores" músicos se dividen en estos dos bandos opuestos.

  • Los "Escritores" impulsan la probabilidad de la respuesta correcta hacia arriba.
  • Los "Canceladores" impulsan la probabilidad de la respuesta correcta hacia abajo.

Cuando los investigadores silenciaron (ablación) a los Canceladores, el modelo en realidad mejoró al resolver los acertijos. Fue como eliminar a un saboteador del equipo de tirar de la cuerda; de repente, los "Escritores" pudieron tirar de la cuerda hacia la línea de meta sin resistencia.

3. Por qué la investigación previa falló

El artículo explica que estudios anteriores (como uno de Todd et al., 2024) utilizaron un método que solo observaba la "fuerza" de la contribución. Debido a esto, accidentalmente captaron una mezcla de Escritores y Canceladores, pero la mezcla cambiaba dependiendo del acertijo.

  • En algunos acertijos, los "Canceladores" eran más fuertes, por lo que el método antiguo pensaba que ellos eran los principales ayudantes.
  • En otros acertijos, los "Escritores" eran más fuertes, por lo que el método antiguo pensaba que ellos eran los principales ayudantes.

El artículo muestra que, al ignorar el "signo" (la dirección), la investigación previa estaba esencialmente mezclando a los héroes y a los villanos, pensando que todos eran simplemente "ayudantes ruidosos".

4. ¿Son los Canceladores simplemente errores?

Los investigadores querían asegurarse de que los "Canceladores" no fueran simplemente partes rotas del modelo o ruido accidental. Realizaron muchas pruebas para demostrar que son partes reales y funcionales del sistema:

  • Leen cosas diferentes: Los Escritores se enfocan en las "etiquetas" (las respuestas) en los ejemplos. Los Canceladores se enfocan en el "formato" (la puntuación y el espaciado). Están mirando partes diferentes de la página.
  • Están impulsados por el contenido: Los Canceladores no están suprimiendo respuestas de forma aleatoria; están intentando específicamente suprimir la respuesta que se acaba de demostrar en los ejemplos.
  • No son "Supresores de Copia": El artículo descartó la idea de que estos sean solo mecanismos genéricos de "no copiar". Son específicos de la lógica de la tarea.

5. El estudio de personaje de "L11.H4"

El artículo hace un zoom en un músico específico, L11.H4, para ver cómo funciona.

  • Este músico es un "Cancelador" en los acertijos de lógica (intenta empujar la respuesta incorrecta).
  • Sin embargo, si cambias el acertijo a una tarea de vocabulario (como emparejar antónimos), este mismo músico cambia su rol y se convierte en un "Escritor" (ayuda a la respuesta correcta).
  • La Lección: Este músico no es intrínsecamente "bueno" o "malo". Su trabajo es suprimir lo que se acaba de demostrar. Si la demostración es la respuesta correcta, la suprime (Cancelador). Si la demostración es la respuesta incorrecta (en un contexto diferente), suprime la respuesta incorrecta, ayudando efectivamente a la correcta (Escritor).

6. La Conclusión

La conclusión principal es que no podemos tratar las partes más "activas" de un modelo de IA como un grupo único y uniforme.

  • Visión Antigua: "Estos son los 20 cabezales más importantes. Usemos ellos para dirigir el modelo".
  • Nueva Visión: "Estos 20 cabezales son en realidad una guerra civil. La mitad está empujando al modelo hacia el lugar correcto, y la otra mitad lo está empujando hacia el lugar equivocado. Si quieres dirigir el modelo, necesitas silenciar a los Canceladores, no solo amplificar a los Escritores".

El artículo no afirma que esto haga que el modelo sea "seguro" o esté listo para su uso médico o legal en el mundo real. Simplemente establece que, para entender cómo estos modelos aprenden reglas a partir de ejemplos, debemos reconocer que sus "músicos" internos a menudo están luchando entre sí, no trabajando juntos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →