← Últimos artículos
💬 NLP

Comparing Transformers and Hybrid Models at the Token Level

Este artículo analiza las diferencias de rendimiento a nivel de token entre los modelos de lenguaje puramente transformer e híbridos utilizando Olmo 3 y Olmo Hybrid, revelando que los modelos híbridos sobresalen en la predicción de contenido semántico y en el seguimiento de estados mediante capas recurrentes, mientras que los transformers superan en tareas de coincidencia de corchetes sintácticos y de copia de n-gramas.

Autores originales: Yanhong Li, William Merrill

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yanhong Li, William Merrill

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñar a dos tipos diferentes de estudiantes a escribir la siguiente oración de una historia. Un estudiante es un Súper-Lector (el Transformer), y el otro es un Súper-Lector con Libreta (el modelo Híbrido).

El artículo pregunta: ¿Cuándo hace realmente un mejor trabajo el estudiante con la libreta que aquel que solo confía en su memoria de lo que ha leído hasta ahora?

Aquí está el desglose de sus hallazgos utilizando analogías simples:

1. Los dos estudiantes

  • El Súper-Lector (Transformer): Este estudiante tiene una memoria increíble para todo lo que acaba de leer. Si dices: "El gato se sentó en el...", puede recordar instantáneamente que "tapete" fue mencionado tres oraciones atrás. Es excelente copiando patrones y terminando oraciones que siguen una regla estricta (como emparejar un paréntesis ( con un )).
  • El Súper-Lector con Libreta (Híbrido): Este estudiante también tiene una buena memoria, pero también lleva una libreta donde anota el "estado" de la historia a medida que avanza. Rastrea quién posee qué, quién está haciendo qué y cómo evoluciona la trama.

2. Cuándo gana el estudiante de la "Libreta"

El artículo encontró que el estudiante con la libreta (el Híbrido) es mucho mejor prediciendo la siguiente palabra cuando la historia requiere mantener el seguimiento de una situación cambiante.

  • La ventaja de "Contenido": El estudiante Híbrido brilla al predecir palabras de clase abierta (como sustantivos, verbos y adjetivos). Estas son las partes "sustanciosas" de una oración que portan un nuevo significado.
    • Analogía: Imagina una historia de detectives. Si el texto dice: "El detective encontró un ... rojo", el Súper-Lector podría adivinar "sombrero" o "auto" basándose en frases comunes. Pero el estudiante Híbrido, habiendo anotado en su libreta que el sospechoso vestía un abrigo rojo anteriormente, es más propenso a adivinar "abrigo" porque está rastreando el estado de la historia, no solo las palabras inmediatas.
  • La ventaja de "Estado": El Híbrido es mejor en tareas donde se debe recordar un rol o un objeto a través de una larga distancia.
    • Ejemplo: "Liam es el violinista. Naomi es la piloto. ... (muchas palabras) ... El violinista revisó el informe". El Híbrido es mejor recordando que "violinista" se refiere a Liam, incluso después de un largo intervalo, porque actualizó su estado interno.

3. Cuándo gana el estudiante de la "Memoria"

Sorprendentemente, el estudiante sin la libreta (el Transformer puro) es en realidad mejor en situaciones específicas donde la respuesta ya está frente a sus ojos.

  • La ventaja de "Cierre": Cuando el texto necesita cerrar una estructura, el Transformer gana.
    • Analogía: Si el texto tiene un paréntesis abierto (, el Transformer sabe exactamente cuál debe ser el paréntesis de cierre ). No necesita una libreta para recordar que un ( requiere un ); simplemente mira el texto visible. El estudiante Híbrido a veces se confunde aquí, quizás porque está demasiado ocupado rastreando el "estado de la historia" y pasa por alto la regla estructural simple.
  • La ventaja de "Copiar": Si el texto está repitiendo una frase larga (como un error de copiar y pegar o una lista repetitiva), el Transformer es imbatible.
    • Analogía: Si el texto dice: "El veloz zorro marrón salta sobre el perro perezoso. El veloz zorro marrón salta sobre el...", el Transformer simplemente copia el patrón que ve justo enfrente de él. El estudiante Híbrido intenta descifrar el "significado" de la repetición, lo cual es un trabajo innecesario, por lo que desempeña peor.

4. El misterio de las "Palabras Funcionales"

El artículo también analizó palabras pequeñas y aburridas como "el", "es", "y" o "a" (palabras funcionales).

  • El estudiante Híbrido es solo ligeramente mejor en estas.
  • ¿Por qué? Porque estas palabras son como una lista pequeña y cerrada. Solo hay un número limitado de ellas. Una vez que conoces la categoría (por ejemplo, "esto es una preposición"), no hay mucho espacio para que la libreta te ayude a adivinar cuál específica usar. La ventaja de la libreta es mayor cuando hay miles de posibilidades (como sustantivos y verbos) y necesitas contexto para elegir la correcta.

5. La gran conclusión

El artículo concluye que los modelos Híbridos no son simplemente "mejores en todo". Son mejores en cosas específicas:

  1. Rastrear la trama: Mantener el seguimiento de quién posee qué, de qué variables se han establecido en el código o de cuál es el tema actual.
  2. Predecir nuevas ideas: Adivinar la siguiente "palabra de contenido" en una historia o código.

Sin embargo, no son mejores en:

  1. Copiar simple: Repetir lo que se acaba de decir.
  2. Cierre estructural: Emparejar paréntesis o etiquetas que ya están abiertas.

Por qué esto importa para el futuro

Los autores sugieren que si queremos construir una IA aún más inteligente, no deberíamos mirar solo la puntuación "promedio". En su lugar, deberíamos mirar qué palabras acierta la IA.

  • Si una IA es mala en "cerrar paréntesis", sabemos que está teniendo problemas con la estructura.
  • Si una IA es mala en "rastrear quién posee qué", sabemos que está teniendo problemas con su libreta interna (seguimiento de estado).

Al desglosar los resultados palabra por palabra, los investigadores pueden ver exactamente qué tipo de "cerebro" (memoria vs. libreta) está utilizando una IA y reparar las partes específicas que son débiles.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →