← Últimos artículos
💬 NLP

Scaling Embeddings Outperforms Scaling Experts in Language Models

Este trabajo demuestra que escalar las dimensiones de los *embeddings* puede ser más eficiente que escalar los expertos en arquitecturas MoE, presentando el modelo LongCat-Flash-Lite como prueba de que esta estrategia mejora el rendimiento y la eficiencia en tareas de codificación y agentes.

Autores originales: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

Publicado 2026-02-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Dilema de la IA: ¿Más "Cerebros" o más "Diccionarios"?

Imagina que estás construyendo un robot súper inteligente. Para que sea brillante, tienes dos formas de gastar tu presupuesto de "memoria y capacidad":

  1. La estrategia de los "Expertos" (MoE): Es como contratar a miles de especialistas. Si le preguntas de medicina, llama al doctor; si es de cocina, llama al chef. Esto es lo que hacen casi todos los modelos actuales (como GPT). El problema es que, a medida que contratas a más especialistas, el robot se vuelve lento, se confunde al decidir a quién llamar y gasta demasiado tiempo en "comunicaciones" internas.
  2. La estrategia de los "Embeddings" (El enfoque de este papel): En lugar de contratar más especialistas, decides darle al robot un diccionario de conceptos infinitamente más profundo y detallado. No solo sabe qué es una "manzana", sino que tiene una conexión instantánea y ultra-detallada con "manzana roja crujiente en otoño".

El descubrimiento de este estudio es que, a veces, es mucho mejor darle al robot un diccionario gigante que contratar a mil especialistas más.


¿Cómo funciona su truco? (La analogía de las piezas de LEGO)

El equipo de Meituan inventó algo llamado "N-gram Embedding". Imaginalo así:

Normalmente, la IA lee palabra por palabra: "El", "gato", "duerme". Es como si solo viera piezas de LEGO sueltas.

Con su método, la IA no solo ve la pieza suelta, sino que tiene una "caja de memoria" que reconoce automáticamente grupos de piezas: "El gato", "gato duerme", "el gato duerme". Al reconocer estos "bloques" de información de antemano, la IA no tiene que esforzarse tanto en entender el contexto; el contexto ya viene "pegado" a la palabra. Es como si, en lugar de leer letra por letra, leyeras frases enteras de un solo vistazo.


Las 3 Reglas de Oro que descubrieron

Para que este "diccionario gigante" funcione y no arruine al robot, los investigadores descubrieron tres secretos:

  1. No te pases de la raya: Si gastas todo tu dinero en el diccionario y te quedas sin dinero para los especialistas, el robot será un erudito que no sabe razonar. El consejo es: no uses más del 50% de tu presupuesto en el diccionario.
  2. Evita las "palabras que chocan": Si tu diccionario es malo, dos conceptos distintos podrían terminar con la misma definición (como si "perro" y "avión" significaran lo mismo por error). Ellos aprendieron a diseñar el diccionario para que esto casi nunca pase.
  3. Dale un "empujoncito" al inicio: Al principio, el diccionario es tan nuevo que la IA lo ignora. Tuvieron que aplicar una técnica de "amplificación" para que la información del diccionario sea lo suficientemente fuerte como para que el resto del cerebro la escuche.

El resultado: LongCat-Flash-Lite

Para demostrar que tenían razón, crearon un modelo llamado LongCat-Flash-Lite.

Es un modelo "híbrido" muy inteligente: tiene un tamaño enorme (68.5 mil millones de parámetros), pero es increíblemente rápido y ligero porque no tiene que activar todo su cerebro para responder.

¿En qué es bueno?
Es un campeón en tareas de programación (coding) y en ser un "agente" (un robot que puede usar herramientas, como buscar en internet o usar una calculadora). En estas tareas, donde la precisión de los detalles es vital, su "diccionario gigante" le da una ventaja aplastante sobre los modelos que solo usan "especialistas".

En resumen:

En lugar de intentar hacer un cerebro más complejo y lento añadiendo más neuronas de razonamiento, este estudio demuestra que hacer que la base del conocimiento (el lenguaje) sea mucho más rica y detallada es una forma más inteligente y rápida de crear una IA superpoderosa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →