← Últimos artículos
🤖 machine learning

Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers

Este artículo propone un novedoso marco de aprendizaje dual que aplica transformaciones de pesos que preservan la funcionalidad para alinear Transformers de miles de millones de parámetros entrenados de forma independiente, permitiendo una conectividad de modo lineal casi libre de barreras y una fusión de modelos efectiva tanto en el dominio del lenguaje como en el de la visión.

Autores originales: Tianyi Li, Zhiqiang Shen

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tianyi Li, Zhiqiang Shen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Fusionar Dos Recetas Diferentes

Imagina que tienes a dos maestros chefs que han pasado años perfeccionando exactamente el mismo plato: un pastel de chocolate. Ambos saben cómo hacerlo delicioso. Sin embargo, aprendieron sus habilidades en cocinas diferentes, usaron tazas medidoras diferentes y organizaron sus ingredientes de formas completamente distintas.

  • El Chef A pone la harina en un bol a la izquierda y el azúcar a la derecha.
  • El Chef B pone la harina a la derecha y el azúcar a la izquierda.

Si intentas simplemente "mezclar" sus recetas a la mitad del proceso (un proceso llamado interpolación lineal), el resultado es un desastre. Podrías terminar con media taza de harina y media taza de azúcar en el mismo bol, pero como sus instrucciones no coinciden, el pastel se desploma. En el mundo de la IA, esto se llama una barrera de pérdida (loss barrier): un punto donde el modelo combinado deja de funcionar y la tasa de error se dispara.

El Problema: Las Diferencias "Ocultas"

Durante mucho tiempo, los científicos pensaron que estos dos chefs simplemente estaban haciendo pasteles diferentes. Pero este artículo argumenta que en realidad están haciendo el mismo pastel; solo tienen simetrías diferentes.

En la IA, la "simetría" significa que puedes reorganizar las cosas sin cambiar el resultado.

  • Permutación: Puedes cambiar el orden de los pasos (como mezclar los huevos antes que la leche frente a la leche antes que los huevos) siempre que ajustes los otros pasos para que coincidan.
  • Escalamiento: Puedes usar una cuchara gigante o una cuch。cuchara diminuta, siempre que ajustes la cantidad de ingredientes para que coincidan.

El problema es que cuando dos modelos de IA se entrenan por separado, naturalmente caen en diferentes "reorganizaciones". Si intentas mezclarlos sin corregir estas reorganizaciones primero, la IA se confunde.

La Solución Antigua: Ajuste Unilateral

Los métodos anteriores intentaban solucionar esto tomando la receta del Chef B y forzándola a parecerse a la del Chef A. Decían: "Está bien, Chef B, mueve tu azúcar a la izquierda para que coincida con el Chef A".

Esto ayuda un poco, pero es como intentar meter un poste cuadrado en un agujero redondo. El Chef B tiene que contorsionar todo su estilo para adaptarse al diseño de la cocina específica del Chef A. Funciona, pero la receta "intermedia" resultante sigue teniendo un alto riesgo de fracaso.

La Nueva Solución: El "Doble Baile" (LMC-DM)

Este artículo presenta un nuevo método llamado Emparejamiento de Aprendizaje Dual (Dual Learned Matching). En lugar de forzar a un chef a copiar al otro, ambos acuerdan encontrarse en el medio.

Imagina una pista de baile. En lugar de que el Chef A se quede quieto y el Chef B intente seguirle el paso, ambos chefs comienzan a bailar el uno hacia el otro.

  1. Ambos aprenden nuevas formas de organizar sus ingredientes (ajustando sus "simetrías").
  2. Ambos se mueven hacia un diseño de cocina compartido y neutral donde sus pasos se alinean perfectamente.
  3. Una vez alineados, pueden mezclar sus recetas sin problemas.

Debido a que ambos chefs son flexibles y se mueven hacia un objetivo común, el punto "intermedio" ya no es una zona de desastre. Se convierte en un camino suave y seguro donde el pastel sabe tan bien como el original.

Lo Que Realmente Encontraron

Los investigadores probaron esto en modelos de IA masivos (algunos con miles de millones de parámetros, lo que es como tener una cocina con millones de ingredientes).

  • El Resultado: Cuando usaron este método del "Doble Baile", la "zona de desastre" (la barrera de pérdida) casi desapareció por completo.
  • Modelos de Visión: Lo probaron en modelos de reconocimiento de imágenes (como los que identifican gatos y perros). Incluso al mezclar dos modelos diferentes, el modelo combinado mantuvo su precisión alta (por encima del 69%) durante todo el tiempo.
  • Modelos de Lenguaje: Lo probaron en modelos de generación de texto (como los que escriben historias). Para modelos de tamaño medio, la tasa de error fue prácticamente cero. Incluso para los modelos gigantes de miles de millones de parámetros, el error fue muy pequeño.

La Conclusión

El artículo demuestra que los grandes modelos de IA no son islas aisladas. En realidad, están conectados por caminos ocultos. Si dejas de intentar forzar a un modelo a copiar al otro y, en su lugar, dejas que ambos modelos se ajusten a sí mismos para encontrarse en el medio, puedes fusionarlos sin problemas.

Esto significa que podemos tomar dos modelos de IA diferentes, altamente entrenados, y combinarlos en uno solo, poderoso, sin necesidad de reentrenarlos desde cero ni construir estructuras complejas. Es como darse cuenta de que dos idiomas diferentes son en realidad solo dialectos del mismo idioma, y si los hablas ambos con un poco de flexibilidad, puedes entenderte perfectamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →