← Últimos artículos
🤖 machine learning

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

Este artículo presenta la Multiplicación de Matrices Reducida (RMM), un método de inferencia adaptativo a la entrada y libre de entrenamiento que reduce los costes computacionales en modelos basados en Transformers al retener selectivamente porciones informativas de productos matriciales, logrando compensaciones escalables entre precisión y eficiencia a través de diversos tamaños de modelos, tareas y modalidades sin modificar los pesos del modelo.

Autores originales: Zixuan Lan, Yanhong Li, Jiawei Zhou

Publicado 2026-08-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zixuan Lan, Yanhong Li, Jiawei Zhou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el cerebro de una computadora moderna como un bibliotecario masivo e hiperinteligente. Este bibliotecario no solo lee libros; también los escribe, resuelve problemas matemáticos e incluso observa imágenes para contar historias. Para lograr esto, utiliza un tipo especial de arquitectura cerebral llamada "Transformer". Piensa en un Transformer como una fábrica gigante donde la información fluye a través de líneas de ensamblaje. En cada estación de estas líneas, la fábrica realiza un cálculo masivo: multiplica enormes cuadrículas de números entre sí. Estas son las "multiplicaciones de matrices" que impulsan la magia. El problema es que estos cálculos son increíblemente pesados. Requieren mucha energía y tiempo, como intentar mover una montaña de arena con una cucharadita. A medida que estos modelos de IA se vuelven más inteligentes y grandes, la "montaña" se vuelve más alta, haciendo que sea costoso y lento ejecutarlos. Los científicos se han preguntado durante mucho tiempo: ¿está el bibliotecario utilizando realmente cada uno de los granos de arena de esa montaña para cada tarea, o hay mucha arena innecesaria que podríamos barrer sin que el bibliotecario lo note?

Este artículo presenta un nuevo y astuto truco llamado Multiplicación de Matrices Reducida (RMM, por sus siglas en inglés). En lugar de intentar encoger permanentemente la fábrica o borrar partes de la memoria del bibliotecario (lo cual podría romper las cosas), RMM actúa como un filtro inteligente y sobre la marcha. Cada vez que el bibliotecario está a punto de realizar un cálculo masivo, RMM hace una pausa y pregunta: "¿Qué números específicos en esta cuadrícula están haciendo el trabajo pesado en este momento?". Luego, selecciona solo los más importantes —por ejemplo, el 50% o el 70% superior— e ignora el resto para ese momento específico. Es como un chef que, en lugar de picar cada vegetal de la nevera para una sopa, prueba rápidamente el caldo y decide usar solo las zanahorias y cebollas que se necesitan actualmente para este sabor específico. ¿Lo mejor de todo? El bibliotecario no necesita ser reentrenado ni enseñado a hacer esto; simplemente funciona de forma natural con los números que ya está generando.

Los investigadores probaron esta idea en una amplia variedad de modelos de IA, que van desde los pequeños con 1 billón de parámetros hasta gigantes con 70 billones. Descubrieron que estos modelos son sorprendentemente flexibles. Cuando redujeron la cantidad de matemáticas realizadas manteniendo solo una parte de los números, los modelos no se desmoronaron. De hecho, cuanto más grande era el modelo, más arena parecía estar dispuesto a soltar sin perder la cabeza. Por ejemplo, el gigante modelo de 70 mil millones de parámetros pudo manejar una reducción del 50% en los cálculos mientras seguía respondiendo preguntas y escribiendo historias casi tan bien como antes. Sin embargo, el artículo también descubrió una peculiaridad curiosa en cómo se construyen estas fábricas: las partes de "atención" del cerebro (donde el modelo decide en qué enfocarse) son muy relajadas y pueden manejar la pérdida de la mitad de su trabajo fácilmente. Pero las partes "MLP" (las partes que realmente procesan y transforman la información) son mucho más sensibles; si cortas demasiado ahí, el modelo empieza a tropezar.

El equipo también demostró que este truco funciona para modelos que pueden ver y hablar, no solo para los que son solo de texto. Incluso construyeron herramientas de software especiales para demostrar que saltarse estos números realmente hace que la computadora funcione más rápido en la vida real, especialmente cuando las historias o las oraciones se vuelven muy largas. Si bien el artículo sugiere que esto es una forma prometedora de hacer que la IA sea más barata y rápida, también señala que no existe un ajuste "perfecto" para todos. Tienes que ajustar cuánto recortar basándote en el modelo específico y en lo que le estás pidiendo que haga. Pero, en general, la RMM ofrece una forma fresca y sin necesidad de entrenamiento para hacer que estos gigantes digitales funcionen de forma más ligera, demostiendo que, a veces, hacer menos matemáticas puede ayudarte a pensar con la misma claridad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →