← Últimos artículos
🤖 machine learning

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

Este artículo presenta HyenaND, un operador subcuadrático y dependiente de la entrada que aplica convoluciones globales directamente a estructuras de datos multidimensionales nativas para superar las limitaciones de los modelos estándar de atención y recurrentes, logrando una precisión competitiva y aceleraciones significativas mediante una implementación especializada en CUDA.

Autores originales: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Pali
Publicado 2026-07-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente a entender el mundo. En este momento, los mejores robots utilizan una herramienta llamada "atención" para mirar todo a la vez, como un estudiante escaneando una página entera de texto para encontrar las palabras más importantes. Esto funciona de maravilla para historias cortas, pero si le das al robot una biblioteca entera, una película en 3D o un mapa meteorológico complejo, la herramienta de "atención" se siente abrumada. Tiene que comparar cada pieza de datos con cada otra pieza, lo que consume tanto tiempo y energía que el robot colapsa o tiene que mirar los datos a través de un pequeño ojo de cerradura (un proceso llamado "patchification" o parcheado) solo para sobrevivir.

Para solucionar esto, los científicos han estado intentando construir herramientas más rápidas. Una idea popular es usar modelos "recurrentes", que leen los datos como una línea de texto, palabra tras palabra. Pero esto es como intentar entender una escultura 3D mirando solo desde un ángulo y luego adivinando el resto; destruye la forma natural del objeto. Otra idea es usar "convoluciones", que son como deslizar una lupa sobre una imagen para detectar patrones. Estas son rápidas y mantienen intacta la forma 3D, pero suelen actuar como un sello rígido, aplicando exactamente el mismo patrón a cada parte de la imagen sin prestar atención a lo que realmente hay allí. La gran pregunta en este rincón de la informática es: ¿Podemos construir una herramienta que sea lo suficientemente rápida para manejar datos 3D masivos, que mantenga la forma natural de esos datos y que sea lo suficientemente inteligente como para cambiar su "lupa" basándose en lo que ve?

Este artículo presenta una nueva herramienta llamada HyenaND que dice "sí". Piensa en HyenaND como una lupa mágica que cambia de forma y puede deslizarse sobre un objeto 3D (como un escaneo médico o una simulación meteorológica) sin llegar a aplanarlo nunca en una línea 1D. A diferencia de los sellos rígidos del pasado, esta herramienta puede observar el objeto completo primero, decidir qué tipo de patrón necesita encontrar y luego ajustar instantáneamente su lente para que coincida. Lo logra mediante un truco matemático ingenioso que involucra "transformadas de Fourier" (una forma de convertir imágenes en ondas sonoras para procesarlas más rápido) que mantiene la velocidad superalta, creciendo solo ligeramente más lento a medida que los datos se agrandan, en lugar de que el costo explote.

Los autores descubrieron que HyenaND es un cambio de paradigma para el manejo de datos multidimensionales complejos. En sus pruebas, demostraron que HyenaND puede realizar tareas que harían que las herramientas de "atención" estándar colapsaran debido a los límites de memoria, como analizar imágenes médicas 3D o simular la dinámica de fluidos. Cuando lo probaron en un juego de "copiado" donde el robot tenía que recordar un color específico de una cuadrícula 3D, HyenaND fue miles de veces más preciso que los métodos antiguos. También construyeron un motor de software especial llamado nSubQ para asegurar que este truco matemático se ejecute a la velocidad del rayo en chips de computadora reales, convirtiendo la velocidad teórica en ahorros de tiempo reales.

El artículo sugiere que, aunque HyenaND es increíblemente poderoso por sí solo, funciona aún mejor cuando se combina con las antiguas herramientas de "atención" en un equipo híbrido. En experimentos con secuencias de ADN, visión computacional (ImageNet) e imágenes médicas, estos equipos híbridos superaron tanto a los modelos de atención pura como a otros modelos rápidos que intentan leer los datos en una línea. Los autores argumentan que ya no tenemos que elegir entre velocidad e inteligencia; podemos tener una herramienta que respete la geometría 3D de nuestros datos, que escale a tamaños masivos y que, además, preste mucha atención a los detalles. Concluyen que este enfoque elimina un cuello de botella importante, permitiendo que la IA del futuro finalmente "vea" el mundo en su gloria nativa de alta resolución en 3D sin tener que mirar a través de un pequeño ojo de cerradura.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →