← Últimos artículos
💻 computer science

FTerViT: Fully Ternary Vision Transformer

Este artículo presenta FTerViT, un Transformer de visión totalmente ternarizado que cuantifica todos los pesos y parámetros de normalización para lograr una compresión de memoria significativa y permitir una implementación eficiente en dispositivos en microcontroladores, manteniendo al mismo tiempo una precisión competitiva en ImageNet-1K.

Autores originales: Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari

Publicado 2026-05-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un bibliotecario brillante y altamente educado (el Transformador de Visión o ViT) que puede mirar una imagen y decirte exactamente qué es. Este bibliotecario es increíblemente inteligente, pero lleva consigo una biblioteca masiva de libros en su cabeza. Si intentas poner a este bibliotecario en una mochila diminuta (un microcontrolador como el de un reloj inteligente o una cámara barata), la mochila se rompe porque los libros son demasiado pesados y ocupan demasiado espacio.

Por lo general, para adaptar una IA inteligente a un dispositivo diminuto, los ingenieros intentan encoger los libros. Podrían convertir el texto en un código más corto, pero a menudo dejan las páginas más importantes y delicadas (como la portada, el índice y el resumen final) en su formato original y voluminoso. El artículo argumenta que esto es como intentar meter una enciclopedia pesada en un bolsillo solo encogiendo los capítulos del medio; la portada y el índice siguen pesando demasiado.

Esto es lo que hicieron los autores de FTerViT para resolverlo:

1. El diccionario de "tres colores"

En lugar de usar números complejos (como 3.14159...) para almacenar información, los autores obligaron a la IA a usar solo tres símbolos simples: -1, 0 y +1.

  • Piensa en esto como un diccionario donde cada palabra se reemplaza por un punto rojo, verde o azul.
  • Al usar solo estas tres opciones, pueden empaquetar la información increíblemente de forma compacta. Es como doblar un mapa gigante en un cuadrado diminuto.
  • A esto lo llaman Ternario (que significa "tres").

2. Las partes "frágiles"

Los intentos anteriores de encoger estos modelos de IA se detuvieron a medio camino. Encogieron el cerebro principal (el "codificador"), pero dejaron la Incrustación de Parches (cómo la IA ve el primer vistazo de la imagen), la Normalización de Capa (cómo la IA equilibra sus pensamientos) y el Clasificador (el tomador de decisiones final) en su formato pesado y de tamaño completo.

  • Los autores se dieron cuenta de que, en un dispositivo diminuto, estas partes pesadas "sobrantes" en realidad ocupan la mayor parte del espacio, aunque sean pequeñas en número.
  • FTerViT es el primero en encogerlo todo, incluidas estas partes frágiles, al formato simple de -1, 0, +1.

3. El truco del "Tutor y el Estudiante"

Encoger un cerebro gigante en uno diminuto suele hacer que olvide cómo pensar, provocando que cometa errores tontos. Para arreglar esto, los autores utilizaron una técnica llamada Distilación de Conocimiento.

  • Imagina a un Chef Maestro (la IA original y pesada) enseñando a un Chef Junior (la IA diminuta y encogida).
  • En lugar de decirle al Chef Junior simplemente "Esto es un gato", el Chef Maestro le muestra cómo ve al gato. "Mira las orejas, los bigotes, la forma".
  • El Chef Junior aprende copiando el proceso de pensamiento del Maestro, no solo la respuesta final. Esto permitió que la IA diminuta se mantuviera inteligente incluso después de ser encogida a su tamaño absoluto más pequeño.

4. El resultado: Una IA inteligente en una cámara de 10 dólares

Los autores probaron esto en un chip de microcontrolador muy barato y común llamado ESP32-S3 (encontrado en dispositivos que cuestan alrededor de 10 dólares).

  • Antes: La IA original era de 88.3 MB. Era demasiado grande para caber incluso en el chip.
  • Después: Su nuevo modelo FTerViT es de solo 5.81 MB. Cabe perfectamente.
  • Rendimiento: Aunque es diminuta, sigue siendo muy inteligente. Identifica correctamente las imágenes aproximadamente el 79.6% de las veces. Esto es mucho mejor que los intentos anteriores de encoger la IA, que a menudo caían al 74% o menos.

5. Por qué importa para tu bolsillo

El artículo muestra que no necesitas un superordenador para ejecutar visión inteligente. Puedes ejecutarlo en un dispositivo con 8 MB de memoria (aproximadamente del tamaño de un archivo de texto pequeño).

  • Velocidad: Debido a que los datos son tan pequeños, el dispositivo no tiene que trabajar tan duro para obtener información. Funciona más rápido y consume menos batería.
  • Eficiencia: Los autores construyeron un "motor" personalizado (software) que ejecuta esta IA diminuta completamente en el chip, sin necesidad de conectarse a internet o a un servidor en la nube.

En resumen: El artículo presenta una forma de encoger los modelos de IA más avanzados para ver imágenes hasta el tamaño de una piedrita diminuta, permitiendo que se ejecuten en dispositivos baratos y alimentados por baterías que anteriormente eran demasiado débiles para manejarlos. Lo lograron simplificando las matemáticas a solo tres números y utilizando un "tutor" para enseñar al modelo diminuto a pensar correctamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →