← Últimos artículos
💻 computer science

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

El artículo presenta Eddy-VL 1.9B, un modelo de incrustación multimodal comprimido diseñado para el despliegue en el borde que alcanza el 91.7% del rendimiento de su profesor de 2.13B mientras reduce los parámetros en un 9.5% y la latencia en un 10% mediante la poda estructural impulsada por sondas y la destilación de conocimiento por capas.

Autores originales: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Publicado 2026-07-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden "ver" y "leer" al mismo tiempo, comprendiendo una imagen de un gato sentado en un tapete tan bien como comprenden las palabras "gato en tapete". Este es el reino de la IA multimodal, una rama de la ciencia donde las máquinas aprenden a conectar imágenes, texto y video en un único lenguaje compartido. Para hacer esto, estos modelos de IA acten como gigantes traductores, convirtiendo todo lo que ven en una larga lista de números llamada embedding. Piensa en un embedding como una huella digital única para una pieza de contenido; si dos huellas digitales son muy similares, la computadora sabe que el contenido está relacionado.

Sin embargo, hay un inconveniente. Los traductores más inteligentes suelen ser los más pesados. Son como enormes supercomputadoras basadas en la nube que necesitan una conexión a Internet constante y de alta velocidad para funcionar. Pero, ¿qué pasa si estás en un sótano secreto, en una sala de evidencia policial o en una estación de campo remota donde la conexión a Internet se ha cortado? Necesitas un traductor que sea lo suficientemente inteligente como para comprender pistas complejas, pero lo suficientemente pequeño como para caber en una laptop local o en un dispositivo de mano. Este es el desafío del despliegue en el borde (edge deployment): hacer que la IA potente funcione sin conexión, de forma rápida y sin necesidad de una conexión a la nube.

Entra en escena Eddy-VL 1.9B, un nuevo modelo diseñado específicamente para estas situaciones de "brecha de aire" (air-gapped) donde la privacidad y la velocidad lo son todo. Los investigadores detrás de este proyecto partieron de un modelo profesor muy inteligente, pero muy pesado, llamado Qwen3-VL-Embedding-2B. Este modelo profesor es como un brillante profesor con 28 capas de pensamiento profundo, pero es demasiado voluminoso para llevarlo en una mochila. El equipo planteó una pregunta sencilla: ¿Podemos encoger a este profesor sin hacer que olvide cómo enseñar?

No solo cortaron piezas al azar; utilizaron una estrategia ingeniosa llamada poda estructural (structural pruning). Imagina el cerebro del profesor como un edificio de 28 pisos. Los investigadores utilizaron una "sonda" especial para medir cuánto estaba repitiendo cada piso el trabajo de los pisos inmediatamente superiores e inferiores. Encontraron cuatro pisos específicos que estaban realizando mucho trabajo redundante —como tener cuatro fotocopiadoras idénticas en fila cuando una bastaría—. Eliminaron estos cuatro pisos, reduciendo el edificio de 28 pisos a 24.

Pero aquí está la parte difícil: cuando eliminas pisos de un edificio, es posible que las personas que viven en el último piso se pierdan. Para solucionar esto, el equipo utilizó la destilación por capas (layered distillation). Piensa en esto como un maestro arquitecto (el profesor original de 28 pisos) guiando a un nuevo y más pequeño arquitecto (el estudiante de 24 pisos). El profesor no solo dice "constrúyelo"; le muestra al estudiante exactamente cómo pensar en cada paso. Utilizaron una técnica llamada CKA (que mide qué tan similares son los pensamientos de dos capas) para asegurar que las capas medias del estudiante estuvieran pensando igual que las del profesor, y utilizaron un método especial de "Matryoshka" para la respuesta final, asegurando que el estudiante pudiera dar respuestas de diferentes tamaños según la necesidad.

El resultado es Eddy-VL 1.9B. Es un modelo con aproximadamente 1.93 mil millones de parámetros, que pesa 3.85 GB —lo suficientemente pequeño como para caber en muchos dispositivos modernos—. En las pruebas, este modelo "encogido" logró mantener aproximadamente el 91.7% de la inteligencia del profesor original. Mientras que el profesor original obtuvo 68.9 en una prueba masiva de 78 tareas diferentes (llamada MMEB-V2), Eddy-VL obtuvo 63.2. Eso puede parecer una caída, pero recuerda, ¡el modelo perdió cuatro capas enteras de pensamiento! Sin los trucos especiales de enseñanza, la puntuación habría caído estrepitosamente a 56.8. El proceso de destilación logró recuperar 6.4 puntos de ese terreno perdido.

El modelo también obtuvo un aumento de velocidad. Debido a que tiene menos capas que procesar, se ejecuta aproximadamente un 10% más rápido que el original, tomando 136.4 milisegundos por imagen en lugar de 150.0 milisegundos. Esto puede no parecer una diferencia enorme, pero en una investigación del mundo real donde estás escaneando miles de fotos incautadas sin conexión, esos segundos extra se acumulan en horas de tiempo ahorrado.

Los investigadores fueron cuidadosos al señalar dónde el modelo todavía tiene dificultades. Aunque se volvió casi tan bueno como el profesor entendiendo relaciones complejas entre palabras e imágenes (obteniendo un 86.1% en una prueba comparado con el 86.4% del profesor), todavía tuvo un poco de problemas con un tipo específico de acertijo llamado Winoground, donde obtuvo 6.8 frente al 8.5 del profesor. Esto sugiere que, si bien el modelo es excelente para la recuperación general, algunos acertijos lógicos muy complicados aún requieren el cerebro completo y sin podar.

En última instancia, Eddy-VL 1.9B no es una solución mágica que lo resuelve todo, sino una herramienta poderosa para un trabajo muy específico. Demuestra que puedes tomar una IA masiva y dependiente de la nube y comprimirla en un paquete ligero y listo para funcionar sin conexión, sin perder demasiada de su esencia. Para investigadores, expertos forenses y cualquier persona que trabaje en lugares donde el internet es un lujo que no pueden permitirse, este modelo ofrece una forma de mantener las luces encendidas y la inteligencia alta, justo en el borde de la red.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →