← Últimos artículos
💻 computer science

X2SAM: Any Segmentation in Images and Videos

X2SAM es un Modelo de Lenguaje Grande Multimodal unificado que extiende las capacidades de segmentación de cualquier tipo desde imágenes hasta videos al acoplar un LLM con un módulo de Memoria de Máscaras, lo que permite la generación de máscaras de alta calidad y coherentes en el tiempo a partir tanto de instrucciones conversacionales como de prompts visuales en diversas tareas de segmentación.

Autores originales: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Publicado 2026-05-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente superinteligente que puede observar una foto o un video y decirte exactamente qué está sucediendo. Durante mucho tiempo, estos asistentes fueron excelentes describiendo la "imagen general" (como "un perro jugando en un parque"), pero pésimos señalando detalles específicos (como "dibuja un círculo alrededor de la pata izquierda del perro").

Por otro lado, tienes herramientas especializadas que son increíbles dibujando esos círculos precisos (máscaras) alrededor de objetos, pero son como robots que solo entienden comandos simples como "haz clic aquí" o "dibuja un recuadro". No entienden frases complejas como: "Encuentra al perro que está persiguiendo la pelota roja y dibuja un contorno alrededor de él".

X2SAM es el nuevo "superconector" que cierra esta brecha. Combina el cerebro de una IA conversacional con las manos de una herramienta de dibujo precisa, y funciona tanto para fotos estáticas como para videos en movimiento.

Aquí tienes un desglose de cómo funciona, utilizando algunas analogías cotidianas:

1. El "traductor universal" para fotos y videos

Piensa en X2SAM como un traductor universal que habla tanto el "lenguaje humano" como el "lenguaje de píxeles".

  • La vieja forma: Si querías encontrar un objeto específico en un video, quizás tenías que usar una herramienta para entender el video y otra para dibujar el contorno. No se comunicaban bien entre sí.
  • La forma X2SAM: Puedes hablarle de manera natural. Puedes decir: "Muéstrame a la persona que camina de un lado a otro cerca de la pared blanca", o incluso señalar un punto en tu pantalla y decir: "Encuentra lo que hay en esta área". X2SAM entiende la instrucción y dibuja el contorno al instante, ya sea una sola foto o un clip de video de 10 segundos.

2. El "banco de memoria" para imágenes en movimiento

Este es el ingrediente secreto que hace que X2SAM sea especial para videos.

  • El problema: Si le pides a una IA estándar que rastree a una persona en un video, a menudo mira cada fotograma (cada imagen de un instante) como si fuera completamente nueva. Puede perder de vista a la persona cuando camina detrás de un árbol o cuando la cámara tiembla.
  • La solución X2SAM: X2SAM tiene un Módulo de Memoria de Máscaras. Imagina esto como un sistema de "notas adhesivas". A medida que se reproduce el video, X2SAM anota dónde estaba el objeto en el fotograma anterior y guarda esa nota en su bolsillo. Cuando mira el siguiente fotograma, consulta sus notas para decir: "Ah, sé que esta persona estaba justo aquí, así que probablemente sigue aquí". Esto le permite mantener el contorno del objeto suave y consistente, incluso si el objeto se mueve, se oculta o cambia de forma.

3. El "cuchillo suizo" de tareas

El artículo afirma que X2SAM puede manejar una enorme variedad de tareas con un solo sistema, en lugar de necesitar una herramienta diferente para cada trabajo. Puede realizar:

  • Segmentación genérica: "Dibuja contornos para todo en esta imagen".
  • Segmentación por referencia: "Dibuja al gato que lleva un sombrero".
  • Segmentación por razonamiento: "Encuentra el objeto que podría usarse para verter agua en un vaso". (Debe pensar para deducir que es una jarra, no solo buscar la palabra "jarra").
  • Segmentación visual anclada: Señalas un punto en la pantalla y dibuja el objeto al que estás señalando.
  • Conversación: Puede charlar contigo sobre la imagen o el video mientras dibuja las máscaras al mismo tiempo.

4. Cómo aprendió (El entrenamiento)

Para volverse tan bueno, los investigadores no le enseñaron una cosa a la vez. Utilizaron una estrategia de Entrenamiento Conjunto Unificado.

  • La analogía: Imagina enseñar a un estudiante. En lugar de enseñarle matemáticas el lunes e historia el martes, le enseñas a resolver problemas de matemáticas usando hechos históricos, y viceversa, todo al mismo tiempo.
  • X2SAM fue entrenado con una enorme mezcla de imágenes y videos simultáneamente. Esto le ayudó a aprender que las reglas para encontrar un "perro" en una foto son similares a encontrar un "perro" en un video, pero con el añadido de recordar dónde estaba el perro un segundo antes.

5. La nueva "prueba" (V-VGD)

Los autores también crearon una nueva prueba llamada segmentación Visual Grounded en Video (V-VGD).

  • La analogía: Antes, las pruebas principalmente preguntaban: "¿Puedes encontrar al perro?". La nueva prueba de X2SAM pregunta: "Estoy señalando un punto en la pantalla en este video; ¿puedes encontrar el objeto al que estoy señalando y rastrearlo mientras se mueve?". Esto prueba si la IA puede realmente entender la conexión entre una señal visual y el objeto en movimiento. X2SAM aprobó esta prueba con honores, superando a modelos anteriores.

En resumen

X2SAM es como darle a un artista humano un par de ojos que pueden ver cada píxel, un cerebro que entiende frases complejas y lógica, y una memoria que recuerda dónde estaban las cosas hace un momento. Te permite tener una conversación natural con una computadora para encontrar y delinear cosas específicas tanto en fotos como en videos, todo en una sola operación.

Lo que no hace (según el artículo):
El artículo se centra enteramente en la capacidad técnica de segmentar (delinear) objetos en imágenes y videos. No afirma que se utilice para diagnóstico médico, vehículos autónomos o vigilancia de seguridad, aunque esos son usos futuros potenciales para dicha tecnología. Es estrictamente una herramienta para comprender y delinear contenido visual basado en instrucciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →