← Últimos artículos
🤖 AI

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

Este artículo investiga la efectividad del prompting de texto frente al visual para la segmentación semántica en Modelos de Visión-Lenguaje, revelando su significativa brecha de rendimiento en comparación con los modelos especialistas y la naturaleza complementaria de ambas modalidades, lo que motiva la propuesta de PromptMatcher, un método libre de entrenamiento que combina ambos prompts para lograr resultados de vanguardia.

Autores originales: Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

Publicado 2026-02-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robot superinteligente que ha leído casi todos los libros de internet y ha visto miles de millones de imágenes. Quieres pedirle a este robot que dibuje una línea alrededor de cosas específicas en una foto nueva, como "encuentra todos los aviones" o "resalta los gatos". Esto se llama segmentación semántica.

El artículo plantea una pregunta simple pero difícil: ¿Cuál es la mejor forma de decirle al robot qué hacer? ¿Le das una instrucción escrita (un prompt de texto) o le muestras una imagen de lo que quieres (un prompt visual)?

Aquí está la historia de su descubrimiento, explicada de forma sencilla:

1. El dilema del "Mostrar" frente al "Decir"

Los investigadores probaron dos formas de hablar con estos modelos de IA gigantes:

  • El método de "Decir" (Prompts de texto): Escribes: "Segmenta todos los gatos". Es como dar una orden verbal.
  • El método de "Mostrar" (Prompts visuales): Le muestras al robot una foto de un gato con un círculo rojo alrededor y le dices: "Haz esto". Es como señalar y decir: "Como este".

Descubrieron que ambos métodos tienen fallos.

  • El texto es complicado porque el lenguaje es caótico. Las palabras pueden ser confusas. Si le pides al robot que encuentre un "fiordo" (un tipo de entrada de mar profunda), podría confundirse porque la palabra es poco común. Si pides "ropa superior", puede que no sepa si te refieres a una camisa, una chaqueta o un sombrero. El robot a veces adivina mal o "alucina" (se inventa cosas) porque las palabras no fueron lo suficientemente claras.
  • Lo visual es complicado porque es específico. Si le muestras la foto de un gato específico, el robot podría centrarse demasiado en el patrón de pelaje de ese gato exacto y pasar por alto otros gatos que se ven ligeramente diferentes.

2. La gran sorpresa: El robot aún no es perfecto

Los autores compararon estos robots "generalistas" (que intentan hacerlo todo) contra robots "especialistas" (que han sido entrenados solo para encontrar gatos, o solo para encontrar aviones).

¿El resultado? Los robots generalistas son todavía un 30% peores que los especialistas. Aunque estos modelos gigantes son famosos por ser inteligentes, aún no están listos para reemplazar a los expertos cuando se trata de dibujar líneas precisas alrededor de objetos en situaciones nuevas y extrañas.

3. El secreto del "Oráculo"

Los investigadores notaron algo fascinante: los prompts de texto y los visuales son mejores amigos.

  • Cuando el prompt de texto falla (por ejemplo, cuando el robot se confunde con la palabra "fiordo"), el prompt visual suele tener éxito.
  • Cuando el prompt visual falla (por ejemplo, cuando el robot se confunde por un ángulo extraño), el prompt de texto suele tener éxito.

Imaginaron un "Oráculo Mágico" que pudiera mirar cada foto e instantáneamente saber: "Para esta foto específica, debería usar la instrucción de texto. Para esa otra, debería usar la imagen".

Si este Oráculo Mágico pudiera cambiar entre los dos métodos perfectamente, el rendimiento del robot subiría un 11%. Esto demostró que los dos métodos se complementan perfectamente; cubren los puntos ciegos del otro.

4. La solución: PromptMatcher

Como no podemos tener un Oráculo Mágico, los autores construyeron una herramienta simple y gratuita llamada PromptMatcher.

Piensa en esto como un equipo de dos personas revisando el trabajo del otro:

  1. El experto en texto (LISA): Lee la instrucción y dibuja una máscara.
  2. El experto visual (SoftMatcher+): Mira la foto de ejemplo y dibuja una máscara.
  3. El árbitro (El Verificador): Esta es la parte ingeniosa. El experto visual actúa como un "crítico" para el experto en texto. Si el experto en texto dibuja una máscara que se ve rara o no coincide con la foto de ejemplo, el Árbitro dice: "No, eso está mal", y la descarta.
  4. El resultado final: Combinan las máscas "aprobadas" de ambos expertos en un único dibujo perfecto.

La conclusión

Al combinar el "Mostrar" y el "Decir", y hacer que uno revise al otro, crearon un sistema que es mejor que el mejor robot de solo texto y mejor que el mejor robot de solo visuales.

No necesitaron reentrenar al robot ni enseñarle cosas nuevas; simplemente descubrieron cómo hacerle las preguntas correctas de la manera correcta. Es un recordatorio de que, a veces, la mejor forma de lograr que una IA inteligente haga un trabajo no es solo hablarle, sino mostrarle lo que quieres decir y luego hacer que revise su propio trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →