← Últimos artículos
🤖 AI

Relational Visual Similarity

Este artículo presenta un nuevo enfoque para medir la similitud visual relacional, que va más allá de la apariencia superficial para capturar la lógica estructural subyacente entre elementos, mediante la creación de un conjunto de datos anonimizado y el ajuste fino de un modelo visión-lenguaje para cerrar la brecha existente en la computación visual.

Autores originales: Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li

Publicado 2026-04-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Imagina que tienes dos fotos muy diferentes!

  • Foto A: Una manzana roja y brillante.
  • Foto B: Un planeta Tierra visto desde el espacio.

Si le preguntas a una inteligencia artificial "tradicional" (como las que usan hoy en día para buscar fotos), te dirá: "No son similares en absoluto". ¿Por qué? Porque para esas máquinas, la similitud se basa en lo que ven: el color (rojo vs. azul/marrón), la forma (redonda vs. esfera) o la textura. Para ellas, una manzana y un planeta son cosas totalmente distintas.

Pero si le preguntas a un humano, podríamos decir: "¡Sí! Son muy similares". ¿Por qué? Porque ambos tienen una estructura interna parecida: tienen una "piel" externa, una "carne" o capa intermedia y un "núcleo" o semilla en el centro.

Aquí es donde entra este nuevo trabajo de investigación, al que llamaremos "RelSim" (Similitud Relacional).

🧠 El Gran Problema: Las Máquinas ven "Cáscaras", los Humanos ven "Historias"

Los autores de este paper dicen que las computadoras actuales son como niños pequeños que solo miran la etiqueta de un juguete. Si ven un coche de juguete rojo y un camión rojo, dicen "¡Son iguales!". Pero no entienden que un coche de juguete y un coche real, aunque se vean diferentes, comparten la misma "lógica" de funcionamiento (ruedas que giran, motor que empuja).

En el mundo de la ciencia cognitiva, esto se divide en dos:

  1. Similitud de Atributos: "Se parecen porque ambos son rojos y redondos". (Lo que hacen las máquinas hoy).
  2. Similitud Relacional: "Se parecen porque ambos cuentan la misma historia o siguen la misma lógica". (Lo que hacen los humanos).

La analogía de la "Caja de Herramientas":
Imagina que la similitud visual tradicional es como comparar dos cajas de herramientas solo por el color de la caja. Si ambas son rojas, la computadora dice "¡Son la misma caja!".
Pero RelSim es como abrir la caja y mirar qué hacen las herramientas. Una caja con un martillo y un clavo es similar a otra caja con un martillo y un clavo, aunque una caja sea de madera y la otra de plástico. La lógica (la relación entre las herramientas) es lo importante, no el color de la caja.

🛠️ ¿Cómo lo hicieron? (El Truco del "Anónimo")

Para enseñar a la computadora a pensar como un humano, los investigadores tuvieron que crear un nuevo tipo de "lenguaje" para las fotos.

  1. El problema: Si le dices a una IA: "Busca fotos de manzanas", te traerá más manzanas. Si le dices "Busca fotos de planetas", te traerá planetas. Nunca encontrará la conexión entre ambos.
  2. La solución: Crearon un diccionario de "Anónimos".
    • En lugar de decir: "Esta foto muestra un plátano madurando", le enseñaron a la IA a decir: "Esta foto muestra la transformación de un {sujeto} a través del tiempo".
    • En lugar de decir: "Esta foto muestra una vela quemándose", le enseñaron a decir: "Esta foto muestra la transformación de un {sujeto} a través del tiempo".

¡De repente, el plátano y la vela son "hermanos" en la base de datos! No porque se vean iguales, sino porque comparten la misma fórmula secreta (la transformación).

🚀 ¿Para qué sirve esto?

Imagina que eres un artista o un diseñador y buscas inspiración.

  • Búsqueda Tradicional: Si buscas "perro con gafas", solo encontrarás perros con gafas.
  • Búsqueda con RelSim: Si buscas "un animal usando un objeto humano de forma graciosa", la IA podría mostrarte:
    • Un perro con gafas.
    • Un gato usando un sombrero de copa.
    • Un pájaro usando un paraguas.

¡La IA entiende que todos siguen la misma lógica de "animal + objeto humano"!

Otro ejemplo genial: Generar imágenes.
Si le pides a una IA tradicional que cambie una foto de un "helado llorando" por un "globo llorando", probablemente solo cambiará el color o la forma. Pero con RelSim, la IA entiende la idea profunda (un objeto redondo derritiéndose o sufriendo) y puede crear un "globo que se desinfla trágicamente" manteniendo esa misma emoción y lógica, aunque se vea muy diferente.

🏆 El Resultado

Los investigadores probaron su nuevo sistema (llamado relsim) contra los gigantes actuales (como CLIP o LPIPS).

  • Las máquinas viejas: Fallaron estrepitosamente. No podían ver la conexión entre cosas que se parecen en "lógica" pero no en "color".
  • RelSim: ¡Ganó! Los humanos prefirieron sus resultados porque la IA finalmente empezó a pensar como nosotros: viendo las conexiones ocultas, no solo la superficie.

En resumen

Este paper nos dice que para que las computadoras sean verdaderamente inteligentes, no basta con que tengan "buenos ojos" para ver colores y formas. Necesitan tener un "cerebro" que entienda las historias, las transformaciones y las relaciones entre las cosas.

Es como pasar de ser un observador que solo describe lo que ve, a ser un filósofo que entiende por qué las cosas son como son. ¡Y eso es un gran salto para la inteligencia artificial!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →