← Últimos artículos
💻 computer science

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

Este artículo presenta COCOTree, un conjunto de datos y una referencia a gran escala para la descomposición visual abierta en estructuras de árbol, que aprovecha una tubería automatizada de LVLM y SAM 3 para generar 1,8 millones de nodos jerárquicos en 21 mil imágenes, acompañados de una nueva métrica de evaluación (OTQ) para evaluar la precisión de las máscaras, la exactitud de las etiquetas y la consistencia estructural.

Autores originales: Junhyub Lee, Seunghun Chae, Hyosu Kim

Publicado 2026-05-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Junhyub Lee, Seunghun Chae, Hyosu Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás mirando una fotografía de una cocina concurrida.

La Vieja Forma:
Las herramientas tradicionales de visión por computadora miran esa foto y dicen: "Veo a una persona, una mesa y una silla". Incluso podrían desglosar un poco a la persona: "Cabeza, torso, brazos". Pero se detienen ahí. Tratan la imagen como una lista plana de elementos. Si le preguntas a la computadora: "¿Qué es ese asa unida al gabinete?", podría simplemente ver un "asa" flotando en el espacio. No sabe que el asa pertenece al gabinete, que a su vez pertenece a la cocina, ni que el asa está hecha de un pomo específico y un tornillo. Carece del "árbol genealógico" de los objetos.

La Nueva Forma (COCOTREE):
Este artículo introduce COCOTREE, una nueva forma de enseñar a las computadoras a ver el mundo no como una lista plana, sino como un gigantesco árbol genealógico ramificado.

Piénsalo como una muñeca rusa anidada o como un árbol con raíces y ramas:

  1. La Raíz: Toda la imagen es el tronco.
  2. Las Ramas: El tronco se divide en objetos grandes (una persona, un gabinete).
  3. Las Ramitas: Esos objetos se dividen en partes (el gabinete se divide en una puerta, un estante y un asa).
  4. Las Hojas: Las partes se dividen aún más (el asa se divide en un pomo y un tornillo).

El objetivo es mapear cada pieza visible de un objeto, hasta el detalle más pequeño, y conectarlas todas en una jerarquía lógica.

¿Cómo Construyeron Esto? (El Chef Robot)

Construir un mapa así para miles de fotos a mano sería imposible. Le tomaría a los humanos años etiquetar cada tornillo y bisagra individual.

En su lugar, los autores construyeron un "Chef Robot" totalmente automatizado que hace el trabajo por ellos. Este robot utiliza dos potentes herramientas de IA trabajando juntas:

  1. El Cerebro (LVLM): Un Modelo de Lenguaje y Visión Grande actúa como un chef curioso. Mira la imagen y dice: "Veo un gabinete. ¿Qué hay dentro? ¡Ah, un estante y un asa!". Usa su "sentido común" para adivinar qué partes existen.
  2. Las Manos (SAM 3): Un modelo de segmentación preciso actúa como un par de manos firmes. Una vez que el Cerebro adivina "asa", las Manos dibujan un contorno perfecto alrededor de ese asa específica en la foto.

El Proceso:
El robot comienza con toda la imagen. Pide al Cerebro que encuentre las partes principales. Las Manos dibujan líneas alrededor de ellas. Luego, el robot toma solo la parte del "gabinete", hace zoom y le pregunta de nuevo al Cerebro: "Ahora que estoy mirando solo el gabinete, ¿qué veo?". El Cerebro dice: "Una puerta y un asa". Las Manos dibujan esas partes. Esto sucede una y otra vez, recursivamente, hasta que el robot no puede encontrar más piezas más pequeñas.

El Resultado: Una Masiva Biblioteca de Árboles

El resultado es COCOTREE, un conjunto de datos que contiene más de 21,000 imágenes y 1.8 millones de nodos estructurales (piezas de objetos).

  • Sin Restricciones: A diferencia de los antiguos conjuntos de datos que solo conocen 80 o 100 palabras específicas (como "perro" o "coche"), este conjunto de datos utiliza un "vocabulario abierto". Puede etiquetar un objeto extraño y único con una descripción larga y específica si lo ve.
  • Profundo: Va mucho más profundo que los métodos anteriores. Mientras que los antiguos conjuntos de datos podrían detenerse en "puerta", este va "puerta -> asa -> pomo -> tornillo".
  • Verificado: Los autores no solo confiaron en el robot. Tuvieron a 20 revisores humanos que verificaron el trabajo. Los humanos coincidieron en que los "árboles genealógicos" del robot eran precisos y coincidían con la forma en que los humanos ven el mundo.

¿Cómo Calificamos al Robot? (La Puntuación OTQ)

¿Cómo calificas un examen donde las respuestas son árboles complejos? No puedes simplemente verificar si el robot acertó el "coche". Tienes que verificar:

  1. ¿Dibujó el contorno de la rueda correctamente? (Precisión de la Máscara)
  2. ¿Lo llamó "rueda" y no "neumático"? (Precisión de la Etiqueta)
  3. ¿Colocó correctamente la rueda bajo el coche, y el neumático bajo la rueda? (Consistencia Estructural)

Para hacer esto, crearon un nuevo sistema de puntuación llamado OTQ (Calidad de Árbol Abierto). Es como un boletín de calificaciones que otorga una sola puntuación basada en qué tan bien el robot dibujó la imagen, nombró las partes y organizó el árbol genealógico.

Resumen

En resumen, COCOTREE es una biblioteca masiva generada automáticamente que enseña a las computadoras a ver el mundo en capas. Va más allá de simplemente "qué hay en la imagen" hacia "cómo están construidos y conectados los elementos de la imagen", utilizando un equipo de robots de IA para construir el mapa y revisores humanos para asegurar que el mapa sea preciso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →