← Últimos artículos
💻 computer science

Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting

Este artículo presenta WS-COC, el primer marco impulsado por modelos de lenguaje multimodal (MLLM) para el conteo de objetos agnóstico a la clase bajo supervisión débil, que utiliza estrategias de diálogo, optimización de ranking y fusión global-local para lograr un rendimiento comparable o superior a los métodos totalmente supervisados con costos de anotación significativamente reducidos.

Autores originales: Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Qijun Chen, Miaojing Shi

Publicado 2026-02-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Qijun Chen, Miaojing Shi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una foto de una multitud inmensa, llena de cientos de personas, coches o peces, y tu trabajo es decirle a una computadora: "¿Cuántos hay?".

Hasta ahora, enseñar a las computadoras a hacer esto era como intentar contar granos de arena en una playa con los ojos vendados: necesitabas que un humano señalara cada grano individualmente con un lápiz digital. Esto tomaba años y costaba una fortuna.

Los investigadores de este paper (presentado en ICLR 2026) han creado una nueva forma de hacerlo usando un "cerebro" de computadora muy inteligente llamado MLLM (un modelo de lenguaje multimodal, como un ChatGPT que puede ver fotos). Pero este cerebro tiene un problema: está acostumbrado a ver fotos con pocas cosas (como un gato en un sofá), no a ver multitudes. Si le preguntas directamente, suele adivinar mal, especialmente cuando hay demasiadas cosas juntas.

Para solucionar esto, crearon WS-COC, un sistema que le enseña a este cerebro a contar sin necesidad de señalar cada objeto. Lo hacen usando tres trucos simples pero geniales:

1. El Truco del "Cuchillo y la Torta" (Divide-and-Discern)

En lugar de pedirle al cerebro que diga el número exacto de golpe (ej: "¡Hay 452 coches!"), lo que hacen es jugar a un juego de adivinanzas por rondas.

  • La analogía: Imagina que tienes una torta gigante y quieres saber cuántos trozos hay. No intentas contarlos todos de una vez. Primero preguntas: "¿Hay más de 100 trozos?". Si la respuesta es sí, preguntas: "¿Hay más de 50?". Luego: "¿Más de 25?".
  • Cómo funciona: El sistema le hace al cerebro una serie de preguntas de "Sí/No" para ir reduciendo el rango de números posibles hasta que el rango es tan pequeño que el cerebro puede dar el número exacto con confianza. Es como ir bajando de un edificio piso por piso en lugar de saltar desde el techo.

2. El Truco del "Ranking de Carreras" (Compare-and-Rank)

A veces es difícil decirle a una computadora "esto tiene 50 objetos" porque los números son abstractos. Pero es mucho más fácil decirle "esto tiene más objetos que aquello".

  • La analogía: Imagina que tienes cuatro cajas de galletas. Es difícil decir cuántas galletas hay en cada una sin abrirlas. Pero si te las pongo en fila, es muy fácil decir: "La caja A tiene menos que la B, la B menos que la C, y la C menos que la D".
  • Cómo funciona: El sistema le muestra al cerebro varias fotos a la vez y le pide que las ordene de la que tiene menos cosas a la que tiene más. Al aprender a comparar y ordenar, el cerebro entiende mejor la "cantidad" relativa, lo que le ayuda a ser más preciso al dar el número final.

3. El Truco del "Zoom y la Mirada Global" (Global-and-Local)

Cuando hay una multitud muy densa (como una plaza llena de gente), el cerebro a veces se abruma y dice "hay menos de los que hay" porque los objetos se superponen y se ven pequeños.

  • La analogía: Imagina que intentas contar las estrellas en el cielo. Si miras todo el cielo de una vez, puedes perder algunas. Pero si divides el cielo en cuatro cuadrantes y cuentas cada uno por separado, luego sumas los resultados, obtienes un número más preciso.
  • Cómo funciona: El sistema hace dos cosas: primero, da una estimación general de toda la foto. Luego, corta la foto en pedazos más pequeños (como un rompecabezas), cuenta los pedazos individualmente y suma esos resultados. Finalmente, mezcla la "visión general" con la "suma de las partes" para corregir los errores. Si la visión general dice "pocos" y la suma de partes dice "muchos", el sistema toma el promedio inteligente para obtener el resultado correcto.

¿Por qué es esto un gran avance?

  • Ahorro de dinero y tiempo: Antes, necesitabas miles de horas de humanos señalando cada objeto. Ahora, solo necesitas decirle al sistema "cuántos hay en total en la foto" (un dato que es fácil de conseguir).
  • Versatilidad: Funciona para contar lo que sea: personas, coches, peces, galletas o nubes. No necesitas entrenar un modelo nuevo para cada cosa.
  • Resultados increíbles: Aunque solo usan datos "débiles" (solo el número total), su sistema funciona tan bien como los métodos antiguos que usaban datos "fuertes" (señalando cada objeto), e incluso mejor en fotos muy llenas.

En resumen, WS-COC es como enseñarle a un niño a contar una pila de monedas no pidiéndole que las cuente una por una de golpe, sino enseñándole a agruparlas, comparar montones y mirar desde diferentes ángulos hasta que la respuesta sea perfecta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →