← Últimos artículos
🤖 machine learning

Hierarchical Clustering Can Jointly Satisfy Richness, Consistency, and Scale Invariance

Este artículo demuestra que, a diferencia del agrupamiento plano que está limitado por el Teorema de Imposibilidad de Kleinberg, el agrupamiento jerárquico puede satisfacer simultáneamente los axiomas de riqueza, consistencia e invariancia de escala a través de la existencia de incontablemente muchos métodos admisibles que comparten un esqueleto estructural común a pesar de su diversidad.

Autores originales: Daichi Kuroda, Maximilien Dreveton, Matthias Grossglauser, Patrick Thiran

Publicado 2026-09-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Daichi Kuroda, Maximilien Dreveton, Matthias Grossglauser, Patrick Thiran

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la ciencia de datos, existe una tarea fundamental llamada agrupamiento (clustering). Imagine que tiene una colección de artículos —quizás una mezcla de frutas, un grupo de personas o un conjunto de documentos— y quiere clasificarlos en grupos significativos basados en qué tan similares son entre sí. Usted no tiene una etiqueta que le diga qué manzana es cuál; solo tiene una medida de qué tan diferente es cada artículo de todos los demás. El objetivo es dejar que los datos hablen por sí mismos y revelen su estructura oculta. Durante décadas, los investigadores han intentado definir la forma perfecta de hacer este ordenamiento. Han propuesto un conjunto de reglas básicas que cualquier buen método de clasificación debería seguir. Una regla es que el método no debe importar las unidades de medida; ya sea que mida la distancia en metros o en millas, los grupos deben permanecer iguales. Otra regla es que el método debe ser lo suficientemente flexible como para encontrar cualquier agrupación posible si los datos son adecuados para ello. Una tercera regla es que, si usted hace que los elementos dentro de un grupo sean más similares entre sí y hace que los elementos entre grupos sean más diferentes, el método no debería decidir repentinamente separar ese grupo.

Durante mucho tiempo, se creyó que ningún método único podía satisfacer estas tres reglas al mismo tiempo. Un famoso resultado en el campo demostró que, si se le obliga a dividir sus datos en una sola capa plana de grupos —como clasificar una baraja de cartas en un solo montón de palos—, inevitablemente tendrá que romper una de las reglas. Podría tener que ignorar la escala de los datos, o podría tener que ignorar ciertas agrupaciones válidas, o podría tener que ser inestable cuando los datos cambian ligeramente. Esto creó una sensación de limitación, como si la naturaleza misma de clasificar datos en grupos planos fuera defectuosa. Pero, ¿y si la solución no fuera forzar los datos en una sola capa, sino dejar que se desplieguen en un árbol? ¿Qué pasaría si, en lugar de solo decir "estos son los grupos", pudiera decir "estos son los grupos, y dentro de esos grupos, hay grupos más pequeños, y dentro de esos, otros aún más pequeños"? Esta es la idea del agrupamiento jerárquico, donde el resultado es una estructura anidada en lugar de una lista plana.

Un equipo de investigadores de la École Polytechnique Fédérale de Lausanne y la Université Gustave Eiffel ha demostrado ahora que este enfoque jerárquico lo cambia todo. Tomaron las tres reglas estrictas que hacían imposible el agrupamiento plano y preguntaron si estas podrían satisfacerse si el resultado fuera una jerarquía. La respuesta es un sí definitivo. Demostraron que no hay solo una forma de hacer esto, sino un número incontablemente grande de métodos que pueden satisfacer las tres reglas simultáneamente. De hecho, descubrieron que el espacio de estos métodos válidos es increíblemente vasto y diverso. Es tan grande que ni siquiera puede enumerarlos todos, y dentro de esta vasta colección, existen muchos métodos que son fundamentalmente incompatibles entre sí. No puede simplemente elegir el "mejor" que lo haga todo perfectamente, porque ningún método único es el ganador definitivo que perfecciona a todos los demás.

Los investigadores no solo demostraron que estos métodos existen; construyeron varios de ellos para mostrar cómo funcionan. Observaron formas comunes de clasificar datos, como el método que siempre fusiona los dos artículos más cercanos primero. Encontraron que una versión específica de este método, que permite fusionar más de dos grupos a la vez cuando están igualmente cerca, funciona perfectamente. También inventaron nuevos métodos basados en qué tan bien separados están los grupos. Un método busca grupos donde los artículos dentro de ellos están mucho más cerca entre sí de lo que están de cualquier cosa fuera de ellos. Otro busca un tipo de separación ligeramente diferente. Demostraron que estos métodos son todos válidos, pero producen resultados distintos. Algunos métodos son muy estrictos y solo encuentran los grupos más obvios y bien separados. Otros son más permisivos y encuentran muchas conexiones más sutiles.

A pesar de esta diversidad salvaje, los investigadores descubrieron un orden oculto. Aunque los métodos no están de acuerdo en los detalles más finos, todos coinciden en las estructuras más obvias y bien separadas. Si toma dos métodos válidos cualesquiera y observa los grupos en los que ambos coinciden, encontrará un esqueleto común de grupos muy claros y distintos. Esto significa que, mientras los métodos pueden diferir en cómo manejan el terreno intermedio y desordenado de los datos, todos respetan la misma base sólida. Los investigadores también exploraron qué sucede si se añade una cuarta regla: que si los datos ya tienen una estructura perfecta de tipo árbol integrada en ellos, el método debe encontrar ese árbol exacto. Incluso con este requisito más estricto, la vasta diversidad de métodos permanece, pero ahora hay un único método, el más grueso, que sirve como punto de partida para todos los demás.

Este trabajo redefine nuestra comprensión de cómo podemos organizar los datos. Muestra que la imposibilidad de satisfacer todos nuestros deseos para un método de clasificación no es un defecto fundamental del universo, sino una limitación de forzar los datos en una sola capa plana. Al permitir que los datos cuenten una historia de grupos anidados, podemos tener un poco de todo. Podemos tener un método que sea invariante a la escala, flexible y estable, todo al mismo tiempo. Los investigadores también demostraron que estos métodos son robustos ante las formas comunes en que preprocesamos nuestros datos, como cambiar las unidades o transformar los números antes de clasificarlos. Esto sugiere que el marco no es solo una curiosidad matemática, sino una herramienta práctica que puede usarse en procesos del mundo real. El estudio nos deja con la imagen de un paisaje lleno de innumerables formas válidas de clasificar el mundo, todas ellas coincidiendo en las características más importantes, pero ofreciendo una rica variedad de perspectivas sobre los detalles.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →