← Últimos artículos
🤖 machine learning

Efficient Coreset Selection via K-Nearest Neighbor Graphs

Este artículo presenta KNNG-CS, un método de selección de co-sets ligero que aprovecha los grafos de K-vecinos más cercanos para identificar eficientemente subconjuntos de datos representativos con costos de tiempo y memoria significativamente reducidos, manteniendo una precisión comparable a los enfoques de aproximación de gradiente existentes.

Autores originales: Yingfan Liu, Leiyu Zhang, Jiadong Xie, Mingzhe Wang, Jeffrey Xu Yu, Jiangtao Cui

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yingfan Liu, Leiyu Zhang, Jiadong Xie, Mingzhe Wang, Jeffrey Xu Yu, Jiangtao Cui

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de aprendizaje automático son los motores detrás de muchas herramientas modernas, desde el reconocimiento de rostros en fotos hasta la predicción de tendencias en el mercado de valores. Para aprender a realizar estas tareas, estos modelos deben ser alimentados con cantidades masivas de datos. Imagine intentar enseñar a un estudiante dándole cada uno de los libros de una biblioteca; eventualmente aprendería, pero el proceso sería increíblemente lento y agotador. En el mundo de la inteligencia artificial, esta es la realidad de entrenar con enormes conjuntos de datos. Requiere una potencia de cómputo y una memoria enormes, lo que a menudo lo hace demasiado costoso o lento para muchas aplicaciones prácticas. Para resolver esto, los científicos utilizan una técnica llamada selección de coreset. El objetivo es simple: en lugar de usar la biblioteca completa, encontrar un subconjunto pequeño y perfecto de libros que contenga todas las lecciones esenciales. Si puede entrenar el modelo con esta muestra diminuta y representativa, este aprenderá tan bien como si hubiera leído todo, pero en una fracción del tiempo y con mucha menos memoria.

Durante años, las mejores formas de encontrar estos subconjuntos pequeños y perfectos han dependido de un método que es computacionalmente pesado. Estos enfoques existentes intentan medir la distancia entre cada uno de los puntos de datos y cada uno de los demás puntos de datos para ver cuáles son más similares. Es como intentar encontrar al mejor representante de una multitud haciendo que cada persona mida su distancia con respecto a todas las demás personas en la sala. Si bien esto funciona, crea una cantidad masiva de datos que es difícil de almacenar y procesar, especialmente cuando el conjunto de datos crece. Los investigadores de la Universidad de Xidian y sus colaboradores se dieron cuenta de que este enfoque de "medir todo" era ineficiente. Observaron que los representantes más útiles en un conjunto de datos son usualmente aquellos que se encuentran en medio de grupos densos de elementos similares, en lugar de aquellos que están aislados. Una muestra que está cerca de muchas otras es probablemente representativa de un patrón común, mientras que una muestra aislada tiene menos probabilidades de ser un buen sustituto para un grupo grande.

Para abordar esto, el equipo desarrolló un nuevo método llamado KNNG-CS. En lugar de obligar a cada elemento a medir su distancia con todos los demás elementos, construyeron un mapa que solo conecta cada elemento con sus diez vecinos más cercanos. Esto crea una red dispersa, o un grafo, que captura las relaciones locales entre los puntos de datos sin la carga abrumadora de calcular cada conexión posible. Una vez construido este mapa, los investigadores asignaron una puntuación a cada elemento basada en cuántos otros elementos lo señalaban como vecino y qué tan cerca estaban esos vecinos. Los elementos que fueron elegidos frecuentemente como un vecino cercano por muchos otros recibieron una puntuación alta, marcándolos como representantes altamente importantes. El algoritmo luego seleccionó de forma codiciosa los elementos con mayor puntuación para formar el subconjunto pequeño final. A medida que cada elemento de alta puntuación era elegido, el algoritmo lo eliminaba junto con sus vecinos del grupo, asegurando que el grupo seleccionado cubriera todo el conjunto de datos de manera eficiente y sin redundancia.

Los resultados de este nuevo enfoque fueron sorprendentes cuando se probaron en cuatro conjuntos de datos del mundo real, que iban desde tipos de cobertura forestal hasta calificaciones de películas y deudas de tarjetas de crédito. El nuevo método produjo un conjunto de entrenamiento pequeño que permitió al modelo de aprendizaje automático lograr una precisión comparable a la de los mejores métodos existentes. Sin embargo, la diferencia en eficiencia fue dramática. El nuevo método funcionó entre 2.3 y 41.2 veces más rápido que las técnicas líderes anteriores. Aún más impresionante fue la reducción en el uso de memoria. Mientras que los métodos antiguos requerían almacenar tablas masivas de distancias que podían consumir gigabytes de memoria, el nuevo enfoque utilizó solo el 0.3% al 7.5% de esa memoria. En términos prácticos, esto significa que tareas que antes requerían servidores costosos y de alta gama ahora podrían realizarse en máquinas mucho más pequeñas y accesibles. Los investigadores encontraron que incluso con un subconjunto de datos muy pequeño, el modelo aprendía eficazmente, convergiendo a una solución estable mucho más rápido que si hubiera sido entrenado con el conjunto de datos completo.

Este trabajo demuestra que, al enfocarse en las relaciones locales en lugar de las comparaciones globales, es posible simplificar drásticamente el proceso de preparación de datos para el aprendizaje automático. El estudio confirma que no es necesario calcular cada distancia posible para encontrar los puntos de datos más importantes; un mapa local inteligente es suficiente. Al utilizar esta estrategia basada en grafos, los investigadores han demostrado que se puede lograr un entrenamiento de modelos de alta calidad con una fracción del tiempo y los recursos que antes se consideraban necesarios. Esto abre la puerta a procesos de entrenamiento más eficientes, permitiendo que modelos complejos sean desarrollados y desplegados en entornos donde la potencia de cómputo es limitada, sin sacrificar la calidad del resultado final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →