← Últimos artículos
🤖 machine learning

Rethinking Efficiency in Neural Combinatorial Optimization: Batched Preference Optimization with Mamba

El artículo presenta ECO, un marco de Optimización Combinatoria Neuronal eficiente que combina una arquitectura base Mamba con eficiencia de memoria con un proceso de Optimización de Preferencia Directa desacoplado y por lotes guiado por búsqueda local durante el entrenamiento para lograr un rendimiento y una utilización de hardware superiores en las tareas TSP y CVRP.

Autores originales: Zhenxing Xu, Zeyuan Ma, Weidong Bao, Yan Zheng, Chongshuang Hu, Ji Wang, Zhiguang Cao

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhenxing Xu, Zeyuan Ma, Weidong Bao, Yan Zheng, Chongshuang Hu, Ji Wang, Zhiguang Cao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un maestro chef intentando organizar un banquete masivo para miles de invitados. Tienes una lista de ingredientes (los "nodos") y un conjunto de reglas: debes visitar cada ingrediente exactamente una vez, cargar solo lo que tu carrito pueda contener y llevar todo de vuelta a la cocina lo más rápido posible. Este es el mundo de la Optimización Combinatoria. Durante décadas, los humanos han utilizado recetas ingeniosas y hechas a mano (algoritmos) para resolver estos acertijos, pero son lentos y a menudo necesitan que un experto humano los ajuste para cada nuevo banquete.

Recientemente, los científicos han empezado a enseñar a las computadoras a aprender estas recetas por sí mismas utilizando Redes Neuronales. Piensa en estas redes como aprendices entusiastas que observan miles de ejemplos e intentan adivinar el siguiente movimiento. Sin embargo, hay un inconveniente: entrenar a estos aprendices es increíblemente costoso. Es como pedirles que cocinen una comida completa, la prueben, la tiren y comiencen de nuevo millones de veces solo para aprender un nuevo truco. Este proceso es tan lento y consume tanta memoria que a menudo hace que la computadora colapse antes de que el aprendiz mejore. La gran pregunta para los investigadores ha sido: ¿Podemos enseñar a estos chefs de IA a ser igual de buenos, pero mucho más rápidos y menos derrochadores?

Este artículo presenta un nuevo marco llamado ECO (Optimización Combinatoria Eficiente) que dice que "sí". Los autores proponen un trucreto de dos partes para acelerar el proceso sin perder calidad. Primero, cambian el estilo de aprendizaje. En lugar de que el aprendiz cocine, pruebe y aprenda un plato a la vez en un bucle caótico, ECO permite que el aprendiz cocine un lote completo de comidas, las compare y luego aprenda de las mejores todas a la vez. Lo llaman "Optimización de Preferencias por Lotes" (Batched Preference Optimization). Es como un profesor que muestra a un estudiante diez ensayos diferentes, señala el mejor y el peor, y le dice: "Mira la diferencia, aprende de eso", en lugar de calificar un ensayo, esperar a que el estudiante lo reescriba y luego calificar el siguiente.

Segundo, actualizan el cerebro del aprendiz. La mayoría de los modelos de IA utilizan una arquitectura "Transformer", que es como un bibliotecario que tiene que leer cada uno de los libros en un estante para encontrar una conexión entre dos páginas específicas. Si el estante se vuelve demasiado largo (miles de ingredientes), el bibliotecario se siente abrumado y se queda sin memoria. ECO cambia esto por una estructura Mamba. Imagina a Mamba como un escáner súper eficiente que lee el estante en un flujo suave y continuo, recordando solo lo que necesita para mantenerse al tanto. Esto permite al sistema manejar banquetes masivos (miles de nodos) sin que la computadora colapse.

Los autores probaron esto en dos problemas clásicos: el Problema del Viajante (encontrar la ruta más corta para visitar muchas ciudades) y el Problema de Rutas de Vehículos (entregar paquetes a muchos clientes con espacio limitado en el camión). Descubrieron que ECO es increíblemente rápido. En un problema con 5,000 ciudades, ECO resolvió el conjunto de prueba en solo 2.5 minutos, mientras que otros métodos neuronales tardaron mucho más, y los resolvedores exactos tradicionales tardaron horas. Crucialmente, los autores demuestran que ECO no hace trampa usando una "búsqueda local" (una solución rápida) durante la prueba final; la IA aprendió los trucos por sí misma durante el entrenamiento.

El artículo sugiere que al combinar este nuevo estilo de aprendizaje "por lotes" con el cerebro eficiente de Mamba, podemos entrenar a la IA para resolver problemas de rutas enormes y complejos mucho más rápido que antes, ahorrando tanto tiempo como potencia de cómputo. Los resultados muestran que ECO es competitivo con, y a menudo mejor que, los mejores métodos de IA existentes, especialmente cuando los problemas se vuelven muy grandes. Sin embargo, los autores tienen cuidado en señalar que, si bien el "cerebro" (el codificador) se volvió más eficiente, el paso final de elegir el siguiente movimiento todavía requiere algo de trabajo pesado, por lo que todo el proceso no es perfectamente lineal, pero es una mejora masiva respecto a las formas antiguas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →