Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems
Esta encuesta proporciona una visión exhaustiva de las estrategias de enrutamiento en sistemas basados en Grandes Modelos de Lenguaje, analizando cómo la dirección dinámica de consultas hacia los modelos apropiados puede optimizar el consumo de recursos, reducir costos y mejorar el rendimiento al abordar las ineficiencias de las arquitecturas monolíticas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde cada vez que haces una pregunta, un equipo de expertos acude corriendo para responderla. Algunos son brillantes pero lentos y caros, como un profesor ganador del Premio Nobel que cobra por hora. Otros son rápidos y baratos, como un amigo con conocimientos que puede encargarse de la mayoría de las cosas, pero que podría tropezar con un acertijo realmente difícil. En el mundo de la inteligencia artificial, estos "expertos" son Modelos de Lenguaje Extensos (LLM). En este momento, la mayoría de los sistemas informáticos están construidos como un restaurante obstinado que envía cada uno de los pedidos, desde un simple vaso de agua hasta una compleja cena de cinco platos, al chef más caro de la cocina. Esto funciona, pero es un desperdicio, es lento y consume mucha energía. La gran pregunta que se hacen los científicos es: ¿Cómo podemos construir un "maître d'" más inteligente que observe tu pedido y decida instantáneamente si enviarlo al ayudante rápido y barato o al genio caro? Este es el corazón de un nuevo campo llamado "enrutamiento" (routing), y se trata de hacer más con menos.
Este artículo, titulado "Doing More with Less" (Hacer más con menos), es un recorrido masivo por las diferentes formas en que los investigadores intentan construir ese inteligente maître d'. Los autores, un equipo de Francia, no solo inventaron un nuevo truco; recopilaron y organizaron todo el panorama de estrategias que se están probando actualmente. Descubrieron que la mejor manera de ahorrar dinero y energía no es usar un cerebro gigante para todo, sino crear un sistema que enrute las preguntas al modelo adecuado basándose en la dificultad de la pregunta. Descubrieron que a menudo se puede usar un modelo pequeño y barato para saludos sencillos y reservar los modelos grandes y caros solo para los rompecabezas lógicos realmente difíciles. Sin embargo, también advierten que esto no es todavía una varita mágica. Algunos métodos son excelentes para ahorrar dinero pero podrían fallar en la precisión, mientras que otros son demasiado complicados para ejecutarse en el mundo real. El artículo sugiere que el futuro reside en sistemas "adaptativos" que puedan aprender y cambiar de opinión a medida que surjan nuevas herramientas, en lugar de quedarse estancados en un conjunto rígido de reglas.
El Gran Problema: El Chef de "Talla Única"
Piensa en un Modelo de Lenguaje Extenso (LLM) como un chef superinteligente. Algunos chefs son generalistas; pueden cocinar casi cualquier cosa, desde un sándwich hasta un suflé. Pero son caros de contratar y tardan mucho tiempo en trabajar. Otros chefs son especialistas; tal vez son increíbles haciendo pizza pero terribles horneando pasteles.
En este momento, la mayoría de los sistemas de IA son como un restaurante que ignora el menú. Si pides un vaso de agua, el sistema llama al chef más caro y poderoso (como GPT-4 o Claude) para hacerlo. Esto es un gran desperdicio. Cuesta mucho dinero, usa una tonelada de electricidad y toma más tiempo del necesario. El artículo argumenta que necesitamos un "enrutador"—un camarero inteligente—que observe tu petición y decida: "Oye, esto es solo una pregunta sencilla. Enviémosla al aprendiz rápido y barato". Pero si haces una pregunta matemática compleja, el camarero debería decir: "De acuerdo, esto necesita al jefe de cocina".
Las Tres Grandes Preguntas que el Artículo Responde
Los autores desglosan el problema en tres preguntas simples: Qué debemos optimizar, Cuándo debemos tomar la decisión y Cómo construimos realmente el enrutador.
1. ¿Qué estamos tratando de ahorrar?
La mayoría de la gente piensa que lo único que importa es el dinero. Pero el artículo señala que también debemos preocuparnos por el tiempo (latencia) y el medio ambiente (energía).
- Dinero: Cada vez que una IA responde a una pregunta, cuesta una pequeña cantidad de dinero por palabra (token).
- Tiempo: Esperar a que una IA lenta y poderosa responda a un simple "Hola" es molesto.
- El Planeta: Los grandes modelos de IA utilizan mucha electricidad. Si podemos usar un modelo más pequeño para el 80% de nuestras preguntas, ahorramos una cantidad masiva de energía y reducimos nuestra huella de carbono.
2. ¿Cuándo se toma la decisión?
El artículo identifica dos momentos principales en los que el "camarero" puede tomar una decisión:
- Antes de que se genere la respuesta (Pre-generación): El camarero observa tu pregunta antes de que alguien empiece a cocinar. Supone: "Esto parece un pedido de pizza sencillo", y lo envía al chef barato inmediatamente. Esto es rápido y ahore dinero porque el gran chef nunca llega a intervenir.
- Después de que se genera la respuesta (Post-generación/Cascada): El camarero deja que el chef barato lo intente primero. Si la respuesta parece mala o el chef parece inseguro, entonces el camarero envía la pregunta al chef caro. Esto es como pedir una pizza, probar un trozo y, si está quemado, llamar al jefe de cocina para que haga una nueva. Esto es más seguro pero más lento y puede costar más si el chef barato falla con frecuencia.
3. ¿Cómo construimos al camarero?
Esta es la parte más divertida. El artículo revisa docenas de diferentes estrategias de "camarero", que agrupa en cuatro familias principales:
- El Camarero "Semejante" (Basado en similitud): Este camarero guarda un álbum de fotos de preguntas pasadas. Si haces una pregunta que suena como una pregunta que hicieron la semana pasada, el camarero la envía al mismo chef que respondió aquella. Es como decir: "La última vez que preguntaste sobre gatos, el experto en gatos estuvo genial, así que enviaré esta pregunta de gatos a él también".
- El Camarero "Profesor" (Supervisado): Este camarero es entrenado como un estudiante. Aprende a reconocer patrones. Por ejemplo, aprende que las preguntas sobre "matemáticas" suelen necesitar un especialista en matemáticas, y las preguntas sobre "chistes" necesitan un modelo creativo. Es como un estudiante que memorizó un libro de texto sobre "Qué chef maneja cada plato".
- El Camarero "Apostador" (Aprendizaje por Refuerzo): Este camarero aprende por ensayo y error, como un personaje de un videojuego. Prueba diferentes chefs, ve si la respuesta fue buena y recibe una "recompensa" si ahorró dinero y obtuvo una buena respuesta. Con el tiempo, aprende la mejor estrategia sin necesidad de un libro de texto.
- El Camarero "Autorreflexivo" (Generativo): Aquí es donde la IA habla consigo misma. El camarero le pregunta al chef barato: "¿Estás seguro de que puedes responder esto?". Si el chef dice: "No estoy seguro", el camarero lo envía inmediatamente al gran chef. Es como preguntarle a un amigo: "¿Sabes esto?", y si duda, llamas al experto.
Lo que el Artículo Descarta (La lista de "No te molestes")
Los autores son muy claros sobre lo que no cuenta como una buena estrategia de enrutamiento. Dicen explícitamente que el simple hecho de reunir respuestas de cinco chefs diferentes y elegir la mejor (llamado "métodos de ensamble") no es lo mismo que el enrutamiento. Eso es como pedir cinco pizzas y tirar las malas; es demasiado caro. El objetivo es elegir al chef correcto antes de empezar a cocinar, no cocinar todo y luego elegir.
También señalan que algunos métodos, como pedir a la IA que adivine su propia confianza, pueden ser complicados. A veces la IA es excesivamente confiada y dice: "¡Lo sé!", cuando en realidad no es así. Esto puede conducir a respuestas erróneas si el sistema confía en el chef equivocado.
El Veredicto: Es Prometedor, Pero No es Perfecto
El artículo concluye que el enrutamiento es una herramienta poderosa, pero aún no es un misterio resuelto.
- Funciona: En muchas pruebas, el enrutamiento inteligente puede reducir los costes a la mitad o más, manteniendo las respuestas tan buenas como el uso de los grandes modelos.
- Es complicado: La mejor estrategia depende de la situación. A veces, un enfoque de "semejanza" funciona mejor; otras veces, un enfoque de "profesor" es superior.
- El futuro: Los autores sugieren que el siguiente gran paso es hacer que estos enrutadores sean "adaptativos". Actualmente, si añades un nuevo chef a la cocina, a menudo tienes que reentrenar todo el sistema del camarero. El objetivo futuro es un camarero que pueda entender instantáneamente las habilidades de un nuevo chef y empezar a utilizarlo inmediatamente, sin necesidad de un largo periodo de entrenamiento.
En resumen, este artículo es una guía para construir sistemas de IA más inteligentes, más baratos y más ecológicos. Nos dice que no necesitamos usar un mazo para romper una nuez. Al construir un sistema inteligente que sepa cuándo usar un martillo pequeño y cuándo uno grande, podemos hacer que la IA sea más rápida, más barata y mejor para el planeta.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.