← Últimos artículos
🤖 machine learning

Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

Este artículo presenta Continuous Depth Batching (CDB), un novedoso marco de planificación que permite una inferencia adaptativa de profundidad de extremo a extremo y eficiente para modelos de lenguaje con bucles, al desacoplar las iteraciones del bucle de las etapas límite y superponer la planificación con la computación de la GPU, logrando así un rendimiento hasta 1.9 veces mayor y una latencia significativamente menor en comparación con los métodos estándar.

Autores originales: Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis

Publicado 2026-08-11
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una biblioteca masiva y superrápida donde un solo bibliotecario puede responder miles de preguntas a la vez. En el mundo de la Inteligencia Artificial, este bibliotecario es un "Modelo de Lenguaje de Gran Escala" (LLM), y las preguntas son textos de instrucciones (prompts) de los usuarios. Normalmente, para ahorrar tiempo y dinero, el bibliotecario procesa todas las preguntas en una línea estricta, dedicando a cada una exactamente la misma cantidad de atención, sin importar si la pregunta es simple o compleja. Esto es eficiente, pero es un desperdicio: responder "¿Cuánto es 2+2?" requiere tanto poder cerebral como resolver un problema complejo de física, aunque la primera sea pan comido.

Recientemente, los científicos descubrieron un truco ingenioso llamado modelos de "bucle" (looped models). En lugar de una línea recta, estos modelos tienen un "bucle de pensamiento". Pueden revisar su trabajo, pasar la respuesta por una cámara de pensamiento especial y, si la respuesta parece buena, se detienen. Si parece dudosa, pasan por la cámara de nuevo. Esto significa que las preguntas fáciles reciben un pase rápido, mientras que las difíciles reciben bucles adicionales de pensamiento profundo. Es como un estudiante que echa un vistazo a un problema matemático simple y escribe la respuesta de inmediato, pero pasa diez minutos garabateando en una pizarra para un problema de cálculo difícil. Esto suena perfecto, pero crea una pesadilla para el bibliotecario que intenta gestionar la fila. Si todos en la fila necesitan una cantidad diferente de tiempo en la cámara de pensamiento, toda la línea se queda atascada. El bibliotecario no puede procesar el siguiente grupo hasta que el actual haya terminado, y si algunas personas todavía están pensando mientras otras han terminado, el sistema se detiene. Este artículo aborda exactamente ese atasco de tráfico.

Los autores de este artículo presentan un nuevo sistema llamado Loteo de Profundidad Continua (CDB, por sus siglas en inglés) para solucionar el atasco de tráfico causado por estos "bucles de pensamiento". Se dieron cuenta de que la forma antigua de gestionar la fila (llamada loteo estándar) era demasiado rígida. Trataba cada pregunta como si necesitara el mismo número de bucles, lo que desperdiciaba la ventaja de velocidad de los nuevos modelos. Para solucionarlo, construyeron un programador dinámico que actúa como un controlador de tráfico súper organizado. En lugar de esperar a que todo el grupo termine, este controlador permite que las preguntas terminadas salgan de la fila inmediatamente y las intercambia instantáneamente por nuevas preguntas que esperan para comenzar.

Piensa en la cocina de un restaurante con mucho movimiento. En el sistema antiguo, si un chef está haciendo una ensalada sencilla (token fácil) y un suflé complejo (token difícil) al mismo tiempo, toda la cocina tiene que esperar hasta que el suflé esté listo antes de servir la ensalada o empezar un nuevo pedido. El nuevo sistema CDB es diferente. Tan pronto como la ensalada está lista, se emplata y se envía, y el chef inmediatamente toma un nuevo pedido para empezar a picar verduras, manteniendo la cocina constantemente ocupada. El artículo muestra que, al hacer esto, el sistema puede mantener el "bucle de pensamiento" funcionando a máxima velocidad sin dejar nunca las manos del chef ociosas.

Los investigadores probaron esto en dos modelos de IA diferentes, llamados Ouro y Huginn. Descubrieron que el CDB funciona increíblemente bien. Para el modelo Ouro, el nuevo sistema alcanzó hasta el 99% de la velocidad máxima teórica posible. En lenguaje sencillo, esto significa que el sistema es casi tan rápido como podría ser si pudieras eliminar mágicamente cada segundo de tiempo desperdiciado. En pruebas del mundo real, esto se tradujo en procesar 1.5 a 1.9 veces más solicitudes por segundo que los métodos antiguos. Cuando el sistema estaba bajo una carga pesada, como un sitio web concurrido con miles de usuarios, el tiempo de espera para las respuestas disminuyó entre un 45% y un 90%.

Sin embargo, el artículo también señala que esta magia no es automática. El sistema funciona mejor cuando el "bucle de pensamiento" es la parte principal del trabajo. Si los pasos previos al bucle (como leer la pregunta) y posteriores al bucle (como escribir la respuesta final) son demasiado lentos o pesados, pueden ralentizar todo el proceso. Los autores descubrieron que para los modelos donde estos pasos adicionales son pesados, la aceleración sigue siendo buena pero no tan dramática. También descubrieron un "punto ideal" para cuántas preguntas procesar a la vez. Si intentas procesar demasiadas pocas preguntas, el sistema pierde tiempo recargando el "cerebro" (pesos) del modelo para cada paso. Si procesas demasiadas, el sistema se satura. El CDB ayuda a encontrar este equilibrio perfecto al rellenar constantemente la fila con nuevas preguntas cada vez que se abre un espacio.

Uno de los trucos más ingeniosos que utilizaron los autores es algo llamado "puerta de previsión" (lookahead gate). Normalmente, el sistema tiene que esperar a que una pregunta termine su bucle de pensamiento antes de saber si la respuesta es lo suficientemente buena para salir. Esto causa una pequeña pausa donde la computadora simplemente se queda allí sentada esperando. El nuevo sistema predice la respuesta un paso antes, permitiendo que se preparen las siguientes ráfagas de preguntas mientras la actual aún está terminando. Es como un director que da la señal a la siguiente sección de la orquesta justo antes de que la sección actual termine, para que no haya silencio entre las notas. Este pequeño cambio redujo el "tiempo de inactividad" de la computadora a casi cero, haciendo que todo el proceso sea increíblemente fluido.

En resumen, este artículo demuestra que podemos hacer que estos modelos de IA inteligentes y autocorrectivos sean realmente lo suficientemente rápidos para usarse en el mundo real. Al tratar los "bucles de pensamiento" como un horario flexible en lugar de una línea rígida, y al intercambiar constantemente las tareas terminadas por nuevas, los autores han construido un sistema que no solo es más inteligente, sino también significativamente más rápido y eficiente. No solo sugirieron que podría funcionar; lo construyeron, lo probaron en hardware real y demostraron que ofrece ganancias de velocidad masivas, convirtiendo una idea teórica en una herramienta práctica para el futuro de la IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →