← Últimos artículos
💻 computer science

Towards Distributed Inference of LLMs on a P2P Network

Este artículo propone un esquema de enrutamiento descentralizado y consciente del prefijo en caché para el servicio de LLM entre pares que aprovecha árboles radix locales y metadatos de pares asíncronos para enrutar las solicitudes a nodos con los prefijos de coincidencia más largos, reduciendo así la latencia de inferencia sin requerir coordinación centralizada ni transferencias de la caché KV.

Autores originales: Shabari S Nair, Krishanu Saini

Publicado 2026-06-17
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shabari S Nair, Krishanu Saini

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo una enorme biblioteca de conocimiento (un Modelo de Lenguaje Extenso) que ayuda a las personas a escribir historias, responder preguntas y resolver problemas. Cada vez que alguien hace una pregunta, la biblioteca tiene que "pensar" a través de la primera parte de la solicitud antes de poder empezar a dar una respuesta. Esta fase de "pensamiento" es lenta y consume mucha energía.

Sin embargo, a menudo muchas personas hacen preguntas que comienzan con las mismas palabras exactas—como "Aquí hay una historia sobre un gato..." o "Traduce esta frase al francés". En una biblioteca inteligente, una vez que se completa el "pensamiento" para esas palabras iniciales, la biblioteca guarda ese trabajo en un cuaderno temporal (llamado KV Cache) para no tener que repetirlo para la siguiente persona. Esto se llama Prefix Caching (Almacenamiento en caché de prefijos).

El Problema: El Cuello de Botella de la "Única Biblioteca"

En una configuración tradicional, podrías tener un edificio de biblioteca gigante con muchos estantes (nodos). Si una persona nueva entra, un gerente central decide a qué estante enviarla.

  • El Problema: Si el gerente envía a una persona al Estante A, pero el "pensamiento" para su pregunta se guardó en el Estante B, el Estante A tiene que empezar desde cero. El gerente tiene que revisar constantemente cada uno de los estantes para ver dónde están las notas. Si el gerente se satura o se avería, toda la biblioteca se ralentiza.
  • La Alternativa: Algunas bibliotecas intentan copiar las notas del Estante B al Estante A instantáneamente. Pero estas notas pueden ser enormes (como mover estanterías enteras) y toma demasiado tiempo y ancho de banda moverlas de un lado a otro, especialmente si los estantes están lejos unos de otros.

La Solución: Una Red de "Chismes" Punto a Punto (Peer-to-Peer)

Este artículo propone una nueva forma de dirigir la biblioteca: Sin un gerente central. En su lugar, cada estante (nodo) es su propio bibliotecario, y todos hablan directamente entre sí.

Así es como funciona, usando una analogía simple:

1. El "Árbol Radix" (El Mapa Mental del Bibliotecario)
Cada bibliotecario mantiene un mapa mental (un Árbol Radix) de las preguntas que ha respondido recientemente y de las notas que ha guardado.

  • Ejemplo: La bibliotecaria Alice sabe que tiene las notas de "Cómo hornear un pastel". El bibliotecario Bob sabe que tiene las notas de "Cómo arreglar una bicicleta".

2. El "Chisme" (Anti-entropía)
En lugar de que un jefe central diga qué está pasando, los bibliotecarios se cuentan chismes. Cada pocos segundos, le susurran un resumen rápido a sus vecinos: "Oye, acabo de guardar notas sobre 'hornear'".

  • No envían las notas pesadas (los datos reales); solo envían una lista diminuta de qué temas han cubierto.
  • Esto sucede en segundo plano, de modo que no ralentiza el trabajo real.

3. La Toma de Decisiones (Enrutamiento)
Cuando un nuevo cliente entra con una solicitud como "Cómo hornear un pastel de chocolate", el bibliotecario que lo ve primero revisa su mapa mental.

  • Pregunta: "¿Quién más tiene las notas sobre 'hornear'?"
  • Si escucha de un vecino que Bob tiene las notas sobre "hornear", le envía al cliente a Bob. Bob puede saltarse la parte de "pensar" e ir directamente a la respuesta.
  • Si su mapa es ligeramente viejo (obsoleto) y envía al cliente a la persona equivocada, no es un desastre. La otra persona simplemente tiene que empezar el "pensamiento" desde cero. La respuesta sigue siendo correcta; solo tomó un poco más de tiempo. La corrección nunca se pierde, solo la velocidad.

4. Manejo de la Multitud (Puntos Calientes/Hotspots)
¿Qué pasa si todo el mundo quiere saber sobre "hornear"? Bob se convierte en el "Especialista en Hornear" y se siente abrumado.

  • El sistema tiene una válvula de seguridad: Si Bob está muy ocupado, le susurra: "¡Estoy lleno!" a los otros bibliotecarios.
  • Los otros bibliotecarios dejan de enviar solicitudes de hornear a Bob por un tiempo, permitiéndole ponerse al día, y envían las nuevas solicitudes a alguien más que tendrá que hacer el "pensamiento" desde cero.

Lo Que Mostraron los Experimentos

Los investigadores probaron esta idea en una simulación informática con cuatro "bibliotecarios" utilizando un conjunto de datos de conocimientos generales (MMLU).

  • Las Redes Rápidas Ganan: Si los bibliotecarios pueden intercambiar chismes rápidamente (baja latencia de red), este sistema es mucho más rápido que no tener ningún enrutamiento. Ahorra mucho tiempo al reutilizar el trabajo de "pensamiento".
  • Las Redes Lentas Pierden: Si el intercambio de chismes tarda demasiado (alta latencia de red), el tiempo dedicado a enviar la solicitud a la persona correcta es mayor que simplemente hacer el trabajo uno mismo.
  • Especialización: El sistema crea naturalmente "especialistas". Si un tema es popular, un nodo eventualmente acumulará todas las notas para ese tema, volviéndose súper rápido en esa materia específica. Sin embargo, si las notas se vuelven demasiado grandes, el sistema elimina automáticamente las notas viejas para hacer espacio, causando que el "especialista" cambie con el tiempo.

La Conclusión Final

Este artículo sugiere que para los sistemas de IA distribuidos, no necesitamos un jefe central pesado o transferencias de datos costosas. En su lugar, podemos usar un sistema descentralizado basado en chismes donde los nodos comparten mapas ligeros de lo que saben.

  • Pros: Es resiliente (si un nodo se rompe, los demás siguen funcionando), escala bien y evita mover grandes cantidades de datos.
  • Contras: Solo funciona bien si la red es rápida y las preguntas tienen mucha repetición (como cuando mucha gente hace preguntas similares). Si la red es lenta o las preguntas son todas únicas, el sistema no gana mucha velocidad.

En resumen, es como un grupo de amigos compartiendo una lista de reproducción. En lugar de que una persona gestione toda la lista, todos le cuentan a los demás qué canciones tienen. Si quieres una canción, se la pides al amigo que la tiene. Si no la tiene, simplemente la reproduces tú mismo. Es desordenado, pero funciona de maravilla cuando todos están escuchando los mismos éxitos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →