← Últimos artículos
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

El artículo propone Pair-In, Pair-Out (PIPO), un marco unificado que combina la compresión de entrada latente con la predicción de salida de múltiples tokens y un mecanismo de aceptación ligero basado en la confianza para lograr aceleraciones significativas de latencia y un rendimiento de razonamiento mejorado en modelos de lenguaje grandes sin la sobrecarga de una pasada de verificador separada.

Autores originales: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Publicado 2026-05-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un modelo de lenguaje grande (LLM) como un escriba muy inteligente, pero muy lento, que escribe historias una palabra a la vez. Para resolver un problema matemático difícil o escribir código complejo, este escriba necesita pensar en voz alta, generando una larga "cadena de pensamiento" antes de escribir la respuesta final. El problema es que escribir una palabra, detenerse, pensar y escribir la siguiente palabra es increíblemente lento y costoso.

El artículo introduce un nuevo método llamado PIPO (Entrada por Pares, Salida por Pares) para hacer que este escriba sea mucho más rápido sin que cometa más errores. Así es como funciona, usando analogías simples:

1. El Problema: El Cuello de Botella de "Un Paso a la Vez"

Actualmente, el escriba funciona como una persona tecleando en una máquina de escribir: escribe una letra, presiona "Enter", espera a que la máquina procese, escribe la siguiente letra, y así sucesivamente. Incluso si el escriba es inteligente, la máquina es lenta porque solo puede manejar una letra por ciclo.

2. La Solución: El Autobús de "Dos Niveles" (PIPO)

PIPO cambia las reglas del camino. En lugar de que el escriba procese una palabra a la vez, PIPO le permite procesar dos palabras a la vez.

  • Entrada por Pares (La Compresión): Imagina que el escriba recibe una pila de dos letras (por ejemplo, "T" y "h"). En lugar de alimentarlas a la máquina por separado, un "compresor" especial las pliega juntas en un solo paquete compacto (una representación latente). Es como doblar un mapa grande en un pañuelo de bolsillo pequeño para que quepa por una puerta estrecha.
  • El Viaje: La máquina procesa este único paquete "plegado".
  • Salida por Pares (El Despliegue): Una vez que la máquina termina, no solo escupe una letra. Tiene una cabeza especial de "despliegue" que toma el resultado y produce instantáneamente dos letras: la siguiente palabra esperada y una palabra borrador predicha (por ejemplo, "e" y " ").

El Resultado: El escriba ahora escribe dos letras por cada ciclo de máquina. Esto duplica efectivamente la velocidad de escritura.

3. El Riesgo: El "Juego de Adivinanzas"

Hay una trampa. Predecir la segunda palabra es una suposición. Si la suposición es incorrecta, toda la oración podría volverse sin sentido.

  • La Vieja Forma (Decodificación Especulativa): Anteriormente, para verificar si una suposición era correcta, el escriba tenía que detenerse, ejecutar una prueba masiva de "verificación" (como un editor senior leyendo todo el borrador de nuevo) y luego decidir si la suposición era buena. Este paso de verificación era tan lento que cancelaba las ganancias de velocidad.
  • La Forma de PIPO (La Cabeza de Confianza): PIPO instala un "medidor de confianza" diminuto y super rápido justo al lado del escriba. Este medidor está entrenado para mirar las dos palabras y decir instantáneamente: "Estoy 95% seguro de que esta segunda palabra es correcta", o "No estoy seguro, omitámosla".
    • Si el medidor dice "Adelante", el escriba guarda ambas palabras.
    • Si el medidor dice "No", el escriba guarda la primera palabra y reemplaza la segunda con un "espacio en blanco" (relleno) para mantener el ritmo.

4. El Secreto: Aprender de los Errores (Distilación en Política)

¿Cómo aprende el "medidor de confianza" a ser tan preciso sin un editor lento?

El artículo utiliza un truco de entrenamiento ingenioso llamado Distilación en Política.

  • Imagina que el escriba (el estudiante) intenta escribir una historia.
  • Un maestro superinteligente (un modelo más grande, preentrenado) también escribe la historia.
  • El sistema compara la suposición del estudiante con la respuesta del maestro.
  • La Magia: El sistema se da cuenta de que el "maestro" está haciendo exactamente el mismo trabajo que el "editor" en el viejo método. Así que, en lugar de ejecutar una verificación lenta de editor cada vez, el sistema usa las respuestas del maestro para entrenar al pequeño "medidor de confianza" durante la fase de aprendizaje.
  • Una vez entrenado, el medidor de confianza sabe exactamente cuándo confiar en la suposición y cuándo tener cuidado, todo sin necesidad del editor lento durante el proceso de escritura real.

5. Los Resultados: Más Rápido y Más Inteligente

El artículo probó esto en tareas difíciles de matemáticas y codificación (como la competencia matemática AIME y puntos de referencia de codificación).

  • Velocidad: Como procesa dos palabras a la vez y salta la lenta verificación de editor, PIPO es de 2 a 2.6 veces más rápido que el método estándar. Obtiene la primera palabra mucho más rápido y mantiene el flujo en movimiento.
  • Precisión: Sorprendentemente, no solo se volvió más rápido; se volvió mejor. Al ajustar más "pensamiento" en la misma cantidad de espacio (porque comprime la entrada), el modelo pudo generar cadenas de razonamiento más largas y completas. En algunas pruebas, la tasa de éxito aumentó en más de 7 puntos en comparación con los métodos normales.

Resumen

PIPO es como actualizar un camión de reparto de una carretera de un solo carril a una autopista de doble carril.

  1. Comprime la carga (entrada) para que dos paquetes quepan en una sola ranura.
  2. Entrega dos paquetes a la vez (salida).
  3. Usa un sensor inteligente (cabeza de confianza) para decidir si el segundo paquete es seguro de guardar, entrenado por un maestro que ya conoce la respuesta.

Esto permite que la IA piense más tiempo y responda más rápido, resolviendo problemas complejos sin la ralentización habitual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →