← Últimos artículos
💬 NLP

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

Este artículo propone la Selección Dinámica de Tokens de Pensamiento (DynTS, por sus siglas en inglés), un método que mejora la eficiencia de los Grandes Modelos de Razonamiento mediante la identificación y retención únicamente de los estados de caché de Clave-Valor de los tokens críticos para la decisión en las trazas de razonamiento, mientras se eliminan las entradas redundantes.

Autores originales: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El "Sobrepensador" con una Mochila Llena

Imagina a un estudiante brillante (el Modelo de Razonamiento Grande) que es increíblemente bueno resolviendo problemas difíciles de matemáticas y ciencias. A diferencia de un estudiante normal que simplemente lanza una respuesta, este estudiante tiene un hábito especial: antes de escribir la respuesta final, escribe un proceso de "pensamiento" masivo y paso a paso en una pizarra. Escribe cada uno de sus pensamientos, cada callejón sin salida, cada "espera, déjame revisar eso" y cada cálculo.

Este "rastro de pensamiento" le ayuda a obtener la respuesta correcta. Sin embargo, hay un inconveniente: la memoria.

Para mantener este proceso de pensamiento, el estudiante necesita mantener cada una de las palabras que ha escrito en su pizarra en su memoria a corto plazo (llamada KV Cache). A medida que el problema se vuelve más difícil, la pizarra se hace más y más larga. Eventualmente, la mochila del estudiante (la memoria de la computadora) se vuelve tan pesosa con todas estas notas que ya no puede moverse rápido. Se vuelve lento, y la computadora que lo ejecuta se queda sin espacio.

El Descubrimiento: La "Regla del 80/20" del Pensamiento

Los investigadores se hicieron una pregunta simple: ¿Realmente necesita el estudiante recordar cada palabra que escribió para obtener la respuesta final?

Analizaron las notas del estudiante y encontraron un patrón sorprendente, que llaman el Principio de Pareto (o la regla del 80/20):

  • La Intuición: De una larga cadena de 100 pensamientos, solo unos 20 a 30 son los pensamientos "dorados" que realmente conducen a la solución.
  • El Resto: Los otros 70+ pensamientos son solo "relleno". Son como el estudiante diciendo: "Bien, empecemos", o "Hmm, tal vez", o repitiendo un número. Estos pensamientos son necesarios para el flujo de la conversación, pero no cambian la respuesta final. Si los borraras, el estudiante podría resolver el problema igual de bien.

La Solución: DYNTS (El Bibliotecario Inteligente)

Los investigadores construyeron un nuevo sistema llamado DYNTS (Selección Dinámica de Tokens de Pensamiento). Imagina a DYNTS como un bibliotecario superinteligente que se para junto al estudiante mientras este piensa.

Así es como funciona el bibliotecario:

  1. El "Predictor de Importancia" (El Radar del Bibliotecario):
    El bibliotecario tiene un radar especial que puede distinguir instantáneamente qué pensamientos son "Dorados" (críticos para la respuesta) y cuáles son "Relleno" (redundantes). Este radar es una herramienta pequeña y ligera conectada al cerebro del estudiante que aprende a reconocer ideas importantes.

  2. La Estrategia de "Ventana Dual" (La Mochila):
    El estudiante tiene una mochila con tres bolsillos específicos:

    • Bolsillo A (La Pregunta): El problema original nunca se elimina. Se mantiene seguro para siempre.
    • Bolsillo B (La Ventana Local): Los últimos pensamientos que el estudiante acaba de escribir se mantienen aquí para asegurar que la oración tenga sentido (gramática y fluidez).
    • Bolsillo C (La Ventana de Selección): Aquí es donde va el historial largo de pensamientos.
  3. La Acción (La Purga):
    A medida que el estudiante escribe más y más, la mochila se llena. Cuando llega al límite, el bibliotecario interviene:

    • Observa el historial largo en el Bolsillo C.
    • Usando su radar, identifica los pensamientos "Dorados".
    • Mantiene los pensamientos Dorados.
    • Desecha (evict) los pensamientos de "Relleno" que no importan.

El Resultado: Más Rápido y Más Ligero

Al hacer esto, los investigadores descubrieron que:

  • Velocidad: El estudiante puede pensar de 1.8 a 2.6 veces más rápido porque no está cargando una mochila pesada llena de notas inútiles.
  • Memoria: La mochila es de 3 a 5 veces más pequeña, lo que significa que puedes ejecutar a este estudiante inteligente en computadoras más pequeñas y baratas.
  • Precisión: Sorprendentemente, el estudiante no se vuelve más tonto. Debido a que el bibliotecario solo desechó el "relleno" y mantuvo los pensamientos "dorados", el estudiante sigue obteniendo la respuesta correcta con la misma frecuencia que antes.

Analogía de Resumen

Imagina que estás tratando de recordar una historia larga para contársela a un amigo.

  • Forma Antigua: Intentas memorizar cada palabra, incluyendo los "este...", "eh...", y "déjame pensar", hasta que te duele la cabeza y olvidas el punto principal.
  • Forma DYNTS: Memorizas los puntos principales de la trama y los remates (los tokens críticos) y solo mantienes las últimas frases en tu cabeza para que el flujo sea fluido. Olvidas los "este..." y los "eh...". Cuentas la historia igual de bien, pero requiere la mitad del esfuerzo y no te da dolor de cabeza.

El artículo demuestra que para estos modelos de IA que "piensan", no necesitamos guardar cada uno de sus pensamientos. Solo necesitamos guardar los importantes, y un sistema inteligente puede determinar cuáles son en tiempo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →