← Últimos artículos
🤖 machine learning

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

Este artículo introduce Extra-CoT, un marco novedoso que logra una compresión extrema del pensamiento en cadena con pérdida mínima de precisión al combinar un compresor que preserva la semántica, un ajuste fino supervisado con proporciones mixtas y una estrategia de optimización de política de proporción jerárquica y restringida (CHRPO) para habilitar un razonamiento eficiente y de alta fidelidad en los modelos de lenguaje grandes.

Autores originales: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

Publicado 2026-05-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un estudiante brillante y excesivamente entusiasta (la IA) que está intentando resolver un problema matemático. Cuando le haces una pregunta sencilla como "¿Cuánto es 2+2?", no se limita a decir "4". En su lugar, escribe un ensayo de 50 páginas explicando la historia de los números, el concepto de la suma y por qué el número 2 es especial, antes de finalmente rodear con un círculo la respuesta "4".

Esto se llama razonamiento de Cadena de Pensamiento (CoT). Ayuda a la IA a obtener la respuesta correcta, pero es increíblemente lento y costoso porque la IA está "sobre-pensando" y generando demasiadas palabras (tokens).

El artículo introduce un nuevo sistema llamado Extra-CoT para resolver esto. Piensa en ello como un programa de entrenamiento de tres pasos para enseñar a este estudiante excesivamente entusiasta a ser conciso sin perder su inteligencia.

El problema con los "editores" existentes

Antes de este artículo, los investigadores intentaron usar "editores" para reducir los largos ensayos del estudiante. Estos editores simplemente cortaban palabras al azar o basándose en reglas simples.

  • La analogía: Imagina un editor que corta una frase diciendo: "La raíz cuadrada de 109 es aproximadamente 10.44". Si la cortan por la mitad, podrías quedarte con "La raíz cuadrada de 10...", lo cual no tiene sentido.
  • El resultado: Cuando estos editores intentaban reducir el ensayo a un tamaño diminuto (como el 20% del original), las respuestas del estudiante se convertían en basura. La lógica se desmoronaba porque los "pasos críticos" eran cortados.

La solución Extra-CoT: Un campamento de entrenamiento de tres pasos

Los autores proponen un nuevo método que trata al estudiante y al editor de manera diferente.

Paso 1: El editor "experto en matemáticas" (El compresor)

Primero, entrenan a un editor especial que entiende las fórmulas matemáticas mejor que nadie.

  • Cómo funciona: En lugar de solo mirar palabras, este editor trata una fórmula matemática completa (como x2+12x=73x^2 + 12x = 73) como un único "bloque" indivisible. Sabe que si cortas una fórmula por la mitad, todo el conjunto se rompe.
  • La analogía: Imagina un bibliotecario que sabe que un capítulo específico de un libro es la "pista" de un misterio. Si necesita reducir la biblioteca, no arrancará páginas de ese capítulo; mantendrá el capítulo entero intacto y cortará las descripciones aburridas que lo rodean.
  • El objetivo: Esto crea un "estándar de oro" de respuestas abreviadas que siguen siendo lógicamente perfectas.

Paso 2: El aula de "modo mixto" (SFT)

A continuación, enseñan al estudiante principal de IA a seguir las instrucciones de este nuevo editor.

  • Cómo funciona: Le muestran al estudiante ejemplos donde el editor dice: "Mantén el 80% del texto", luego "Mantén el 60%", luego "Mantén el 20%".
  • La analogía: Es como un entrenador que prepara a un atleta para correr diferentes distancias. El atleta aprende que cuando el entrenador grita "¡Sprint corto!", no deja de correr; corre eficientemente para esa distancia específica. Esto enseña a la IA a obedecer diferentes "presupuestos" de palabras.

Paso 3: El entrenador "arriesgado" (CHRPO)

Finalmente, utilizan un sistema de recompensas especial (Aprendizaje por Refuerzo) para impulsar al estudiante a ser aún más eficiente.

  • El problema: El estudiante tiene miedo de ser demasiado breve porque podría obtener la respuesta incorrecta.
  • La solución: El entrenador (CHRPO) otorga una gran bonificación si el estudiante obtiene la respuesta correcta y usa muy pocas palabras. Pero, si el estudiante intenta ser demasiado breve y se equivoca, la penalización es masiva.
  • La analogía: Imagina un programa de televisión donde obtienes un premio por resolver un rompecabezas en 10 segundos. Si lo resuelves en 5 segundos, obtienes un premio doble. Pero si te apresuras y te equivocas, lo pierdes todo. Esto incentiva a la IA a encontrar el "punto dulce" de ser super rápida pero aún precisa.

Los resultados

El artículo probó esto en problemas matemáticos difíciles (como los que se encuentran en competiciones de secundaria).

  • La victoria: El nuevo sistema (Extra-CoT) pudo reducir el número de palabras que la IA generaba en un 73% (hasta solo el 27% de la longitud original) mientras obtenía en realidad más preguntas correctas que antes.
  • Comparación: Los métodos antiguos (como "TokenSkip") fallaban cuando se les pedía ser tan breves. O bien se negaban a seguir la orden o daban respuestas incorrectas. Extra-CoT se mantuvo calmado y preciso incluso en los límites extremos.
  • Velocidad: Debido a que la IA escribe mucho menos, resuelve problemas 3 veces más rápido en tiempo real.

Resumen

En resumen, Extra-CoT es un sistema que enseña a la IA a dejar de "sobre-pensar". Utiliza un editor inteligente que respeta las fórmulas matemáticas, entrena a la IA para seguir límites estrictos de palabras y la recompensa por ser tanto rápida como correcta. El resultado es una IA que puede resolver acertijos lógicos complejos utilizando una fracción de la potencia de cálculo y el tiempo que necesitaba antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →