← Últimos artículos
🤖 AI

Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning

El artículo presenta Funnel of Thoughts (FoT), un método de inferencia sin entrenamiento que reduce significativamente los costos computacionales y la latencia para los Grandes Modelos de Razonamiento al podar prematuramente las trayectorias de razonamiento improductivas basándose en marcadores de vacilación léxica, preservando al mismo tiempo la precisión de la votación completa de múltiples muestras.

Autores originales: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La inteligencia artificial moderna ha llegado a un punto en el que sus modelos de razonamiento más potentes no se limitan a dar una única respuesta a una pregunta difícil. En su lugar, generan cadenas de pensamiento largas y sinuosas, explorando múltiples caminos hacia una solución antes de establecer una conclusión final. Este proceso imita la deliberación humana, pero introduce un desafío único: cuando se le pide el mismo problema repetidamente, estos modelos suelen producir respuestas diferentes y, a veces, contradictorias. Para garantizar la fiabilidad, los ingenieros han adoptado la estrategia de pedir al modelo que genere muchos intentos diferentes, o "rollouts", y luego seleccionar la respuesta más común entre ellos. Este método, conocido como votación por mayoría, mejora significativamente la precisión en tareas complejas como las matemáticas avanzadas. Sin embargo, conlleva un alto precio. Debido a que estas cadenas de razonamiento pueden extenderse por miles de palabras, ejecutar docenas de ellas simultáneamente consume una cantidad masiva de potencia de cómputo. El costo crece rápidamente a medida que las cadenas se alargan, lo que significa que la parte más costosa del proceso es a menudo el mismísimo final, donde el modelo podría estar atrapado en un bucle de autocorrección innecesaria o vacilación.

Un equipo de investigadores de la Universidad de Corea ha desarrollado un nuevo método llamado "Funnel of Thoughts" (Embudo de Pensamientos) para resolver esta ineficiencia sin sacrificar la precisión. Su trabajo aborda un problema específico: en un grupo de treinta y dos intentos de razonamiento diferentes, a menudo hay algunos que no son productivos. Estos intentos específicos tienden a espiralizarse en bucles repetitivos, cuestionando infinitamente su propia lógica o quedándose atrapados en estados de "no respuesta", mientras consumen la gran mayoría de los recursos informáticos. Los investigadores descubrieron que estos intentos fallidos se revelan a través de un patrón simple y observable en el texto que generan. Utilizan con frecuencia marcadores de vacilación específicos —palabras y frases como "Espera", "En realidad", "quizás" o "Déjame reconsiderar". Al contar con qué frecuencia aparecen estos marcadores, el sistema puede identificar qué caminos de razonamiento es probable que fallen mucho antes de que terminen.

El nuevo método funciona ejecutando los treinta y dos intentos en paralelo, tal como antes, pero introduce un "embudo" que estrecha progresivamente el campo. En puntos de control específicos a lo largo del camino, el sistema comprueba dos cosas. Primero, si un intento ya ha producido una respuesta clara y final, se guarda inmediatamente en un banco seguro y el sistema detiene la generación de texto para ese intento específico. Esto preserva el voto de la ruta exitosa sin desperdiciar más energía. Segundo, para los intentos que aún están en ejecución, el sistema calcula la densidad de esos marcadores de vacilación. Si un intento está lleno de demasiadas señales de incertidumbre, se poda, o se corta, prematuramente. Esto permite al sistema descartar las rutas de desperdicio y espiralización, manteniendo las rutas productivas que probablemente conducirán a la solución correcta.

Los resultados de este enfoque son sustanciales. Al utilizar este método, los investigadores pudieron reducir el costo computacional total, medido en las operaciones de atención requeridas por el modelo, en casi la mitad. En pruebas del mundo real en una sola tarjeta gráfica de alto rendimiento, esto se tradujo en una reducción del tiempo de procesamiento de más del treinta y siete por ciento. Crucialmente, esta eficiencia no se produjo a costa de la precisión. El método mantuvo el mismo alto nivel de corrección que el enfoque tradicional de ejecutar los treinta y dos intentos hasta su finalización. De hecho, en algunos problemas difíciles, el nuevo método incluso mejoró el resultado final. Esto sucedió porque el método tradicional a veces permitía que unos pocos intentos improductivos y repetitivos dominaran la votación final simplemente porque fueron los únicos que terminaron, mientras que el nuevo método eliminó esas distracciones tempranamente, permitiendo que la respuesta correcta emergiera con mayor claridad.

Los investigadores probaron esta técnica en seis modelos de razonamiento de gran tamaño diferentes y en una variedad de evaluaciones matemáticas desafiantes. Encontraron que la señal de los marcadores de vacilación era consistente en todos los modelos, independientemente de su arquitectura interna o tamaño. El método también demostró ser robusto cuando se aplicó a tareas fuera de las matemáticas, como responder preguntas científicas complejas o generar código, siempre que el sistema pudiera identificar cuándo se había alcanzado una respuesta final. La idea clave es que el sistema no necesita comprender el contenido del razonamiento para saber cuándo detenerse; solo necesita reconocer el patrón de indecisión. Esto permite que el método funcione sin entrenamiento adicional o herramientas externas complejas, basándose únicamente en el texto que el modelo ya está produciendo.

Este trabajo sugiere que la parte más costosa del razonamiento de la inteligencia artificial es a menudo la menos productiva. Al aprender a reconocer los signos tempranos de que un modelo se está quedando estancado, podemos evitar que desperdicie recursos en caminos que no conducirán a ninguna parte. El "Funnel of Thoughts" demuestra que es posible hacer que estos sistemas potentes sean significativamente más rápidos y económicos de ejecutar, manteniéndolos igual de inteligentes. Ofrece una forma práctica de escalar el uso de los modelos de razonamiento avanzados, haciéndolos más viables para aplicaciones del mundo real donde la velocidad y el costo son factores críticos. Los hallazgos indican que el futuro de la IA eficiente puede no residir en construir modelos más grandes, sino en formas más inteligentes de gestionar los que ya tenemos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →