← Últimos artículos
💬 NLP

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

Este artículo introduce un método de búsqueda Tree-of-Thought basado en la novedad que aprovecha el conocimiento preentrenado de un LLM para medir y podar rutas de razonamiento redundantes, mejorando así la eficiencia y reduciendo los costos de tokens en tareas de planificación y razonamiento basadas en lenguaje.

Autores originales: Leon Hamm, Zlatan Ajanovic

Publicado 2026-05-08
📖 4 min de lectura☕ Lectura para el café

Autores originales: Leon Hamm, Zlatan Ajanovic

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas muy complejo, como navegar por un laberinto masivo o averiguar cómo apilar bloques perfectamente. Tienes un asistente superinteligente (una IA) que puede pensar, pero tiene un mal hábito: se abruma fácilmente y gasta mucho dinero (en "tokens", que es la moneda que usa la IA para pensar) intentando cada posible camino, incluso aquellos que claramente conducen a callejones sin salida.

Este artículo presenta una nueva forma de ayudar a esta IA a pensar de manera más inteligente, no solo más arduamente. Los autores lo denominan "Búsqueda de Árbol de Pensamientos basada en Novedad".

Aquí está el desglose usando analogías simples:

1. El Problema: El "Pasillo Infinito"

Los métodos actuales de IA (llamados "Árbol de Pensamientos") funcionan como una persona explorando un laberinto. Prueban un camino, chocan contra una pared, retroceden y prueban otro.

  • El Problema: La IA a menudo prueba caminos que son solo ligeras variaciones de caminos que ya ha intentado. Es como caminar por un pasillo, girar a la izquierda, chocar contra una pared, girar a la derecha y darte cuenta de que estás exactamente en la misma habitación en la que estabas hace cinco minutos.
  • El Costo: Dado que la IA sigue explorando estos callejones sin salida, consume una cantidad masiva de tiempo y dinero (potencia de cálculo).

2. La Solución: El "Filtro de Novedad"

Los autores tomaron una idea de la planificación informática clásica (usada para cosas como la navegación de robots) y enseñaron a la IA a utilizarla. A esto lo llaman "Novedad".

Piensa en la "Novedad" como un detector de frescura.

  • Antigua Forma: La IA pregunta: "¿Qué puedo hacer a continuación?" y lo prueba todo.
  • Nueva Forma: Antes de que la IA pruebe un nuevo camino, se pregunta a sí misma: "¿He visto una situación como esta antes?"
    • Si la respuesta es "Sí, esto es básicamente lo mismo que antes", la IA dice: "¡Omitirlo!" y corta esa rama inmediatamente.
    • Si la respuesta es "No, esto es algo nuevo", la IA sigue explorando.

3. Cómo Enseñaron a la IA a Hacer Esto

La parte complicada es que la IA no entiende naturalmente "átomos" o "variables" como lo hacían las computadoras antiguas. Ella entiende el lenguaje.

  • Los investigadores no le dieron a la IA una fórmula matemática compleja. En su lugar, le plantearon una pregunta simple: "¿Este nuevo estado es diferente de la lista de estados que ya hemos visitado?"
  • La IA utiliza su conocimiento general para responder "Sí" o "No". Si dice "No" (no es nuevo), ese camino se poda (se corta).

4. Los Resultados: Más Inteligente, No Solo Más Rápido

El equipo probó esto en tres tipos diferentes de desafíos:

  1. Blocksworld: Apilar y mover bloques (como un videojuego clásico).
  2. Logística: Mover paquetes entre ciudades con camiones y aviones.
  3. Matemáticas: Resolver problemas difíciles de matemáticas de secundaria.

¿Qué sucedió?

  • En los mejores casos: La IA se convirtió en una maestra de la eficiencia. Encontró la solución correcta con la misma frecuencia que antes, pero utilizó hasta 20 veces menos dinero (tokens) porque dejó de perder tiempo en caminos sin salida.
  • La Trampa: El sistema es un poco frágil. Es como un coche con un motor muy sensible. Si ajustas las instrucciones (prompts) perfectamente, vuela. Si las instrucciones están ligeramente fuera de lugar, la IA se confunde, deja de funcionar o, de hecho, gasta más dinero porque hace demasiadas preguntas de "¿Esto es nuevo?".

5. La Gran Conclusión

El artículo demuestra que podemos hacer que el razonamiento de la IA sea mucho más barato y rápido enseñándole a reconocer cuándo "ya ha estado allí y lo ha hecho".

Sin embargo, los autores son honestos sobre las limitaciones:

  • Funciona mejor cuando la IA ya es buena en la tarea específica.
  • Depende en gran medida de cómo haces las preguntas (el "prompt").
  • No garantiza una solución perfecta cada vez, pero cuando funciona, es una gran victoria para la eficiencia.

En resumen: Enseñaron a la IA a dejar de caminar en círculos preguntando: "¿He visto esto antes?". Si la respuesta es sí, da la vuelta y ahorra una fortuna.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →