← Últimos artículos
🤖 AI

Reasoning Structure of Large Language Models

Este artículo introduce un referente escalable y un proceso para convertir trazas de razonamiento no estructuradas en grafos verificables, permitiendo el análisis cuantitativo de la estructura y eficiencia del razonamiento para diagnosticar mejor los modos de falla y comparar los comportamientos de los modelos más allá de las métricas tradicionales de precisión y recuento de tokens.

Autores originales: Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam, Roger Wattenhofer

Publicado 2026-06-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam, Roger Wattenhofer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo a dos chefs intentar hornear exactamente el mismo pastel. Ambos chefs te entregan un pastel perfecto y delicioso al final. Si solo miras el producto final, podrías pensar que ambos hicieron el mismo trabajo. Pero, ¿qué pasaría si uno de los chefs siguió una receta precisa, paso a paso, mientras que el otro deambuló por la cocina, probó diez ingredientes diferentes, quemó algunos lotes y finalmente dio con la mezcla correcta por accidente?

Durante mucho tiempo, cuando probábamos los modelos de "razonamiento" de IA, solo mirábamos el pastel final (la respuesta) o cuántas palabras usaban para describir el proceso (conteo de tokens). Este artículo argumenta que esto es como juzgar a un chef solo por el sabor del pastel, ignorando si realmente sabía cocinar o si solo tuvo suerte.

Aquí está lo que hicieron los investigadores para mirar detrás de la cortina, explicado de forma sencilla:

1. El patio de juegos de acertijos

En lugar de pedirle a la IA que escriba un ensayo o resuelva un acertijo vago, los investigadores les dieron un conjunto de 21 acertijos de lógica diferentes (como "Tents", donde tienes que colocar tiendas de campaña junto a árboles basándote en reglas estrictas). Estos acertijos son como un gimnasio controlado para el cerebro. Tienen reglas claras y no se puede hacer trampa; o lo resuelves o no lo haces. Los investigadores hicieron estos acertijos cada vez más difíciles, como aumentar el peso en una pesa de gimnasio.

2. Convirtiendo palabras en un mapa

Cuando una IA resuelve un acertijo, generalmente escribe un flujo largo de pensamientos (un "rastro"). Los investigadores construyeron una herramienta especial que toma este flujo desordenado de texto y lo convierte en un mapa visual (un grafo).

  • Nodos (Puntos): Cada punto es un hecho o afirmación individual que la IA hizo (por ejemplo, "Hay un árbol en este lugar").
  • Aristas (Líneas): Las líneas conectan los puntos para mostrar cómo un hecho llevó a otro (por ejemplo, "Debido a que hay un árbol aquí, debe haber una tienda allí").

Esto convierte un párrafo de texto en un diagrama estructurado que se puede medir.

3. La nueva tarjeta de puntuación: "Eficiencia de Razonamiento"

Los investigadores introdujeron una nueva métrica llamada Eficiencia (η\eta). Piensa en esto como medir qué tan "enfocado" está el pensamiento de la IA.

  • Alta Eficiencia (El Láser): El mapa de la IA parece un túnel estrecho y directo. Reúne los hechos necesarios y avanza directamente hacia la solución sin deambular.
  • Baja Eficiencia (La Niebla): El mapa de la IA parece una telaraña desordenada. Explora muchos callejones sin salida, repite los mismos hechos una y otra vez, y deambula por los bordes del problema antes de (tal vez) encontrar la respuesta.

4. Lo que descubrieron

Al usar este mapa y la puntuación de eficiencia, encontraron algunas cosas sorprendentes que la antigua puntuación de "respuesta final" pasó por alto:

  • Más palabras \neq Mejor pensamiento: El hecho de que una IA use más palabras (tokens) no significa que esté pensando mejor. De hecho, los investigadores descubrieron que las palabras extra eran a menudo la IA "revisándose" a sí misma o dando vueltas en círculos, no resolviendo realmente el problema.
  • El problema de lo "Difuso": Algunos modelos obtenían la respuesta correcta pero tenían un mapa muy desordenado y disperso. Eran como un detective que encuentra al criminal pero tuvo que entrevistar a 50 personas inocentes primero. Otros modelos eran "enfocados", encontrando la respuesta con un camino limpio y directo.
  • El muro de la dificultad: A medida que los acertijos se volvían más difíciles, los modelos de IA empezaban a fallar. Incluso cuando los investigadores les permitieron usar cantidades masivas de palabras (potencia de cómputo), los modelos aún no podían resolver los acertijos más difíciles. Resulta que simplemente darle a una IA más tiempo para "pensar" (más tokens) no corrige las brechas fundamentales de razonamiento.
  • La estructura importa: La puntuación de "Eficiencia" podía distinguir entre un modelo que era inteligente y enfocado, frente a uno que solo estaba adivinando y probando, incluso si ambos obtenían la misma puntuación final.

La conclusión

Este artículo nos ofrece una nueva forma de observar el pensamiento de la IA. En lugar de solo preguntar "¿Obtuvo la respuesta correcta?", ahora podemos preguntar "¿Cómo llegó allí?".

Es la diferencia entre un estudiante que memoriza la clave de respuestas y un estudiante que realmente entiende las matemáticas. Los investigadores construyeron una herramienta para ver la parte de la "comprensión" mapeando los pasos lógicos, demostrando que cómo razona una IA es tan importante como qué responde.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →