← Últimos artículos
🤖 machine learning

Is Code Better Than Language for Algorithmic Reasoning

Este artículo demuestra que, para los modelos de lenguaje aumentados con herramientas, la ventaja de rendimiento del código sobre el lenguaje natural en el razonamiento algorítmico proviene primordialmente de la ejecución externa fiable más que de la representación de código intermedia, ya que el razonamiento simulado mediante código no produce una ganancia significativa sobre el razonamiento en lenguaje natural.

Autores originales: Terry Tong, Yu Feng, Surbhi Goel, Dan Roth

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Terry Tong, Yu Feng, Surbhi Goel, Dan Roth

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un acertijo matemático muy difícil. Tienes dos formas principales de obtener la respuesta:

  1. El método del "Hablador": Le pides a un asistente inteligente que piense en voz alta en inglés sencillo, paso a paso, y luego te diga la respuesta.
  2. El método del "Programador": Le pides al mismo asistente que escriba un programa informático para resolver el acertijo, y luego dejas que una computadora ejecute realmente ese programa para obtener la respuesta.

Durante mucho tiempo, la gente notó que el método del "Programador" solía funcionar mucho mejor. Pero nadie estaba seguro de por qué. ¿Era porque escribir código obliga al asistente a pensar con más claridad? ¿O era porque dejar que una computadora ejecute el código es mucho más fiable que confiar en el asistente para que haga las matemáticas en su cabeza?

Este artículo plantea un experimento ingenioso para descubrir qué factor es el verdadero héroe.

El experimento de las tres rutas

Los autores crearon una "autopista de tres carriles" para probar esto, utilizando un banco de pruebas de 40 tareas de acertijos algorítmicos (como ordenar listas, encontrar rutas o realizar matemáticas complejas).

  • Ruta 1 (El Hablador Puro): El asistente resuelve el problema enteramente en inglés. Piensa, escribe un párrafo de razonamiento y da la respuesta.
    • Resultado: Obtuvo aproximadamente el 17% de las respuestas correctas.
  • Ruta 2 (El Programador Falso): El asistente escribe el código (como Python), pero luego finge ejecutarlo. En lugar de entregar el código a una computadora, el asistente lee su propio código y simula los pasos en su mente, escribiendo el resultado en inglés.
    • Resultado: Obtuvo aproximadamente el 17% de las respuestas correctas.
    • La Gran Revelación: Es casi exactamente lo mismo que la Ruta 1. Escribir el código no ayudó al asistente a pensar mejor; solo cambió el formato de sus pensamientos.
  • Ruta 3 (El Programador Real): El asistente escribe el mismo código que en la Ruta 2, pero esta vez, le entrega el código a una computadora real (un entorno de ejecución Python) para que lo ejecute.
    • Resultado: Obtuvo aproximadamente el 49% de las respuestas correctas.

El "Porqué" detrás de la magia

El artículo utiliza algunas formas creativas de explicar estos resultados:

1. La analogía de la "Traducción" (Representación vs. Ejecución)
Piensa en la "Traza" (los pasos de razonamiento) como una receta.

  • La Ruta 1 es una receta escrita en una historia larga y florida.
  • La Ruta 2 es la misma receta, pero escrita como una lista estricta y estructurada.
  • La Ruta 3 es esa lista estricta, pero en lugar de un chef humano intentando leerla y adivinar el resultado, le entregas la instrucción a un chef robot que sigue las instrucciones perfectamente.

El experimento demostró que cambiar la receta de una historia (inglés) a una lista (código) no hizo al chef humano más inteligente. El chef humano (el LLM) cometió los mismos errores ya fuera leyendo la historia o la lista. El salto masivo en el rendimiento solo ocurrió cuando el chef robot (el ejecutor de la computadora) tomó el control.

2. La teoría de la "Molestia"
Los autores argumentan que el lenguaje natural está lleno de "ruido". Puedes decir lo mismo de mil maneras diferentes ("suma los números", "súmalos", "ponlos juntos"). Esta variedad extra confunde al modelo. El código es más estricto; tiene menos formas de decir lo mismo.
Sin embargo, el artículo demuestra que, aunque el código sea más "limpio", el modelo sigue sin poder usar esa limpieza para resolver los problemas matemáticos por sí solo. El código no le otorga mágicamente nuevas habilidades matemáticas al modelo.

3. La prueba de "Recuperación"
Los autores observaron los casos en los que la computadora obtuvo la respuesta correcta, pero el asistente humano (simulando el código) se equivocó. Esto sucedió el 33% de las veces.
Por el contrario, observaron los casos en los que la computadora falló (tal vez el código estaba roto), pero el asistente humano adivinó la respuesta correcta de todos modos. Esto ocurrió solo el 1.6% de las veces.
Esto demuestra que la computadora es un "ejecutor" mucho más fiable de lo que el asistente humano lo es para "simular" el código.

La conclusión fundamental

El artículo concluye que el Código no es mejor que el Lenguaje porque sea una mejor forma de pensar.

La ventaja de usar código no es que obligue a la IA a ser más inteligente. La ventaja es que el Código permite a la IA delegar el trabajo a una máquina que no comete errores matemáticos.

  • El Cuello de Botella: El problema no es que la IA no pueda escribir un buen código; es que la IA es mala revisando su propio trabajo o haciendo las matemáticas en su cabeza.
  • La Solución: El verdadero poder proviene de la herramienta (la computadora que ejecuta el código), no del lenguaje (el código en sí).

En resumen: Si quieres que una IA resuelva un problema matemático difícil, no te limites a pedirle que escriba código esperando que ella misma encuentre la respuesta. Pídele que escriba código y, después, deja que una computadora lo ejecute realmente. Ahí es donde ocurre la magia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →