← Últimos artículos
💬 NLP

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

Este estudio exploratorio evalúa cinco modelos de lenguaje grandes en acertijos de Sudoku de 6x6 y descubre que, aunque un modelo muestra una capacidad de resolución limitada, ninguno puede proporcionar explicaciones que reflejen un razonamiento estratégico o una resolución intuitiva de problemas, lo que destaca barreras significativas para la toma de decisiones colaborativa efectiva entre humanos e IA.

Autores originales: Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

Publicado 2026-04-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un equipo de robots muy inteligentes y bien leídos. Les pides que resuelvan un acertijo lógico llamado Sudoku (específicamente una versión más pequeña de 6×6) y, lo que es más importante, que te enseñen cómo lo resolvieron en inglés sencillo.

Este artículo es como un boletín de calificaciones para cinco de estos robots, verificando dos cosas:

  1. ¿Obtuvieron la respuesta correcta?
  2. ¿Pudieron explicar su razonamiento de una manera que realmente tenga sentido para un humano?

Aquí está el desglose de lo que los investigadores encontraron, usando algunas analogías cotidianas.

El escenario: La "prueba de Sudoku"

Los investigadores crearon casi 2.300 de estos acertijos de 6×6. Piensa en estos acertijos como un gimnasio para el cerebro. No son los acertijos más difíciles del mundo (como la versión de 9×9), pero son lo suficientemente truculentos como para que no puedas simplemente adivinar; debes usar lógica y reglas para averiguar dónde van los números.

Querían ver si los Modelos de Lenguaje Grande (LLM), los cerebros de IA detrás de los chatbots, podían actuar como un buen tutor. Un buen tutor no solo te da la hoja de respuestas; te guía a través de los pasos para que entiendas por qué se hizo un movimiento.

Los resultados: Los "resolutores" frente a los "explicadores"

1. Los robots de código abierto (La "hora de los aficionados")

Los investigadores probaron cuatro modelos de código abierto diferentes (como Llama, Gemma y Mistral).

  • El resultado: Estos robots básicamente suspendieron la prueba. De 2.293 acertijos, resolvieron el acertijo completo correctamente menos del 1% de las veces.
  • La analogía: Imagina pedirle a un grupo de personas que llenen un crucigrama. Estos robots eran como personas que adivinaban palabras al azar. Podían acertar algunas letras por casualidad, pero no podían mantener la coherencia de toda la imagen. Olvidaban las reglas tan pronto como comenzaban a escribir.

2. El estudiante estrella: "o1-preview" de OpenAI

Luego estaba un modelo específico de OpenAI llamado o1-preview.

  • El resultado: Este modelo fue una estrella en resolver. Obtuvo el acertijo completo correcto aproximadamente el 65% de las veces. En los acertijos más fáciles, fue perfecto (100%).
  • El problema: A medida que los acertijos se volvieron más difíciles (el nivel "Diabólico"), su rendimiento disminuyó. Comenzó a cometer errores, como un estudiante que es genial con los deberes de matemáticas pero se confunde cuando el examen se pone realmente difícil.

3. El verdadero problema: El "malo explicando"

Aquí es donde el estudio se vuelve interesante. Los investigadores tomaron los 20 acertijos que o1-preview resolvió correctamente y le pidieron que explicara sus pasos a expertos humanos.

  • El resultado: La explicación fue un desastre.

    • Justificación: Solo el 5% de las veces el robot explicó realmente por qué eligió un número. La mayoría de las veces, simplemente dijo: "Puse un 5 aquí", sin decir por qué.
    • Claridad: Las explicaciones eran confusas, saltaban de un lado a otro y usaban términos incorrectamente.
    • Valor educativo: Si intentabas aprender a resolver Sudoku con este robot, no aprenderías nada. No enseñó ninguna estrategia.
  • La analogía: Imagina a un chef maestro que puede cocinar un filete perfecto. Le preguntas: "¿Cómo lo hiciste?".

    • Una buena explicación: "Lo sellé a fuego alto durante dos minutos, luego bajé la temperatura..."
    • Lo que hizo o1-preview: Te entregó el filete y dijo: "Está listo. Está bueno. Aquí está el filete". Te dio el resultado pero se negó a (o no pudo) compartir la receta. Fue como un mago que realiza un truco perfectamente, pero cuando le preguntan cómo, simplemente dice: "Simplemente lo hice", y luego inventa una razón falsa que no coincide con lo que realmente sucedió.

La gran conclusión

El artículo concluye que, aunque la IA está mejorando en hacer el trabajo (resolviendo el acertijo), sigue siendo terrible en contar la historia de cómo hizo el trabajo.

Los autores argumentan que, para que la IA sea un verdadero socio para los humanos, especialmente en trabajos importantes como la medicina o el derecho, debe poder mostrar su trabajo claramente. Ahora mismo, incluso la IA más inteligente es como un estudiante que saca una 'A' en el examen pero no puede explicar la respuesta al profesor.

¿Qué sigue?

El artículo sugiere que, en lugar de intentar que la IA "piense" como un humano completamente por sí sola, deberíamos combinar la IA con herramientas lógicas (como software matemático especializado).

  • La idea: Permitir que el software lógico realice las matemáticas difíciles y estrictas para asegurar que la respuesta sea 100% correcta. Luego, permitir que la IA actúe como traductor, tomando esas matemáticas estrictas y aburridas y convirtiéndolas en una historia amigable y fácil de entender para un humano.

En resumen: La IA puede resolver el acertijo, pero aún no puede enseñarte cómo resolverlo. Es una gran trabajadora, pero una pésima maestra.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →