← Últimos artículos
💬 NLP

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

Este estudio evalúa las capacidades de los modelos de lenguaje de gran tamaño para resolver problemas de estática mediante un enfoque de destilación de modelos, revelando que, si bien desempeñan un buen papel en preguntas de solo texto, su precisión disminuye significativamente cuando se requieren diagramas y razonamiento de múltiples pasos debido a los desafíos para aplicar consistentemente la información visual en lugar de limitaciones de reconocimiento de imágenes.

Autores originales: Tanner Culleton, Hung-Fu Chang

Publicado 2026-06-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Tanner Culleton, Hung-Fu Chang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un estudiante muy inteligente y culto llamado "ChatGPT", que ha leído casi todos los libros de la biblioteca. Quieres probar si este estudiante realmente puede resolver problemas difíciles de tareas de ingeniería, específicamente en una materia llamada Estática (que trata sobre cómo se equilibran las fuerzas en objetos estacionarios, como puentes o grúas).

Aquí está lo que hicieron los investigadores, explicado de forma sencilla:

1. El problema del "Copiar y Pegar"

Primero, los investigadores intentaron lo obvio: tomaron preguntas reales de libros de texto y le pidieron a ChatGPT que las resolviera.

  • El Resultado: Fue un desastre. El estudiante se confundió, especialmente cuando los problemas involucraban dibujos en 3D. Mezclaba las direcciones (como decir "arriba" cuando quería decir "derecha") y se equivocaba en las matemáticas.
  • La Analogía: Fue como pedirle a un estudiante que lea un mapa escrito en un idioma que apenas conoce. Conocía las palabras, pero no podía entender las direcciones.

2. El truco de la "Ingeniería Inversa" (Destilación de Modelos)

Dado que las preguntas de los libros de texto eran demasiado difíciles, los investigadores intentaron un trucción ingenioso llamado Destilación de Modelos. En lugar de pedirle al estudiante que resolviera preguntas de otras personas, le pidieron que escribiera sus propias preguntas.

  • La Lógica: Pensaron: "Si ChatGPT puede escribir una buena pregunta, probablemente sabe la respuesta a ese tipo específico de pregunta porque la 'aprendió' de sus propios datos de entrenamiento".
  • El Proceso: Le pidieron a ChatGPT que generara 50 problemas de estática. Notaron que el estudiante seguía escribiendo los mismos problemas simples y en 2D (planos) una y otra vez. Así que seleccionaron las 25 mejores preguntas únicas que ChatGPT parecía entender bien.

3. Los Tres Niveles de la Prueba

Los investigadores crearon tres "exámenes" diferentes usando esas 25 preguntas para ver cómo funcionaba el cerebro del estudiante:

  • Examen A (Solo Texto): Le pidieron a ChatGPT que resolviera las preguntas que él mismo escribió, usando solo palabras.
    • Resultado: Puntuación Perfecta (100%). ¡El estudiante sabía las respuestas porque él mismo escribió las preguntas!
  • Examen B (Con Imágenes): Tomaron esas mismas preguntas de solo texto y dibujaron diagramas simples para ellas.
    • Resultado: La puntuación bajó al 68%. El estudiante aún podía leer las palabras, pero la imagen lo confundió. Le costó conectar el dibujo con las matemáticas.
  • Examen C (La Prueba de "Nuevos Números"): Tomaron los diagramas del Examen B y cambiaron todos los números (por ejemplo, cambiando una fuerza de 10 lbs a 15 lbs).
    • Resultado: La puntuación bajó al 60%. Esto demostró que el estudiante no solo estaba memorizando las respuestas. Estaba intentando resolver el problema desde cero, pero cometía errores en medio del proceso.

4. ¿Qué aprendieron?

Los investigadores compararon a ChatGPT con otro estudiante de IA llamado "Gemini".

  • El Gran Descubrimiento: El problema no era que la IA no pudiera "ver" las imágenes. El problema era que no podía pensar por pasos.
  • La Analogía: Imagina a un chef que puede leer una receta perfectamente (Solo Texto). Si le entregas los ingredientes y una foto del plato (Diagrama), aún puede cocinar. Pero si le pides que cocine una comida compleja de varios tiempos donde tiene que ajustar la receta a mitad de camino (Razonamiento de múltiples pasos), empieza a dejar caer ingredientes o a olvidar el siguiente paso.
  • La Conclusión: La IA es muy buena con la matemática simple de un solo paso. Pero cuando tiene que mirar una imagen, extraer información y luego usar esa información en tres o cuatro pasos diferentes para obtener una respuesta final, se pierde. Sigue el método correcto, pero a menudo obtiene el número equivocado al final.

Resumen

El artículo concluye que, si bien la IA se está volviendo muy buena leyendo y escribiendo, todavía es un poco torpe cuando se trata del razonamiento visual y de cadenas de lógica largas y complejas. Es como un estudiante que conoce la teoría perfectamente, pero se queda paralizado cuando se le pide que la aplique a un dibujo del mundo real con números cambiantes.

Nota: Los investigadores solo probaron estos problemas de ingeniería específicos. No afirmaron que esto se aplique a diagnósticos médicos, asesoría legal u otros campos, ni sugirieron cómo arreglar la IA para el futuro. Simplemente informaron cómo se desempeñó la IA en este conjunto específico de acertijos de ingeniería.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →