← Últimos artículos
⚡ electrical engineering

A Benchmark on LLM-Based Power Flow Computation: Do More Structured Prompts Help?

Este artículo presenta una evaluación comparativa que demuestra que, aunque Gemini 2.5 Pro supera a otros modelos en el cálculo de flujo de potencia Gauss-Seidel basado en LLM, ninguna configuración alcanza la fiabilidad necesaria para la resolución numérica directa y, contrariamente a lo esperado, los prompts más estructurados pueden degradar la precisión en comparación con formatos narrativos simples.

Autores originales: Tingwei Chen, Kaiyang Huang, Kai Sun

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tingwei Chen, Kaiyang Huang, Kai Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes tres "estudiantes" de IA diferentes (llamémosles Gemini, Claude y GPT-3.5) y quieres ver si pueden actuar como una calculadora para una red eléctrica. Específicamente, les pides que resuelvan un problema matemático clásico, paso a paso, llamado "Flujo de Potencia", que los ingenieros utilizan para asegurarse de que la electricidad se mueva de forma segura a través de una red de cables.

Los investigadores diseñaron un experimento controlado para ver dos cosas:

  1. ¿Pueden estos estudiantes de IA realmente hacer los cálculos?
  2. ¿Cambia la forma en que haces la pregunta (el "prompt") la calidad de su desempeño?

Aquí tienes el desglose de sus hallazgos utilizando analogías simples:

La Configuración: Una Carretera de Tres Carriles

Los investigadores crearon una red eléctrica diminuta y simplificada con solo tres "ciudades" (barras) conectadas por carreteras (líneas de transmisión). Generaron 50 escenarios de tráfico diferentes (cargas aleatorias y condiciones de la carretera) y pidieron a la IA que calculara exactamente cuánta electricidad necesita generar la central eléctrica principal (la "barra de referencia") para mantener todo funcionando.

Pusieron a prueba a la IA con cuatro formas diferentes de hacer la pregunta:

  1. La Historia: Un párrafo simple que describe el problema (como una pregunta de libro de texto).
  2. La Historia + Ejemplo: La misma historia, pero con un ejemplo resuelto de un libro de texto justo antes.
  3. La Lista de Verificación: Una lista numerada de pasos a seguir, pidiendo a la IA que muestre su trabajo.
  4. La Hoja de Cálculo: Un formato rígido y legible por máquinas (JSON) con un requisito estricto de mostrar cada paso del cálculo.

Los Resultados: ¿Quién Aprobó y Quién Reprobó?

1. El "Sobre-pensador" (Gemini 2.5 Pro)

  • La Sorpresa: Podrías pensar que darle a una IA una hoja de cálculo rígida y pedirle que muestre cada paso la haría más precisa. Hizo lo contrario.
  • La Analogía: Imagina pedirle a un estudiante brillante de matemáticas que resuelva un problema. Cuando solo dices: "Aquí está el problema, dame la respuesta", lo acierta el 54% de las veces. Pero cuando le entregas un formulario complejo y dices: "Rellena cada casilla y muestra tu trabajo línea por línea", se confunde, lo complica en exceso y sus errores se triplican.
  • Veredicto: Gemini es el más inteligente de los tres, pero es muy sensible a cómo le hablas. Lo simple es mejor; las instrucciones complejas en realidad perjudican su desempeño.

2. El "Estable Eddie" (Claude Sonnet 4.5)

  • El Comportamiento: A Claude no le importó mucho cómo se hizo la pregunta. Ya fuera una historia, una lista de verificación o una hoja de cálculo, obtuvo la respuesta correcta aproximadamente el 38% de las veces sin importar qué.
  • La Analogía: Piensa en Claude como un estudiante que tiene una forma específica de estudiar. Cambiar el formato del examen no les ayuda, pero tampoco les perjudica. Simplemente se mantienen en la misma zona "promedio".
  • Veredicto: Añadir un ejemplo resuelto (mostrándoles un problema resuelto) ayudó ligeramente a Claude, pero aún no fue suficiente para ser una calculadora confiable.

3. El "Estudiante con Dificultades" (GPT-3.5 Turbo)

  • El Comportamiento: Este modelo falló casi todas y cada una de las veces, independientemente de cómo se hiciera la pregunta.
  • La Analogía: Imagina pedirle a un estudiante que aún no ha aprendido el material que resuelva un problema de cálculo. Ya sea que les des una pista, un libro de texto o una calculadora, aún se equivocan entre el 90% y el 96% de las veces.
  • Veredicto: Simplemente no es capaz de este tipo específico de matemáticas complejas y multietapa en este momento.

La Gran Conclusión: "Más Instrucciones" ≠ "Mejores Resultados"

El hallazgo más importante de este artículo es una advertencia para cualquiera que intente usar IA para matemáticas o ingeniería: Darle a la IA instrucciones más detalladas, datos estructurados o pedirle que "muestre su trabajo" no garantiza una mejor precisión.

De hecho, para el modelo más inteligente probado, hacer el prompt más complejo lo hizo peor. Es como decirle a un GPS que "recalcule la ruta usando un algoritmo específico" cuando solo necesitaba decir "Conduce hasta allí". Las reglas adicionales confundieron al sistema.

La Conclusión Final: No Listos para Estrenar

Los investigadores concluyeron que ninguno de estos modelos de IA está listo para reemplazar a una calculadora de ingeniería real.

  • Incluso el mejor resultado (Gemini con un prompt simple) solo obtuvo la respuesta correcta dentro de un margen de error del 5% aproximadamente la mitad de las veces.
  • En el mundo real, si estás gestionando una red eléctrica, un error del 5% podría significar un apagón o un incendio. Necesitas un 100% de precisión.

Resumen: Estos modelos de IA son excelentes para explicar qué es el flujo de potencia o para ayudar a los ingenieros a generar ideas, pero no están listos para ser las calculadoras reales que gestionan la red. Si les pides que hagan los cálculos, aún necesitas a un humano (o un programa informático tradicional) para verificar los números.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →