← Últimos artículos
🤖 machine learning

Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

Este artículo demuestra que las métricas estándar de precisión por ejecución sobrestiman significativamente la fiabilidad de los modelos de lenguaje extensos en tareas de programación deterministas al ignorar la brecha sustancial entre el éxito de una única ejecución y el rendimiento consistente sin reintentos, particularmente para los modelos de nivel medio, estableciendo así la necesidad de un análisis de estabilidad de ejecuciones repetidas para una evaluación precisa.

Autores originales: Yongxi Zhou, Lai Yun Choi, Jiaxi Wen, Wenbo Ye

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yongxi Zhou, Lai Yun Choi, Jiaxi Wen, Wenbo Ye

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un equipo de chefs para cocinar un plato específico basándose en una receta que tú les das. Les pides a cada chef que intente cocinar el plato cinco veces seguidas, utilizando exactamente los mismos ingredientes e instrucciones.

La mayoría de la gente miraría los resultados y diría: "¡Vaya, el Chef A lo hizo bien 4 de las 5 veces! Eso es una tasa de éxito del 80%. Es excelente".

Pero este artículo plantea una pregunta diferente, más práctica: "Si le pido al Chef A que cocine este plato justo ahora, ¿puedo confiar en que será perfecto cada vez, o tengo que seguir pidiéndole que lo intente hasta que lo logre?"

Los investigadores descubrieron que la forma estándar de medir el éxito (la "tasa de éxito del 80%") a menudo nos engaña. Hace que los chefs parezcan más fiables de lo que realmente son.

Aquí hay un desglose de sus hallazgos utilizando analogías sencillas:

1. El "Promedio" frente a la "Racha Perfecta"

El artículo introduce dos formas de medir a un chef (o a un modelo de IA):

  • Tasa de aprobación por ejecución (El Promedio): Esto es como contar cuántos platos perfectos salieron de la cocina en total. Si un chef hace 100 platos y 80 son perfectos, tiene una puntuación del 80%. Esto es lo que la mayoría de la gente observa.
  • Tasa de Estabilidad Perfecta (La puntuación de "Sin Reintentos"): Esto pregunta: "¿Cuántas de las órdenes hizo bien el chef al primer intento, sin fallar nunca?".

El Gran Descubrimiento: La puntuación del "Promedio" es casi siempre mayor que la puntuación de "Sin Reintentos".

  • La Analogía: Imagina a un chef que lanza una moneda para decidir si añade sal o no.
    • Escenario A: Logra el plato bien el 50% de las veces, pero cuando se equivoca, se equivoca muy mal. Es inconsistente.
    • Escenario B: Logra el plato bien el 50% de las veces, pero o es siempre perfecto o es siempre terrible.
    • El artículo encontró que para los chefs de "nivel medio" (aquellos que son buenos pero no perfectos), la brecha entre su puntuación de "Promedio" y su puntuación de "Sin Reintentos" es enorme. Un modelo puede parecer un 86% preciso en promedio, pero si necesitas que funcione perfectamente sin una segunda opinión, en realidad es solo un 75% fiable. Esa es una diferencia del 17,8%: una brecha masiva que cambia a quién contratarías.

2. La Trampa del "Rango Medio"

Los investigadores descubrieron que las mentiras más grandes ocurren con los modelos de "rango medio".

  • Los modelos de alto nivel son tan buenos que rara vez cometen errores, por lo que sus puntuaciones de "Promedio" y "Estabilidad" son cercanas.
  • Los modelos de bajo nivel son tan malos que casi siempre fallan, por lo que sus puntuaciones también son cercanas (ambas bajas).
  • Los Modelos de Rango Medio: Estos son los complicados. Tienen éxito con la suficiente frecuencia como para parecer buenos, pero fallan con la suficiente frecuencia como para ser molestos. Debido a que están "en la cuerda floja", sus resultados oscilan salvajemente. El artículo encontró que, para estos modelos, la puntuación del "Promedio" sobrestima su fiabilidad en casi 18 puntos porcentuales.

3. El "Prompt" (La Tarjeta de Receta)

El equipo probó si dar al chef una tarjeta de receta más detallada (un "Prompt Detallado") frente a una corta (un "Prompt Mínimo") los hacía más consistentes.

  • El Resultado: Depende enteramente del chef.
  • Para algunos modelos, una receta detallada ayudó. Para otros, una receta corta fue mejor. Para algunos, no importó en absoluto.
  • La Lección: No existe un "prompt mágico" que lo arregle todo. No puedes simplemente darle una mejor instrucción a un modelo de nivel medio y esperar que de repente sea perfectamente estable.

4. Los Modelos que "Piensan" (Razonamiento vs. Estándar)

Algunos chefs modernos están entrenados para "pensar paso a paso" antes de cocinar (Modelos de Razonamiento). Los investigadores se preguntaron si este "pensar" los hacía más consistentes.

  • El Resultado: No necesariamente.
  • Aunque algunos modelos de "pensamiento" fueron sorprendentemente estables, otros fueron en realidad menos estables que sus contrapartes que no piensan. El acto de "pensar" no garantizó una racha perfecta. De hecho, para algunos, los pasos de pensamiento adicionales introdujeron más oportunidades para que las cosas salieran mal.

5. Por qué esto importa

El artículo argumenta que debemos dejar de mirar solo la puntuación del "Promedio".

  • El Mundo Real: Si estás construyendo un sistema de software que necesita ejecutarse automáticamente (como un coche autónomo o un script bancario), no quieres un sistema que funcione "la mayoría de las veces". Quieres un sistema que funcione cada vez sin que tengas que pulsar el botón de "reintentar".
  • La Conclusión: Para saber si una IA está realmente lista para el mundo real, tienes que probarla repetidamente. Necesitas saber no solo si puede resolver el problema, sino qué tan fiablemente lo resuelve al primer intento.

En resumen: Una puntuación alta en un examen no significa que el estudiante sea constante. Este artículo nos muestra cómo medir la diferencia entre "lograrlo eventualmente" y "lograrlo cada vez".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →