← Últimos artículos
🤖 AI

Structured Prompts Improve Evaluation of Language Models

Este estudio presenta un marco reproducible que integra la programación declarativa DSPy con HELM para demostrar que la elección de prompts estructurados, especialmente aquellos con razonamiento paso a paso, mejora significativamente el rendimiento de los modelos de lenguaje y altera sustancialmente las clasificaciones en los rankings de evaluación.

Autores originales: Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi
Publicado 2026-04-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que las Inteligencias Artificiales (IA) son como cocineros extremadamente talentosos que pueden preparar cualquier plato del mundo. Pero hay un problema: si le pides a un chef que cocine un pastel, el resultado depende totalmente de cómo se lo pides.

Si le dices: "Haz un pastel", quizás te dé una torta seca. Pero si le dices: "Por favor, mezcla la harina primero, luego añade los huevos y hornea a 180 grados", te dará una obra maestra.

Hasta ahora, los ranking de IA (como las listas de los mejores cocineros) evaluaban a todos los chefs usando exactamente la misma frase corta y aburrida para pedirles los platos. El problema es que esa frase no les hacía brillar a todos por igual.

Aquí es donde entra este estudio, que es como un cambio de reglas en la competencia de cocina.

1. El Problema: La "Frase Mágica" Fija

Imagina que tienes un examen de matemáticas. Si el examen siempre dice: "Resuelve esto", algunos alumnos lo hacen bien y otros mal. Pero si el examen dijera: "Primero dibuja un diagrama, luego escribe los pasos y al final da la respuesta", ¡todos mejorarían!

Los investigadores descubrieron que las listas de las IAs más inteligentes (como las que ves en las noticias) estaban usando la primera opción (la frase fija). Esto hacía que los resultados fueran injustos: no medían realmente quién era el mejor chef, sino quién entendía mejor esa frase específica.

2. La Solución: Darles un "Guion" Estructurado

Los autores usaron una herramienta llamada DSPy (piensa en ella como un director de teatro). En lugar de darle al chef una sola frase, el director les dio un guion estructurado.

Probaron 5 formas de pedir las cosas:

  • La forma antigua: "Hazlo" (Sin ayuda).
  • Pensar paso a paso (CoT): "Antes de dar la respuesta, explica tu razonamiento paso a paso como si estuvieras resolviendo un misterio".
  • Dar ejemplos: "Mira cómo lo hice en estos 3 casos anteriores, ahora tú hazlo".
  • Optimizar: Usar un algoritmo para encontrar la mejor combinación de instrucciones.

3. Lo que Descubrieron (¡La Sorpresa!)

  • El "Pensar Paso a Paso" es el Superpoder: Descubrieron que la técnica más importante no era usar un algoritmo súper complejo, sino simplemente pedirle a la IA que "piense antes de hablar" (esto se llama Chain-of-Thought o Cadena de Pensamiento).

    • Analogía: Es como si antes de saltar al agua, el nadador se tomara un segundo para ver la corriente. ¡De repente, todos nadan mejor!
    • Resultado: Las IAs mejoraron un 6% en promedio solo por pedirles que pensaran paso a paso.
  • Los Rankings Cambian: Cuando evaluaron a las IAs con estos nuevos guiones, cambiaron las posiciones en la lista.

    • Analogía: Imagina una carrera de coches. Si la carrera es solo en línea recta, el coche A gana. Pero si la pista tiene curvas y obstáculos (el nuevo guion), el coche B, que es más ágil, gana.
    • En 5 de cada 7 pruebas, el orden de las IAs cambió. ¡La que era segunda pasó a ser primera!
  • Más no es Mejor: Intentar usar optimizadores súper avanzados (como un chef que intenta inventar 100 recetas nuevas) apenas dio beneficios extra. Lo que realmente importaba era la estructura básica de "pensar paso a paso".

  • Los Pequeños Ganan: Las IAs más pequeñas y baratas (como un chef de barrio) mejoraron mucho más que las gigantes y caras (como un chef de 3 estrellas Michelin). Con el guion correcto, una IA pequeña pudo competir de igual a igual con una gigante.

4. ¿Por qué es importante esto?

Hasta ahora, las empresas y los hospitales elegían qué IA usar basándose en esas listas antiguas. Este estudio nos dice: "¡Ojo! Esas listas pueden estar equivocadas".

Si una empresa compra la IA número 1 de la lista vieja, pero la IA número 3 funciona mucho mejor con el nuevo método de "pensar paso a paso", están perdiendo dinero y calidad.

En Resumen

Este paper nos enseña que la forma en que le hacemos una pregunta a una IA es tan importante como la inteligencia de la propia IA.

  • Antes: Le preguntábamos con una frase tibia y aburrida.
  • Ahora: Le damos un guion estructurado que le dice: "Piensa, razona y luego responde".
  • Resultado: Las IAs se vuelven más inteligentes, los rankings cambian y las IAs más pequeñas pueden brillar tanto como las grandes.

Es como descubrir que, para ganar un partido de fútbol, no necesitas solo jugadores fuertes, sino un buen entrenador que les diga cómo jugar. ¡Y el mejor entrenador es pedirles que piensen antes de actuar!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →