← Últimos artículos
💬 NLP

Prompt Stability Scoring for Text Annotation with Large Language Models

Este artículo aborda la vulnerabilidad de la anotación de texto en modelos de lenguaje grandes ante variaciones en los prompts mediante la propuesta de un marco general denominado Puntuación de Estabilidad del Prompt (PSS), que adapta las métricas tradicionales de fiabilidad para diagnosticar problemas de estabilidad e incluye un paquete de Python para su implementación práctica.

Autores originales: Christopher Barrie, Elli Palaiologou, Petter Törnberg

Publicado 2026-05-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Christopher Barrie, Elli Palaiologou, Petter Törnberg

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: ¿Es tu IA "Caprichosa"?

Imagina que contratas a un asistente muy inteligente, pero ligeramente nervioso, para ordenar un montón de cartas en sobres de "Sí" y "No". Les das una instrucción específica: "Si la carta menciona dinero, ponla en la pila de 'Sí'".

Les pides que hagan esto 30 veces.

  • Escenario A: Colocan las mismas cartas en las mismas pilas cada vez.
  • Escenario B: En el primer intento, ponen una carta sobre "ahorros" en la pila de "Sí". En el segundo intento, ponen esa misma carta en la pila de "No". En el tercer intento, la vuelven a poner en "Sí".

Incluso si el asistente suele tener razón, el Escenario B es un problema. Significa que su toma de decisiones es inestable. Si no puedes confiar en que sea consistente con las mismas instrucciones exactas, ciertamente no puedes confiar en él si cambias ligeramente la redacción (por ejemplo, "Si la carta habla de efectivo...").

Este artículo trata sobre crear una prueba para ver si tu asistente de IA es estable (Escenario A) o caprichoso (Escenario B) antes de permitirle realizar cualquier trabajo real.


El Problema: La IA es Sensible a la "Ensalada de Palabras"

Los autores explican que los Modelos de Lenguaje Grandes (IA) no funcionan como una calculadora. No buscan una respuesta fija en un libro. En su lugar, predicen la siguiente palabra una por una, como una persona adivinando qué sigue en una oración.

Debido a esto, dos cosas pueden arruinar su consistencia:

  1. El Problema del "Mismo Prompt": Incluso si escribes las mismas instrucciones exactas dos veces, la IA podría dar una respuesta ligeramente diferente debido a factores aleatorios diminutos e invisibles en su cerebro informático (como una moneda girando en segundo plano).
  2. El Problema de la "Reformulación": Si cambias tus instrucciones solo un poco, como decir "Clasifica esto" en lugar de "Ordena esto", la IA podría confundirse y dar una respuesta totalmente diferente.

El artículo argumenta que la precisión no es suficiente. Una IA podría obtener la respuesta correcta el 90% de las veces, pero si cambia su respuesta cada vez que ajustas el prompt, tus resultados de investigación son poco fiables.

La Solución: La "Puntuación de Estabilidad del Prompt" (PSS)

Los autores crearon una herramienta (un paquete de Python llamado promptstability) que actúa como una prueba de estrés para tus instrucciones de IA.

Piénsalo como probar un puente:

  • Estabilidad Intraprompt (La Prueba de "Repetición"): Ejecutas la misma instrucción exacta 30 veces sobre los mismos datos. La herramienta verifica: ¿La IA dio la misma respuesta cada vez? Si las respuestas saltan, el puente es inestable.
  • Estabilidad Interprompt (La Prueba de "Reformulación"): Tomas tu instrucción y pides a otra IA que la reescriba de 10 maneras diferentes (por ejemplo, "Ordena estos", "Categoriza estos", "Etiqueta estos"). Luego ejecutas las 10 versiones sobre los mismos datos. La herramienta verifica: ¿La IA siguió estando de acuerdo consigo misma, incluso aunque las palabras cambiaron?

La herramienta te da una puntuación (llamada alfa de Krippendorff, que es simplemente una forma elegante de decir "puntuación de acuerdo").

  • Puntuación Alta (Cerca de 1.0): ¡Genial! Tus instrucciones son robustas. La IA es consistente.
  • Puntuación Baja (Por debajo de 0.8): ¡Advertencia! Tus instrucciones son demasiado frágiles. Un pequeño cambio en la redacción rompe el sistema.

Lo que Descubrieron (Resultados de la "Prueba de Estrés")

Los investigadores probaron esto en seis conjuntos de datos reales diferentes (como tuits políticos de EE. UU., manifiestos de partidos del Reino Unido y artículos de noticias). Esto es lo que descubrieron:

  1. Lo Simple es Estable: Cuando la tarea era fácil y los datos eran claros (como identificar si un tuit era de un republicano o un demócrata), la IA era muy estable. No importaba si reformulabas el prompt; daba la misma respuesta.
  2. Lo Complejo es Frágil: Cuando la tarea era difícil o los datos estaban desordenados (como decidir si un tuit usa lenguaje "populista", o clasificar respuestas de encuestas en 12 categorías muy similares), la IA se volvió inestable. Pequeños cambios en el prompt hicieron que la IA cambiara de opinión.
  3. La Trampa del "Formato": A veces la IA no estaba realmente confundida; simplemente olvidó seguir las reglas de formato (como escribir un párrafo en lugar de un número). Cuando los investigadores filtraron estas respuestas "descuidadas", las puntuaciones de estabilidad subieron. Esto les enseñó que a veces el problema no es el cerebro de la IA, sino su incapacidad para seguir reglas de formato estrictas.
  4. El Modelo Importa: Compararon una IA potente (GPT-4) con una de código abierto más pequeña. La potente fue mucho más estable. Esto significa que la "caprichosidad" no siempre es tu culpa; a veces simplemente necesitas una IA más inteligente.

El "Manual de Juego": ¿Qué Deberías Hacer?

El artículo ofrece una guía sencilla para los investigadores:

  • Paso 1: Ejecuta la Prueba de Estabilidad. Antes de gastar dinero o tiempo validando tus resultados, ejecuta la herramienta promptstability.
  • Paso 2: Revisa la Puntuación.
    • Si la puntuación es alta: Puedes continuar. Tu flujo de trabajo es robusto.
    • Si la puntuación es baja: ¡Detente! No confíes en tus resultados todavía.
  • Paso 3: Arregla el Problema.
    • ¿La IA ignora el formato? Arregla el prompt para que sea más estricto.
    • ¿La tarea es demasiado vaga? Haz tus instrucciones más claras.
    • ¿Los datos están demasiado desordenados? Quizás esta tarea específica es demasiado difícil para que una IA la maneje de forma consistente.
    • ¿La IA es demasiado débil? Prueba un modelo más potente.

La Conclusión

No puedes asumir que, solo porque una IA te da una respuesta, esa respuesta es fiable. Este artículo proporciona una lista de verificación para asegurar que tu IA no esté simplemente adivinando al azar o reaccionando con demasiada sensibilidad a cómo formulaste tus preguntas.

La estabilidad es la base de la confianza. Si tu IA no puede estar de acuerdo consigo misma cuando haces la misma pregunta de formas ligeramente diferentes, no puedes confiar en los resultados que te da para tu investigación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →