Designing large language model prompts to extract scores from messy text: A shared dataset and challenge
Este artículo presenta un conjunto de datos compartido de 1.446 textos de investigación desordenados con puntuaciones de calidad del Reino Unido y un desafío correspondiente para diseñar prompts de Modelos de Lenguaje Extensos óptimos que extraigan con precisión puntuaciones válidas o identifiquen valores faltantes, con el objetivo de superar una línea base inicial de precisión del 72,6 % mientras se avanza en la comprensión de la ingeniería de prompts para tareas numéricas complejas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un bibliotecario intentando organizar una pila enorme de cartas. Cada carta fue escrita por un robot (una IA) para describir qué tan bueno es un artículo de investigación. Los robots debían dar una calificación simple, como una puntuación de estrellas del 1 al 4.
Los robots son escritores desordenados. Algunas cartas comienzan con la puntuación, otras la esconden en medio de un párrafo, algunas dan tres puntuaciones diferentes y olvidan combinarlas, y otras simplemente divagan sin dar ninguna puntuación. Peor aún, algunos robots incluso inventan puntuaciones falsas como "95%" o "4/5" cuando las reglas solo permiten de 1 a 4 estrellas.
El Problema
Mike Thelwall, el autor de este artículo, ha reunido 1,446 de estas cartas desordenadas. Él lo llama un "conjunto de datos compartido". Su objetivo es desafiar a otros investigadores a construir un "manual de instrucciones mágico" (llamado prompt) para un nuevo robot más inteligente.
El trabajo de este nuevo robot es leer las cartas desordenadas y extraer el número correcto. Pero debe seguir dos reglas estrictas:
- Ser un Detective: Debe averiguar la puntuación correcta incluso si la carta es confusa. Si la carta menciona "Originalidad", "Significancia" y "Rigor" por separado, el robot debe saber que debe promediarlos. Si la carta no tiene una puntuación, debe decir "-1" (que significa "no lo sé").
- Ser un Robot, No un Charlatán: El robot debe solo escupir el número (como "3*" o "-1"). No puede decir: "Creo que la puntuación es 3 porque...". Si añade cualquier palabra extra, la respuesta es incorrecta.
El Desafío
Piensa en esto como un juego de "Simón Dice" jugado con un robot un poco literal pero algo confundido.
- La Puntuación Actual: El autor probó un manual de instrucciones simple, y el robot acertó aproximadamente el 73% de las veces.
- El Objetivo: El desafío es que cualquiera diseñe un mejor manual de instrucciones que obtenga una puntuación más alta.
¿Por qué hacer esto?
Este artículo no trata de usar esto para calificar ensayos de estudiantes reales o corregir diagnósticos médicos en este momento. En cambio, es un ejercicio de entrenamiento. Al obligar a los investigadores a descubrir cómo hacer que los robots extraigan números específicos de textos desordenados, aprendemos:
- Cómo hablar con los robots para que escuchen mejor (Diseño de Prompts).
- Dónde se confunden los robots y cómo arreglar esas instrucciones.
- Cómo manejar situaciones en las que el robot no está seguro (saber cuándo decir "-1" en lugar de adivinar).
La Conclusión
Este artículo es una invitación a un concurso. Dice: "Aquí hay una pila de notas de robots desordenadas y una lista de las respuestas correctas. ¿Puedes escribir el conjunto perfecto de instrucciones para que un robot lea estas notas y te dé justo el número correcto, cada vez? El ganador es la persona que logre el porcentaje más alto de respuestas correctas".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.