User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models
Este artículo investiga el potencial de utilizar Modelos de Lenguaje Grandes para analizar opiniones de usuarios en busca de requisitos de usabilidad, demostrando mediante un conjunto de datos codificado y ingeniería de prompts que los Modelos de Lenguaje Grandes pueden lograr un rendimiento comparable al humano en la identificación de problemas de usabilidad, siempre que los prompts estén cuidadosamente diseñados.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres el chef de un restaurante concurrido. Quieres saber exactamente qué piensan tus clientes sobre tu comida para poder mejorar tu menú. Podrías contratar a un equipo de críticos gastronómicos profesionales para que prueben cada plato y redacten informes detallados, pero eso es costoso y lento. Alternativamente, podrías simplemente leer las miles de reseñas desordenadas, emocionales y a veces confusas que las personas dejan en tu sitio web.
Este artículo trata sobre intentar enseñar a una computadora superinteligente (llamada Modelo de Lenguaje Grande, o LLM) a leer esas reseñas desordenadas y encontrar aquellas que realmente hablan sobre usabilidad, es decir, qué tan fácil o difícil es usar la aplicación.
Aquí está la historia de su experimento, explicada de forma sencilla:
El Problema: Demasiado Ruido, Poco Tiempo
Las empresas de software se ahogan en reseñas de usuarios. La gente escribe cosas como: "¡Esta aplicación es una pesadilla!", "¡Hice clic tres veces y aún no funcionó!" o "Me encanta la nueva función, pero el botón es demasiado pequeño".
- La Vieja Forma: Para encontrar las quejas útiles, los investigadores solían entrenar computadoras usando Aprendizaje Automático. Pero esto era como intentar enseñarle a un perro a traer algo lanzándole miles de palos y esperando que aprendiera. Requería una cantidad masiva de trabajo humano para etiquetar los datos primero.
- La Nueva Idea: ¿Y si simplemente le pedimos a una computadora superinteligente (la LLM) que lea las reseñas y nos diga cuáles tratan sobre "usabilidad"? Estas computadoras ya están entrenadas con todo internet, por lo que podrían entender el contexto sin que tengamos que enseñarles desde cero.
El Experimento: La "Prueba de Sabor"
Los investigadores de Alemania organizaron una prueba controlada para ver si la computadora podía hacer el trabajo tan bien como un experto humano.
Los Ingredientes: Recopilaron 300 reseñas reales de usuarios de tres tipos muy diferentes de aplicaciones:
- Una aplicación de tráfico/radar (para conductores).
- Una aplicación de supermercado (para compradores).
- Una aplicación de creación musical (para músicos).
- ¿Por qué estas tres? Para asegurarse de que la computadora no fuera buena solo con un tipo específico de lenguaje.
Los Jueces Humanos: Dos expertos humanos leyeron las 300 reseñas. Utilizaron una lista de verificación famosa (las 10 Heurísticas de Usabilidad de Nielsen) para decidir si una reseña trataba sobre "usabilidad" (Verdadero) o no (Falso). Discutieron sobre las difíciles hasta llegar a un acuerdo. Esto creó la clave de respuestas "Estándar de Oro".
El Estudiante Computador: Le dieron a la LLM un conjunto de instrucciones (llamado un Prompt). Piensa en este prompt como una receta.
- Primer intento: La receta era vaga. La computadora se confundió.
- Segundo y tercer intentos: Los investigadores refinaron la receta, añadiendo pasos más específicos y ejemplos (como decirle a la computadora: "Si alguien dice que la aplicación es 'engorrosa', eso cuenta como un problema de usabilidad").
- La Prueba Final: Le dieron a la computadora la receta final, pulida, y le pidieron que calificara las 300 reseñas.
Los Resultados: Un Estudiante Prometedor, Pero Imperfecto
Los investigadores compararon las calificaciones de la computadora con la clave de respuestas de los expertos humanos.
- La Buena Noticia: La computadora fue sorprendentemente buena encontrando las reseñas "Verdaderas". No se perdió muchas quejas de usabilidad. Si un humano decía: "Esto es un problema de usabilidad", la computadora generalmente estaba de acuerdo.
- La Mala Noticia: La computadora estaba un poco demasiado entusiasta. A veces marcaba reseñas como "problemas de usabilidad" cuando los humanos pensaban que eran solo quejas generales o errores.
- La Verificación de Fiabilidad: Cuando midieron con qué frecuencia la computadora y los humanos coincidían en la respuesta exactamente igual, los resultados fueron mixtos.
- Para la aplicación de música, coincidieron bastante bien.
- Para las aplicaciones de tráfico y supermercado, discreparon con más frecuencia.
- Crucialmente, los errores de la computadora no ocurrieron en los mismos lugares donde los humanos estaban inseguros. La computadora estaba cometiendo sus propios errores únicos, lo que significa que aún no estaba "pensando" perfectamente como un experto humano.
La Conclusión: Un Asistente Útil, No un Reemplazo
El artículo concluye que, aunque la computadora no está lista para reemplazar por completo a los expertos humanos, es una herramienta muy útil.
Piensa en la LLM como un becario súper rápido.
- Si le pides al becario que lea 1.000 reseñas, encontrará casi todas y cada una de las quejas sobre usabilidad.
- También podría marcar algunas cosas que en realidad no son problemas de usabilidad (falsas alarmas), pero los investigadores argumentan que es mejor tener algunas reseñas extra para revisar que perder un problema real.
- La clave para que el becario funcione bien fue el Prompt (las instrucciones). Una instrucción vaga llevó a malos resultados; una instrucción detallada y cuidadosamente elaborada llevó a buenos resultados.
En resumen: Ya no necesitas pasar meses entrenando a una computadora para leer reseñas. Solo necesitas darle a una computadora inteligente un conjunto de instrucciones muy claras, y puede hacer un gran trabajo ayudándote a encontrar lo que tus usuarios realmente necesitan. Sin embargo, aún necesitas que un humano verifique el trabajo, especialmente en casos difíciles.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.