Assessing Task-based Chatbots: Snapshot and Curated Datasets for Dialogflow
Este artículo presenta TOFU-D y COD, dos conjuntos de datos que comprenden 1.788 y 185 chatbots de Dialogflow respectivamente, para abordar la escasez de recursos curados para la investigación empírica, mientras que el análisis preliminar revela brechas significativas en la cobertura de pruebas y vulnerabilidades de seguridad frecuentes que subrayan la necesidad de estudios sistemáticos multiplataforma sobre la calidad y la seguridad de los chatbots.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el mundo de los chatbots como una ciudad enorme y bulliciosa. Durante mucho tiempo, los investigadores que estudian cómo construir chatbots mejores, más seguros y más fiables han intentado navegar por esta ciudad, pero han estado trabajando con un mapa muy incompleto. La mayoría del tiempo han estado observando unos pocos vecindarios pequeños y de código abierto (como el distrito "Rasa"), pero realmente no han explorado el gran centro comercial, donde viven los chatbots de uso profesional y comercial.
Este artículo es como un equipo de planificadores urbanos que finalmente ha decidido tomar una instantánea de todo ese centro comercial. Esto es lo que hicieron, explicado de forma sencilla:
1. La Gran Instantánea (TOFU-D)
Los investigadores fueron a GitHub (una biblioteca gigante en línea donde la gente guarda su código) y buscaron cualquier cosa etiquetada como "Dialogflow". Dialogflow es una herramienta comercial popular creada por Google que las empresas utilizan para construir chatbots.
- La Búsqueda: Comenzaron con más de 12.000 posibles "edificios" (repositorios).
- El Filtro: Se dieron cuenta de que muchos de estos eran solo terrenos baldíos o sitios de construcción, no chatbots reales. Filtraron el ruido y encontraron 1.788 "edificios" de chatbots reales y funcionales.
- El Resultado: Crearon un conjunto de datos llamado TOFU-D. Piensa en esto como un álbum de fotos masivo y sin editar de cada chatbot que pudieron encontrar en ese distrito específico en un día determinado. Muestra la realidad pura: algunos son diminutos, otros son enormes, algunos son desordenados y otros son brillantes.
2. El Recorrido Curado (COD)
Mirar 1.788 chatbots es abrumador, y muchos son solo ejemplos "de juguete" o prototipos rotos. Para que esto sea útil para la investigación seria, el equipo creó un segundo conjunto de datos más pequeño llamado COD.
- La Selección: Actuaron como curadores de un museo. No eligieron chatbots al azar; eligieron los que realmente estaban haciendo algo interesante. Buscaron chatbots que:
- Tuvieran una conversación real (no solo una lista de respuestas preescritas).
- Se conectaran con servicios externos (como un bot de restaurante que realmente consulta una base de datos de menús).
- Estuvieran escritos en inglés (para que los investigadores pudieran entenderlos).
- Fueran lo suficientemente populares como para tener una "estrella" en su página de GitHub.
- El Resultado: Terminaron con 185 chatbots de alta calidad. Esta es su colección del "Salón de la Fama", diseñada para ser los sujetos de prueba perfectos para estudiar cómo funcionan estos bots y dónde fallan.
3. Lo que Encontraron en la Ciudad
Cuando los investigadores recorrieron estos chatbots, notaron algunas cosas interesantes sobre la "arquitectura" de esta ciudad:
- Mezcla de Idiomas: Aunque la mayoría de los chatbots hablan inglés, la ciudad es sorprendentemente diversa. El código detrás de ellos está escrito en muchos idiomas diferentes (JavaScript, Python, Java, etc.), a diferencia del vecindario de código abierto donde casi todos hablaban principalmente Python.
- Complejidad: Los chatbots curados (COD) eran mucho más complejos. No solo decían "Hola" y "Adiós"; realmente realizaban tareas, se conectaban a servicios en la nube y manejaban datos reales de usuarios.
- La Conexión con "Google": Muchos de estos chatbots fueron construidos para trabajar de forma fluida con las propias herramientas de Google, como el Asistente de Google, que es una característica que no se ve tan a menudo en el distrito de código abierto.
4. La Inspección de Seguridad (Los controles de "Bandit" y "Botium")
Para ver si estos chatbots eran seguros y fiables, los investigadores realizaron dos pruebas rápidas, como un inspector de edificios y un gerente de control de calidad:
- El Control de Calidad (Botium): Intentaron generar casos de prueba automáticamente (como un robot intentando hablar con el chatbot para ver si se rompe). Descubrieron que las pruebas a menudo faltaban. Los chatbots eran excelentes para responder preguntas simples, pero a menudo fallaban cuando los usuarios decían "Hola", intentaban decir algo inesperado o necesitaban recordar lo que se había dicho anteriormente. Era como encontrar un coche que conduce de maravilla en una carretera recta pero se detiene ante la primera señal de stop.
- El Control de Seguridad (Bandit): Buscaron agujeros de seguridad en el código. Descubrieron que muchos chatbots tenían "puertas abiertas". Por ejemplo:
- Algunos estaban escuchando conexiones de cualquier red, no solo de las que deberían.
- Algunos permitían la ejecución de código que no debería ejecutarse.
- También encontraron errores comunes, como olvidar establecer límites de tiempo para las solicitudes (lo que puede congelar el sistema) o usar generadores de números aleatorios débiles.
La Conclusión
El punto principal de este artículo es que los investigadores ya no pueden limitarse a estudiar unos pocos chatbots simples. El mundo de los chatbots es enorme y variado. Al proporcionar estos dos nuevos conjuntos de datos —la instantánea masiva (TOFU-D) y la lista curada de alta calidad (COD)— los autores están entregando a la comunidad de investigación un mapa mucho mejor y un mejor conjunto de sujetos de prueba.
No están diciendo que estos chatbots sean perfectos; de hecho, sus pruebas muestran que tienen fallos significativos en cuanto a pruebas y seguridad. Pero al tener una colección clara, grande y diversa de ejemplos del mundo real, los investigadores finalmente pueden empezar a solucionar esos fallos de forma sistemática, en lugar de adivinar basándose en unos pocos ejemplos pequeños.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.