← Últimos artículos
⚡ electrical engineering

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

Este artículo presenta HALAS, el primer conjunto de datos anotado por humanos de alucinaciones de naturaleza espontánea en sistemas modernos de ASR derivados de llamadas de ganancias reales, el cual revela que los métodos de detección actuales tienen un desempeño insuficiente y establece un referente riguroso para evaluar la mitigación de alucinaciones.

Autores originales: Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un escriba muy inteligente y de alta tecnología llamado "ASR" (Reconocimiento Automático del Habla). Este escriba es contratado para escuchar a las personas hablar y escribir exactamente lo que dicen. Por lo general, este escriba es increíble. Pero a veces, cuando el audio se vuelve un poco difícil o el escriba está cansado, comienza a alucinar.

En este contexto, una alucinación no es ver fantasmas; es que el escriba escribe con confianza palabras que nunca fueron pronunciadas. Podría añadir un "gracias" cuando nadie lo dijo, repetir una oración tres veces, o inventar una oración completamente nueva que cambie el sentido de la conversación.

Aquí hay un desglose simple de lo que hicieron los investigadores en este artículo, utilizando analogías de la vida cotidiana:

1. El Problema: La prueba del "Silencio"

Anteriormente, los científicos intentaban solucionar estas alucinaciones probando a los escribas con problemas falsos. Les daban ruido estático o silencio y veían si inventaban palabras.

  • La Analogía: Es como probar la capacidad de un chef para cocinar un filete pidiéndole que cocine una piedra. Si falla, sabes que no puede cocinar piedras, pero no sabes si puede manejar un trozo de carne real y dura.
  • La Realidad: Los investigadores se dieron cuenta de que el habla del mundo real (como personas hablando unas sobre otras en una oficina concurrida) es diferente del ruido falso. Necesitaban ver cómo se comportaban los escribas en el mundo real.

2. La Solución: HALAS (El "Salón de la Fama de las Alucinaciones")

El equipo creó un nuevo conjunto de datos llamado HALAS. Piensa en esto como un "Salón de la Vergüenza" o un "Salón de la Fama" de los errores, pero específicamente para las cosas que los escribas inventaron.

  • Cómo lo construyeron: Tomaron 119 horas de grabaciones reales de llamadas de resultados corporativos (personas hablando sobre dinero y negocios).
  • La Selección "Complicada": No eligieron clips al azar. Buscaron los momentos donde siete escribas de primer nivel diferentes dieron respuestas distintas.
    • Analogía: Imagina pedirle a siete personas diferentes que describan una foto borrosa. Si todos dicen cosas diferentes, esa foto es probablemente muy difícil de ver. Los investigadores eligieron esos momentos "borrosos" porque ahí es donde los escribas tenían más probabilidades de empezar a inventar cosas.
  • El Toque Humano: Contrataron a 10 expertos humanos para que escucharan el audio y la producción del escriba. Si el escriba escribió una palabra que no estaba en el audio, el humano la marcó como una "Alucinación".

3. Lo que Encontraron: Las "Palabras Fantasma"

Cuando analizaron los datos, encontraron algunos patrones sorprendentes:

  • Todos lo hacen: Los siete modelos de IA más avanzados que probaron cometieron estos errores. Nadie fue perfecto.
  • Los Errores "Favoritos": Los escribas no cometían errores aleatorios. Seguían cometiendo los mismos errores una y otra vez.
    • Analogía: Es como un estudiante que olvida constantemente poner un punto al final de una oración. Pueden escribir "tú", "está bien", "gracias" o "sí", incluso cuando nadie dijo esas palabras. Alrededor del 55% de todas las alucinaciones fueron solo estas frases comunes.
  • Bajo Error, Alto Rieso: A veces, el escriba acertaba el 95% de las palabras (una baja "Tasa de Error de Palabra"), pero el 5% que fallaba eran mentiras totales (alucinaciones). Esto es peligrooso porque el texto parece mayormente correcto, por lo que podrías no notar la mentira.
  • Severidad: Algunos errores eran menores (añadir un "eh" o un "mmm"), pero otros eran graves (cambiar el sentido de una oración o contradecir lo que se dijo).

4. La Prueba: ¿Podemos atrapar a los mentirosos?

Los investigadores utilizaron HALAS para probar si los métodos actuales podían detectar estas alucinaciones.

  • Las Pruebas "Proxy": Intentaron usar herramientas matemáticas simples (como verificar qué tan largo es el texto o qué tan similar es al audio original).
    • Resultado: Estas herramientas estaban bien, pero no eran excelentes. Podían detectar los errores obvios y locos, pero pasaban por alto los más sutiles.
  • El Test de "IA contra IA": Intentaron usar otras IA (como Modelos de Lenguaje Extensos) para revisar el trabajo.
    • Resultado: Sorprendentemente, los métodos "libres de referencia" (que miran las señales de la actividad cerebral interna del escriba en lugar de compararlo con una "respuesta correcta") funcionaron mejor que aquellos que tenían la "respuesta correcta" frente a ellos.
  • La Puntuación: El mejor método de detección que encontraron solo detectó aproximadamente el 53% de las alaciones. Esto significa que, incluso con las mejores herramientas, todavía estamos perdiendo casi la mitad de las mentiras que cuentan los escribas.

La Conclusión Final

Este artículo presenta HALAS, el primer "conjunto de datos de alucinaciones" del mundo real donde los humanos han marcado cuidadosamente dónde los sistemas de habla a texto de IA mienten.

Encontraron que:

  1. Incluso los escribas de IA más inteligentes inventan palabras en conversaciones reales.
  2. Tienden a cometer los mismos errores específicos repetidamente.
  3. Las herramientas actuales no son muy buenas para detectar estas mentiras, especialmente cuando el resto del texto parece correcto.

El artículo concluye que HALAS es ahora el nuevo "estándar de oro" para probar qué tan bien podemos detectar estas alucinaciones de la IA, alejándonos de probar con ruido falso y moviéndonos hacia el habla humana real y desordenada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →