← Últimos artículos
⚡ electrical engineering

MURMUR: An Efficient Inference System for Long-Form ASR

Murmur es un sistema de inferencia eficiente para el reconocimiento automático del habla de largo formato que resuelve la compensación entre precisión y latencia mediante la optimización de los tamaños de los fragmentos y el empleo de una política de desalojo de caché KV de ventana deslizante, logrando una precisión de una sola pasada con una latencia significativamente reducida.

Autores originales: Wei-Tzu Lee, Keisuke Kamahori, Baris Kasikci

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Wei-Tzu Lee, Keisuke Kamahori, Baris Kasikci

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando transcribir una conversación muy larga y compleja, como una conferencia de todo un día o una serie de reuniones. Quieres que la computadora escriba exactamente lo que se dijo, quién lo dijo y cuándo lo dijo, todo sin tardar una eternidad en terminar el trabajo.

Este artículo presenta un nuevo sistema llamado MURMUR que resuelve un problema difícil: las herramientas existentes te obligan a elegir entre velocidad y precisión.

Así es como funciona MURMUR, explicado mediante analogías sencillas:

El Problema: El dilema de "Demasiado pequeño" vs. "Demasiado grande"

Actualmente, hay dos formas principales en las que las computadoras manejan el audio largo:

  1. El enfoque de "Costura" (Demasiado pequeño): Imagina que estás intentando leer un libro de 500 páginas, pero solo puedes leer 5 páginas a la vez. Lees 5 páginas, las dejas, lees las siguientes 5, y así sucesivamente. Para darle sentido a la historia, tienes que adivinar cómo se conecta el final de la página 5 con el principio de la página 6.

    • El resultado: Es muy rápido porque puedes leer muchos fragmentos pequeños a la vez. Pero a menudo aciertas mal las conexiones. Podrías pensar que un personaje en la página 6 es la misma persona que en la página 5, pero no lo es. En el habla, esto significa que la computadora se confunde sobre quién está hablando o cuándo empezó a hablar.
  2. El enfoque de "Maratón" (Demasiado grande): Imagina intentar leer todo un libro de 500 páginas de una sola sentada sin detenerte.

    • El resultado: Entiendes la historia perfectamente porque tienes todo el contexto. Pero esto requiere una cantidad masiva de tiempo y energía. Si el libro es demasiado largo, tu cerebro podría cansarse y empezar a repetir la misma frase una y otra vez (un "bucle de repetición"), haciendo que todo el intento falle.

La Solución: La magia de los dos pasos de MURMUR

MURMUR es un sistema inteligente que encuentra la zona de "punto medio". No elige entre los dos extremos; combina lo mejor de ambos usando dos trucos ingeniosos.

Truco 1: El tamaño de fragmento de la "Zona Ideal" (Nivel Inter-Fragmento)

En lugar de leer fragmentos diminutos de 5 páginas o el libro de 500 páginas completo, MURMUR decide leer fragmentos de 50 páginas a la vez.

  • La analogía: Piensa en ello como una carrera de relevos. En lugar de correr todo el maratón solo (lento) o tener a 100 personas corriendo 100 metros cada una (confuso en los relevos), tienes un equipo donde cada persona corre 50 millas sólidas.
  • Por qué funciona: El artículo descubrió que para el habla, un tamaño de fragmento de unas 300 segundos (5 minutos) es el equilibrio perfecto. Es lo suficientemente largo para mantener el contexto claro (para que la computadora sepa quién está hablando), pero lo suficientemente corto como para que la computadora pueda procesar varios fragmentos al mismo tiempo, lo que la hace mucho más rápida que leer todo de una vez.

Truco 2: El truco de la "Memoria Selectiva" (Nivel Intra-Fragmento)

Incluso con fragmentos de 5 minutos, la computadora todavía tiene que recordar todo lo que ha escuchado hasta ahora para entender la oración actual. Esto consume mucha memoria de computadora (llamada "caché KV").

  • La analogía: Imagina que estás escuchando una conferencia larga. No necesitas recordar cada una de las palabras que el orador dijo hace 10 minutos para entender lo que está diciendo justo ahora. Principalmente necesitas recordar las palabras más recientes y algunos "puntos de anclaje" clave del principio.
  • La magia: MURMUR observa la memoria de la computadora y se da cuenta de que, para la mayor parte del audio, la computadora solo está prestando atención a una fracción minúscula de las palabras que escuchó antes. Es como un reflector que solo ilumina algunas palabras específicas.
  • La acción: MURMUR expulsa cortésmente (evict) las palabras no importantes y olvidadas de la memoria a corto plazo de la computadora para hacer espacio para las nuevas. Esto mantiene a la computadora funcionando rápido sin perder la "visión general".

Los Resultados: Rápido y Preciso

Los autores probaron MURMUR con grabaciones de reuniones reales. Esto es lo que encontraron:

  • Velocidad: MURMUR es 4.2 veces más rápido que el enfoque de "Maratón" (leer todo de una vez).
  • Precisión: Es tan preciso como el enfoque de "Maratón". Identifica correctamente quién está hablando y cuándo, algo que el enfoque de "Costura" suele errar.
  • Fiabilidad: El enfoque de "Maratón" a veces falla por completo si la grabación es demasiado larga o ruidosa (quedándose atrapado en un bucle). Debido a que MURMUR divide el audio en fragmentos, si un fragmento tiene un problema, el resto de la reunión se salva.

Resumen

MURMUR es como un bibliotecario súper eficiente. En lugar de intentar leer toda la biblioteca a la vez (demasiado lento) o leer una oración a la vez y perder el hilo (demasiado impreciso), lee capítulos manejables, recuerda las partes más importantes y olvida el resto. Esto le permite transcribir conversaciones largas de forma rápida y precisa, dándote las palabras correctas, los hablantes correctos y el tiempo correcto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →