← Últimos artículos
💻 computer science

Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis

Este artículo propone un marco de diagnóstico multimodal que utiliza Transformadores de Espectrogramas de Audio y modelos de lenguaje-visión para analizar sonidos respiratorios y metadatos del paciente, demostrando una precisión e interpretabilidad superiores en comparación con la auscultación médica tradicional y los enfoques previos basados en CNN para el diagnóstico de asma y el monitoreo remoto.

Autores originales: Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman, Evgeny Furman

Publicado 2026-09-08
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman, Evgeny Furman

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Escuchar la respiración de un paciente es una de las herramientas más antiguas del equipo de un médico. Durante siglos, los médicos han presionado sus oídos o estetoscopios contra el pecho para detectar el sutil rastro de fluido, el silbido agudo de las vías respiratorias estrechadas o el silencio suave de unos pulmones sanos. Esta práctica, conocida como auscultación, depende enteramente del oído humano y de la experiencia de quien escucha. Aunque es invaluable, también es subjetiva; dos médicos podrían escuchar cosas diferentes en la misma respiración, y un diagnóstico puede depender en gran medida de cuánta práctica haya tenido el médico. Dado que enfermedades respiratorias como el asma afectan a millones de personas en todo el mundo, la comunidad médica ha buscado durante mucho tiempo una forma de hacer que este proceso de escucha sea más objetivo, consistente y accesible, especialmente para niños pequeños o personas en áreas remotas donde los especialistas escasean.

En años recientes, los científicos han recurrido a las computadoras para ayudar a escuchar. Al convertir el sonido de la respiración en un mapa visual llamado espectrograma —donde el tiempo transcurre a lo largo de la parte inferior y el tono sube por el lateral—, los investigadores pueden tratar una respiración como si fuera una imagen. Esto les permite utilizar potentes programas informáticos, diseñados originalmente para reconocer gatos o coches en fotografías, para identificar patrones de enfermedades. Sin embargo, estos intentos tempranos a menudo dependían de modelos computacionales más antiguos que solo observaban el sonido, ignorando el resto de la historia del paciente, como su edad o sexo. Además, comparar diferentes programas informáticos ha sido difícil porque a menudo se probaron en diferentes conjuntos de datos, lo que dificultaba saber cuál funcionaba realmente mejor.

Un equipo de investigadores de la Universidad Ben-Gurion en Israel y la Universidad Médica Estatal de Perm en Rusia se propusieron resolver estos problemas probando la nueva generación de modelos computacionales en una colección única y compartida de datos de pacientes. Querían ver si la inteligencia artificial moderna podía no solo escuchar los sonidos de la respiración, sino también comprender el contexto del paciente, imitando la forma en que un médico humano combina lo que oye con lo que sabe sobre la persona. Su trabajo se centra en distinguir entre pacientes con asma y aquellos sin ella, una tarea crítica para gestionar una condición que afecta hasta al 29 por ciento de la población en varios países.

Los investigadores recopilaron un gran conjunto de grabaciones de más de 1,300 participantes, que iban desde bebés hasta adultos. Estas grabaciones capturaron el sonido de la respiración tranquila en cuatro puntos diferentes del cuerpo: la boca, la tráquea, el pecho y la espalda. Cada grabación iba acompañada de información estructurada sobre el paciente, incluyendo su edad, sexo y el lugar donde se tomó el sonido. El equipo introdujo estos datos en tres tipos diferentes de modelos computacionales para ver cuál podía diagnosticar el asma con mayor precisión.

El primer modelo que probaron fue un tipo de programa informático bien establecido conocido como red neuronal convol로cional, específicamente una versión llamada DenseNet201. Este modelo había sido utilizado en su trabajo previo y servía como una base de referencia fiable. Observaba únicamente el mapa visual del sonido, ignorando los detalles personales del paciente. El segundo modelo era un sistema de vanguardia llamado Transformador de Espectrograma de Audio (Audio Spectrogram Transformer). Este modelo fue diseñado específicamente para comprender patrones de sonido y fue entrenado con vastas bibliotecas de audio antes de ser adaptado a esta tarea médica. El tercer modelo era un sistema multimodal de visión y lenguaje llamado Moondream2. Este era el intento más ambicioso; estaba diseñado para observar el mapa de sonido mientras leía simultáneamente una descripción textual de la edad, el sexo y la ubicación de la grabación del paciente, con la esperanza de que combinar estos dos flujos de información condujera a un mejor diagnóstico.

Los resultados revelaron un claro ganador. El modelo de sonido especializado, el Transformador de Espectrograma de Audio, superó a todos los demás con una precisión notable. Logró una tasa de éxito del 98.7% en cuanto a precisión, sensibilidad, especificidad y puntuación F1, con un Índice de Youden de 0.974. Este rendimiento fue significativamente mayor que el del modelo DenseNet más antiguo, que fue correcto aproximadamente el 87 por ciento de las veces. El modelo multimodal, Moondream2, funcionó de manera similar al modelo más antiguo, logrando aproximadamente un 86.5 por ciento de precisión. Curiosamente, los investigadores descubrieron que el modelo multimodal dependía en gran medida de la información textual que se le proporcionaba. Cuando eliminaron la edad y el sexo del paciente de la entrada, la capacidad del modelo para diagnosticar el asma colapsó, produciendo errores en cada uno de los casos de asma. Esto sugirió que, si bien el modelo podía usar el texto para tomar una decisión, le costaba aprender los patrones de sonido por sí mismo de manera tan efectiva como el modelo construido específicamente para audio.

El estudio también exploró cómo estos modelos computacionales toman sus decisiones, un paso crucial para ganar la confianza de los médicos. Para el modelo más antiguo, los investigadores pudieron utilizar una técnica que resalta las partes específicas del mapa de sonido que activaron el diagnóstico, de forma muy parecida a un mapa de calor que muestra dónde se enfocó una cámara. Para el nuevo modelo de sonido, analizaron los mecanismos de atención interna para ver en qué partes del sonido se estaba enfocando la computadora. Descubrieron que ambos modelos se centraban en el mismo rango de frecuencia, aproximadamente entre 800 y 1800 hercios, particularmente durante el tercer ciclo de una respiración. Esta consistencia sugiere que las computadoras no están adivinando al azar, sino que están detectando realmente las mismas características acústicas físicas que los médicos escuchan.

Los investigadores concluyeron que, si bien combinar los detalles del paciente con el análisis del sonido es un paso lógico, la generación actual de modelos de propósito general que intentan hacer ambas cosas puede no ser tan efectiva como un modelo diseñado específicamente para el sonido. El modelo de audio especializado demostró que podía aprender los matices de la enfermedad respiratoria a partir del sonido por sí solo, superando el rendimiento de la auscultación humana reportada en la literatura médica. Los hallazgos sugieren que el futuro del diagnóstico asistido por computadora podría residir en el uso de herramientas altamente especializadas para tareas específicas, en lugar de intentar construir un único sistema que lo haga todo. Estos modelos ofrecen un camino prometedor hacia el monitoreo continuo y remoto de los pacientes, permitiendo potencialmente la detección temprana de ataques de asma y una atención más consistente para las personas en todas partes, independientemente de su acceso a un especialista.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →