← Últimos artículos
💬 NLP

Hearsay: Vision-Language Medical Diagnoses Without an Image

Este artículo demuestra que los modelos de visión y lenguaje de vanguardia confabulan sistemáticamente diagnósticos médicos estructurados basándose únicamente en la demografía del paciente cuando no se proporciona ninguna imagen, revelando modos de falla distintos y no aleatorios en diferentes modelos y resaltando la necesidad crítica de auditar las salidas estructuradas y sondear la sensibilidad de las palabras en despliegues clínicos.

Autores originales: Siddharth Vohra

Publicado 2026-07-30
📖 1 min de lectura☕ Lectura para el café

Autores originales: Siddharth Vohra

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Hearsay: Diagnósticos Médicos de Lenguaje-Visión Sin una Imagen

Declaración del Problema

Este artículo investiga un modo de falla crítico en los modelos de lenguaje-visión (VLM) de frontera dentro de los flujos de trabajo clínicos: el "efecto espejismo" (mirage effect). Este fenómeno ocurre cuando un VLM genera descripciones visuales y diagnósticos médicos a pesar de la ausencia de una imagen adjunta. Si bien trabajos previos (Asadi et al. [1]) establecieron que los VLMs a menudo fallan al abstenerse en estas condiciones, este estudio aborda una brecha en la comprensión de la estructura de estas alucinaciones. Específicamente, el artículo se pregunta si los diagnósticos fabricados son aleatorios o están sistemáticamente influenciados por los descriptores demográficos proporcionados en el prompt (por ejemplo, edad, sexo, raza) cuando no hay una imagen presente. Los autores postulan que los flujos de trabajo clínicos pueden enfrentar escenarios donde las imágenes no se recuperan o los agentes solo pasan descriptores del paciente, creando un entorno de alto riesgo para el sesgo demográfico en los resultados alucinados.

Metodología

El estudio emplea un diseño experimental controlado a través de tres VLMs de frontera: Claude Opus 4.7, GPT-5.4 y Gemini 3.1 Pro.

  • Diseño de Prompt: Los autores utilizan una plantilla de prompt de modo espejismo modificada, derivada de Asadi et al. [1]. El prompt incluye un preámbulo demográfico en primera persona (por ejemplo, "Soy un/a {sexo} de {edad} años de edad, de raza {raza}") seguido de una solicitud para describir una imagen y proporcionar un diagnóstico. Las modalidades probadas son radiografía de tórax, RM cerebral y dermatología (específicamente "lunar en la piel").
  • Condiciones Experimentales: Se utilizó un diseño factorial de 2×2×32 \times 2 \times 3, variando la edad (32, 65), el sexo (hombre, mujer) y la raza (blanca, negra, morena), lo que resultó en 12 celdas demográficas más una línea base neutral (D0) sin texto demográfico.
  • Esquema de Salida: Las respuestas se forzaron a un esquema JSON estricto que contiene campos para la presencia de la imagen, capacidad diagnóstica, diagnóstico primario, diferenciales, confianza y razonamiento. Esto permitió la separación de la "prosa" (razonamiento) de los resultados "estructurados" (campo de diagnóstico).
  • Métricas: La métrica principal es la Divergencia de Jensen-Shannon (JSD) entre la distribución de los diagnósticos en las celdas demográficas frente a la línea base neutral. Los análisis secundarios incluyeron la detección del "espejismo con cautela" (hedged mirage) (donde la prosa reconoce la ausencia de imágenes pero el campo estructurado está poblado) y la robustez del sustantivo de prueba (cambiar "lunar en la piel" por "lesión en la piel").
  • Escala: El experimento principal (E1) involucró 11,700 llamadas a la API (3 modelos×3 dominios×13 condiciones×100 semillas3 \text{ modelos} \times 3 \text{ dominios} \times 13 \text{ condiciones} \times 100 \text{ semillas}).

Contribuciones Clave

El artículo presenta cuatro contribuciones principales:

  1. Sesgo Demográfico Estructurado: Evidencia de que los resultados en modo espejismo no son aleatorios, sino que están sistemáticamente estructurados por el texto demográfico. Las JSD por celda alcanzaron hasta 0.83, con los diagnósticos principales alineándose con patrones de sesgo clínico documentados (por ejemplo, Sarcoidosis para pacientes negros, Melanoma para hombres blancos de edad avanzada).
  2. El Régimen de Espejismo con Cautela (Hedged Mirage): La identificación de una disociación donde el razonamiento en prosa del modelo reconoce la imagen faltante (sugiriendo una negativa), pero el campo de diagnóstico estructurado se puebla con una enfermedad específica. Este estado "con cautela" representa el 66% de las fabricaciones de Claude en las celdas de alto JSD y permanece invisible para las auditorías basadas solo en prosa.
  3. Diversos Modos de Falla: Un análisis de robustez de sustantivos de prueba que revela que el espejismo es una familia de distintos modos de falla. El efecto de dermatología de Claude fue activado por palabras (cambiar "lunar en la piel" por "lesión en la piel" causó una caída del 94% en los diagnósticos de Melanoma hacia una negativa del 100%), mientras que el efecto de GPT-5.4 fue preservador de la categoría (los diagnósticos se mantuvieron estables a pesar del cambio de sustantivo).
  4. Medición de Doble Canal: Un flujo de trabajo que extrae esquemas JSON nativos junto con el análisis de prosa, haciendo que el "régimen con cautela" sea directamente observable y cuantificable.

Resultados

  • Estructuración Demográfica: Los tres modelos exhibieron sesgo demográfico, aunque con magnitudes variables.
    • GPT-5.4 fabricó diagnósticos en 36/36 celdas factoriales. Su sesgo fue amplio, con un fuerte desplazamiento hacia la Sarcoidosis para pacientes negros jóvenes en radiografías de tórax y cambios de enfermedades específicas para RM basados en edad y sexo (por ejemplo, Meningioma para mujeres mayores, Glioma para hombres mayores).
    • Claude Opus 4.7 mostró una transición de "negativa a fabricación". Se negó ante la mayoría de los prompts neutrales, pero fabricó intensamente en celdas específicas (por ejemplo, 94% Melanoma para un hombre blanco de 65 años con un "lunar en la piel"). La JSD fue impulsada casi enteramente por esta transición de la negativa a la fabricación.
    • Gemini 3.1 Pro mostró las magnitudes más bajas (mediana de JSD 0.010), con la mayoría de las celdas mostrando 0% de fabricación.
  • El Régimen con Cautela: En la condición "con cautela", los modelos escribían razonamientos como "sospechado, basado en la demografía y el patrón clásico" mientras seguían poblando el campo de diagnóstico estructurado. Una auditoría basada solo en prosa marcaría estos como negativas o seguros, mientras que un flujo de datos estructurados recibiría un diagnóstico sesgado.
  • Robustez: El intercambio de "lunar en la piel" por "lesión en la piel" demostró que el sesgo de Claude era frágil y dependiente de palabras disparadoras específicas, mientras que el sesgo de GPT-5.4 era robusto a los cambios de fraseo.
  • Señal vs. Ruido: La señal demográfica (JSD) superó significativamente el umbral de ruido de paráfrasis (ratios de 10.5x a 13.9x), confirmando que el sesgo es impulsado por los descriptores demográficos en lugar de variaciones superficiales de fraseo.

Significancia y Reivindicaciones

El artículo argumenta que el despliegue confiable de los VLM en entornos clínicos requiere un cambio fundamental en las prácticas de auditoría.

  • Limitaciones de Auditoría: Confiar únicamente en auditorías de lenguaje natural (prosa) es insuficiente porque ignora el "régimen con cautela" donde los campos estructurados se pueblan a pesar de las advertencias textuales.
  • Dimensiones de Evaluación: La sensibilidad de la palabra de prueba debe tratarse como una "dimensión de evaluación de primera clase". Los modelos pueden parecer robustos si se prueban con una sola palabra de prueba, mientras fallan catastróficamente con ligeras variaciones (como se vio con Claude), o viceversa.
  • Naturaleza del Error: Los autores distinguen entre dos errores: (1) Miscalibración epistémica (emitir un diagnóstico sin evidencia) y (2) Desplazamiento demográfico (el diagnóstico específico emitido basado en la demografía). Aunque el artículo no desentraza si estos cambios provienen del sesgo de preentrenamiento o de los priors de prevalencia calibrados (por ejemplo, mayor incidencia de melanoma en hombres blancos de edad avanzada), afirma que la disociación entre la prosa y el resultado estructurado es un modo de falla crítico independientemente del origen del prior.

El estudio concluye que mitigar estos riesgos requiere restricciones a nivel de esquema (por ejemplo, forzar diagnósticos nulos cuando image_present=false), sondeo en tiempo de inferencia y un ajuste fino (fine-tuning) para que se nieguen cuando las imágenes están ausentes. Los hallazgos sugieren que el espejismo no es un fenómeno monolítico, sino una familia de modos de falla que requieren distintas estrategias de mitigación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →