Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review
Esta revisão de escopo de 49 estudos de XAI clínica revela que as avaliações priorizam esmagadoramente a confiança e as percepções do usuário em detrimento de capacidades críticas de supervisão, como a detecção de falhas e de vieses, baseando-se fortemente em medidas não validadas e raramente avaliando o desempenho em sistemas implantados.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Nos hospitais modernos, os médicos dependem cada vez mais de programas de computador para ajudar a diagnosticar doenças e sugerir tratamentos. Essas ferramentas, construídas sobre modelos matemáticos complexos, podem processar vastas quantidades de dados de pacientes mais rapidamente do que qualquer ser humano. No entanto, esses modelos frequentemente funcionam como uma "caixa preta", oferecendo uma recomendação sem explicar como chegaram àquela conclusão. Para corrigir essa opacidade, pesquisadores desenvolveram um campo chamado inteligência artificial explicável. O objetivo é simples: fornecer o raciocínio do computador junto com sua resposta, tal como um médico mostrando seu raciocínio em um quadro negro. A esperança é que, ao ver a lógica por trás de uma sugestão, um clínico possa decidir se deve confiar nela, detectar um erro ou anulá-la caso o conselho seja perigoso. Essa capacidade de verificar e corrigir a máquina é conhecida como supervisão humana, e é considerada essencial para a segurança em decisões médicas de alto risco.
Uma nova revisão de pesquisas científicas, no entanto, sugere que a forma atual como testamos essas explicações está negligenciando a parte mais crítica do trabalho. Nicolas Frey e seus colegas da Charité – Universitätsmedizin Berlin examinaram quarenta e nove estudos publicados entre 2015 e o início de 2026 que testaram como médicos e estagiários de medicina interagem com essas ferramentas explicáveis. Os pesquisadores queriam saber se os estudos realmente provavam que as explicações ajudam os clínicos a detectar erros, ou se estavam apenas medindo o quanto os clínicos gostavam da aparência da explicação. Eles encontraram uma lacuna significativa. Embora os estudos frequentemente perguntassem aos médicos se consideravam as explicações confiáveis ou fáceis de entender, eles quase nunca testavam se essas explicações realmente ajudavam os médicos a identificar quando o computador estava errado.
A revisão mapeou exatamente o que esses quarenta e nove estudos mediram. Os resultados mostraram um foco pesado em sentimentos e percepções. Em quarenta e dois dos estudos, os pesquisadores perguntaram aos participantes o quanto eles confiavam no sistema. Em trinta e quatro estudos, perguntaram se as explicações eram úteis e, em trinta e três, perguntaram se eram compreensíveis. Essas perguntas baseiam-se no autorrelato, onde um médico simplesmente diz: "Eu me sinto confiante nesta resposta". Os pesquisadores descobriram que apenas uma pequena fração dos estudos foi além para testar o comportamento real. Apenas três estudos testaram se um médico conseguiria detectar uma falha específica na lógica do computador, e apenas um estudo testou se um médico conseguiria reconhecer um viés sistemático nos conselhos do sistema. Talvez o mais impressionante seja que nenhum estudo testou se um médico conseguiria prever corretamente o que o computador faria em uma nova situação, uma habilidade que seria fundamental para uma verdadeira compreensão.
As evidências sugerem que o cenário atual de pesquisa prioriza o sentimento de segurança sobre a mecânica da segurança. A maioria dos estudos ocorreu em ambientes controlados e simulados, em vez de hospitais reais e movimentados. Nessas simulações, os médicos eram frequentemente apresentados com conselhos corretos e incorretos do computador, mas os estudos raramente mediam se os médicos rejeitavam com sucesso o conselho errado. Em vez disso, frequentemente mediam se os médicos concordavam com o computador, sem saber se essa concordância era com uma resposta certa ou errada. Os pesquisadores observaram que um médico pode relatar alta confiança em um sistema e ainda assim seguir cegamente uma recomendação perigosa, ou pode se sentir confuso por uma explicação, mas ainda assim tomar a decisão correta ao ignorar o computador. Como os estudos focaram tão intensamente no primeiro caso — o que os médicos diziam sentir —, eles forneceram pouca evidência de que as explicações realmente ajudavam os médicos a detectar erros quando o computador estava errado.
Além disso, os métodos usados para coletar esses dados foram frequentemente fracos. Mais da metade das medições baseou-se em perguntas ad-hoc ou escalas não verificadas, em vez de ferramentas estabelecidas e cientificamente testadas. Apenas dez de duzentos e cinquenta e três pontos de dados da revisão utilizaram um instrumento validado, que é um teste padrão e confiável para aspectos como confiança ou satisfação. A vasta maioria dos dados veio de simples questionários onde os médicos classificavam sua experiência em uma escala. A revisão também destacou que apenas dois dos quarenta e nove estudos analisaram sistemas que foram de fato implementados e utilizados em ambientes clínicos reais. O restante foram experimentos onde o comportamento do computador era controlado pelos pesquisadores, o que significa que não sabemos se as explicações se sustentam quando um médico está sob pressão de tempo, cansado ou lidando com um caso de paciente complexo.
Os autores argumentam que esse desequilíbrio cria uma falsa sensação de segurança. Eles apontam que a confiança é uma atitude, enquanto a supervisão é uma ação. Um médico pode se sentir muito confiante em um sistema, mas ainda assim falhar ao não anular uma recomendação errada. Para saber verdadeiramente se uma explicação é segura, os pesquisadores precisam testar comportamentos específicos: O médico consegue prever o que o computador dirá a seguir? Ele consegue detectar um erro quando o computador está errado? Ele consegue reconhecer quando o computador é tendencioso contra um determinado grupo de pacientes? A revisão descobriu que essas habilidades específicas, críticas para a segurança, estavam quase totalmente ausentes da literatura atual. Os estudos nos mostraram como as explicações parecem para um clínico, mas não mostraram se essas explicações o ajudam a desempenhar melhor o seu trabalho quando a máquina falha.
O artigo conclui que, para que a inteligência artificial explicável seja verdadeiramente útil e segura, a forma como a testamos deve mudar. Estudos futuros precisam ir além de perguntar aos médicos como eles se sentem e começar a testar o que eles realmente fazem. Isso significa projetar experimentos onde a correção do computador seja manipulada para ver se os médicos conseguem distinguir o certo do errado. Significa usar ferramentas comprovadas e confiáveis para medir atitudes, em vez de apenas supor com base em simples questionários. Finalmente, significa testar esses sistemas no mundo real, ao longo do tempo, para ver se as explicações continuam a apoiar a tomada de decisão adequada quando os riscos são altos e a pressão é real. Até que essas mudanças ocorram, a comunidade médica terá uma visão clara de quanto os médicos gostam das explicações, mas pouquíssimas provas de que essas explicações realmente mantêm os pacientes seguros.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.