Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification
Este estudo demonstra que variações estocásticas não controladas em execuções nominalmente idênticas de aprendizado profundo para classificação de ressonância magnética de tumores cerebrais podem exceder as diferenças de desempenho entre distintas arquiteturas de modelos, daí minando a confiabilidade de estudos de ablação padrão e necessitando de protocolos de reprodutibilidade mais rigorosos.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo de alto risco da imagem médica, os computadores são cada vez mais solicitados a observar imagens do cérebro humano e detectar tumores. Essas imagens, chamadas de exames de ressonância magnética (RM), são complexas e detalhadas, e o software usado para analisá-las baseia-se em um tipo de inteligência artificial conhecido como aprendizado profundo (deep learning). Para treinar esses sistemas, pesquisadores alimentam-nos com milhares de imagens e deixam que o computador aprenda padrões por conta própria, ajustando suas configurações internas milhões de vezes até que se torne melhor em identificar doenças. O objetivo é criar uma ferramenta em que os médicos possam confiar para ajudar a diagnosticar condições como tumores cerebrais. No entanto, para que essa tecnologia seja segura e útil, os resultados devem ser consistentes. Se um computador receber os mesmos dados duas vezes, ele deve, idealmente, dar a mesma resposta. Quando cientistas comparam dois modelos de computador diferentes para ver qual é melhor, eles frequentemente buscam diferenças muito pequenas na precisão, às vezes apenas uma fração de um percentual, para decidir qual modelo deve avançar para testes no mundo real.
Um pesquisador da San Francisco Bay University propôs-se a testar uma ideia específica: se adicionar um tipo especial de raciocínio a um modelo de computador padrão de imagem cerebral o tornaria melhor na detecção de tumores. O modelo padrão observa a imagem diretamente, enquanto a nova versão tentava compreender as relações entre diferentes partes da imagem, de forma semelhante a como um humano poderia ligar os pontos entre características. O pesquisador construiu um experimento rigoroso para testar isso, executando os modelos de computador repetidas vezes para ver se a nova abordagem oferecia realmente uma vantagem. O que ele encontrou, no entanto, não foi um avanço na detecção de tumores, mas uma descoberta surpreendente sobre a confiabilidade do próprio processo de teste. Ele descobriu que o próprio processo de treinamento do computador era tão instável que duas execuções idênticas do exato mesmo modelo poderiam produzir resultados diferentes que eram maiores do que as minúsculas diferenças que ele estava tentando medir entre os dois modelos diferentes.
O estudo começou com uma grande coleção de fatias de RM de centenas de pacientes, dividida cuidadosamente para que os dados de um único paciente não aparecessem tanto no grupo de treinamento quanto no de teste. Isso era crucial porque, se o computador visse o tumor do mesmo paciente em ambos os grupos, ele simplesmente memorizaria aquela pessoa específica em vez de aprender a reconhecer a doença de forma geral. O pesquisador treinou um modelo padrão e uma versão mais complexa que incluía a camada extra de raciocínio. Ele executou cada versão várias vezes, alterando um número inicial aleatório, conhecido como seed (semente), para ver como os resultados variavam. No mundo da ciência da computação, essa semente serve para garantir que, se você começar com o mesmo número, o computador faça exatamente a mesma coisa todas as vezes. A expectativa era que o modelo complexo fosse ligeiramente melhor ou ligeiramente pior que o simples, e que executar o teste três vezes forneceria uma média clara.
Em vez disso, os resultados mostraram um padrão caótico. Quando o pesquisador executou o exato mesmo modelo de configuração duas vezes com o mesmo número inicial, as pontuações de precisão diferiram em mais de dois pontos percentuais em média. Essa variação foi tão grande que completamente ofuscou as pequenas diferenças entre os dois modelos diferentes que ele estava comparando. Na verdade, a diferença entre as duas execuções idênticas foi mais do que o dobro da diferença entre o modelo simples e o complexo. Isso significava que o experimento estava essencialmente medindo ruído, em vez de sinal. O pesquisador percebeu que o computador não estava se comportando como um instrumento confiável; era como se uma balança usada para pesar moedas de ouro desse uma leitura diferente toda vez que você pisasse nela, mesmo que estivesse parado exatamente no mesmo lugar.
Aprofundando a investigação, o pesquisador encontrou duas razões principais para essa falta de confiabilidade. Primeiro, o computador estava sendo configurado incorretamente. O número inicial aleatório estava sendo aplicado depois que o modelo já havia sido construído, o que significava que as configurações iniciais do modelo ainda eram aleatórias e incontroladas. Mesmo após corrigir esse erro e aplicar o número inicial antes da construção do modelo, os resultados ainda não eram perfeitamente idênticos. O segundo problema estava escondido nas profundezas do motor matemático do computador. Embora o software afirmasse estar operando em um modo perfeitamente determinístico, uma parte específica do cálculo usado para ensinar o modelo estava produzindo resultados ligeiramente diferentes a cada vez. Essa falha oculta era invisível aos controles padrão que os pesquisadores usam para garantir que seus experimentos sejam reproduzíveis.
O estudo também revelou que a maneira como os dados são divididos pode alterar dramaticamente o resultado. Quando o pesquisador dividiu os dados por fatias individuais de RM, em vez de por paciente, a precisão do computador saltou quase cinco pontos percentuais. Isso aconteceu porque o computador estava essencialmente reconhecendo padrões do mesmo paciente tanto nos conjuntos de treinamento quanto nos de teste, permitindo que ele reconhecesse o paciente em vez do tumor. Essa pontuação inflada era uma ilusidade, mascarando a verdadeira capacidade do modelo. Além disso, quando o pesquisador testou o quão bem os modelos lidavam com imagens distorcidas ou ruidosas, uma única execução de teste sugeriu que um modelo era mais robusto, mas quando o teste era repetido, o resultado invertia, mostrando que o outro modelo era melhor. Essa reversão provou que um único experimento não é suficiente para tirar uma conclusão.
A conclusão final do trabalho foi que a camada extra de raciocínio não melhorou a capacidade de detectar tumores cerebrais. O modelo complexo não era melhor e, de certa forma, era mais lento e menos confiável. Mais importante ainda, o estudo destacou uma falha crítica na forma como muitos estudos de IA médica são conduzidos. As diferenças que os pesquisadores frequentemente alegam encontrar são menores do que a variação natural do próprio processo de teste. O pesquisador argumentou que, antes de os cientistas confiarem em um novo modelo, eles devem primeiro verificar se sua configuração de teste é estável o suficiente para detectar pequenas mudanças. Isso envolve verificar se os números iniciais aleatórios são aplicados corretamente e executar o mesmo teste duas vezes para medir a variação natural. Essas verificações custam muito pouco tempo e esforço, mas são frequentemente ignoradas. Sem elas, o campo corre o risco de construir ferramentas médicas sobre fundamentos que são instáveis demais para suportar o peso das decisões clínicas. O artigo serve como um lembrete de que, na busca por uma melhor tecnologia médica, garantir que a ferramenta de medição seja precisa é tão importante quanto a própria ferramenta.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.