← Últimos artigos
📊 statistics

Impact of Missing Data Imputation on The Structure of Real-World Clinical Datasets: A Comparison of Median, K-Nearest Neighbours, and MICE Approaches

Este estudo demonstra que a imputação por k-vizinhos mais próximos (KNN) supera tanto a substituição pela mediana quanto a imputação múltipla por equações encadeadas (MICE) na preservação da fidelidade distributiva e da integridade estrutural multivariada de conjuntos de dados clínicos do mundo real através de vários níveis de ausência de dados.

Autores originais: Karol Aguiar Quevedo, Alilis Fontana Bellorín, Carlos Jordá Jordá Aragón, Cristóbal Aguilar-Gallardo

Publicado 2026-08-24
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Karol Aguiar Quevedo, Alilis Fontana Bellorín, Carlos Jordá Jordá Aragón, Cristóbal Aguilar-Gallardo

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da pesquisa médica, os dados são o sangue que alimenta a descoberta. Médicos e cientistas dependem de registros de histórico de pacientes, resultados de exames laboratoriais e desfechos de tratamentos para compreender doenças e melhorar os cuidados. No entanto, os registros médicos do mundo real raramente são perfeitos. Pacientes perdem consultas, máquinas falham ou médicos simplesmente esquecem de anotar uma medição específica. Essas lacunas, conhecidas como dados ausentes, criam um problema: se um pesquisador tentar analisar uma lista de números com buracos nela, os resultados podem ser enganosos ou impossíveis de calcular. Para corrigir isso, os pesquisadores frequentemente preenchem as lacunas usando um processo chamado imputação. A forma mais comum, e simples, de fazer isso é observar todos os números que possuem para uma medição específica, encontrar o valor central e colar esse mesmo número em cada espaço vazio. Embora seja fácil de fazer, isso tem uma falha conhecida: achata a variedade natural dos dados, fazendo com que um grupo diversificado de pacientes pareça mais idêntico do que realmente é. Uma abordagem mais sofisticada envolve o uso de modelos computacionais complexos para adivinhar quais seriam os números ausentes com base em como eles se relacionam com outras informações sobre o paciente. A questão que enfrenta a comunidade científica é se o método simples é bom o suficiente, ou se o método complexo é necessário para manter os dados honestos.

Uma equipe de pesquisadores de Valência, Espanha, partiu para responder a essa pergunta testando três maneiras diferentes de preencher as lacunas em registros médicos reais. Eles não criaram dados falsos para testar suas teorias; em vez disso, usaram duas grandes coleções reais de informações de pacientes. O primeiro grupo consistia de 408 pacientes que haviam passado por transplantes de pulmão, um procedimento complexo onde os médicos monitoram dezenas de medições antes, durante e após a cirurgia. O segundo grupo incluiu 1.700 pacientes que sofreram um ataque cardíaco, com registros detalhando seus sinais vitais e histórico médico. Em ambos os grupos, muitos números estavam ausentes. No grupo de transplante de pulmão, algumas medições estavam ausentes de tão pouco quanto 0,2% dos pacientes até tanto quanto 77,9% dos pacientes. No grupo de ataque cardíaco, os dados ausentes variavam de 0,24% a mais de 63%. Os pesquisadores queriam ver qual método de preenchimento dessas lacunas preservava melhor a verdadeira forma e as relações dos dados originais.

A equipe comparou três estratégias específicas. A primeira foi a abordagem padrão e simples: substituir cada número ausente pela mediana, ou valor central, dos números que foram realmente registrados. O segundo método foi chamado de k-vizinhos mais próximos (k-nearest neighbours), que funciona encontrando os pacientes no banco de dados que são mais semelhantes ao que possui o dado ausente e usando seus valores para fazer um palpite. O terceiro foi uma técnica estatística altamente complexa conhecida como imputação múltipla, que executa uma série de modelos sofisticados para gerar várias versões diferentes possíveis dos dados ausentes e, então, faz a média delas. Os pesquisadores mediram o quão próximo o dado preenchido correspondia aos dados originais e completos usando uma régua estatística que verifica se a distribuição dos números parece a mesma. Eles também verificaram se as relações entre diferentes variáveis, como a relação entre idade e pressão arterial, permaneciam intactas.

Os resultados foram surpreendentes para muitos que esperam que o método mais complexo seja sempre o melhor. O método simples de usar o valor central de fato distorceu os dados, comprimindo a variedade de números e fazendo o conjunto de dados parecer menos diverso do que realmente era. No entanto, o modelo estatístico complexo de várias etapas teve um desempenho ainda pior neste teste específico. Ele introduziu os maiores erros e alterou as relações entre as variáveis mais do que qualquer outro método. O método que teve o melhor desempenho foi a abordagem de k-vizinhos mais próximos. Ele preservou a dispersão natural dos dados e manteve as relações entre diferentes medições médicas mais precisas do que tanto o método simples de valor central quanto o modelo complexo. No grupo de transplante de pulmão, o modelo complexo distorceu quase 39% das variáveis, enquanto o método de k-vizinhos mais próximos distorceu apenas cerca de 11%. No grupo de ataque cardíaco, o modelo complexo distorceu 39% das variáveis, enquanto o método de k-vizinhos mais próximos distorceu apenas 11%.

Os pesquisadores descobriram que, à medida que a quantidade de dados ausentes aumentava, todos os métodos cometiam mais erros, mas o método de k-vizinhos mais próximos cometia erros muito mais lentamente. Quando uma variável tinha uma alta porcentagem de números ausentes, o método simples de valor central e o modelo complexo ambos tiveram dificuldades para manter os dados parecendo reais, mas o método de k-vizinhos mais próximos resistiu melhor. Isso provavelmente ocorre porque o modelo complexo tenta construir uma regra matemática perfeita para cada variável individual, o que se torna difícil quando há muitas variáveis e não há pacientes suficientes para aprender. O método de k-vizinhos mais próximos, por outro lado, simplesmente olha para os pacientes mais semelhantes e copia seu padrão, o que funciona bem mesmo quando os dados estão bagunçados ou incompletos.

Este estudo não sugere que o modelo estatístico complexo seja inútil. Esse modelo é projetado para um propósito diferente: fornecer uma gama de respostas possíveis e levar em conta a incerteza de não saber os números verdadeiros, o que é crucial para certos tipos de análise estatística profunda. No entanto, para muitos pesquisadores que simplesmente precisam de um conjunto de dados limpo e completo para descrever um grupo de pacientes ou para explorar relações entre variáveis, o modelo complexo pode ser excessivo e até contraproducente. As descobertas sugerem que, para criar uma versão única e confiável de um conjunto de dados médicos, o método de k-vizinhos mais próximos oferece um equilíbrio poderoso. É muito mais preciso do que o método simples de valor central, que ainda é amplamente utilizado, e é mais fácil de usar do que o modelo complexo, exigindo menos decisões técnicas do pesquisador.

O estudo destaca uma lição prática para a ciência médica: às vezes, a ferramenta mais sofisticada não é a melhor para o trabalho. Na realidade bagunçada dos registros hospitalares, onde os dados são frequentemente incompletos e os perfis dos pacientes são únicos, um método que observa pacientes semelhantes para preencher as lacunas pode preservar a verdadeira história dos dados melhor do que uma fórmula matemática rígida. Ao escolher a ferramenta certa, os pesquisadores podem garantir que os padrões que descobrem em seus dados reflitam a realidade dos pacientes que estão estudando, em vez de serem artefatos de como tentaram corrigir os números ausentes. Este trabalho fornece um caminho claro para cientistas que desejam manter seus dados honestos sem se perderem em uma complexidade desnecessária.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →