← Últimos artigos
💬 NLP

Decomposing Error and Style in Automated Clinical Coding

Este artigo argumenta que grande parte da lacuna de desempenho na codificação clínica automatizada atribuída ao erro do modelo advém, na verdade, de estilos de codificação sistemáticos e não modelados, demonstrando que condicionar explicitamente os modelos a uma rubrica de estilo específica de cada codificador melhora significavelmente a precisão e resolve discrepâncias entre diferentes métodos de avaliação.

Autores originais: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

Publicado 2026-09-22✓ Author reviewed ⓘ
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Sempre que um paciente deixa o consultório de um médico ou um hospital, uma parte crítica do trabalho administrativo começa. Um codificador médico deve ler as notas clínicas escritas pelo médico e traduzi-las em um conjunto padronizado de códigos alfanuméricos. Esses códigos dizem às seguradoras e aos programas governamentais exatamente o que estava errado com o paciente e o que foi feito para tratá-lo, determinando quanto o prestador de serviços receberá. Por décadas, o campo da codificação automatizada tratou essa tarefa como um simples jogo de correspondência: um programa de computador lê a nota e, se sua lista de códigos não corresponder peramente a uma única lista de "padrão ouro" criada por um especialista humano, o computador é marcado como errado. Essa abordagem assume que, se dois especialistas lerem a mesma nota e seguirem as mesmas regras, produzirão exatamente a mesma lista de códigos.

No entanto, no mundo real da medicina, essa suposição não se sustenta. Mesmo especialistas humanos altamente treinados, olhando para as mesmas notas de pacientes e usando as mesmas diretrizes oficiais, frequentemente produzem listas de códigos diferentes. Eles podem discordar sobre incluir ou não uma condição menor, sobre o quão específico ser sobre um diagnóstico ou se devem adicionar códigos administrativos para serviços que foram discutidos, mas não realizados. Por muito tempo, os pesquisadores acreditaram que esse desacordo era simplesmente erro humano — um custo desordenado e inevitável de se ter um sistema vasto com dezenas de milhares de códigos possíveis. Mas um novo estudo sugere que o que parece erro é, na verdade, algo completamente diferente: uma diferença sistemática de estilo. Assim como dois escritores podem descrever o mesmo evento com diferentes níveis de detalhe ou foco, dois codificadores aplicam políticas internas diferentes sobre o que merece ser registrado e quanta evidência é necessária para justificá-lo.

Uma equipe de pesquisadores da Amazon propôs-se a investigar essa lacuna, questionando se o desacordo entre os codificadores era ruído aleatório ou um padrão previsível que eles poderiam medir e utilizar. Eles começaram analisando um conjunto de dados público de 110 atendimentos de pacientes que haviam sido codificados por duas equipes independentes. Apesar de trabalharem com notas idênticas, essas duas equipes concordaram em apenas 73 por cento dos códigos. Quando os pesquisadores trouxeram um terceiro grupo independente de auditores clínicos para revisar as notas e remover quaisquer códigos que estivessem claramente injustificados, o acordo aumentou apenas ligeiramente para 77 por cento. Isso significava que, mesmo após a remoção de erros óbvios, um quarto dos códigos ainda diferia entre os especialistas. Os pesquisadores hipotetizaram que essa lacuna restante não era uma falha de conhecimento, mas uma diferença de "estilo de codificação" — um conjunto específico de preferências que cada codificador ou unidade médica possui em relação ao quão agressivamente codificar, quão específico ser e quanta documentação é necessária para justificar um código.

Para testar essa ideia, os pesquisadores construíram um sistema que pudesse medir esse estilo. Eles criaram uma rubrica simples, ou um checklist, com dez dimensões diferentes. Algumas dimensões faziam perguntas como: "O codificador lista apenas a queixa principal ou lista cada problema mencionado?" Outras perguntavam: "O codificador infere uma condição a partir de um medicamento mencionado ou espera que o médico declare explicitamente o diagnóstico?" Usando um modelo de linguagem de grande escala, eles analisaram centenas de notas de pacientes e suas respectivas listas de códigos para pontuar cada conjunto de dados nessas dez dimensões. Esse processo criou um "perfil de estilo" para cada grupo de codificadores, essencialmente resumindo seus hábitos coletivos em um conjunto de números que descreviam sua abordagem.

O avanço ocorreu quando os pesquisadores usaram esses perfis de estilo para guiar os modelos de computador. Em vez de apenas pedir ao computador para "codificar esta nota", eles adicionaram um bloco de instrução específico que descrevia o estilo do codificador que se pretendia imitar. Por exemplo, se o estilo alvo fosse "agressivo", o computador recebia a instrução de listar todas as condições possíveis mencionadas no texto. Se o estilo fosse "conservador", ele era instruído a listar apenas o que era explicitamente confirmado. Os resultados foram impressionantes. Quando o computador recebia um perfil de estilo que correspondia aos dados que ele estava tentando codificar, sua precisão saltava dramaticamente. Em vários conjuntos de dados, o desempenho do computador melhorou em até 26 pontos em uma escala de pontuação padrão. Por outro lado, quando o computador recebia um perfil de estilo que colidia com os dados — dizendo a um codificador conservador para ser agressivo, ou vice-versa — seu desempenho despencava em até 21 pontos.

Essa descoberta sugere que muito do que anteriormente era culpado pela incapacidade do computador de entender a medicina era, na verdade, o computador falhando em entender os hábitos do codificador. Os pesquisadores testaram isso em cinco conjuntos de dados diferentes, incluindo consultas ambulatoriais e registros de internação hospitalar, e descobriram que o efeito se mantinha para quase todos os métodos que tentaram. Quer utilizassem um prompt básico ou um pipeline complexo de várias etapas, adicionar o perfil de estilo correto consistentemente elevava os resultados. De fato, um modelo de computador simples e não treinado, guiado pelas instruções de estilo corretas, teve um desempenho tão bom quanto um modelo altamente sofisticado e pré-treinado que não possuía tal orientação. Isso implica que o computador já conhece as regras médicas; ele só precisa saber qual versão das regras aplicar em um contexto específico.

O estudo também revelou que este "estilo" é uma propriedade da fonte de dados, não apenas ruído aleatório. Quando os pesquisam visualizaram os perfis de estilo de diferentes hospitais e equipes de codificação, viram que os perfis se agrupavam por origem. Um hospital que tendia a ser muito específico sobre diagnósticos tinha um perfil distinto, diferente de um hospital que preferia códigos mais amplos e menos específicos. Esse agrupamento confirmou que o estilo é uma característica real e mensurável de como um grupo médico opera. No entanto, os pesquisadores também observaram que seu checklist de dez pontos não era um mapa perfeito de todo o cenário. Em um caso específico envolvendo duas equipes que discordavam em 27 por cento de seus códigos, o checklist não conseguiu explicar totalmente a diferença, sugerindo que ainda existem dimensões ocultas de estilo que suas ferramentas atuais não conseguem enxergar. Além disso, a abordagem funcionou menos bem para registros de internação hospitalar, onde o volume massivo de códigos por paciente sobrecarregava a escala simples que eles haviam desenhado.

Em última análise, o trabalho reformula a forma como devemos pensar sobre a codificação médica automatizada. Sugere que o objetivo não deve ser forçar cada computador a corresponder a uma única e rígida lista de "padrão ouro", mas sim reconhecer que diferentes ambientes médicos têm diferenças sistemáticas e legítimas na forma como documentam o cuidado. Ao medir e adaptar-se a esses estilos, os computadores podem se tornar muito mais precisos. Os pesquisadores concluem que a lacuna entre o desempenho humano e o da máquina não é apenas uma questão de inteligência ou treinamento, mas de alinhamento. Se pudermos ensinar a máquina a falar a mesma "linguagem" de documentação que o codificador humano, podemos recuperar uma quantidade significativa de precisão que antes era considerada perdida por erro. Isso não significa que o computador está adivinhando; significa que o computador está finalmente ouvindo as instruções certas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →