Clinically Grounded AI-Scribing in Psychotherapy: Benchmarking LLMs Against Expert Documentation in the iCARE Framework
Este artigo apresenta o framework de documentação clinicamente fundamentado iCARE e o respectivo conjunto de dados iHOPE para avaliar onze grandes modelos de linguagem, revelando que, embora os modelos de código fechado geralmente superem os de código aberto em métricas automatizadas, a avaliação de especialistas humanos destaca pontos fortes e fracos específicos — como dificuldades com o raciocínio temporal e preferências clínicas variadas — que ressaltam a necessidade de ferramentas de IA projetadas para auxiliar, em vez de substituir, os terapeutas.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo
Nas salas silenciosas onde a psicoterapia acontece, o trabalho é profundamente humano. Ele depende de um terapeuta ouvindo a história de um cliente, percebendo o peso de uma pausa e compreendendo o contexto de um medo que se estende por anos. Para que o terapeuta realize esse trabalho de forma eficaz, ele também deve manter um registro. Essas notas não são meramente burocracia administrativa; elas são o mapa do mundo interior de uma pessoa, capturando desde a crise imediata até o longo histórico de família e hábitos que a moldaram. Tradicionalmente, escrever essas notas tem sido um fardo pesado, desviando a atenção do clínico do paciente para a tela do computador. Nos últimos anos, a inteligência artificial prometeu aliviar esse fardo. Esses "escreventes de IA" podem ouvir uma conversa e digitá-la, mas no complexo mundo da saúde mental, a maioria dos sistemas atuais fica aquém das expectativas. Eles tendem a produzir resumos breves e secos que perdem a nuance, as correntes emocionais subjacentes e os detalhes críticos de segurança que definem uma sessão de terapia. O desafio tem sido construir uma máquina que não apenas transcreva palavras, mas que entenda a história.
Uma equipe de pesquisadores da Índia e de Singapura deu um passo significativo para resolver esse problema ao repensar como as notas de terapia devem ser estruturadas e como as máquinas devem aprender a escrevê-las. Eles começaram criando uma nova e abrangente estrutura para documentação chamada iCARE. Diferente dos formatos abreviados padrão usados em muitos hospitais, que são projetados para verificações administrativas rápidas, o iCARE foi construído para capturar toda a profundidade de um encontro clínico. É uma estrutura detalhada com dezessete seções distintas, variando desde informações básicas de identificação e as principais preocupações do cliente até um mergulho profundo em seu histórico médico, uma avaliação de risco para perigos imediatos como automutilação e um plano para sessões futuras. Os pesquisadores argumentaram que um sistema de IA deve primeiro ser capaz de gerar essa imagem rica e completa antes de poder ser condensada em um resumo mais curto. Para testar essa ideia, eles construíram um novo conjunto de dados chamado iHOPE. Eles pegaram 174 sessões de terapia gravadas de uma coleção pública, limparam o áudio para garantir que cada palavra fosse ouvida e, então, tiveram uma equipe de psiquiatras e psicólogos especialistas escreverem notas perfeitas, de padrão ouro, para cada sessão usando o novo formato iCARE. Isso criou um parâmetro, um conjunto de respostas ideais contra o qual qualquer máquina poderia ser medida.
Os pesquisadores então colocaram onze diferentes modelos de linguagem de grande escala à prova. Esses modelos, que são os poderosos programas de computador por trás dos chatbots modernos, foram solicitados a ouvir as gravações de terapia e escrever as notas iCARE. Eles testaram os modelos de duas maneiras: primeiro, fornecendo as gravações sem exemplos para seguir e, segundo, mostrando-lhes um exemplo de uma nota perfeita antes de pedir que escrevessem o restante. Os resultados revelaram uma divisão clara entre os diferentes tipos de IA. Os modelos de código fechado, que são desenvolvidos por grandes empresas de tecnologia e não são abertos para modificação pelo público, performaram consistentemente melhor do que os modelos de código aberto, que são construídos pela comunidade pública. Um modelo específico, o GPT-4o-mini, alcançou as pontuações mais altas em testes de computador padrão que medem o quão proximamente as palavras da máquina correspondem às palavras dos especialistas humanos. Outro modelo, o Gemini Pro, mostrou uma força particular na identificação de marcadores de crise, como sinais de risco de suicídio ou abuso de substâncias, que são detalhes de segurança críticos na terapia.
No entanto, a história tornou-se mais interessante quando os pesquisadores pediram a especialistas humanos que julgassem as notas, em vez de depender apenas de pontuações de computador. Eles trouxeram seis profissionais de saúde mental para ler as notas cegamente, sem saber qual IA as escreveu, e avaliá-las em cinco qualidades fundamentais: confiabilidade, relevância, precisão, completude e clareza. Os especialistas humanos descobriram que, embora os principais modelos de computador fossem bons, eles ainda lutavam com o fluxo do tempo. As máquinas frequentemente falhavam em distinguir corretamente o que aconteceu em uma sessão passada do que foi planejado para a próxima, um aspecto fundamental da terapia que exige a compreensão de uma linha do tempo. Surpreendentemente, os especialistas humanos preferiram as notas de um modelo menor e de código aberto chamado Mistral em relação aos modelos comerciais mais poderosos. De fato, o Mistral foi o único sistema que pontuou ligeiramente acima das notas escritas por humanos em uma categoria específica: completude. Essa descoberta sugere que a maneira como medimos atualmente o sucesso da IA com algoritmos de computador nem sempre coincide com o que um clínico humano realmente precisa. Os modelos comerciais eram excelentes em corresponder a frases específicas, mas o modelo menor parecia capturar a essência clínica da sessão de forma mais eficaz aos olhos dos especialistas.
O estudo conclui que, embora a inteligência artificial esteja pronta para auxiliar terapeutas, ela ainda não está pronta para substituí-los. Os pesquisadores descobriram que o melhor caminho a seguir é um caminho colaborativo, onde a IA lida com o trabalho pesado de redigir as notas detalhadas, permitindo que o terapeuta revise, refine e finalize o registro. Essa abordagem pode liberar um tempo valioso para que os clínicos foquem no paciente, em vez de no teclado. A equipe enfatizou que seu trabalho não é uma solução final, mas uma fundação. Eles disponibilizaram sua nova estrutura, seu conjunto de dados de notas de especialistas e seu método de avaliação para outros cientistas, para que o campo possa continuar evoluindo. O objetivo final é reduzir a lacuna entre a enorme necessidade de cuidados de saúde mental e o número limitado de terapeutas disponíveis, usando a tecnologia para apoiar, em vez de substituir, a conexão humana que está no coração da cura.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.