← Últimos artigos
💻 computer science

A human-validated procedure for linking PhD dissertation metadata to OpenAlex author profiles

Este artigo apresenta e valida um método generalizável, verificado por humanos, que combina medidas de similaridade de nível de caractere, tópicas e baseadas em transformer para vincular de forma confiável metadados de dissertações de doutorado a perfis de autores do OpenAlex, alcançando alta precisão no rastreamento de trajetórias de carreira acadêmica e revelando que aproximadamente 17,3% dos doutorandos da América do Norte não podem ser vinculados a publicações subsequentes.

Autores originais: Jens Peter Andersen, Chaoqun Ni

Publicado 2026-08-28
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Jens Peter Andersen, Chaoqun Ni

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Todos os anos, centenas de milhares de estudantes em todo o mundo concluem seus doutorados, um marco que assinala sua entrada formal no mundo da pesquisa. Durante décadas, cientistas que estudam como as carreiras acadêmicas se desenrolam dependeram de um grupo específico de pessoas para dizer o que acontece a seguir: aqueles que continuam a publicar artigos em periódicos. Ao rastrear esses trabalhos publicados, pesquisadores construíram um quadro de quanto tempo os cientistas permanecem ativos, quão produtivos são e como suas carreiras evoluem. No entanto, esse quadro possui um ponto cego significativo. Ele inclui apenas as pessoas que continuaram publicando. Ele ignora o vasto número de graduados que deixam o mundo da publicação acadêmica inteiramente, talvez para trabalhar na indústria, no governo ou no ensino, ou simplesmente para parar de escrever para periódicos. Como esses indivíduos não aparecem nas bases de dados padrão usadas para rastrear a produção científica, eles são efetivamente invisíveis para os estudos que tentam compreender o escopo total do impacto de um doutorado. Sem saber quem está faltando, qualquer estimativa de sucesso profissional ou de atrito é baseada em uma amostra que já foi filtrada pelo requisito de continuar publicando.

Para resolver este problema, uma equipe de pesquisadores desenvolveu uma nova maneira de conectar os pontos entre uma dissertação de doutorado e a carreira subsequente de seu autor, mesmo que esse autor nunca publique outro artigo. Eles focaram no enorme hiato entre o registro de um grau e o registro de uma carreira. O desafio é imenso: uma dissertação é frequentemente o único registro do trabalho de uma pessoa em um campo específico, e as bases de dados que contêm milhões de artigos científicos estão repletas de pessoas que compartilham nomes comuns. Um pesquisador chamado "John Smith" em uma tese de 2009 pode ser a mesma pessoa que um "J. Smith" que publicou um artigo em 2015, ou podem ser duas pessoas completamente diferentes. A dificuldade é agravada pelo fato de que muitos graduados mudam seus nomes, usam iniciais diferentes ou publicam sob variações ligeiramente diferentes de seus nomes. Métodos anteriores frequentemente dependiam de uma correspondência simples de nomes ou de voluntários que já haviam vinculado seu próprio trabalho, ambos os quais falham em capturar a maioria silenciosa de graduados que não continuam no mundo da publicação.

Os pesquisadores abordaram isso criando um sistema computadorizado que atua como um bibliotecário altamente qualificado, comparando os detalhes de uma dissertação contra milhões de correspondências potenciais em uma base de dados global de publicações científicas chamada OpenAlex. Em vez de apenas olhar para nomes, o sistema lê os títulos das dissertações e os títulos dos artigos publicados, decompondo-os em pequenos fragmentos de texto para ver o quanto eles se sobrepõem. O sistema também utiliza tecnologia avançada para compreender os tópicos subjacentes do trabalho, reconhecendo que um artigo sobre "aprendizado de máquina" pode estar relacionado a uma tese intitulada "inteligência artificial", mesmo que as palavras sejam diferentes. O sistema gera uma pontuação que representa a probabilidade de a pessoa que escreveu a tese ser a mesma pessoa que escreveu os artigos. Para garantir que este sistema funcione, os pesquisadores o testaram fazendo com que especialistas humanos revisassem milhares de correspondências potenciais, verificando se os palpites do computador estavam corretos. Eles descobriram que, ao combinar a correspondência de texto com a análise de tópicos, o sistema poderia identificar de forma confiável a mesma pessoa através de diferentes registros com um alto grau de precisão.

Os resultados deste novo método revelam uma realidade alarmante sobre a força de trabalho acadêmica. Quando os pesquisadores aplicaram seu sistema a um grande grupo de doutorandos da América do Norte, descobriram que uma parte significativa desses indivíduos não pôde ser vinculada a nenhuma publicação subsequente na base de dados. Especificamente, eles estimam que entre 10,2% e 20,7% de uma coorte típica de doutorandos nunca aparecem nas principais bases de dados bibliográficas após receberem seus graus, com uma melhor estimativa de 17,3%. Isso significa que quase um em cada cinco doutorandos está ausente dos mapas padrão de carreiras científicas. Este grupo não está necessariamente falhando; eles podem ser bem-sucedidos em outros setores, mas sua ausência dos dados distorce nossa compreensão do que acontece após o doutorado. O estudo também mostrou que a taxa de "desaparecimento" do registro de publicação aumenta com o tempo. Embora cerca de 73% dos graduados ainda sejam observados publicando no ano imediatamente após o grau, esse número cai para aproximadamente 50% após quinze anos. Esse declínio é ainda mais acentuado quando se incluem os graduados que nunca publicaram nada, sugerindo que a maioria dos pesquisadores contribui para a literatura científica por apenas uma janela de tempo limitada.

Os pesquisadores também testaram se a inteligência artificial moderna poderia substituir seu sistema computadorizado estruturado. Eles descobriram que, embora os grandes modelos de linguagem pudessem fazer julgamentos muito precisos quando estavam altamente confiantes, eles eram mais lentos e ligeiramente menos eficazes em encontrar correspondências em todo o grupo do que o sistema de pontuação especializado. A abordagem mais eficiente, sugerem eles, é usar o sistema especializado rápido para escanear todos os dados e, em seguida, usar a inteligência artificial apenas para dupla conferência nos casos em que o primeiro sistema estiver em dúvida. Esse processo de duas etapas permite uma visão abrangente dos dados sem ficar preso pelo tempo e custo de verificar cada registro com um modelo complexo.

Em última análise, este trabalho faz mais do que apenas corrigir um problema técnico de correspondência de dados; ele muda a história da carreira acadêmica. Ao contabilizar os graduados que não publicam, o estudo fornece uma imagem mais honesta e completa dos resultados da formação de doutorado. Ele mostra que o caminho após o doutorado é muito mais diverso do que os dados anteriormente permitiam ver, com um número substancial de pessoas movendo-se para funções que não envolvem a publicação em periódicos acadêmicos. O método desenvolvido aqui é aberto e pode ser aplicado a outros campos e países, oferecendo uma nova ferramenta para formuladores de políticas e pesquisadores entenderem o verdadeiro destino de milhões de pessoas que obtêm um doutorado todos os anos. Ele nos lembra que o fim de uma dissertação nem sempre é o início de uma carreira científica, e que o valor de um doutorado estende-se muito além das páginas de um periódico.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →