COCI: Conference Organisers and Content Identifier
Este artigo apresenta o COCI, um framework baseado em IA que utiliza Grandes Modelos de Linguagem e mapeamento semântico para extrair metadados estruturados de Chamadas de Trabalhos (Calls for Papers) não estruturadas, integrando, assim, a literatura cinzenta em grafos de conhecimento acadêmico estabelecidos para análise sistemática.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A ciência é frequentemente imaginada como uma coleção de livros finalizados e artigos de periódicos polidos, os relatórios finais de pesquisas que passaram por rigorosos portões editoriais. No entanto, uma vasta quantidade da conversa científica acontece muito antes de essas páginas finais serem impressas. Este é o mundo da "literatura cinzenta", um termo para documentos que existem fora dos canais tradicionais de publicação. Entre estes estão as "chamadas para trabalhos" (calls for papers), que são essencialmente convites enviados por organizadores de conferências para reunir novas pesquisas. Esses documentos são vitais porque revelam as faíscas iniciais de novas ideias, mostrando sobre quais tópicos os pesquisadores estão entusiasmados e quem está liderando o movimento. Contudo, como esses convites são frequentemente espalhados por listas de e-mail e páginas web simples, eles carecem dos rótulos organizados e padronizados que bibliotecas e bases de dados utilizam para organizar informações. Isso torna quase impossível estudá-los em grande escala, deixando um ponto cego significativo em nossa compreensão de como a ciência evolui e quem a está moldando.
Para resolver este problema, uma equipe de pesquisadores construiu uma nova ferramenta digital chamada COCI, que significa Conference Organisers and Content Identifier (Identificador de Organizadores e Conteúdo de Conferências). Pense neste sistema como um tradutor altamente qualificado que pode ler textos desestruturados e bagunçados e transformá-los em uma lista limpa e organizada de fatos. Os pesquisadores alimentaram seu sistema com o texto bruto de quarenta diferentes convites de conferências, abrangendo campos desde a ciência da computação até a ciência dos materiais. A ferramenta utiliza inteligência artificial avançada para escanear o texto e extrair detalhes específicos: o nome da conferência, onde e quando ela ocorrerá, os tópicos amplos sendo discutidos e, o mais importante, os nomes e funções de cada pessoa organizando o evento.
O que torna esta ferramenta particularmente poderosa é o que ela faz após extrair esses nomes. Em vez de apenas listar uma pessoa como "John Smith", o sistema trabalha para conectar esse nome a um ID digital permanente e único usado pela comunidade de pesquisa global. Ele verifica suas descobertas em relação a várias bases de dados massivas e estabelecidas para garantir que encontrou a pessoa certa e a organização certa. Se o sistema encontrar uma correspondência, ele anexa um identificador único ao perfil dessa pessoa, vinculando-a ao seu trabalho passado e à sua instituição. Ele faz o mesmo com a própria conferência, conectando o evento a registros conhecidos de encontros semelhantes. Esse processo transforma um convite simples e informal em um dado estruturado que pode ser vinculado a outros registros científicos, efetivamente preenchendo a lacuna entre anúncios informais e os mapas formais do conhecimento científico.
Os pesquisadores testaram seu sistema processando quarenta exemplos do mundo real e, em seguida, verificando manualmente os resultados para ver o quão bem ele performou. A ferramenta extraiu com sucesso os metadados de todos os documentos que analisou. Em um caso específico, a saída do sistema revelou uma incompatibilidade em uma base de dados externa; a investigação mostrou que isso não foi uma falha do algoritmo de alinhamento do COCI, mas sim um erro existente dentro da própria base de dados OpenAlex, que havia listado o nome do organizador como um apelido alternativo para outro pesquisador. Este caso destaca que a confiabilidade da extração semântica é, por vezes, contingente à qualidade dos Dados Conectados (Linked Data) externos. A equipe também construiu uma interface visual que exibe essa informação de forma clara, mostrando os detalhes da conferência, a lista de organizadores com suas identidades verificadas e os tópicos mapeados para categorias científicas padrão. Essa representação estruturada abre caminhos para se conectar com bases de dados externas, permitindo a possibilidade futura de investigar se organizadores estiveram envolvidos anteriormente em má conduta acadêmica.
O objetivo final deste trabalho é dar reconhecimento formal ao trabalho, muitas vezes invisível, de organizar a comunidade científica. Ao transformar esses documentos espalhados e informais em dados estruturados, os pesquisadores criaram uma base para uma nova maneira de rastrear a saúde e a qualidade das conferências acadêmicas. No futuro, planejam construir um sistema que busque automaticamente novos convites conforme eles aparecem, criando um registro vivo de como as comunidades científicas se formam e mudam. Isso permitiria que a comunidade mais ampla compreendesse os estágios iniciais das tendências de pesquisa e desse crédito às pessoas que constroem as plataformas para a descoberta, garantindo que o trabalho de organizar a ciência seja visto e valorizado tanto quanto a própria pesquisa.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.