← Últimos artigos
💻 computer science

Research Entity Extraction and Topic Detection from UKRI Grant Proposals

Este artigo apresenta descobertas preliminares do projeto "Tracking Stars and Unicorns", demonstrando que uma abordagem baseada em Mistral supera tanto o GPT-4o quanto um algoritmo bespoke de DSIT-Taxonomies na extração precisa de entidades de pesquisa e na classificação de tópicos dentro de propostas de subvenção do UKRI, oferecendo uma solução segura e eficiente para identificar áreas de pesquisa emergentes.

Autores originais: Xingran Ruan, Angelo Salatino, Rosa Filgueira, Kara Moraw, Alexandru Marcoci, Gemma Derrick, Sarah Callaghan

Publicado 2026-06-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xingran Ruan, Angelo Salatino, Rosa Filgueira, Kara Moraw, Alexandru Marcoci, Gemma Derrick, Sarah Callaghan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que o governo do Reino Unido é uma biblioteca gigantesca que financia milhares de novos livros (projetos de pesquisa) todos os anos. Os bibliotecários (UKRI) querem saber: Quais são as novas histórias mais empolgantes sendo escritas agora? Eles precisam identificar "unicórnios" — ideias totalmente novas e inovadoras que podem mudar o mundo antes mesmo de se tornarem famosas.

O problema é que há propostas demais para ler uma por uma. Por isso, os autores deste artigo testaram três diferentes "bibliotecários robôs" (ferramentas de IA) para ler os resumos dessas propostas de financiamento e dizer do que os projetos realmente tratam.

Aqui está como eles fizeram e o que descobriram, explicado de forma simples:

Os Três Bibliotecários Robôs

A equipe testou três diferentes "cérebros" de IA para ver qual era o melhor para ler as propostas:

  1. GPT-4o: Uma IA muito famosa e poderosa (como um professor superinteligente e muito bem informado).
  2. Mistral: Uma IA um pouco menor e mais rápida (como um pesquisador júnior perspicaz e eficiente).
  3. DSIT-Taxonomies: Um programa de computador mais antigo, baseado em regras (como um bibliotecário que apenas procura palavras específicas em um dicionário).

O Teste: Lendo os "Resumos"

Os pesquisadores pegaram 42 propostas de financiamento reais de diferentes áreas (como arte, medicina e engenharia). Eles pediram a cada robô que fizesse duas coisas:

  1. Extrair as palavras importantes: (ex: "células-tronco", "inteligência artificial", "mudanças climáticas").
  2. Classificar o projeto em uma categoria: (ex: "Isso é sobre Biologia? Ou Física?").

Eles compararam as respostas dos robôs entre si e também em relação a especialistas humanos para ver quem acertava.

Os Resultados: Quem Venceu?

1. O "Caçador de Palavras-Chave" (DSIT-Taxonomies) Teve Dificuldades
O robô antigo baseado em regras era como uma pessoa tentando entender um poema contando apenas quantas vezes a palavra "amor" aparece. Ele frequentemente perdia a visão do todo.

  • Ele fragmentava frases boas em pedaços minúsculos e inúteis (ex: via "sinal" e "amplificador" como duas coisas separadas, em vez de um único conceito).
  • Ele capturava palavras aleatórias como "no entanto" ou "milhares" que não significavam nada de relevante.
  • A Pontuação: Ele acertou o tópico apenas 71% das vezes.

2. O "Superprofessor" (GPT-4o) Foi Excelente
A grande IA foi excelente. Ela entendeu o contexto e extraiu as ideias certas, exatamente como um especialista humano faria.

  • A Pontuação: Ela acertou o tópico 90,5% das vezes.

3. O "Júnior Eficiente" (Mistral) Foi a Estrela Surpresa
A IA menor (Mistral) teve um desempenho quase idêntico ao do grande professor.

  • Ela extraiu as mesmas palavras importantes que o GPT-4o.
  • Cometeu menos erros de inventar palavras que não estavam no texto (um problema chamado "alucinação").
  • A Pontuação: Ela também acertou o tópico 90,5% das vezes.

Por que a Mistral é o "Unicórnio" desta História

O artigo conclui que a Mistral é a melhor escolha para este trabalho, e aqui está o porquê, usando uma analogia simples:

  • Segurança: Imagine que você está lendo um diário secreto. Você não gostaria de enviar esse diário para um servidor de nuvem gigante e público onde qualquer pessoa pudesse ver. A Mistral é como uma ferramenta que você pode manter dentro do seu próprio escritório seguro. Ela é rápida, barata e mantém a privacidade dos dados.
  • Desempenho: Embora seja menor que o GPT-4o, ela fez o mesmo trabalho tão bem quanto.
  • Confiabilidade: Ela teve menos probabilidade de inventar fatos falsos do que a IA maior.

O Ponto Principal

Os pesquisadores descobriram que você não precisa da IA maior e mais cara para entender propostas de pesquisa. Uma IA inteligente, eficiente e segura (Mistral) pode ler propostas de financiamento, extrair as ideias importantes e classificá-las em categorias tão bem quanto as gigantes do setor.

Isso significa que o governo do Reino Unido pode agora usar esta ferramenta para escanear sua enorme biblioteca de 350.000 propostas para encontrar esses "unicórnios" precoces — as novas e empolgantes áreas de pesquisa que merecem financiamento — sem se preocupar com vazamentos de dados ou em pagar pela tecnologia mais cara.

Nota: O artigo testou isso em apenas 42 propostas para provar que o método funciona. O próximo passo (que eles planejam fazer) é usar este método na biblioteca completa de 350.000 propostas para mapear o futuro da pesquisa no Reino Unido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →