← Últimos artigos
🤖 AI

Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH

Este artigo descreve uma iniciativa em curso no âmbito do projeto LLMs4EU e da infraestrutura ALT-EDIC para adaptar modelos de fundação para a investigação nas Ciências Sociais e Humanidades através da integração de grafos de conhecimento e corpora multilíngues, empregando um rigoroso quadro de avaliação quantitativa e qualitativa para garantir um apoio de IA fiável, eticamente conforme e sensível ao domínio para tarefas académicas.

Autores originais: Adam Faci, Alessio Miaschi, Anne Combe, Pascal Cuxac, Francesca Frontini, Nicolas Larrousse, Stéphane Pouyllau

Publicado 2026-07-08
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Adam Faci, Alessio Miaschi, Anne Combe, Pascal Cuxac, Francesca Frontini, Nicolas Larrousse, Stéphane Pouyllau

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Ensinando a IA a Ler como um Humanista

Imagine que você tem um robô bibliotecário superinteligente (um Grande Modelo de Linguagem, ou LLM) que leu quase tudo na internet. Ele é ótimo para responder perguntas sobre ciência, matemática e notícias em inglês. Mas, se você perguntar a ele sobre história, filosofia ou literatura em francês ou italiano, ele frequentemente erra. Ele tende a ignorar livros, focar apenas em artigos de periódicos em inglês e perder a forma profunda, complexa e interpretativa como os estudiosos humanos realmente pensam.

Este artigo descreve um projeto chamado ReSearch_SSH (parte de uma iniciativa europeia maior chamada LLMs4EU) que está tentando consertar isso. O objetivo é pegar esse robô bibliotecário "geral" e treiná-lo especificamente para entender as Ciências Sociais e Humanidades (SSH). Eles querem uma IA que respeite diferentes línguas, entenda que um livro é tão importante quanto um artigo de periódico e saiba que o mesmo texto pode ser interpretado de muitas maneiras diferentes dependendo de quem o lê.

O Problema: A Armadilha do "Tamanho Único para Todos"

Atualmente, a maioria das ferramentas de IA para pesquisa é como um mapa genérico do mundo. Eles são desenhados majoritariamente em inglês e destacam apenas as maiores cidades (periódicos importantes). Se você tentar navegar por uma pequena vila na Itália ou um debate histórico específico na França usando este mapa, você se perderá.

Os autores argumentam que isso não é neutro. Isso exclui estudiosos que trabalham em outras línguas ou que estudam coisas como manuscritos antigos, blogs digitais ou história local. Isso força todos a pensar como um "cientista de ciências duras" (procurando fatos simples e citações) em vez de um humanista (procurando contexto, nuances e diferentes perspectivas).

A Solução: Um Kit de Ferramentas Especializado

Em vez de construir um novo mecanismo de busca do zero, a equipe está atualizando uma plataforma de pesquisa francesa existente chamada ISIDORE. Pense no ISIDORE como o porão de uma biblioteca enorme e bem organizada. A equipe está instalando um novo "assistente inteligente" dentro dele.

Eis como eles estão construindo isso, usando três ferramentas principais:

1. A "Lista de Leitura Especializada" (Dados)

Você não pode ensinar um chef a cozinhar culinária francesa se der a ele apenas receitas americanas. Para treinar a IA, eles estão alimentando-a com uma dieta massiva e curada de textos de Ciências Sociais e Humanidades.

  • O Cardápio: Eles estão usando cerca de 3 milhões de documentos de uma base de dados chamada ISTEX. Isso inclui livros, artigos e dados em mais de 60 idiomas, embora o francês e o inglês sejam os pratos principais.
  • Os Acompanhamentos: Para garantir que a IA entenda o jargão específico das Humanidades Digitais, eles estão adicionando artigos de conferências italianas e periódicos especializados.
  • O Objetivo: Isso garante que a IA aprenda o "dialeto" específico dos estudiosos, não apenas o "dialeto" da internet.

2. O "Mapa de Verificação de Fatos" (Grafos de Conhecimento)

Esta é a parte mais importante. A IA padrão costuma "alucinar" (inventar coisas) porque adivinha com base em padrões. Este projeto utiliza um Grafo de Conhecimento, que é como uma rede gigante e interconectada de fatos.

  • A Analogia: Imagine que a IA é um guia turístico. Uma IA normal pode adivinhar onde fica um ponto turístico. Esta IA, no entanto, está segurando um mapa detalhado (Wikidata e outros grafos) que liga autores aos seus livros, livros aos seus temas e temas a eventos históricos.
  • Como funciona: Quando a IA responde a uma pergunta, ela não apenas adivinha; ela olha para o mapa, encontra a página exata no livro e diz: "Eu encontrei esta resposta neste documento específico". Isso torna a resposta rastreável e confiável.

3. O "Ciclo de Feedback Humano" (Avaliação)

A equipe não está apenas testando a IA com pontuações de computador; eles estão testando-a com especialistas humanos reais.

  • O Painel: Eles reuniram um grupo de estudiosos de Humanidades Digitais da França e da Itália.
  • O Teste: Esses especialistas farão perguntas complexas à IA e verificarão se as respostas fazem sentido em um contexto de pesquisa real. Eles verificam: "Esta resposta é realmente útil para um historiador? Ela perdeu uma nuance crucial?".
  • O Resultado: Se a IA falhar, os especialistas dizem o porquê, e a IA aprende a pensar mais como um estudioso humano.

As Regras do Jogo (Jurídico e Ética)

O artigo enfatiza que este não é um experimento de "velho oeste". Eles estão construindo isso dentro de uma estrutura jurídica rigorosa (como a Lei de IA da UE e o GDPR).

  • Sem Suposições Aleatórias: A IA foi projetada para ser um "assistente de pesquisa", não um tomador de decisões. Ela sugere, mas os humanos decidem.
  • Privacidade: Eles são cuidadosos para não usar dados pessoais para perfilar pessoas.
  • Direitos Autorais: Eles estão respeitando as regras dos livros que utilizam. Não estão apenas roubando conteúdo; estão usando dados licenciados e garantindo que a IA aponte de volta para a fonte original para que os autores recebam o crédito.

Onde Eles Estão Agora?

O projeto está atualmente na fase de preparação.

  • Eles estão coletando e limpando os dados (os "ingredientes").
  • Eles estão estabelecendo as regras legais e éticas (os "protocolos de segurança da cozinha").
  • Eles estão prestes a iniciar a primeira rodada de treinamento do modelo com esses dados específicos.

A Conclusão

Este artigo é um roteiro para construir uma IA que não apenas "fala" como um humano, mas pensa como um estudioso. Ao combinar uma biblioteca especializada de livros, um mapa de verificação de fatos e uma equipe de especialistas humanos, eles esperam criar uma ferramenta que ajude pesquisadores a descobrir novas ideias sem perder a nuance, a língua e a ética que tornam as Humanidades especiais. Trata-se de garantir que a IA sirva ao estudioso, em vez de forçar o estudioso a mudar a forma como trabalha para se ajustar à IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →