← Últimos artigos
💬 NLP

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

Este artigo apresenta a submissão do DS@GT ARC para o CLEF 2026 LongEval, a qual argumenta que, embora os modelos de fronteira se destaquem em fluência, um pipeline corretivo combinando filtragem pré-geração e verificações de entailment pós-geração é necessário para melhorar a fidelidade das citações e o embasamento das respostas em QA científico, destacando a necessidade de métricas de avaliação que priorizem o embasamento estrito sobre pontuações tradicionais de relevância.

Autores originais: Brandon Michaels, Brendon Johnson

Publicado 2026-07-17
📖 1 min de leitura☕ Leitura rápida

Autores originais: Brandon Michaels, Brendon Johnson

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: DS@GT ARC no LongEval

Definição do Problema
O conhecimento científico é dinâmico, evoluindo por meio de pesquisa e publicação contínuas. Esse desvio temporal impõe desafios significativos para sistemas de Geração Aumentada por Recuperação (RAG), que correm o risco de recuperar informações desatualizadas ou irrelevantes, perder evidências ou gerar respostas que não estão fatualmente fundamentadas nos documentos de origem fornecidos. Embora o RAG seja teoricamente ideal para o questionamento científico (QA) ao alavancar documentos externos, os sistemas atuais frequentemente sofrem de "erros relacionados à recuperação", incluindo a inclusão de documentos distratores e a geração de afirmações não fundamentadas. Existe uma lacuna crítica entre as métricas tradicionais de avaliação de linguagem natural (que favorecem fluência e sobreposição lexical) e a exigência de integridade estrita de citação e fundamentação factual em domínios científicos.

Metodologia
A equipe DS@GT ARC participou da Tarefa 4 do CLEF 2026 LongEval, que utilizou o corpus de literatura científica CORE. A tarefa forneceu uma consulta e um conjunto fixo de dez documentos pré-recuperados, exigindo que os participantes gerassem respostas em linguagem natural suportadas por citações específicas desse conjunto. A equipe avaliou três abordagens arquiteturais distintas:

  1. Baseline Híbrido DS@GT: Uma implementação padrão de RAG usando um recuperador híbrido (BM25 + embeddings densos BGE) para classificar fragmentos semânticos sobrepostos. Os top-kk fragmentos foram alimentados diretamente em um modelo Gemma-4-31B ajustado para instrução para síntese de resposta.
  2. Pipeline de RAG Corretivo (CRAG) + CiteFix: Uma arquitetura corretiva de dois estágios projetada para impor a fundamentação:
    • Pré-Geração: Um cross-encoder leve (CRAG) avalia os fragmentos recuperados contra a consulta, descartando aqueles que não atingem um limiar de implicação para filtrar distratores antes da geração.
    • Pós-Geração: O CiteFix analisa as afirmações geradas contra os fragmentos de documentos citados. Citações que carecem de implicação para suportar as afirmações específicas são podadas, impondo uma atribuição estrita.
  3. Benchmarks de Modelos de Fronteira: Duas execuções curadas manualmente usando modelos de última geração (GPT-5.5 Thinking e Claude Opus 4.7 Thinking) que ignoraram o particionamento (chunking) e a pontuação, sintetizando respostas diretamente do texto bruto dos dez documentos candidatos.

Estratégia de Avaliação
A equipe empregou um framework de avaliação duplo:

  • Métricas Oficiais da Tarefa: Métricas padrão, incluindo ROUGE e scores BERT para similaridade lexical/semântica contra um conjunto de ouro oculto, Precisão de Citação e Cobertura de Nugget.
  • Diagnósticos RAGAs Sem Referência: Uma configuração de LLM-como-juiz (usando Claude Sonnet 4.6) para medir a Fidelidade Global (fundamentação das afirmações contra o contexto total de 10 documentos), Fidelidade de Citação (fundamentação das afirmações estritamente contra os documentos citados) e Relevância da Resposta.

Resultos Principais
A avaliação revelou uma divergência significativa entre as métricas de desempenho tradicionais e a fundamentação factual:

  • Modelos de Fronteira: GPT-5.5 e Claude Opus 4.7 alcançaram as pontuações mais altas nas métricas oficiais (ROUGE, BERT, Relevância da Resposta) e na Precisão de Citação. No entanto, os diagnósticos RAGAs expuseram um modo de falha crítico: esses modelos frequentemente geraram respostas altamente relevantes baseando-se em sua memória paramétrica em vez do contexto fornecido. Consequentemente, exibiram baixa Fidelidade de Citação (ex: GPT-5.5 pontuou 0.417), indicando que frequentemente alucinam citações ou falham em fundamentar detalhes específicos nos documentos recuperados.
  • Pipeline Corretivo: O pipeline CRAG+CiteFix alcançou a maior Fidelidade Global (0.784) e Fidelidade de Citação (0.758) entre todas as submissões. No entanto, essa adesão estrita à fundamentação resultou em pontuações ROUGE e BERT mais baixas em comparação com o Baseline Híbrido. Essa queda foi atribuída ao "comportamento de abstenção" do pipeline, onde o sistema se recusou a gerar respostas quando o contexto recuperado carecia de evidência suficiente, em vez de alucinar a partir da memória paramétrica.
  • Significância Estatística: Um teste de postos sinalizados de Wilcoxon nos scores RAGAs indicou que as melhorias na fidelidade proporcionadas pelas intervenções corretivas não foram estatisticamente significativas através das 47 consultas de teste, sugerindo potenciais limitações nos modelos de NLI usados para verificação ou no ajuste específico das intervenções.

Significância e Conclusões
O artigo argumenta que a avaliação de sistemas de QA RAG confiáveis requer uma mudança no design de métricas. Os resultados demonstram que modelos de fronteira podem maximizar a relevância da resposta e a fluência enquanto falham em utilizar o contexto fornecido, um modo de falha que as métricas tradicionais (ROUGE/BERT) não penalizam. Inversamente, pipelines que impõem fundamentação estrita podem parecer ter um desempenho inferior em métricas de sobreposição lexical devido a comportamentos de abstenção mais seguros.

Os autores concluem que assegurar pipelines de QA RAG em domínios científicos exige métricas de avaliação que recompensem a segurança estrutural e modos de falha adequados (como a abstenção) em vez da fluência conversacional que depende da memória paramétrica. Eles propõem que futuros benchmarks devem priorizar métricas que imponham a fundamentação estrita da resposta para garantir que as afirmações científicas sejam empiricamente respaldadas pelos documentos de pesquisa citados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →