← Últimos artigos
💬 NLP

Characterizing Narrative Content in Web-scale LLM Pretraining Data

Este artigo introduz um novo framework e um conjunto de dados, o NarraDolma, para caracterizar a estrutura narrativa detalhada dos dados de pré-treinamento de LLMs em escala web, revelando que as qualidades narrativas estão mensuravelmente presentes, mas são distribuídas desigualmente entre fontes e tópicos de maneiras que as práticas atuais de curadoria negligenciam.

Autores originais: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assando um bolo gigante para uma festa enorme. A receita pede "farinha", mas você não sabe que tipo de farinha tem. É uma farinha de bolo fina e sedosa? Trigo integral grosseiro? Está misturada com areia?

Por muito tempo, cientistas construindo "Large Language Models" (LLMs) — os cérebros de IA superinteligentes por trás de ferramentas como chatbots — estiveram misturando sua "farinha" (o texto da internet usado para o treinamento) sem realmente saber os ingredientes específicos. Eles sabiam que algumas partes eram "tóxicas" ou "sobre matemática", mas não sabiam muito sobre as histórias dentro da mistura.

Este artigo é como uma equipe de cientistas de alimentos que decidiu levar um microscópio até esse enorme monte de farinha. Eles queriam responder: Quanto de narrativa realmente existe aí dentro e como ela se parece?

Aqui está o detalhamento da investigação deles:

1. O Livro de Receitas (O Framework)

Os pesquisadores não apenas perguntaram: "Isso é uma história?" (Sim/Não). Em vez disso, eles criaram um perfil de sabor detalhado baseado em como os humanos contam histórias. Eles dividiram a "narrativa" em três ingredientes principais:

  • O Ator (Agência): Quem está agindo? Estamos vendo o mundo através dos olhos deles? Sentimos suas emoções ou ouvimos seus pensamentos? (Pense nisso como o "coração" da história).
  • O Palco (Cenário): Onde e quando isso está acontecendo? É um "lugar qualquer" vago ou um quarto empoeirado específico na Paris de 1920? (Pense nisso como o "pano de fundo").
  • O Enredo (Eventos): O que realmente acontece? As coisas mudam? Existe uma cadeia de causa e efeito ou apenas uma lista de coisas? (Pense nisso como a "ação").

Eles transformaram isso em 11 "ponteiros" ou controles deslizantes específicos que podem ser avaliados de 1 a 5.

2. A Degustação (Os Dados)

Eles pegaram uma biblioteca massiva de textos da internet chamada DOLMA (que é enorme — 3 trilhões de palavras, como uma biblioteca que levaria uma vida inteira para ler).

  • Passo 1: Eles não podiam ler tudo. Então, construíram um assistente robô (um modelo chamado NARRABERT) para ajudá-los.
  • Passo 2: Primeiro, contrataram especialistas humanos para ler 400 trechos aleatórios e avaliá-los com base naqueles 11 ponteiros. Este foi o "padrão ouro".
  • Passo 3: Eles ensinaram o assistente robô a imitar os humanos.
  • Passo 4: O robô passou por 3 milhões de trechos e os avaliou. Eles criaram um novo mapa chamado NARRADOLMA.

3. As Descobertas Surpreendentes

Quando olharam para o mapa, descobriram três coisas grandes:

A. Histórias não são apenas "ligadas" ou "desligadas".
Não é como um interruptor de luz onde um texto é uma história ou não é. É mais como um dimmer (controle de intensidade). Alguns textos são muito fracos (fatos entediantes), outros são brilhantes (romances dramáticos), e a maioria está em algum lugar entre os dois. Os pesquisadores descobriram que a "narrativa" na internet é um cenário contínuo e multidimensional, não uma categoria simples.

B. A "farinha" é misturada de forma desigual.
Se você pensa que o "Reddit" é cheio de histórias e a "Wikipedia" é cheia de fatos, você está quase certo, mas é mais complexo.

  • Reddit e Livros são como um porta-temperos cheio de "sentimentos internos" e "pensamentos de personagens". Eles são altos nos ponteiros do "Ator".
  • Wikipedia e Notícias são como um mapa. São altos em "Eventos" e "Tempo/Lugar", mas baixos em "Sentimentos".
  • Blogs de Viagem e Gastronomia são como uma pintura. São altos em "detalhes sensoriais" (cheiros, visões), mas baixos em "Conflito".

C. Você não pode simplesmente "adicionar mais histórias" adicionando mais livros.
Os pesquisadores descobriram que, mesmo dentro de uma única fonte (como o Reddit), a "narrativa" varia drasticamente. Alguns posts do Reddit são puro drama; outros são apenas perguntas técnicas.

  • A Metáfora: Imagine que você quer deixar seu bolo mais "fofinho". Você pode pensar: "Vou apenas adicionar mais farinha de bolo!". Mas se esse saco de farinha contém, na verdade, uma mistura de farinha de bolo, areia e cascalho, apenas adicionar mais do saco não garante um bolo mais fofinho. Você precisa saber qual parte específica do saco é a boa farinha.

4. Por que Isso Importa

O artigo conclui que as pessoas que constroem modelos de IA têm tratado suas fontes de dados (como "Reddit" ou "Notícias") como se fossem todas do mesmo tipo de contador de histórias. Elas não são.

Se uma IA for treinada principalmente em "Notícias" (altos eventos, baixos sentimentos), ela pode ser boa em relatar fatos, mas ruim em entender emoções humanas. Se for treinada principalmente no "Reddit" (altos sentimentos, baixa estrutura), ela pode ser boa em empatia, mas ruim em lógica de causa e efeito.

A Conclusão:
Este artigo não inventou uma nova IA nem consertou uma quebrada. Em vez disso, construiu uma fita métrica para as histórias da internet. Ele nos mostrou que a parte da "narrativa" dos nossos dados é bagunçada, variada e distribuída de forma desigual. Antes de podermos ensinar a IA a contar histórias melhores, primeiro temos que entender exatamente que tipo de histórias estão atualmente na mistura.

Os pesquisadores disponibilizaram sua fita métrica (o modelo) e seu mapa (o conjunto de dados) para que qualquer outra pessoa possa usar, para que todos possamos começar a assar bolos melhores no futuro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →