← Últimos artigos
💬 NLP

HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures

O HERMES introduz um substrato de rotulagem hierárquica reutilizável e derivado de dados que utiliza transformações semânticas aprendidas e quantização vetorial residual para anotar documentos com códigos de multigranularidade, permitindo a descoberta de estratégias ideais de mistura de dados através de diversas resoluções que métodos de granularidade fixa não conseguem testar.

Autores originais: Ziyun Qiao, Yue Min, Ruining Chen, Yujun Li

Publicado 2026-07-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ziyun Qiao, Yue Min, Ruining Chen, Yujun Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô gigante (uma IA) a falar e pensar, alimentando-o com uma biblioteca massiva de livros, sites e artigos. A grande questão não é apenas quanta informação você fornece a ele, mas quais livros você escolhe e em que ordem.

Este artigo apresenta uma nova ferramenta chamada HERMES para resolver um problema específico: Como organizamos essa biblioteca bagunçada para que o robô aprenda a melhor mistura possível de tópicos?

Aqui está a decomposição usando analogias simples:

1. O Problema: O Rótulo "Tamanho Único"

Imagine que você tem uma pilha gigante de documentos misturados. Para ensinar o robô, você precisa separar esses documentos em grupos.

  • O Jeito Antigo: Você poderia usar uma lista pré-definida de categorias como "Ciência", "História" ou "Culinária". Mas estas são rígidas. Se você quiser olhar para "Ciência" com mais detalhes, não pode simplesmente dar um zoom; você tem que jogar fora a lista antiga e criar uma marca nova do zero.
  • O Gargalo: O artigo argumenta que o problema não é a capacidade de aprendizado do robô (o "misturador"); o problema é o próprio sistema de rotulagem. Ele é muito rígido.

2. A Solução: HERMES (A "Boneca Russa" de Rótulos)

O HERMES é uma nova forma de rotular cada documento da biblioteca uma única vez, mas de uma maneira que permite que você dê "zoom in" ou "zoom out" o quanto quiser, sem nunca precisar reclassificar os livros.

Pense no HERMES como um conjunto de Bonecas Russas ou um sistema de endereçamento hierárquico:

  • Nível 1 (A Caixa Grande): Cada documento recebe um rótulo amplo, como "Música" ou "Culinária". Existem cerca de 256 dessas caixas grandes.
  • Nível 2 (A Caixa Média): Dentro de "Música", você pode dar zoom para ver subgrupos como "Rock", "Jazz" ou "Hip-Hop". Existem cerca de 65.000 destes.
  • Nível 3 (A Caixa Pequena): Dentro do "Hip-Hop", você pode dar zoom ainda mais para artistas ou eras específicas. Existem cerca de 130.000 desses pequenos grupos.

O Truque Mágico: Você não precisa rodar três máquinas de classificação diferentes. Você roda a máquina de classificação uma vez. O "nível de zoom" é apenas uma questão de quantos dígitos do endereço você lê.

  • Leu 1 dígito? Você obtém a categoria ampla de "Música".
  • Leu 3 dígitos? Você obtém a categoria específica de "Hip-Hop dos anos 1990".

Isso economiza uma quantidade massiva de poder computacional porque você só precisa rotular a biblioteca uma vez, mas pode experimentar diferentes níveis de detalhe instantaneamente.

3. A Descoberta: Não se Trata do "Melhor" Grupo, mas do "Zoom Certo"

Os pesquisadores testaram isso em um modelo de IA de 1 bilhão de parâmetros. Eles descobriram duas coisas surpreendentes:

Descoberta A: A Zona "Goldilocks" (Nem tão quente, nem tão frio)
Eles testaram duas formas de escolher livros dos grupos:

  1. A abordagem "Cobrir Todas as Bases": Escolher alguns livros de cada subgrupo, não importa quão pequeno ou de baixa qualidade seja.
  2. A abordagem "Alta Qualidade": Escolher apenas os 30% melhores livros dentro de cada subgrupo.

O Resultado: No nível de zoom intermediário (Nível 2, os 65.000 grupos), a abordagem de "Alta Qualidade" tornou o robô significativamente mais inteligente. Ele aprendeu melhor porque os grupos eram grandes o suficiente para que a escolha dos "melhores" livros realmente fizesse sentido.

Descoberta B: A Armadilha do "Muito Pequeno"
No entanto, quando deram zoom para o nível mais fino (Nível 3, os 130.000 grupos minúsculos), a abordagem de "Alta Qualidade" parou de funcionar.

  • Por quê? Os grupos tornaram-se tão pequenos que havia apenas um punhado de livros neles. Tentar escolher o "melhor" livro de um grupo de apenas 5 livros é como tentar escolher o melhor jogador de um time de 5 pessoas; a diferença é insignificante, e você pode acabar escolhendo um livro ruim por puro acaso.
  • A Lição: Você não pode continuar dando zoom para sempre. Existe um "ponto ideal" onde os grupos são detalhados o suficiente para serem úteis, mas grandes o suficiente para terem uma boa seleção de dados de alta qualidade.

4. A Conclusão: Uma Nova Forma de Pensar sobre Dados

O artigo conclui que o HERMES não é apenas um algoritmo de classificação melhor (ele na verdade performa quase o mesmo que os métodos de classificação padrão quando você olha para o panorama geral).

Seu real valor é que transforma a organização de dados de um "interruptor" em um "botão de ajuste" (dial).

  • Antes: Você tinha que escolher entre "Rótulos Coarsos" ou "Rótulos Finos" e ficar com eles.
  • Agora: Você pode usar um único sistema de rotulagem e ajustar o "botão de granularidade" para encontrar o equilíbrio perfeito para as necessidades específicas de treinamento da sua IA.

Em resumo, o HERMES oferece aos pesquisadores um mapa flexível e reutilizável de seus dados, permitindo que encontrem o "nível de zoom" perfeito onde a seleção de dados de alta qualidade realmente melhora a capacidade cerebral da IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →