← Últimos artigos
💬 NLP

POLARIS: Guiding Small Models to Write Long Stories

O artigo apresenta o POLARIS, uma receita de treinamento GRPO de baixo custo computacional que combina recompensas de LLM-como-juiz com injeção de referência humana para permitir que modelos pequenos como o Qwen3.5-9B gerem histórias de formato longo e alta qualidade que rivalizam com modelos muito maiores, mantendo simultaneamente forte adesão ao comprimento e generalização.

Autores originais: Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

Publicado 2026-06-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: Pequenos Escritores se Cansam

Imagine que você tem um robô escritor muito inteligente, mas pequeno (um "modelo pequeno"). Se você pedir para ele escrever um conto curto, ele é ótimo. Mas, se você pedir para ele escrever um romance longo, duas coisas ruins acontecem:

  1. Ele desiste: Ele para de escrever muito antes da história terminar.
  2. Ele perde o juízo: A história fica bagunçada, repetitiva ou entediante à medida que se torna mais longa.

Supercomputadores caros e grandiosos (como os "modelos de fronteira") conseguem escrever histórias longas bem, mas são caros demais para a maioria das pessoas usarem. Os autores deste artigo perguntaram: "Podemos ensinar um robô pequeno e barato a escrever histórias longas e de alta qualidade sem precisar de um supercomputador?"

A Solução: POLARIS

Eles criaram uma receita de treinamento chamada POLARIS. Pense nisso como um método especial de treinamento para o robô. Em vez de apenas deixar o robô praticar sozinho, eles adicionaram dois ingredientes secretos ao seu acampamento de treinamento.

Ingrediente 1: O "Editor Rigoroso" (O Juiz LLM)

Normalmente, ao treinar uma IA, usa-se uma "folha de pontuação" simples que apenas diz "Bom" ou "Ruim". Isso é como um professor dando uma nota "C" a um aluno sem dizer o porquê.

O POLARIS utiliza um Juiz LLM de Fronteira (uma IA muito avançada) atuando como um Editor Rigoroso.

  • Como funciona: Em vez de apenas dar uma nota, este Editor lê a história e preenche uma Rubrica detalhada (um checklist).
  • O Checklist: Ele observa 16 coisas diferentes, como "O personagem teve uma voz clara?" (Bom) ou "A história ficou repetitiva?" (Ruim).
  • A Analogia: Imagine um workshop de escrita onde um autor famoso lê sua história e dá notas específicas: "Seu diálogo está muito rígido" ou "O final parece apressado". O robô aprende com essas notas específicas, não apenas com uma nota genérica.

Ingrediente 2: A "Âncora Humana" (Injeção de Referência Humana)

Esta é a parte mais única. Em um grupo de treinamento típico, o robô gera 5 histórias diferentes, e o computador escolhe a melhor delas para aprender. Mas, às vezes, todas as 5 histórias são medíocres, e o robô fica preso em um ciclo de escrever histórias "ok", mas não "ótimas".

O POLARIS adiciona uma Âncora Humana a cada grupo.

  • Como funciona: Para cada comando (prompt), o sistema força o robô a olhar para uma história real escrita por um humano ao lado de suas próprias tentativas.
  • A Analogia: Imagine um grupo de alunos tentando resolver um problema de matemática. Normalmente, eles apenas comparam suas respostas entre si. Mas, nesta classe, o professor coloca um exemplo perfeitamente resolvido no quadro. Os alunos não estão apenas adivinhando; eles têm uma "Estrela do Norte" para seguir. Mesmo que o robô não copie a história humana, ver esse exemplo de alta qualidade mantém a "ambição" do robô alta e evita que ele se acomode com uma escrita de baixa qualidade.

Os Resultados: O Modelo "Pequeno" que Joga de Igual para Igual

Os autores pegaram um modelo padrão de 9 bilhões de parâmetros (Qwen3.5-9B) e o treinaram usando este método em cerca de 1.400 contos.

  • A Surpresa: Embora o robô tenha sido treinado apenas em histórias de até 4.000 palavras, ele aprendeu a escrever histórias de até 12.000 palavras (3 vezes mais longas!) sem perder a qualidade.
  • A Comparação:
    • Vs. Modelo Base: É muito melhor do que a versão não treinada.
    • Vs. Modelos Gigantes: Desempenha quase tão bem quanto modelos que são 3 vezes maiores (27 bilhões de parâmetros) e muito mais caros.
    • O "Teste de Estresse": A maioria dos modelos pequenos entra em colapso quando solicitada a escrever histórias longas. O POLARIS é o único modelo pequeno que se manteve forte, mantendo a história coerente e realmente terminando o comprimento solicitado.

Por que Isso Importa

O artigo argumenta que a "Generalização de Comprimento" (a capacidade de escrever textos mais longos do que o limite de treinamento) é um excelente teste de estresse.

  • A Metáfora: Se você treina um corredor para uma corrida de 1 milha, ele pode se cansar aos 2 quilômetros. Se ele consegue correr 3 milhas sem parar, isso prova que ele tem resistência real, não apenas um surto de velocidade.
  • O POLARIS provou que, com o "treinamento" certo (o Editor Rigoroso e a Âncora Humana), um modelo pequeno pode ter a resistência de um gigante.

Resumo

O POLARIS é um método de treinamento inteligente e de baixo custo que ensina modelos de IA pequenos a escrever histórias longas e criativas através de:

  1. Fornecer feedback detalhado e específico de um editor de IA inteligente.
  2. Mostrar exemplos humanos de alta qualidade para manter o foco em alto nível.

O resultado é uma IA pequena e acessível que escreve histórias longas tão bem quanto as gigantes e caras, sem precisar de um supercomputador para rodar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →