← Últimos artigos
💬 NLP

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

O artigo apresenta o ASTER, um framework que supera o colapso de interação no raciocínio integrado com ferramentas ao alavancar uma estratégia de cold-start direcionada com trajetórias densas de interação, permitindo que um modelo de 4 bilhões de parâmetros alcance o estado da arte em benchmarks matemáticos como o AIME 2025.

Autores originais: Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

Publicado 2026-02-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um aluno muito inteligente, mas inexperiente (um Grande Modelo de Linguagem), a resolver problemas matemáticos incrivelmente difíceis. O aluno é brilhante em pensar, mas frequentemente comete pequenos erros de cálculo que se transformam em respostas erradas porque tenta fazer tudo de cabeça.

O artigo apresenta um novo método de treinamento chamado ASTER (Agentic Scaling with Tool-integrated Extended Reasoning) para corrigir isso. Aqui está a história de como eles fizeram isso, usando analogias simples.

O Problema: O Aluno "Autoconfiante"

Anteriormente, pesquisadores tentaram ensinar esses modelos de IA a usar ferramentas (como uma calculadora ou um interpretador de código) apenas deixando-os praticar e aprender com seus erros (Aprendizado por Reforço).

No entanto, isso frequentemente levava a um problema que os autores chamam de "Colapso de Interação".

  • A Analogia: Imagine um aluno que deve usar uma calculadora para um teste de matemática longo e complexo. Em vez disso, ele tenta fazer a matemática difícil de cabeça, se confunde e, no final, apenas digita 1+1 na calculadora para "conferir" seu trabalho. Ele não usou a ferramenta para ajudá-lo a pensar; ele apenas a usou como uma pequena rede de segurança no final.
  • O Resultado: A IA para de usar as ferramentas de forma eficaz. Ela retorna a "pensar" demais internamente, comete erros e falha ao resolver problemas longos e complexos.

A Solução: O Aprendizado de "Mestre Chef"

Os autores perceberam que, antes de deixar um aluno praticar por conta própria, você precisa mostrar a ele como usar as ferramentas adequadamente primeiro. Eles chamam isso de Cold-Start SFT (Ajuste Fino Supervisionado).

Eles testaram diferentes maneiras de ensinar o aluno:

  1. O Método de "Correção Rápida": Mostrar ao aluno soluções onde a ferramenta é usada apenas uma ou duas vezes.
  2. O Método de "Mergulho Profundo" (ASTER): Mostrar ao aluno um pequeno conjunto de exemplos (apenas 4.000) onde a ferramenta é usada constantemente.

A Descoberta Chave: Densidade de Interação
O artigo descobriu que a densidade do uso da ferramenta nos exemplos de treinamento importa mais do que qualquer outra coisa.

  • A Analogia: Se você quer ensinar um chef a cozinhar um jantar de 10 pratos, mostrar a ele uma receita onde ele usa o forno apenas uma vez não é suficiente. Você precisa mostrar a ele uma receita onde ele está constantemente picando, mexendo, provando e ajustando o calor.
  • A Abordagem ASTER: Eles criaram um conjunto de dados "Mestre Chef" onde a IA tinha que usar a ferramenta (o interpretador de código) repetidamente — às vezes mais de 9 vezes em um único problema — para resolvê-lo. Isso ensinou à IA um "hábito" (ou viés comportamental) de conferir constantemente seu trabalho com a ferramenta, em vez de apenas adivinhar.

O Processo de Treinamento: Duas Etapas

Depois que a IA aprendeu esse "hábito" através desses 4.000 exemplos, eles a deixaram praticar por conta própria usando Aprendizado por Reforço.

  1. Etapa 1 (A Rodada de Prática): A IA pratica com um limite de quantas vezes ela pode usar a ferramenta. Ela aprende a ser eficiente.
  2. Etapa 2 (A Maratona): Eles dão à IA um "espaço de pensamento" muito mais longo (mais memória) e permitem que ela use a ferramenta até 50 vezes. Como ela aprendeu o hábito do "Mergulho Profundo" anteriormente, ela não colapsa; ela continua usando a ferramenta de forma eficaz para resolver problemas mais difíceis.

Os Resultados: Pequenos, mas Poderosos

A parte mais surpreendente do artigo é o tamanho do modelo.

  • Eles treinaram um modelo relativamente pequeno (4 Bilhões de parâmetros).
  • A Analogia: É como um carro de corrida pequeno e ágil que, porque foi ensinado a técnica de direção perfeita, consegue vencer caminhões enormes e pesados (modelos de IA muito maiores) em uma pista difícil.
  • A Pontuação: Em uma competição de matemática muito difícil (AIME 2025), este modelo pequeno obteve 90,0%, superando modelos muito maiores, como o DeepSeek-V3.2 (que possui 671 Bilhões de parâmetros), e até alguns dos melhores modelos da OpenAI.

Resumo do "Ingrediente Secreto"

O artigo afirma que, para tornar uma IA boa em usar ferramentas para tarefas longas e difíceis, você não deve apenas jogá-la no fundo do poço. Em vez disso:

  1. Não se preocie com a perfeição imediata: Os exemplos de treinamento iniciais não tornaram a IA perfeita na matemática imediatamente.
  2. Foque no "Fluxo": Você deve forçar a IA a usar a ferramenta muito durante o treinamento inicial.
  3. A Recompensa: Isso cria um hábito forte. Quando a IA começa a praticar por conta própria, ela naturalmente continua usando a ferramenta, permitendo que resolva problemas que antes eram impossíveis para ela.

Em resumo: Ensine a IA a usar a calculadora constantemente, não apenas no final, e ela se tornará um gênio da matemática.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →