← Últimos artigos
🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

Este artigo apresenta o Pensamento Eficiente em Orçamento (BET), um framework de duas etapas que otimiza a computação em tempo de teste de modelos de raciocínio de grande escala ao aprender a alocar orçamentos dinamicamente com base nos retornos esperados em vez da dificuldade percebida, alcançando assim uma redução significativa de tokens enquanto melhora o desempenho por meio de comportamentos adaptativos de "resolução rápida", "fold elegante" e "chamada heroica".

Autores originais: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

Publicado 2026-05-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente brilhante, mas ligeiramente excessivamente entusiasta, que está tentando resolver uma pilha enorme de quebra-cabeças para você. Este assistente é ótimo em pensar, mas tem um mau hábito: às vezes ele passa horas encarando um quebra-cabeça impossível de resolver, e outras vezes, ele superanalisa um quebra-cabeça simples que poderia ter sido resolvido em um minuto. Isso desperdiça seu tempo e dinheiro (na forma de poder de computação).

Este artigo apresenta um novo método de treinamento chamado BET (Pensamento Eficiente em Orçamento) para ensinar esse assistente a ser mais inteligente sobre quanto "energia de pensamento" ele gasta em cada quebra-cabeça.

Veja como o BET funciona, usando analogias simples:

O Problema: O "Superpensador" vs. O "Subpensador"

Atualmente, os grandes modelos de IA agem como um aluno que não sabe quando parar de estudar.

  • O Quebra-Cabeça Fácil: Se você perguntar "Qual é 2+2?", o aluno pode escrever um ensaio de 10 páginas provando por que 2+2 é igual a 4, desperdiçando tempo.
  • O Quebra-Cabeça Impossível: Se você fizer uma pergunta que atualmente é muito difícil para o aluno (como um problema matemático complexo que ele ainda não aprendeu), ele pode continuar tentando por horas, sem chegar a lugar nenhum, apenas porque não sabe que não consegue resolver.
  • O Quebra-Cabeça Difícil, mas Solúvel: Se o quebra-cabeça é difícil, mas factível, o aluno precisa continuar pensando. Mas os métodos atuais às vezes o interrompem muito cedo, fazendo-o desistir de um quebra-cabeça que ele poderia ter resolvido.

A Solução: Três Superpoderes do BET

O artigo ensina à IA três comportamentos específicos, que os autores chamam de "Resolução Rápida" (Short Solve), "Desistência Educada" (Nice Fold) e "Aposta Heroica" (Hero Call). Pense neles como estratégias de pôquer:

  1. Resolução Rápida (A Vitória Rápida):

    • A Analogia: Você vê uma mão simples no pôquer. Sabe que vai ganhar, então não precisa blefar ou superanalisar. Você apenas pega as fichas e segue em frente.
    • O que o BET faz: Se a IA vê uma pergunta fácil, ela responde rapidamente e de forma concisa. Ela para de desperdiçar energia em coisas que já conhece.
  2. Desistência Educada (Sabendo Quando Parar):

    • A Analogia: Você está jogando pôquer e percebe que sua mão é terrível e as probabilidades estão contra você. Um jogador inteligente "desiste" (abandona) imediatamente para economizar seu dinheiro para mãos melhores. Ele não continua jogando dinheiro em um jogo perdedor.
    • O que o BET faz: Se a IA percebe que uma pergunta é muito difícil para sua capacidade mental atual, ela diz "Não consigo resolver isso" e para imediatamente. Ela não perde tempo tentando forçar uma resposta em um problema que não consegue desvendar. Isso economiza uma quantidade enorme de poder de computação.
  3. Aposta Heroica (Ir Tudo no Momento Certo):

    • A Analogia: Você tem uma mão forte no pôquer, mas ainda não é óbvio. Você sabe que precisa investir mais dinheiro para ganhar o pote grande. Você faz uma "aposta heroica" e continua jogando profundamente.
    • O que o BET faz: Se a IA vê uma pergunta difícil que ela pode resolver se pensar bastante, ela economiza sua energia e continua. Ela não se corta muito cedo.

Como Eles Ensinaram a IA (O Treinamento em Duas Etapas)

Os pesquisadores não apenas disseram à IA para "ser eficiente". Eles a ensinaram em dois passos:

  • Etapa 1: O Plano de Aula (Início Frio): Eles mostraram à IA exemplos de como se comportar. Mostraram: "Aqui está um problema fácil; aqui está como você o responde rapidamente." "Aqui está um problema impossível; aqui está como você diz 'Eu desisto'." "Aqui está um problema difícil; aqui está como você continua pensando."
  • Etapa 2: O Jogo de Prática (Aprendizado por Reforço): Eles deixaram a IA jogar o jogo. Toda vez que a IA tentava resolver um problema, o sistema verificava: "Você desperdiçou tempo em um problema impossível? Você desistiu muito cedo de um difícil?" Com base nos resultados, deram à IA uma pontuação (uma recompensa). Se a IA economizasse dinheiro em problemas impossíveis, mas ainda resolvesse os difíceis, ela recebia uma pontuação alta.

Os Resultados

Quando testaram esse novo método em sete testes diferentes de matemática e lógica:

  • Economizou cerca de 55% do tempo de pensamento. A IA usou aproximadamente metade do poder de computação que usava antes.
  • Melhorou na resolução de problemas. Como não estava desperdiçando tempo em tarefas impossíveis ou superanalisando as fáceis, ela na verdade resolveu mais problemas difíceis corretamente.
  • Funciona em novos tipos de quebra-cabeças. Mesmo tendo sido treinada apenas em matemática, ela aplicou esses hábitos de "gastar com inteligência" a perguntas de ciências e quebra-cabeças de lógica que nunca havia visto antes.

A Conclusão

O BET ensina os modelos de IA a serem como um investidor inteligente. Em vez de gastar dinheiro (poder de computação) cegamente, ele calcula o "retorno sobre o investimento" para cada pergunta.

  • Se o retorno for baixo (pergunta fácil), gaste pouco.
  • Se o retorno for negativo (pergunta impossível), não gaste nada.
  • Se o retorno for alto (difícil, mas solúvel), invista pesadamente.

Isso torna a IA mais rápida, mais barata de executar e, surpreendentemente, melhor em resolver as coisas difíceis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →