← Últimos artigos
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

O artigo apresenta o Deco-G, um framework de decodificação que melhora o desempenho de modelos de linguagem de grande escala em tarefas complexas ao desacoplar a resolução de problemas de requisitos de formatação rígidos por meio de um Módulo de Estimativa de Formato dedicado que garante a conformidade sem prejudicar o raciocínio.

Autores originais: Haikang Deng, Po-Nien Kung, Nanyun Peng

Publicado 2026-07-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haikang Deng, Po-Nien Kung, Nanyun Peng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está pedindo a um robô superinteligente para resolver um problema de matemática difícil, mas exige que ele escreva a resposta em um formato muito específico e rígido, como "A resposta final é 42". Geralmente, quando você mistura a parte de "pensar muito" com a parte de "escrever perfeitamente" em uma única instrução grande, o robô fica confuso. É como tentar fazer malabarismo enquanto caminha em uma corda bamba; muitas vezes ele deixa a bola cair (a matemática) ou tropeça na corda (o formato).

O artigo de Haikang Deng e colegas apresenta um novo sistema chamado DECO-G para consertar isso. Pense no DECO-G como uma união brilhante entre dois especialistas: um Solucionador de Problemas e um Policial de Formato.

O Problema: A Bagunça "Emaranhada"

No modo antigo, você dava ao robô um comando gigante: "Resolva este problema de matemática E certifique-se de escrever a resposta em uma caixa JSON". O artigo argumenta que esse "emaranhamento" prejudica o cérebro do robô. Eles sugerem que, quando o robô tenta fazer as duas coisas ao mesmo tempo, começa a cometer erros na matemática apenas para satisfazer as regras de formatação.

Os autores argumentam explicitamente contra a ideia de que simplesmente dizer ao robô para "ter cuidado" ou usar templates rígidos pré-fabricados (como forçá-lo a seguir um esquema JSON estrito passo a passo) seja a melhor solução. Eles descobriram que esses métodos rígidos frequentemente interrompem o raciocínio do robô no meio do caminho, levando a respostas incoerentes ou cálculos errados, mesmo que o formato pareça perfeito.

A Solução: A Estratégia de Duas Equipes

O DECO-G divide o trabalho.

  1. O Solucionador de Problemas (O LLM): Este é o robô principal. Ele recebe apenas o problema de matemática. Ele não se preocupa com o formato de forma alguma. Ele apenas pensa, raciocina e resolve o problema livremente.
  2. O Policial de Formato (O FEM): Este é um módulo auxiliar separado e menor. Ele não resolve a matemática. Seu único trabalho é observar a saída do robô e sussurrar: "Ei, você está chegando perto do fim, mas precisa dizer 'A resposta final é' antes de dar o número".

A mágica acontece na forma como eles conversam. O Policial de Formato usa um "lookahead probabilístico" (uma maneira sofisticada de espiar o futuro) para adivinhar: "Se o robô disser 'A' agora, quais são as chances de ele terminar a frase corretamente?". Se as chances forem baixas, o Policial gentilmente direciona a escolha da próxima palavra do robô para guiá-lo de volta ao caminho, sem forçá-lo a parar de pensar.

As Armas Secretas

Para fazer essa parceria funcionar rápido e sem atrasar o computador, os autores introduziram três truques legais:

  • Destilação Consciente de Instrução: Em vez de treinar o Policial de Formato em conversas aleatórias e chatas, eles o treinaram especificamente em como o robô se comporta quando está realmente tentando resolver problemas. Isso torna o Policial muito mais inteligente ao saber o que o robô provavelmente fará a seguir.
  • Construção de Trie Flexível: Imagine um mapa de todas as formas possíveis de a resposta parecer. Normalmente, esses mapas ficam enormes e bagunçados se a resposta puder ter comprimentos diferentes. Os autores construíram um mapa "flexível" que mescla caminhos, para que o computador não fique sobrecarregado tentando verificar cada possibilidade individual.
  • Poda de Estado HMM: O Policial de Formato tem um cérebro enorme com milhares de estados ocultos. Os autores perceberam que, na maioria das vezes, o robô só se importa com um pequeno grupo desses estados. Então, eles disseram ao Policial para ignorar o resto, reduzindo o trabalho computacional em cerca de 13 vezes (de aproximadamente 1,08 GFLOPs para 0,08 GFLOPs por etapa) mantendo a precisão quase a mesma.

O Que os Números Dizem

A equipe testou isso em três desafios diferentes:

  1. Problemas de Matemática (GSM8k): Ao resolver matemática de nível escolar, o DECO-G superou consistentemente os outros métodos. Por exemplo, no modelo Llama-3.1-8B, ele acertou 85,2% das respostas mantendo 100% de conformidade de formato. Em contraste, um método rígido chamado "Outlines" acertou apenas 81,3%, e uma abordagem padrão de "Apenas Prompt" obteve 82,3% de acerto, mas falhou no formato na maioria das vezes.
  2. Extração de Eventos: Ao extrair detalhes específicos de notícias, o DECO-G melhorou as pontuações para identificar quem fez o quê (a métrica "Argument Id" subiu para 39,4 para o Llama).
  3. LLM-como-Juiz: Quando o robô tinha que avaliar resumos, o DECO-G ajudou a alinhar melhor com juízes humanos, alcançando as maiores pontuações médias de correlação (como 0,418 para Coerência no Llama).

O Veredito

O artigo sugere que, ao separar o "pensar" da "formatação", podemos obter o melhor dos dois mundos: respostas que são matematicamente corretas e perfeitamente formatadas. Os autores mediram isso através de conjuntos de dados reais e descobriram que o DECO-G supera consistentemente o ato de tentar fazer tudo de uma vez ou usar restrições forçadas e rígidas.

No entanto, eles observam algumas ressalvas. Este sistema não é uma varinha mágica que funciona instantaneamente em qualquer robô; você tem que treinar um novo "Policial de Formato" para cada modelo de robô específico que usar. Além disso, para alguns modelos (como a série Qwen), o cérebro do robô é tão focado que você precisa pressionar o Policial de Formato com mais força (usando um fator de controle de γ=2) para que ele escute.

Em resumo, o DECO-G sugere que, se você quer que um robô seja um gênio na matemática e um perfeccionista na formatação, não deve pedir que ele faça as duas coisas ao mesmo tempo. Dê a ele um parceiro para lidar com as regras e observe-o brilhar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →