Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
O Marco DeepResearch é um agente de pesquisa profunda otimizado com um design centrado em verificação em três níveis (síntese de dados, construção de trajetórias e escalabilidade no tempo de teste) que supera agentes de grande escala em benchmarks desafiadores ao mitigar a propagação de erros através de mecanismos explícitos de validação.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você precisa encontrar uma informação muito específica e difícil na internet, como "Qual era o nome do gato do primo do ator que fez o filme X, mas que só apareceu em uma cena de 10 segundos?".
Para resolver isso, você não pode apenas dar um "Google" rápido. Você precisa de um detetive digital que pesquise, leia, conecte pontos, verifique se a informação é real e, se errar, volte atrás e tente de novo. É aqui que entra o Marco DeepResearch.
Este é um novo "detetive" criado pela Alibaba, e o segredo dele não é ser um gigante (ele é pequeno, com apenas 8 bilhões de "neurônios", enquanto outros rivais têm 30 bilhões), mas sim ser extremamente cuidadoso e organizado.
Aqui está a explicação do papel, usando analogias do dia a dia:
O Problema: O Detetive Desatento
Antes do Marco, os outros agentes de pesquisa (os "detetives" antigos) tinham um grande defeito: eles eram apressados.
- Eles faziam a pesquisa, encontravam uma resposta que parecia boa, e paravam.
- Se a primeira pista estivesse errada, eles continuavam a investigação baseada nessa mentira.
- Era como montar uma casa de cartas: se a primeira carta estiver torta, toda a casa cai.
A Solução: O Marco e o "Checador de Qualidade"
O Marco foi projetado com uma filosofia central: "Verificação em Primeiro Lugar". Pense nele como um detetive que tem um chefe rigoroso (um verificador) que não deixa nada passar sem uma segunda opinião.
O trabalho deles foi dividido em três etapas principais, como se fosse a produção de um filme:
1. Treinamento com Dados "À Prova de Falhas" (Síntese de Dados)
Para ensinar o Marco, eles precisaram criar um livro de exercícios (perguntas e respostas).
- O jeito antigo: Criavam perguntas difíceis, mas muitas vezes a resposta tinha mais de uma possibilidade ou estava errada. Era como treinar um aluno com um livro de matemática onde as respostas do gabarito estavam erradas.
- O jeito do Marco: Eles criaram um sistema de "checagem cruzada". Antes de aceitar uma pergunta para o treino, um "advogado do diabo" (um verificador) tenta provar que a resposta está errada. Se o verificador não conseguir derrubar a resposta, só então ela entra no livro de treino.
- Analogia: É como um teste de segurança onde você tenta quebrar o cadeado. Se o cadeado aguenta o ataque, só então ele é considerado seguro.
2. Aprendendo a "Pensar e Checar" (Trajetória de Pesquisa)
Ao treinar, o Marco não aprende apenas a dar a resposta final. Ele aprende a verificar cada passo.
- O jeito antigo: O agente pensava: "Pesquisei, achei, acabou".
- O jeito do Marco: O agente pensa: "Pesquisei. Espere, essa informação bate com a anterior? Vou pedir para outro agente (o verificador) checar isso. Se não bater, vou pesquisar de novo".
- Analogia: Imagine um cozinheiro. O cozinheiro antigo joga todos os ingredientes na panela e espera ficar bom. O Marco é como um chef que prova o molho a cada 5 minutos, ajusta o sal, e só serve o prato quando está perfeito.
3. O Poder de "Pensar Mais" na Hora da Prova (Escalonamento no Tempo de Teste)
Quando o Marco está resolvendo um problema real (não mais no treino), ele tem um limite de tempo ou de "tentativas" (chamado de orçamento de ferramentas).
- O jeito antigo: Se o tempo acabasse, ele dava a melhor resposta que tinha até aquele momento, mesmo que estivesse com medo de estar errado.
- O jeito do Marco: Se ele chegar perto do fim do tempo e ainda tiver dúvidas, ele usa uma estratégia inteligente: "Jogue tudo fora e comece de novo". Ele apaga as pistas confusas que acumulou e tenta encontrar a resposta por um caminho diferente, usando o verificador para garantir que a nova tentativa é sólida.
- Analogia: É como um jogador de xadrez que, se perceber que fez um movimento ruim, não continua jogando no mesmo erro. Ele volta ao tabuleiro, analisa a posição de novo e tenta uma estratégia diferente, garantindo que a próxima jogada seja a certa.
O Resultado: O "Guerreiro Pequeno" que Vence Gigantes
O resultado mais impressionante é que o Marco, sendo um modelo pequeno (8B), consegue vencer ou empatar com modelos gigantes (30B) em tarefas de pesquisa complexa.
- Por que? Porque ele não gasta energia tentando ser o mais rápido ou o mais "inteligente" de cara. Ele gasta energia verificando.
- Em testes onde era preciso navegar por dezenas de sites para achar um detalhe específico, o Marco foi mais preciso que os gigantes, porque ele não se deixou enganar por informações falsas ou pistas enganosas.
Resumo em uma frase
O Marco DeepResearch é como um detetive que, em vez de tentar adivinhar a resposta mais rápido, decide verificar cada pista três vezes, garantindo que, mesmo sendo menor e mais rápido, ele nunca cometa o erro de entregar uma mentira como verdade.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.