← Últimos artigos
🤖 AI

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

Este artigo apresenta uma prova de conceito demonstrando que o Aprendizado por Reforço com Recompensas Verificáveis (RLVR) melhora significativamente a capacidade de pequenos modelos de linguagem de executar chamadas de ferramentas complexas e de múltiplas etapas em ambientes sintéticos da Atlassian (Jira e Confluence), alcançando taxas de sucesso próximas da perfeição na maioria dos cenários sem depender de APIs ao vivo ou de feedback humano.

Autores originais: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

Publicado 2026-07-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um bibliotecário muito inteligente e culto (a IA) que é ótimo em prever a próxima palavra de uma frase. Se você perguntar "O céu é...", ele dirá confiantemente "azul". Mas se você pedir para ele realmente fazer algo em um sistema de escritório complexo — como "Criar um novo ticket de projeto e vinculá-lo a uma página específica" — ele frequentemente tropeça. Ele pode saber as palavras para dizer, mas erra os detalhes, como colocar o número de ID errado na caixa errada ou esquecer de verificar se a caixa existe primeiro.

Este artigo trata de ensinar esse bibliotecário a realmente fazer o trabalho, não apenas falar sobre ele, usando um método de treinamento específico chamado RLVR (Aprendizado por Reforço com Recompensas Verificáveis).

Aqui está a divisão do experimento deles em termos cotidianos:

1. O Problema: O "Piloto Automático" vs. O "Piloto"

Grandes Modelos de Linguagem (LLMs) são treinados para serem como pilotos automáticos que preveem a próxima palavra. Eles são excelentes em escrever histórias ou e-mails. Mas, em um escritório corporativo (especificamente usando ferramentas da Atlassian como Jira e Confluence), o sucesso não é sobre escrever uma frase bonita; é sobre apertar os botões exatos na ordem exata com os dados exatos.

  • O Jeito Antigo: Você pede à IA para "Criar uma subtarefa". A IA pode dizer: "Ok, vou criar uma subtarefa", mas ela esquece de atribuí-la a uma pessoa ou usa o código do projeto errado. Ela parece fluente, mas a tarefa falha.
  • O Objetivo: Os autores queriam ver se poderiam treinar a IA para parar de apenas "adivinhar a próxima palavra" e começar a "agir como um piloto" que verifica os instrumentos antes de voar.

2. A Solução: Um Campo de Treinamento de "Videogame"

Em vez de deixar a IA praticar nos servidores reais e vivos da empresa (o que é arriscado e lento), os autores construíram um gêmeo digital perfeito (uma versão de videogame) dos sistemas Jira e Confluence.

  • O Simulador: Este "jogo" parece e age exatamente como o software real, mas é seguro. Se a IA cometer um erro, nada quebra.
  • O Árbitro (O Sistema de Recompensa): Este é o ingrediente secreto. Geralmente, você precisa de um humano para avaliar o trabalho da IA. Aqui, eles construíram um árbitro automatizado e rigoroso.
    • Se a IA coloca os dados certos na caixa certa? Pontos.
    • Se a IA verifica se uma página existe antes de tentar editá-la? Pontos de bônus.
    • Se a IA tenta usar uma ferramenta que não existe ou esquece uma etapa obrigatória? Pontos de penalidade.
    • Crucialmente: O árbitro não precisa de um humano para olhar a tela. Ele apenas verifica a matemática e o código.

3. O Treinamento: Tentativa e Erro

Eles pegaram duas versões de uma IA (um modelo menor de 1.7B e um modelo maior de 4B) e as deixaram jogar nesse simulador milhares de vezes.

  • A IA tenta completar uma tarefa (como "Criar uma página").
  • Ela falha, recebe uma pontuação baixa do árbitro e tenta novamente.
  • Ela aprende lentamente: "Ah, eu ganhei pontos quando verifiquei a página pai primeiro. Eu perdi pontos quando esqueci o código do projeto."
  • Isso é Aprendizado por Reforço: A IA aprende recebendo recompensas por bom comportamento e penalidades por mau comportamento.

4. Os Resultados: De "Ok" para "Perfeito"

Eles testaram a IA antes e depois deste treinamento em cinco tarefas de escritório diferentes.

  • Antes do Treinamento: A IA era decente em tarefas simples, mas terrível em tarefas complexas. Por exemplo, ao criar uma nova página no Confluence, a IA não treinada obtinha apenas cerca de 35% dos pontos. Ela cometia erros pequenos, mas custosos.
  • Após o Treinamento: A IA treinada tornou-se quase perfeita. Na mesma tarefa de criação de página, ela saltou para 100%.
  • A Grande Vitória: O treinamento foi mais eficaz nas tarefas mais difíceis (aquelas com mais regras e campos de dados). A IA aprendeu a seguir o padrão rigoroso de "verificar-então-fazer" exigido por esses sistemas.

5. A Ressalva (Limitações)

Os autores são muito honestos sobre o que isso ainda não faz:

  • Não é mágica para tudo: Eles tiveram que criar manualmente as "regras do árbitro" para essas tarefas específicas. Você não pode simplesmente conectar isso a qualquer software no mundo sem construir um novo árbitro para ele primeiro. É como ter um treinador que é incrível ensinando futebol, mas ainda não aprendeu basquete.
  • Uma tarefa era fácil demais: Para uma tarefa específica (alterar o status de um ticket), a IA já era perfeita antes do treinamento, então o treinamento não adicionou valor ali.

A Conclusão

Este artigo prova que você pode pegar uma IA padrão, colocá-la em um ambiente de escritório simulado e seguro, e usar um árbitro automatizado e rigoroso para ensiná-la a seguir regras complexas. Isso transforma a IA de um "bot tagarela" que soa bem, mas falha nos detalhes, em um "trabalhador confiável" que realiza o trabalho perfeitamente. No entanto, isso requer a construção de uma "academia de treinamento" personalizada para cada tipo específico de software que você deseja que ela utilize.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →