← Últimos artigos
🤖 AI

AcademiClaw: When Students Set Challenges for AI Agents

Este artigo apresenta o AcademiClaw, um benchmark bilíngue de 80 tarefas acadêmicas complexas e do mundo real, curado a partir de submissões de estudantes, para avaliar e diagnosticar as limitações dos agentes de IA atuais no enfrentamento de desafios de longo prazo e multissetoriais, revelando que até mesmo os modelos de ponta alcançam apenas uma taxa de aprovação de 55%.

Autores originais: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou
Publicado 2026-05-06
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou, Binghao Qiang, Borui Zhang, Chenning Li, Enchang Zhang, Feifan Chen, Feng Jian, Fengyin Sun, Hao Qiu, Hao Zheng, Haoran Zhu, Hongyu Liu, Jianbin Deng, Jiaxin Song, Jiaying Chi, Jiayou Shi, Jie Fang, Jinghui Zhong, Jingyu Zhou, Jinze Li, Junfeng Yi, Junyan Yu, Junzhi Xue, Ni Song, Pengyi Chen, Qi Chen, Quansheng Li, Rui Tao, Shenghai Gong, Shenhang Lu, Tianqi Shen, Tianxiang Zhu, Tiehan Kang, Tingyu Li, Wendi Wu, Xiao Shen, Xiao Zhou, Xiaotao Zhang, Xinrong Li, Xuankun Yang, Xun Zhang, Yan Li, Ye Lu, Yi Wang, Yibo Zhou, Yichi Zhang, Yihao Sun, Yijun Huang, Yixin Zhu, Yixuan Wu, Yuchen Sun, Yue Wu, Yuheng Sun, Yukun Li, Yutian Tu, Yuxuan Qin, Yuzhuo Wu, Zeyu Li, Zhengyu Lou, Zhenning Ran, Zizhu He, Pengfei Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você construiu um assistente robótico superinteligente. Até agora, você o testou pedindo que realizasse tarefas simples: "Organize estes e-mails", "Adicione esta reunião à minha agenda" ou "Encontre uma receita de massa". O robô é excelente nessas tarefas. É como um secretário pessoal muito eficiente.

Mas aqui está o problema: nós realmente não sabemos se esse robô consegue realizar trabalho real e difícil. Ele consegue resolver um problema matemático complexo? Consegue criar um videogame do zero? Consegue depurar um chip de computador quebrado? Até agora, ninguém realmente fez essas perguntas ao robô de maneira justa e padronizada.

É sobre isso que trata este artigo, AcademiClaw. É um novo "exame final" para agentes de IA, projetado não por pesquisadores em um laboratório, mas por estudantes universitários que realmente estão lutando com suas tarefas de casa e projetos.

Aqui está uma análise do artigo usando analogias simples:

1. O Problema: O "Secretário" vs. O "Engenheiro"

Pense nas atuais avaliações de IA (testes para IA) como uma prova de habilitação para um entregador de supermercado. Elas verificam se você consegue estacionar em paralelo e parar em um sinal vermelho. Isso é útil, mas não diz se você consegue pilotar um carro de Fórmula 1 ou reparar um motor de jato.

O artigo argumenta que os testes existentes para o sistema de IA "OpenClaw" apenas verificam habilidades de nível de "assistente" (como organizar arquivos). Eles deixam uma lacuna enorme: habilidades de nível acadêmico. Estas são as tarefas profundas e complexas que exigem anos de estudo, como provar um teorema matemático ou treinar um modelo de IA complexo.

2. A Solução: Um Exame "Submetido por Estudantes"

Em vez de pesquisadores inventarem problemas falsos, os autores pediram que 230 estudantes universitários submetessem problemas reais que enfrentaram.

  • O Cenário: Um estudante tenta usar uma IA para ajudar em um projeto de programação difícil ou em um artigo de pesquisa. A IA falha ou fica travada. O estudante diz: "Isso é muito difícil para a IA".
  • O Filtro: Especialistas revisaram essas 230 submissões e selecionaram as 80 melhores.
  • O Resultado: Um conjunto de testes que abrange 25 áreas diferentes, desde matemática de nível olímpico até física de videogames pesada em GPU e depuração de software complexo.

A Analogia: Imagine uma competição de chefs. Em vez de os juízes pedirem aos chefs para "picar uma cebola", os estudantes (os clientes) dizem: "Preciso de um jantar de cinco pratos que use ingredientes de três continentes diferentes, cozinhados em um estilo específico, e preciso que esteja pronto em 40 minutos". Esse é o nível de dificuldade que o AcademiClaw introduz.

3. O Ambiente de Teste: A "Caixa de Areia Segura"

Para garantir que a IA não quebre nada ou trapaceie, cada tarefa ocorre em uma caixa de areia digital (um ambiente de computador bloqueado chamado contêiner Docker).

  • A IA recebe uma tarefa.
  • Ela pode ler arquivos, escrever código, executar programas e até usar um navegador da web.
  • Ela tem que fazer tudo sozinha, passo a passo.
  • Detalhe Crucial: Algumas tarefas exigem uma GPU (uma placa de vídeo poderosa usada para matemática pesada e treinamento de IA). Isso é como pedir ao robô para levantar um peso pesado; a maioria dos testes anteriores apenas pedia para levantar uma pena.

4. Como Eles Avaliam: O "Juiz Multicamadas"

Você não pode apenas perguntar: "Ela terminou?" porque a resposta pode ser "Sim, mas o código está quebrado".
O artigo usa um sistema de avaliação 6-em-1:

  1. Correspondência de Padrões: Ela escreveu as palavras certas?
  2. Execução de Código: O programa realmente roda sem travar?
  3. Juiz de IA: Outra IA lê o relatório e dá a nota como um professor.
  4. IA de Visão: Ela consegue "ver" se um gráfico ou imagem parece correto?
  5. Teste de Navegador: Ela realmente construiu um site funcional?
  6. Verificação de Estrutura: O formato do arquivo está correto (como um JSON ou CSV)?

Eles também têm uma Auditoria de Segurança (como um guarda de segurança) para garantir que a IA não tentou excluir arquivos importantes ou hackear coisas que não deveria.

5. Os Resultados: O "Teste de Realidade"

Os autores testaram seis dos modelos de IA mais inteligentes disponíveis (como Claude, GPT e Gemini) neste novo exame.

  • A Pontuação: Mesmo a melhor IA passou apenas em 55% das tarefas. Isso significa que elas falharam quase metade das vezes em problemas que estudantes universitários acharam difíceis.
  • A Armadilha do "Excesso de Pensamento": O artigo descobriu algo estranho. Algumas IAs usaram 5 vezes mais "poder cerebral" (tokens) do que outras, mas não obtiveram melhores resultados.
    • Analogia: Imagine dois estudantes fazendo uma prova. O Estudante A lê a pergunta com cuidado, pensa por um minuto e escreve uma resposta perfeita. O Estudante B entra em pânico, escreve 10 páginas de besteiras sem sentido e erra a resposta. O artigo descobriu que mais esforço não equivale a melhor qualidade.
  • Personalidades Diferentes: As IAs tinham "personalidades" diferentes:
    • O Leitor: (Claude) Lê tudo primeiro, pensa, e depois age. Alta qualidade, mas mais lento.
    • O Martelo: (Gemini) Apenas começa a bater nas coisas (executando código) imediatamente, esperando que funcione. Rápido, mas frequentemente quebra coisas e falha nas verificações de segurança.
    • O Minimalista: (GPT) Faz o mínimo necessário, mas obtém resultados surpreendentemente bons.

6. A Grande Conclusão

O artigo conclui que, embora a IA seja ótima em ser uma "secretária digital", ela ainda é muito instável quando solicitada a ser uma "pesquisadora" ou "engenheira".

  • A Lacuna: Há uma desconexão massiva entre o que a IA consegue fazer hoje e o que o trabalho acadêmico e profissional do mundo real exige.
  • O Problema de Segurança: A IA que tentou "adivinhar e verificar" seu caminho através dos problemas (Gemini) também foi a mais propensa a violar as regras de segurança.
  • O Futuro: Os autores esperam que este novo teste (AcademiClaw) ajude os desenvolvedores a construir IAs que sejam realmente capazes de resolver os problemas difíceis e complexos que enfrentamos no mundo real, e não apenas os fáceis.

Em resumo: O artigo criou um teste de "modo difícil" para IA usando tarefas de casa reais de estudantes. Os resultados mostram que mesmo as IAs mais inteligentes ainda estão lutando com o trabalho profundo e complexo do mundo real, e usar mais poder de computação não necessariamente as torna mais inteligentes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →