A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
Este estudo compara o ChatGPT 03-mini e o DeepSeek-R1 em tarefas de programação do Codeforces, revelando que, embora ambos os modelos apresentem desempenho semelhante em problemas fáceis e tenham dificuldade com os difíceis, o ChatGPT supera significativamente o DeepSeek-R1 em desafios de dificuldade média.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine dois alunos brilhantes, mas muito diferentes, sentando-se para uma série de exames de programação. Um é o ChatGPT (especificamente a versão o3-mini), um aluno bem conhecido e altamente treinado que leu quase todos os livros da biblioteca. O outro é o DeepSeek-R1, um desafiante mais novo e de código aberto vindo da China, conhecido por seu foco intenso em raciocínio lógico e quebra-cabeças matemáticos.
Os pesquisadores da Universidade de Bergen decidiram colocá-los à prova usando uma "academia" para programadores chamada Codeforces. Eles deram a ambos os alunos 29 problemas, variando de aquecimentos simples a maratonas exaustivas, e pediram que escrevessem código em C++ para resolvê-los.
Veja como o confronto se desenrolou, dividido por dificuldade:
1. O Aquecimento (Tarefas Fáceis)
Pense nestes como problemas aritméticos simples ou quebra-cabeças de lógica básica.
- O Resultado: Ambos os alunos fizeram um ótimo trabalho. Eles foram como dois atletas de elite correndo uma corrida de 100 metros; ambos cruzaram a linha de chegada com sucesso.
- O Pulo do Gato: Embora ambos tenham acertado as respostas, o DeepSeek às vezes correu um pouco mais devagar e usou um pouco mais de "energia" (memória) do que o ChatGPT, mas ambos cruzaram a linha de chegada.
2. A Meia Distância (Tarefas Médias)
É aqui que a corrida ficou interessante. Esses problemas exigiam um pouco mais de estratégia e planejamento.
- ChatGPT: Este aluno foi o vencedor claro aqui. Eles resolveram cerca de 55% desses problemas corretamente. Foram como um maratonista experiente que sabe exatamente como dosar seu ritmo.
- DeepSeek: Este aluno lutou significativamente, resolvendo apenas cerca de 18% dos problemas médios. Foi como se eles ficassem confusos no meio da corrida, tropeçassem em seus próprios pés ou esquecessem as regras.
- Por quê? O artigo sugere que o ChatGPT pode ter tido mais prática com esse tipo específico de dados de "programação competitiva" durante seu treinamento, dando-lhe uma vantagem inicial.
3. A Ultra-Maratona (Tarefas Difíceis)
Estes foram os desafios mais difíceis, exigindo lógica complexa e multi-etapa.
- O Resultado: Ambos os alunos bateram em uma parede.
- ChatGPT conseguiu resolver apenas 1 em 9 problemas difíceis.
- DeepSeek falhou em resolver nenhum dos problemas difíceis (0%).
- A Metáfora: Imagine pedir a ambos os alunos para construir um arranha-céu do zero, sem um projeto. Ambos ficaram presos. O ChatGPT tentou construir alguns andares antes que a estrutura desmoronasse (erros de tempo de execução), enquanto o DeepSeek frequentemente nem conseguia começar a fundação (erros de compilação) ou ficou sem energia (limites de memória) antes de terminar.
O Consumo de "Energia" (Memória e Tempo)
Os pesquisadores também analisaram quanto "combustível" (memória do computador) e tempo cada aluno usou.
- ChatGPT foi geralmente mais rápido e mais eficiente com seus recursos nas tarefas fáceis e médias.
- DeepSeek às vezes usou uma quantidade massiva de memória ou levou muito tempo para pensar, especialmente nas tarefas difíceis. Em um caso, o DeepSeek levou tanto tempo para pensar sobre um problema que esgotou completamente o tempo limite.
A Conclusão
O artigo conclui que, embora o DeepSeek-R1 seja um novo contendor poderoso que consegue lidar bem com tarefas simples, o ChatGPT o3-mini é atualmente o melhor "treinador" para desafios de codificação de dificuldade média. No entanto, quando os problemas ficam verdadeiramente difíceis, ambos os modelos precisam de ajuda humana. Eles ainda não estão prontos para resolver os quebra-cabeças mais difíceis sozinhos.
Nota Importante do Estudo:
Os pesquisadores pediram a cada aluno que tentasse o problema apenas uma vez (uma tentativa de "único tiro"). Eles não permitiram que tentassem novamente se falhassem ou pedissem dicas. O artigo observa que, se humanos fossem permitidos a orientá-los ou se eles usassem uma versão diferente e mais especializada do DeepSeek (chamada DeepSeek-Coder), os resultados poderiam ter sido diferentes. Mas com base neste teste específico, o ChatGPT saiu na frente no meio-termo, enquanto ambos lutaram no nível superior.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.