← Últimos artigos
🤖 AI

A Large-Scale Dataset of MCP Implementations on GitHub

Este artigo apresenta o primeiro conjunto de dados em larga escala e baseado em evidências de 2.297 implementações validadas do Model Context Protocol (MCP) do GitHub, criado por meio de um rigoroso pipeline de verificação híbrida para estabelecer um benchmark fundamental para analisar ecossistemas de MCP do mundo real, tendências de desenvolvimento e padrões arquiteturais.

Autores originais: Benny Toeppe, Amine Barrak, Emna Ksontini

Publicado 2026-07-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Benny Toeppe, Amine Barrak, Emna Ksontini

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o mundo da IA como um robô gigante e tagarela que vive dentro de um computador. Por muito tempo, esse robô só conseguia falar sobre o que aprendeu em seus dados de treinamento, como um estudante que só conhece o que está em seu livro didático. Mas recentemente, um novo livro de regras chamado Model Context Protocol (MCP) chegou. Pense no MCP como um tradutor universal e um conjunto de tomadas padrão que permitem ao robô se conectar a ferramentas do mundo real — como aplicativos de clima, mecanismos de busca ou editores de código — para que ele possa realmente fazer coisas em vez de apenas falar sobre elas.

Mas aqui está o problema: ninguém sabia exatamente quantas pessoas estavam realmente construindo essas "tomadas" ou como elas eram por baixo do capô. Havia rumores e listas, mas nenhum mapa sólido do código real.

É aí que entra este artigo. Os autores agiram como caçadores de tesouros digitais, mergulhando no GitHub (uma biblioteca gigante onde desenvolvedores armazenam seu código) para construir o primeiro mapa massivo e verificado desses projetos MCP.

A Grande Escavação
A equipe não apenas adivinhou; eles construíram um pipeline de robô superinteligente para caçar pistas. Eles começaram com 3.238 projetos potenciais que mencionavam "MCP". Mas nem todo projeto que diz "Eu sou um projeto MCP" realmente é um. Alguns eram apenas cascas vazias, outros eram apenas tutoriais e alguns estavam usando o nome "MCP" para algo totalmente diferente (como um mod de jogo para Minecraft, não uma ferramenta de IA).

Para chegar à verdade, eles realizaram um check-up de vários estágios:

  1. A Verificação de Currículo: O projeto teve atualizações recentes? Se não tivesse se movido em nove meses, estava fora.
  2. O Escaneamento de Código: Eles procuraram por arquivos de "impressão digital" específicos (como package.json ou pyproject.toml) que provam que o projeto está realmente tentando se conectar ao sistema MCP.
  3. A Verificação de Estrutura: Eles procuraram por pastas e pontos de entrada específicos que mostram que o código está pronto para ser executado, não apenas sentado ali como um conceito.

Após todo esse filtragem, eles encontraram 2.297 projetos que eram o caso real. Eles foram tão cuidadosos que, quando verificaram manualmente uma amostra aleatória, descobriram que o processo tinha 83% de precisão. Eles até detectaram 90 projetos que pareciam ferramentas reais, mas eram na verdade apenas modelos de "mostrar e contar" sem partes funcionais, e os expulsaram da lista final.

O Que Esses Projetos Estão Fazendo?
Uma vez que tiveram sua lista de 2.297 projetos verificados, eles os classificaram em três papéis principais, como personagens em uma peça:

  • Os Clientes: Estes são os "requisitantes". Eles são como as mãos do robô, estendendo-se para pedir ferramentas. (Pense em uma interface de chat pedindo a previsão do tempo).
  • Os Servidores: Estes são os "provedores". Eles detêm as ferramentas e as entregam quando solicitados.
  • Os Gateways: Estes são os "intermediários" ou tradutores. Eles ajudam diferentes sistemas a conversarem entre si, preenchendo lacunas entre a IA e serviços externos.

Os dados sugerem que Python e TypeScript são as linguagens superstar para construir essas ferramentas. Elas dominam a cena tanto para os requisitantes (Clientes) quanto para os provedores (Servidores). Curiosamente, os "intermediários" (Gateways) também gostam de usar Go, uma linguagem conhecida por sua velocidade e confiabilidade.

Como Eles São Construídos?
O artigo sugere que a maioria desses projetos não são monolitos corporativos massivos. Em vez disso, eles parecem pequenas equipes ágeis. O projeto típico tem cerca de 4 colaboradores únicos e 70 commits (atualizações). Os desenvolvedores parecem preferir fazer pequenos ajustes frequentes em vez de atualizações enormes e assustadoras de uma só vez.

O Que Isso Significa
Este artigo não afirma ter resolvido todos os mistérios sobre ferramentas de IA. Em vez disso, ele fornece uma base sólida e baseada em evidências. Ele sugere que, embora o ecossistema esteja crescendo rápido, ele é atualmente dominado por algumas linguagens chave e segue um padrão específico de desenvolvimento pequeno e iterativo. Ao fornecer aos pesquisadores uma lista limpa e verificada de 2.297 projetos reais, este trabalho prepara o terreno para estudos futuros entenderem como essas conexões de IA estão realmente evoluindo, em vez de apenas adivinhar com base no hype de marketing.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →