Resumo Técnico: QUARCH: Um Benchmark para Avaliar o Raciocínio de LLMs em Arquitetura de Computadores
Declaração do Problema
O campo da arquitetura de computadores, que faz a ponte entre abstrações de software de alto nível e implementações de hardware de baixo nível, permaneceu ausente das atuais avaliações de Large Language Models (LLMs). Embora os benchmarks existentes em sistemas de computação visem tarefas de implementação técnica — como geração de código, síntese de Register-Transfer Level (RTL), integração de System-on-Chip (SoC) e verificação de chips — eles avaliam primariamente a capacidade de um modelo de produzir artefatos programáticos. Eles falham em avaliar se um modelo consegue raciocinar sobre os princípios subjacentes que guiam decisões de design, como as compensações (trade-offs) em potência, desempenho e área (PPA) dentro de um espaço de otimização multiobjetivo.
Benchmarks atuais como GSM8K, AIME e SWE-bench medem o raciocínio em matemática, engenharia de software e ciência geral, mas nenhum benchmark dedicado existe para avaliar as habilidades de raciocínio conceitual e analítico exigidas pela arquitetura de computadores. Essa lacuna dificulta o desenvolvimento de agentes de IA capazes de acelerar a inovação no design de sistemas de computação.
Metodologia
Construção do Benchmark (QUARCH v1.0)
Os autores introduzem o QUARCH (pronuncia-se 'quark'), o primeiro benchmark projetado para facilitar o desenvolvimento e a avaliação das capacidades de conhecimento e raciocínio de LLMs especificamente em arquitetura de computadores. O benchmark compreende 2.671 pares de pergunta-resposta (QA) validados por especialistas. O processo de construção empregou uma estratégia de três frentes para garantir alta qualidade e relevância:
- Geração de Dados Sintéticos: LLMs geraram questões de múltipla escolha do tipo cloze-style fundamentadas em um corpus de manuais técnicos, publicações acadêmicas e recursos online. Estas passaram por uma validação de dois estágios: filtragem inicial por um LLM-as-a-judge seguida de revisão independente por três especialistas humanos.
- Crowdsourcing de Especialistas e Competições: Um portal baseado na web foi desenvolvido para solicitar questões avançadas de análise, design e implementação de indivíduos com formação técnica. As submissões foram revisadas quanto à ambiguidade e correção.
- Exames Acadêmicos: Questões foram curadas de exames universitários de arquitetura de computadores via web scraping manual e um pipeline customizado que extraiu texto e diagramas, convertendo-os em pares de QA independentes.
Estrutura de Habilidades
O QUARCH avalia LLMs através de quatro competências fundamentais, alinhadas com a forma como arquitetos raciocinam na prática:
- Recall (Recuperação): Recuperar conhecimento de domínio, definições e fatos (ex: identificar componentes em um diagrama).
- Analyze (Analisar): Deduzir, inferir ou interpretar dados para raciocinar sobre implicações de carga de trabalho e comportamento do sistema (ex: identificar gargalos).
- Design (Projetar): Propor ou melhorar características arquiteturais enquanto satisfaz restrições e equilibra compensações (ex: sugerir um sistema de predição de desvio dinâmico).
- Implement (Implementar): Traduzir um design em artefatos executáveis (código/RTL/scripts de simulação) para validar soluções.
O conjunto de dados inclui 1.547 MCQs (múltipla escolha) e 1.124 questões de resposta livre (FRQs), com 548 questões multimodais incorporando imagens (diagramas, esquemas, gráficos) junto ao texto.
Protocolo de Avaliação
Os autores avaliaram 10 modelos de fronteira (da Anthropic, DeepSeek, Google, Meta, Mistral e OpenAI) em um cenário zero-shot.
- Graduação: Para MCQs, a correção é determinada pela escolha final. Para FRQs, um LLM-as-a-judge (especificamente o
CLAUDE-3.7-SONNET-THINKING) foi empregado para avaliar a correção em relação à verdade fundamental (ground truth).
- Validação: A fidelidade do LLM-as-a-judge foi validada contra especialistas humanos do domínio. A taxa de concordância entre o juiz LLM e os especialistas humanos foi de 85,48%, comparável à taxa de concordância humano-humano de 90,75%.
- Métricas: O desempenho é reportado como "acurácia por geração" (estimativa de pass@k=1 sobre 3 gerações).
Contribuições Principais
- Primeiro Benchmark Especializado: O QUARCH v1.0 é o primeiro benchmark explicitamente projetado para avaliar conhecimento e raciocínio avançado de arquitetura de computadores em LLMs, compreendendo 2.671 QAs validados por especialistas.
- Estrutura de Habilidades Formalizada: O artigo estabelece uma estrutura para avaliar sistematicamente LLMs em quatro habilidades distintas (Recall, Analyze, Design, Implement), revelando que, embora os modelos possam possuir conhecimento de domínio, eles têm dificuldade com o raciocínio de ordem superior.
- Análise Abrangente: Os autores fornecem uma análise profunda das tendências dos modelos e pontos de falha, incluindo dificuldades com a semântica de execução de código, suposições de propriedades arquiteturais não convencionais, dificuldades em modelar o estado do sistema e heterogeneidade na expertise por tópico.
- Metodologia de Avaliação Escalável: O artigo demonstra uma metodologia confiável para avaliar respostas de formato livre usando LLM-as-a-judge, mostrando alta concordância com especialistas humanos.
- Demonstração de Transferência de Conhecimento: Os autores mostam que o ajuste fino (fine-tuning) de modelos de código aberto nos QAs do QUARCH se traduz em melhor desempenho em uma tarefa realista de design de hierarquia de memória, resultando em soluções mais eficientes em termos de área e mais viáveis.
Resultados
Desempenho dos Modelos
- Recall vs. Raciocínio: Modelos de fronteira demonstram um desempenho forte em questões de Recall (84%–91% de acurácia), indicando que possuem conhecimento fundamental de domínio. No entanto, o desempenho cai significamente em habilidades de Raciocínio (Analyze, Design, Implement).
- Gaps de Desempenho: O gap entre Recall e Raciocínio é substancial. Por exemplo, o
GPT-5.2 atinge 88,4% em Recall, mas cai para 73,2% em Raciocínio. Outros modelos mostram gaps ainda maiores, com alguns caindo abaixo de 35% em habilidades de ordem superior, apesar de altos scores de recall.
- Variância de Habilidade: As habilidades de Implement exibem os maiores gaps de desempenho (24%–72%), sugerindo que traduzir conceitos de design em artefatos executáveis continua sendo um desafio significativo.
- Sensibilidade de Modalidade: Modelos multimodais performam aproximadamente 5% pior em questões contendo imagens em comparação com questões apenas de texto, indicando dificuldades em interpretar diagramas arquiteturais e esquemas.
Modos de Falha
A análise identificou modos de falha específicos:
- Semântica de Execução de Código: Modelos lutam para entender como o código de alto nível interage com o hardware (ex: padrões de acesso à memória, escalonamento de instruções).
- Suposições Não Convencionais: Modelos frequentemente recorrem a propriedades arquiteturais não convencionais (ex: endereçamento de nível de palavra) quando os prompts não declaram explicitamente convenções padrão.
- Rastreamento de Estado do Sistema: Modelos frequentemente falham em manter um estado de sistema consistente, levando a inferências incorretas sobre latência e throughput em cenários evolutivos.
- Heterogeneidade de Tópicos: A expertise varia significativamente por tópico; um modelo forte em "Arquiteturas Emergentes" pode ter dificuldades com "Design de IP".
Estudo de Caso de Transferência de Conhecimento
Em um estudo de caso envolvendo o design de uma hierarquia de memória para um acelerador de hardware de ML:
- O ajuste fino de modelos de código aberto (
GEMMA-3-27B-IT e LLAMA-3.3-70B-INSTRUCT) nos QAs do QUARCH levou a um aumento significativo na porcentagem de tentativas onde os modelos propuseram designs que satisfazem orçamentos estritos de área e energia (ex: aumentando as taxas de sucesso de 30% para 70% para o Gemma).
- Modelos ajustados descobriram designs que são até 1,99× mais eficientes em área do que aqueles propostos por seus contrapartes de modelo base.
Significância e Alegações
O artigo alega que o QUARCH fornece uma fundação para construir e medir as capacidades de LLMs que podem acelerar a inovação em sistemas de computação. Ao avaliar holisticamente as habilidades fundamentais, o QUARCH aborda a lacuna crítica entre "conhecer" fatos arquiteturais e "raciocinar" sobre compensações arquiteturais.
Os autores enfatizam que, embora os modelos de fronteira possuam conhecimento específico de domínio, eles lutam com o pensamento de ordem superior necessário para o raciocínio arquitetural. O benchmark serve como uma ferramenta de diagnóstico para identificar essas lacunas e um campo de treinamento para melhorar o desempenho do modelo em tarefas de design do mundo real. A capacidade demonstrada de modelos ajustados em gerar designs de hardware mais eficientes sugere que o QUARCH pode efetivamente traduzir o progresso dos LLMs em metodologias agênticas para o design de sistemas.
O trabalho é modesto em seu escopo, focando em raciocínio conceitual e paradigmas de QA em vez de cadeias de ferramentas agênticas completas, mas argumenta que isolar e medir essas capacidades de raciocínio é um precursor necessário para o desenvolvimento de agentes de IA robustos para arquitetura de computadores. O benchmark e o leaderboard estão publicamente disponíveis para fomentar mais pesquisa e desenvolvimento neste domínio.