← Últimos artigos
🤖 AI

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

O artigo apresenta o CriterAlign, um framework centrado em critérios que aprimora a previsão de preferências de código em pares ao substituir a pontuação independente por comparações diretas no nível de critérios e incorporar o Guia Alinhado à Preferência Humana (HPAG), superando significativamente os juízes monolíticos existentes.

Autores originais: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

Publicado 2026-05-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um gerente tentando decidir qual de dois funcionários (vamos chamá-los de Alice e Bob) fez um trabalho melhor em um projeto de programação. Você tem o código deles, os resultados que produziram e uma lista de regras a seguir.

Por muito tempo, modelos de IA tentando fazer esse trabalho agiam como um único supervisor sobrecarregado. Eles olhavam para o trabalho de Alice, davam uma nota de 0 a 10. Depois olhavam para o trabalho de Bob, davam uma nota de 0 a 10 para aquele. Finalmente, comparavam os dois números e escolhiam o vencedor.

O artigo "CriterAlign" argumenta que essa abordagem "nota primeiro" é falha para programação. É como julgar um concurso de culinária dando a cada chef uma nota separada para "sabor", "apresentação" e "velocidade", e depois somá-las. O problema é que a IA frequentemente se distrai com coisas superficiais (como quem escreveu mais palavras ou usou formatação mais elaborada) e perde as diferenças reais e sutis que os humanos valorizam.

CriterAlign é uma nova maneira de julgar que muda o jogo de "pontuação" para "comparação direta". Eis como funciona, usando analogias simples:

1. A partida "Cara a Cara" (Julgamento em Pares)

Em vez de pontuar Alice e Bob separadamente, o CriterAlign os coloca no ringue para cada regra individual.

  • Jeito Antigo: "Alice recebe 8/10 para velocidade. Bob recebe 7/10 para velocidade."
  • Jeito CriterAlign: "Entre Alice e Bob, quem é realmente mais rápido?"
    A IA é forçada a olhar para eles lado a lado e dizer: "Alice ganha neste ponto específico", ou "É um empate", ou "Bob ganha". Isso imita como os humanos realmente pensam ao comparar duas opções.

2. O "Microscópio do Árbitro" (Refinamento Impulsionado por Empates)

Às vezes, a IA olha para uma regra (como "O código é eficiente?") e diz: "Ambos empataram; não consigo distinguir a diferença".
No sistema antigo, a IA simplesmente aceitava o empate e seguia em frente. O CriterAlign trata um "empate" como um sinal de que a regra era muito vaga.

  • A Analogia: Imagine dois corredores cruzando a linha de chegada no exato mesmo momento. Um árbitro ruim diz: "É um empate". Um bom árbitro diz: "Espere, vamos olhar a pisada deles. Um dos corredores tropeçou levemente?"
    O CriterAlign pega esse "empate" e decompõe a regra em perguntas menores e mais precisas (por exemplo: "Quem lidou melhor com os casos de borda?") até conseguir encontrar uma diferença real.

3. A "Verificação de Justiça" (Consistência de Troca)

Juízes de IA são notoriamente enviesados pela ordem. Se você mostrar o código de Alice primeiro, a IA pode gostar mais dela apenas porque ela apareceu primeiro.

  • A Analogia: Imagine um teste de degustação onde o juiz sempre prefere o primeiro copo de água que bebe.
    O CriterAlign executa uma "verificação de justiça". Ele pede à IA para julgar o par novamente, mas desta vez, inverte a ordem (Bob primeiro, depois Alice). Se a IA mudar de ideia apenas porque a ordem mudou, o CriterAlign joga aquela peça específica de evidência no lixo. Ele mantém apenas os julgamentos que são estáveis e justos, independentemente de quem vem primeiro.

4. O "Sussurro Humano" (HPAG)

Mesmo com regras melhores, a IA ainda pode ter uma "personalidade" diferente da de um humano. Ela pode valorizar "código limpo" em vez de "efeitos visuais legais", enquanto os humanos podem preferir o oposto.

  • A Analogia: Imagine um juiz robô que nunca conheceu um humano. Ele precisa de uma "cola" escrita por humanos que diga: "Ei, quando você vir um design web, lembre-se de que os humanos se importam mais com como ele parece do que com como o código está organizado."
    O CriterAlign cria essa cola (chamada HPAG) estudando milhares de exemplos passados onde a IA errou a resposta em comparação com um humano. Ele extrai as "lacunas" no raciocínio e injeta essas lições no cérebro da IA antes que ela comece a julgar. Isso ensina a IA a pensar como um humano sem precisar re-treinar todo o modelo.

O Resultado

Quando os pesquisadores testaram esse novo sistema em um grande conjunto de benchmark de tarefas de programação:

  • A IA antiga de "único supervisor" acertou cerca de 60% das respostas (correspondendo às preferências humanas).
  • Os antigos sistemas de rubrica de "pontuação" realmente fizeram pior do que o único supervisor.
  • O CriterAlign saltou para 66% de precisão.

Em resumo: O CriterAlign impede que a IA tente classificar trabalhos individualmente. Em vez disso, ele força a IA a agir como um árbitro humano: comparando duas respostas cara a cara, focando nos empates para encontrar o verdadeiro vencedor, ignorando o viés de ordem e seguindo uma "cola humana" para garantir que ela valorize as coisas certas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →