SAGE: Scalable AI Governance & Evaluation
O SAGE é uma estrutura de governança de IA escalável que operacionaliza o julgamento humano de alta qualidade por meio de um loop de calibração bidirecional de política, precedente e juízes substitutos de LLM, utilizando destilação de baixo custo para permitir a avaliação de modelos alinhados à política no LinkedIn Search que, por fim, aumentou os usuários ativos diários em 0,25%.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é o editor-chefe de um jornal imenso (LinkedIn) que publica milhões de artigos (vagas e perfis) todos os dias. Seu objetivo é garantir que, quando um leitor pesquisar por algo específico, como "analista de dados júnior", ele receba o artigo perfeito, e não apenas um aleatório que por acaso contenha essas palavras.
O problema? Você tem artigos demais e leitores demais. Você não pode ter um editor humano para ler cada um dos resultados de pesquisa para verificar se é bom. Se você tentar usar matemática simples (como contar quantas pessoas clicaram em um link), pode ser enganado por artigos populares, mas irrelevantes.
Esta é a história do SAGE, um novo sistema que o LinkedIn construiu para resolver esse problema. Pense no SAGE como um "Supereditor" que aprende a pensar como um especialista humano, mas trabalha com a velocidade de um robô.
Aqui está como ele funciona, dividido em etapas simples:
1. O Problema: A Lacuna entre "Humano vs. Robô"
Normalmente, quando as empresas constroem mecanismos de busca, elas dependem de duas coisas:
- Editores Humanos: Eles são ótimos em julgar a qualidade, mas são lentos e caros. Eles não podem ler milhões de resultados.
- Métricas de Engajamento: Eles contam cliques e visualizações. Mas isso é como julgar um filme pelo seu sucesso de bilheteria; um filme ruim ainda pode ser popular se as pessoas clicarem nele por acidente. Isso não diz se o filme é realmente bom.
O LinkedIn precisava de uma maneira de obter o julgamento de qualidade de um humano com a velocidade de uma máquina.
2. A Solução: O Framework "SAGE"
SAGE significa Scalable AI Governance & Evaluation (Governança e Avaliação de IA Escalável). É uma equipe de três partes que trabalha em conjunto para criar um "livro de regras" perfeito para julgar resultados de busca.
Parte A: A Política (O Livro de Regras)
Este é um conjunto de regras escritas em linguagem clara. Em vez de dizer "corresponder palavras-chave", diz coisas como: "Se um usuário pedir uma vaga de nível inicial, o resultado não deve exigir 10 anos de experiência". Ele define exatamente o que é "bom".
Parte B: O Precedente (As Respostas de Exemplo)
Imagine um professor dando a um aluno alguns ensaios com notas perfeitas e explicações. O SAGE usa um conjunto pequeno e cuidadosamente selecionado de exemplos "padrão ouro" criados por especialistas humanos. Esses exemplos mostram à IA exatamente como aplicar o livro de regras a situações complicadas.
Parte C: O Juiz Substituto (O Aluno)
Este é um modelo de IA (um Grande Modelo de Linguagem ou LLM) que atua como o juiz. Ele lê os resultados da busca e os compara com o Livro de Regras e as Respostas de Exemplo.
3. O Ingrediente Secreto: "Treinamento de Duas Vias"
No passado, você apenas dizia as regras para a IA e esperava que ela entendesse. O SAGE utiliza um Ciclo de Calibração de Duas Vias.
- Humano para IA: Humanos ensinam as regras à IA e mostram exemplos.
- IA para Humano: A IA na verdade critica os humanos!
- Se a IA vê um especialista humano cometer um erro (como ignorar um detalhe oculto em uma descrição de vaga longa), ela sinaliza o erro.
- Se a IA fica confusa porque as regras estão vagas, ela diz aos humanos: "Ei, seu livro de regras não cobre este caso específico".
Isso cria um ciclo onde o Livro de Regras, os Exemplos e o Juiz de IA ficam mais inteligentes juntos. Eles corrigem os erros uns dos outros até que concordem quase perfeitamente (cerca de 77% de concordância com especialistas humanos, o que é considerado "substancial" nesta área).
4. O Truque de Velocidade: "Destilação" (Professor para Aluno)
A IA "Professor" (aquela que aprendeu com os humanos) é muito inteligente, mas lenta e cara de operar. É como um professor genial que leva horas para corrigir uma redação. O LinkedIn precisa avaliar milhões de redações por segundo.
Por isso, eles usaram uma técnica chamada Destilação.
- Imagine que o Professor (o gênio) explica seu processo de pensamento para um Aluno (um estagiário rápido e eficiente).
- O Aluno aprende a imitar a lógica do Professor, mas torna-se muito menor e mais rápido.
- O Resultado: O Juiz Aluno é 92 vezes mais barato e rápido que o Professor, mas ainda obtém a resposta correta quase com a mesma frequência que os especialistas humanos.
5. Como Isso Mudou o LinkedIn
Depois de construir esse Juiz Aluno rápido e inteligente, o LinkedIn o utilizou de três maneiras poderosas:
- A Rede de Segurança (Testes Offline): Antes de lançar um novo recurso de busca, eles o passam pelo Juiz Aluno. Se a IA disser: "Este novo recurso está mostrando resultados ruins", eles podem interrompê-lo imediatamente. Eles não precisam esperar que os usuários reais reclamem. Isso reduziu o tempo de teste de 2 semanas para 3 dias.
- O Porteiro em Tempo Real (Serviço Online): Eles comprimiram a IA ainda mais para torná-la minúscula o suficiente para rodar em tempo real. Agora, toda vez que você pesquisa, uma versão minúscula desta IA verifica os resultados instantaneamente para garantir que eles sigam as regras.
- O Sistema de Alerta Antecipado: Eles usaram a IA para monitorar o sistema 24 horas por dia, 7 dias por semana. Às vezes, uma atualização de busca pode parecer boa com base nos cliques, mas a IA percebe que a qualidade está caindo. Ela detectou um problema que as métricas humanas deixaram passar, evitando uma experiência ruim para os usuários.
A Conclusão
Ao construir este sistema, o LinkedIn não apenas tornou sua busca "mais rápida"; tornou-a mais inteligente e confiável.
O artigo afirma que, ao usar o SAGE para aplicar regras de alta qualidade, eles observaram um aumento de 0,25% nos Usuários Ativos Diários no LinkedIn. No mundo de uma plataforma com centenas de milhões de usuários, essa pequena porcentagem representa um número massivo de pessoas que encontraram o que procuravam, permaneceram no site e continuaram voltando.
Em resumo: O SAGE transformou o trabalho desordenado e subjetivo de "decidir o que é um bom resultado de busca" em um processo claro, automatizado e escalável que aprende com seus erros e continua melhorando.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.