← Últimos artigos
🤖 machine learning

Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates

Este artigo propõe um framework de edição de conhecimento escalável e de forma fechada para LLMs de Mistura de Especialistas que aproveita estruturas tensoriais e a identidade matricial de Woodbury para realizar atualizações por especialista com aceleração de até 6x, mantendo qualidade de edição comparável a bases de camadas densas.

Autores originais: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: Atualizar uma Biblioteca Gigante

Imagine um Modelo de Linguagem de Grande Escala (LLM) como um bibliotecário massivo e superinteligente que sabe quase tudo. No entanto, uma vez que o bibliotecário é treinado, seu conhecimento fica "congelado". Se o mundo muda (por exemplo, um novo presidente é eleito ou um fato científico é corrigido), o bibliotecário continua dando respostas antigas e erradas.

Geralmente, para corrigir isso, você precisa enviar o bibliotecário de volta à escola para uma longa e cara sessão de retreinamento. Isso é lento, custa uma fortuna em poder computacional e corre o risco de fazer o bibliotecário esquecer outras coisas que já sabia.

Edição de Conhecimento é um atalho. Em vez de reeducar todo o bibliotecário, você apenas entra e troca um arquivo específico em sua memória. Métodos anteriores funcionaram muito bem para modelos "densos" (onde cada parte do cérebro está ativa), mas lutaram com modelos modernos.

O Novo Desafio: A Equipe de "Especialistas"

Modelos de IA modernos (como os usados pela OpenAI ou DeepSeek) não usam um único cérebro gigante. Eles usam uma arquitetura de Mistura de Especialistas (MoE).

  • A Analogia: Imagine que, em vez de um bibliotecário gigante, você tem uma equipe de 100 especialistas especializados (um historiador, um programador, um chef, um médico, etc.).
  • Como funciona: Quando você faz uma pergunta, um "roteador" (um gerente) olha para a pergunta e acorda apenas os 4 ou 8 especialistas que são relevantes. Os outros permanecem dormindo.
  • O Problema: Se você quiser atualizar um fato (por exemplo, "A capital da França é Paris"), as antigas ferramentas de edição não sabiam como falar com essa equipe específica. Elas tentavam tratar toda a equipe como uma grande massa, o que é ineficiente e bagunçado. O método existente para corrigir isso (chamado MoE-Edit) era como tentar atualizar os especialistas um por um, em uma longa fila, o que levava uma eternidade.

A Solução: MoTE (O Gerente Inteligente da Equipe)

Os autores propõem um novo método chamado MoTE (Editor Tucker de Mistura de Especialistas). Eles resolveram o problema usando dois truques principais:

1. A Matemática do "Atalho" (Identidade de Woodbury)

A maneira antiga de atualizar os especialistas exigia resolver um quebra-cabeça matemático massivo e complexo que envolvia inverter uma matriz enorme (uma grade de números). Era como tentar resolver um Sudoku com um milhão de quadrados.

Os autores usaram um truque matemático chamado Identidade de Woodbury.

  • A Analogia: Em vez de resolver o quebra-cabeça de um milhão de quadrados, eles perceberam que só precisavam resolver um pequeno quebra-cabeça de 50 quadrados que representa as mudanças que você deseja fazer.
  • O Resultado: Isso transforma uma tarefa que leva horas em uma que leva minutos. Eles podem atualizar o conhecimento sem nunca precisar "acordar" ou calcular o peso completo de cada especialista de uma vez.

2. Respeitando a Estrutura da Equipe (Decomposição Tensorial)

O segundo truque foi perceber que os especialistas não são aleatórios; eles estão relacionados. Eles foram treinados juntos, então seu conhecimento está conectado em uma forma 3D específica (como um bloco de queijo em vez de uma folha de papel plana).

  • A Analogia: Imagine que os especialistas são um coral. Se você quiser mudar o tom da música, você não apenas grita com uma pessoa; você ajusta a harmonia de todo o grupo.
  • O Método: Os autores usaram Decomposição de Tucker. Esta é uma maneira de comprimir o "bloco de queijo" (os pesos dos especialistas) em uma forma central menor que captura a essência do grupo.
  • O Benefício: Ao editar essa forma "central" menor, eles atualizam automaticamente todos os especialistas de uma maneira que respeita seus relacionamentos. Isso impede que o modelo fique confuso ou "esqueça" outras coisas.

Os Resultados: Rápido e Preciso

O artigo testou o MoTE em vários modelos de IA modernos (como Qwen e GPT-OSS) e o comparou com o melhor método anterior (MoE-Edit) e o retreinamento padrão.

  • Velocidade: O MoTE é até 6 vezes mais rápido que o melhor método anterior. Ele pode editar 1.000 fatos em uma fração do tempo.
  • Qualidade: É tão bom em corrigir os fatos (Eficácia) e não quebrar outras partes do modelo (Especificidade) quanto os métodos mais lentos.
  • Eficiência: Ele consegue isso fazendo apenas o cálculo matemático pesado uma vez no final do processo e, em seguida, espalhando esse resultado para as outras camadas, em vez de recalcular para cada camada individual.

Resumo

O artigo apresenta o MoTE, uma ferramenta que nos permite atualizar modelos de IA modernos, baseados em "especialistas", de forma rápida e precisa. Ele faz isso ao:

  1. Usar um atalho matemático para evitar cálculos pesados desnecessários.
  2. Respeitar a estrutura de equipe dos especialistas para que as atualizações façam sentido.

Isso significa que podemos manter os modelos de IA atualizados com o mundo real sem precisar reeducá-los do zero, economizando quantidades massivas de tempo e energia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →