← Últimos artigos
💻 computer science

Distributional Neurons: Making Uncertainty a Unit of Computation

O artigo introduz o EVE, um neurônio variacional que trata a incerteza como um primitivo computacional ao propagar estados latentes distribuicionais, demonstrando que essa abordagem ao nível de neurônio melhora a calibração da incerteza e o desempenho tanto em arquiteturas densas de MLPs quanto em Transformers, enquanto mantém uma precisão de ponto competitiva.

Autores originais: YVES RUFFENACH

Publicado 2026-07-21
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: YVES RUFFENACH

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Vida Secreta de uma Célula Cerebral

Imagine que você está tentando ensinar um computador a reconhecer um gato em uma foto. Você constrói um cérebro digital feito de camadas de pequenos e simples processadores chamados "neurônios". Na versão padrão desses cérebros digitais, cada neurônio age como um robô rígido e de mente única. Ele recebe informações, processa os números e cospe uma única resposta definitiva: um número específico. Se o robô diz "0,8", essa é a única verdade que ele conhece. Ele não sabe se está adivinhando, se a imagem está borrada ou se apenas está tendo um dia ruim. É um mundo de certeza absoluta, mesmo quando o mundo é caótico.

Mas a vida real é cheia de "talvez". Quando você olha para uma forma borrada na névoa, você não vê apenas "gato" ou "não gato"; você sente uma certa incerteza. Cientistas tentam há muito tempo ensinar os computadores a sentirem essa incerteza, geralmente sacudindo todo o cérebro ou adicionando camadas extras de dúvida no final do processo. No entanto, um novo estudo sugere que podemos estar olhando para o problema pelo ângulo errado. Em vez de tornar o cérebro inteiro incerto, e se tornássemos os próprios blocos de construção minúsculos e individuais incertos? Esta pesquisa faz uma pergunta simples e lúdica: E se cada neurônio individual no céreão digital não fosse um robô rígido, mas um pequeno jogador que guarda algumas diferentes possibilidades no bolso de trás?

Conheça EVE: O Neurônio que Mantém suas Opções Abertas

Neste artigo, um pesquisador chamado Yves Ruffenach introduz um novo tipo de neurônio digital chamado EVE. Pense em um neurônio padrão como um trabalhador de fábrica que carimba uma peça específica todas as vezes. O EVE, por outro lado, é como um trabalhador que não apenas carimba uma peça; eles criam uma caixa inteira de versões ligeiramente diferentes dessa peça, escolhem uma ao acaso e, então, a utilizam para construir a próxima camada.

O artigo chama isso de um "neurônio distribucional". Em vez de passar adiante um único número (como 5,0), o EVE passa uma distribuição — uma nuvem inteira de números possíveis. Ele faz isso tendo uma "posterior" interna (uma palavra sofisticada para seu palpite atual do que poderia ser verdade) e uma "prior" (o que ele acha que é geralmente possível). Ele amostra um "estado latente" aleatório desta nuvem, usa esse estado aleatório para realizar seu trabalho e, então, passa o resultado adiante. Crucialmente, o neurônio é treinado para manter seus palpites internos honestos usando uma penalidade de "regularização KL", que é como um professor dando uma bronca gentil no neurônio se ele começar a adivinhar loucamente sem um bom motivo.

O estudo testa essa ideia em três estágios distintos, como um cientista dando zoom em uma única célula, depois construindo um órgão inteiro e, finalmente, colocando-o em uma máquina complexa.

Estágio 1: O Microscópio
Primeiro, os pesquisadores isolaram um único neurônio para ver o que ele poderia fazer por conta própria. Eles configuraram um jogo onde o objetivo era prever números que tinham uma quantidade específica e variável de "ruído" (aleatoriedade) anexada a eles. Eles compararam o EVE contra três outros tipos de neurônios:

  1. Um neurônio determinístico padrão e entediante (o robô rígido).
  2. Um neurônio determinístico "correspondente" que tinha a mesma quantidade de poder computacional, mas sem aleatoriedade.
  3. Um neurônio "heterocedástico" especial que foi explicitamente instruído a prever a incerteza no final do processo.

Os resultados foram fascinantes. O robô padrão era razoável ao adivinhar o número, mas terrível em saber quão incerto estava. O robô "correspondente" era tão incerto quanto o padrão. Mas o EVE? Ele foi uma estrela. Enquanto adivinhava os números com a mesma precisão que o poderoso robô correspondente, ele se tornou incrivelmente bom em rastrear a incerteza real. De fato, ele se alinhou com o padrão de ruído real 93,9% das vezes, enquanto o robô padrão estava quase em zero. O EVE provou que um único neurônio poderia aprender a conter a incerteza dentro de si mesmo, não apenas na saída.

Estágio 2: A Pilha Profunda
Em seguida, os pesquisadores perguntaram: "Isso funciona quando você empilha 128 desses neurônios uns sobre os outros?" Eles construíram uma rede neural profunda e massiva (128 camadas de profundidade, com 128 neurônios em cada camada) para prever a eficiência energética em edifícios. Este é um teste real de "composição" — esses neurônios incertos podem trabalhar juntos sem que todo o sistema colapse no caos?

A resposta foi um "sim, mas com uma ressalva". Quando testaram a rede profunda, o EVE melhorou significativamente a capacidade do modelo de lidar com a incerteza. Ele reduziu o "Log-Likelihood Negativo" (uma pontuação de quão bem o modelo prevê todo o intervalo de possibilidades) em cerca de 18,8% e melhorou outras pontuações de incerteza entre 4,5% e 8,3% em todas as cinco execuções de teste. No entanto, quando se tratava de apenas adivinhar o número exato (medido por MSE e MAE), o EVE era aproximadamente o mesmo que o robô padrão, às vezes um pouco melhor, às vezes um pouco pior. A grande vitória foi que a "incerteza" não desapareceu conforme o sinal viajava através das 12-8 camadas; ela permaneceu viva e mensurável. Os pesquisadores observaram, contudo, que isso veio com um custo: o EVE era cerca de 7,1 vezes mais lento para rodar devido ao processo extra de amostragem e cálculos matemáticos.

Estágio 3: A Ponte Transformer
Finalmente, os pesquisadores tentaram encaixar o EVE em uma arquitetura "Transformer" moderna, o tipo de cérebro usado para modelos de linguagem como aqueles que escrevem ensaios ou conversam com você. Eles substituíram as partes "feed-forward" padrão de um Transformer por neurônios EVE e pediram que ele previsse a próxima palavra em uma história (usando um conjunto de dados chamado PG-19).

Os resultados sugeriram que o EVE poderia, de fato, ser inserido nesses sistemas modernos e complexos. O Transformer alimentado pelo EVE melhorou sua capacidade de prever a próxima palavra (diminuindo a "perplexidade" de 189,74 para 161,94) e ficou melhor em adivinhar a palavra certa (a precisão subiu de 0,1938 para 0,2064). Ele também produziu sinais de incerteza de Monte Carlo "não degenerados", que é uma forma sofisticada de dizer que, quando o modelo era solicitado a adivinhar várias vezes, ele dava respostas diferentes e interessantes que refletiam sua incerteza, em vez de apenas repetir o mesmo palpite. No entanto, o estudo descobriu que a "incerteza" estava acontecendo principalmente na primeira camada da rede; as camadas mais profundas ainda não estavam utilizando todo o seu potencial.

O Que Isso Significa (e o Que Não Significa)

O artigo sugere que tornar a incerteza uma unidade fundamental de computação — dentro do próprio neurônio — é uma ideia viável e poderosa. Mostra que você pode isolar esse comportamento, construir redes profundas com ele e até conectá-lo aos modelos de linguagem mais avançados.

No entanto, os autores são cuidadosos ao não afirmar que isso é uma solução mágica. Eles descartam explicitamente a ideia de que se trata apenas de ter mais poder computacional; um neurônio padrão com o mesmo poder não obteve os mesmos resultados. Eles também observam que, embora o EVE seja ótimo em incerteza, ele nem sempre vence no quesito de ser apenas "correto" sobre o número exato. Nos testes de rede profunda, as taxas de erro padrão (MSE e MAE) foram muito próximas, e às vezes o modelo padrão foi ligeiramente melhor. Além disso, o estudo admite que a versão atual é mais lenta e que a "incerteza" no experimento do Transformer ainda não estava perfeitamente equilibrada entre todas as camadas.

Em suma, o EVE sugere que, se quisermos que os computadores entendam a bagunça do mundo, não devemos apenas adicionar um botão de "dúvida" no final. Devemos ensinar os próprios blocos de construção minúsculos a manter algumas opções abertas, a amostrá-las e a aprender a estar confortáveis com o desconhecido. É uma mudança pequena e lúdica na forma como construímos cérebros digitais, mas uma que pode ajudá-los a ver o mundo um pouco mais como nós vemos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →