← Últimos artigos
💬 NLP

Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled

Este estudo demonstra que, ao controlar a expansão da dimensionalidade usando grandes modelos de linguagem não treinados, o poder preditivo dos vetores de LLMs treinados para o tempo de leitura humano e dados de fMRI exibe um escalonamento inverso, com o valor agregado do treinamento diminuindo para zero em apenas alguns bilhões de parâmetros.

Autores originais: Yi-Chien Lin, Hongao Zhu, William Schuler

Publicado 2026-09-01
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Yi-Chien Lin, Hongao Zhu, William Schuler

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Por décadas, cientistas observaram computadores aprenderem a ler e escrever com uma velocidade que parece quase biológica. Essas máquinas, conhecidas como modelos de linguagem de grande escala, são treinadas em vastas bibliotecas de textos humanos até que consigam prever a próxima palavra em uma frase com uma precisão surpreendente. Como elas lidam tão bem com a linguagem, pesquisadores começaram a se perguntar se essas máquinas não estariam apenas nos imitando, mas na verdade espelhando a maneira como nossos próprios cérebros processam a linguagem. A esperança predominante era que, à medida que esses modelos se tornassem maiores e mais complexos, eles passariam a ser cada vez melhores em prever quanto tempo um humano leva para ler uma palavra, ou como nossos cérebios se iluminam quando ouvimos uma história. Essa ideia sugeria que a arquitetura dessas mentes digitais poderia ser um mapa para a arquitetura do pensamento humano, implicando que qualquer falha em corresponder aos dados humanos era simplesmente uma questão de necessidade de mais poder computacional.

No entanto, um novo estudo de pesquisadores da Universidade Estadual de Ohio e da Universidade da Califórnia, San Diego, desafia essa visão otimista. Eles descobriram que, quando controlaram cuidadosamente o tamanho bruto dos dados que esses modelos produziam, a relação entre o tamanho do modelo e o desempenho semelhante ao humano mudou de uma forma específica: o benefício adicional do treinamento desapareceu. Em vez de o processo de treinamento tornar os modelos maiores significativamente melhores do que seus equivalentes não treinados, os maiores modelos não tiveram um desempenho melhor do que as versões não treinadas do mesmo tamanho. O estudo sugere que o sucesso aparente desses sistemas massivos foi, em grande parte, uma ilusão criada pelo volume colossal de informações às quais eles podiam acessar, e não por uma compreensão genuína da linguagem. Quando os pesquisadores removeram essa vantagem, o treinamento que tornou esses modelos tão poderosos pareceu não oferecer nenhum benefício extra sobre uma versão completamente não treinada da mesma máquina.

Para entender como chegaram a essa conclusão, deve-se primeiro observar como esses modelos são tipicamente testados. Pesquisadores frequentemente alimentam um modelo de linguagem com uma história e comparam o estado interno do modelo com dados humanos, como o tempo que uma pessoa pausa em uma palavra específica ou como o céreão dela responde a uma frase. Em estudos anteriores, parecia que modelos maiores, que possuem mais variáveis internas para trabalhar, previam consistentemente melhor o comportamento humano. Isso levou a uma teoria chamada hipótese "qualidade-poder": quanto maior o modelo, mais ele se assemelha à mente humana. Mas os pesquisadores suspeitavam de uma falha oculta nessa lógica. Quando um modelo cresce, ele não apenas se torna mais inteligente; ele também produz um número muito maior de sinais internos, ou vetores, para análise. É como dar a um aluno uma prova com o dobro de questões; mesmo que o aluno não saiba nada, ter mais questões lhe dá mais chances de acertar a resposta por sorte. Os pesquisadores perceberam que estudos anteriores poderiam estar medindo o benefício de ter mais questões, em vez do benefício de ter um cérebro melhor.

Para resolver esse quebra-cabeça, a equipe projetou uma série de experimentos que separaram o efeito do tamanho do efeito da inteligência. Eles coletaram dados de cinco famílias diferentes de modelos de linguagem, variando de pequenos com alguns centenas de milhões de parâmetros até massivos com 66 bilhões de parâmetros. Eles testaram esses modelos contra dados humanos reais, incluindo tempos de leitura de pessoas lendo histórias naturais e exames cerebrais de pessoas ouvindo essas mesmas histórias. Em seu primeiro experimento, eles replicaram os achados anteriores: conforme os modelos ficavam maiores, suas previsões do comportamento humano pareciam realmente melhorar. Isso confirmou que o efeito "qualidade-poder" era visível na superfície.

Mas então, eles introduziram um controle crucial. Eles pegaram os mesmos modelos e os observaram antes de serem treinados em qualquer texto. Esses modelos não treinados possuem exatamente o mesmo tamanho e estrutura que os treinados, mas são essencialmente ruído aleatório, sem conhecimento de linguagem. Ao comparar os modelos treinados contra seus gêmeos não treinados, os pesquisadores puderam ver quanto da melhoria veio do aprendizado real e quanto veio simplesmente de possuir um número maior de sinais internos para trabalhar. Eles usaram um método semelhante a um reservatório, onde uma rede não treinada de grande escala atua como uma fonte de matéria-prima que pode ser moldada por um classificador simples. Se o treinamento estivesse realmente tornando o modelo mais semelhante ao humano, a versão treinada deveria ter superado significativamente a versão não treinada, especialmente à medida que os modelos cresciam.

Os resultados foram surpreendentes. Quando os pesquisadores controlaram o tamanho dos sinais internos, a vantagem extra do treinamento desapareceu. Na verdade, para modelos com mais de alguns bilhões de parâmetros, as versões treinadas não tiveram um desempenho melhor do que as não treinadas. Em vários conjuntos de dados, o benefício extra do treinamento caiu para zero. Isso significa que as melhorias massivas vistas em estudos anteriores não foram porque os modelos maiores aprenderam uma compreensão mais profunda da linguagem, mas simplesmente porque tinham mais dimensões internas para ajustar aos dados. Os pesquisadores descobriram que, à medida que os modelos cresciam além de um certo ponto, a contribuição do treinamento para o ajuste do modelo sobre uma base não treinada caía para zero, em vez de aumentar. Quanto maior o modelo se tornava, menos o processo de treinamento adicionava ao poder preditivo fornecido pelo tamanho do modelo isoladamente.

O estudo também observou diferentes camadas dentro dos modelos, verificando se as seções intermediárias da rede, que alguns trabalhos anteriores sugeriam serem mais importantes, comportavam-se de forma diferente. Eles encontraram o mesmo padrão: a contribuição do treinamento caiu para zero em todas as camadas conforme os modelos cresciam. Mesmo quando ajustaram seus métodos estatísticos para considerar a possibilidade de os modelos estarem simplesmente atingindo um limite de quão bem podiam prever dados humanos, a tendência se manteve. Os pesquisadores concluíram que o sucesso desses grandes modelos em prever o comportamento humano deve-se amplamente a um efeito estatístico onde ter mais variáveis permite um melhor ajuste, em vez de um reflexo genuíno da cognição humana.

Essa descoberta sugere um desalinhamento significativo entre a maneira como esses sistemas artificiais são construídos e a maneira como os cérebos humanos funcionam. O processo de treinamento que torna esses modelos tão bons em gerar texto não os torna necessariamente melhores modelos de leitura humana ou atividade cerebral. De fato, o estudo argumenta que as versões não treinadas dessas redes massivas, que atuam como reservatórios complexos de conexões aleatórias, podem ser tão eficazes quanto as versões caras e totalmente treinadas para prever dados humanos. Os pesquisadores propõem que estudos futuros devem usar esses modelos não treinados como um padrão de base para garantir que quaisquer melhorias atribuídas ao treinamento sejam reais e não apenas um subproduto do tamanho do modelo. Embora a ideia de que "maior é melhor" tenha impulsionado o campo por anos, este trabalho sugere que, no reino do processamento da linguagem humana, existe um ponto onde adicionar mais tamanho e treinamento não nos aproxima da compreensão da mente humana, mas, em vez disso, nos afasta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →