← Últimos artigos
💻 computer science

Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review

Esta revisão sintetiza evidências de perspectivas representacionais, comportamentais e mecanísticas sobre concordância sujeito-verbo, negação e generalização composicional em Transformers pré-treinados para revelar padrões distintos de convergência e fragmentação, propondo, em última análise, um diagnóstico de acessibilidade e uso para esclarecer limitações atuais e orientar pesquisas futuras de múltiplos níveis.

Autores originais: Yizhe Wang, Zhenhua Ling

Publicado 2026-09-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yizhe Wang, Zhenhua Ling

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A linguagem é um sistema de regras que nos permite pegar ideias simples e combiná-las em novos pensamentos infinitos. Por décadas, cientistas têm se perguntado se os massivos programas de computador que agora escrevem textos fluentes e respondem a perguntas complexas realmente aprenderam essas regras, ou se estão apenas mimetizando padrões que viram anteriormente. Esses programas, conhecidos como modelos de linguagem pré-treinados, são treinados em vastas quantidades de escrita humana. Eles podem produzir frases que soam perfeitamente naturais, levando muitos a assumir que entendem a gramática e o significado da mesma forma que os humanos. No entanto, produzir as palavras certas não é o mesmo que saber por que essas palavras pertencem umas às outras. Um programa pode acertar uma frase por acidente, ou ao depender de um atalho, sem realmente compreender a lógica subjacente. Para resolver esse mistério, pesquisadores desenvolveram três maneiras diferentes de olhar para dentro desses modelos: verificar quais informações estão armazenadas em sua memória interna, testar o que eles realmente produzem em seu resultado e rastrear as vias específicas que os levam a tomar uma decisão.

Uma nova revisão dos pesquisadores Yizhe Wang e Zhenhua Ling une essas três formas de olhar para ver se elas contam a mesma história. Os autores focaram em três áreas específicas da linguagem que são essenciais para entender como esses modelos funcionam: como os verbos concordam com seus sujeitos, como a palavra "não" altera o significado de uma frase e como os modelos combinam partes familiares para criar novas ideias complexas. Ao reunir e comparar centenas de estudos que utilizaram esses três métodos, os pesquisadores descobriram que a resposta depende inteiramente de qual parte da linguagem você está perguntando. Às vezes, a evidência dos três métodos se alinha perfeitamente; outras vezes, os métodos contam histórias conflitantes, revelando lacunas no que os modelos realmente sabem.

A história de sucesso mais clara que os pesquisadores encontraram envolve a concordância sujeito-verbo, a regra de que um sujeito singular precisa de um verbo singular, como "the cat runs" (o gato corre), enquanto um sujeito plural precisa de um verbo plural, como "the cats run" (os gatos correm). Nesta área, as três formas diferentes de olhar para os modelos concordam. Quando os pesquisadores olharam para dentro dos estados internos do modelo, puderam encontrar um sinal claro de se um substantivo era singular ou plural. Quando testaram o resultado do modelo, ele quase sempre escolhia a forma verbal correta. Mais importante ainda, quando os pesquisadores intervieram para mudar esse sinal interno, o comportamento do modelo mudou de uma maneira previsível, forçando-o a escolher o verbo errado. Essa convergência sugere que, para regras gramaticais simples, esses modelos realmente aprenderam a relação e a utilizam para tomar decisões.

O quadro torna-se muito mais complicado ao observar a negação, ou como os modelos lidam com a palavra "não". Aqui, as três lentes não concordam. As verificações internas mostram que os modelos conseguem detectar a presença da palavra "não" e entender aproximadamente onde ela se aplica em uma frase. No entanto, quando os modelos são solicitados a produzir texto ou responder a perguntas baseadas em uma frase negada, eles frequentemente falham em aplicar o significado correto. Eles podem ver a palavra "não", mas ainda agir como se a frase fosse positiva. Os pesquisadores descobriram que, embora os modelos possam detectar o marcador, eles não utilizam confiavelmente para inverter a verdade da afirmação. É como se o modelo visse a placa, mas não seguisse a instrução que ela dá. Esse descompasso significa que, embora os modelos possuam as peças de informação, eles não as utilizam consistentemente para compreender o significado completo.

A terceira área, que envolve combinar diferentes partes da linguagem para criar novos significados, mostra a maior confusão. Esta é a habilidade de pegar palavras e regras conhecidas e aplicá-las a situações que o modelo nunca viu antes. A evidência aqui é fragmentada. Alguns estudos mostram que os modelos podem lidar com combinações simples, especialmente quando os pesquisadores fornecem dicas ou dividem a tarefa em etapas menores. Outros estudos mostram que, quando os modelos são deixados para decifrar cadeias complexas de raciocínio por conta própria, eles frequentemente falham. O problema é que os diferentes estudos não estão olhando para a mesma coisa. Alguns estão testando se o modelo consegue reconhecer um padrão, enquanto outros estão testando se ele consegue construir uma nova ideia do zero. Como os pesquisadores não conseguiram encontrar uma maneira única e consistente de medir essa habilidade em todos os estudos, eles não puderam concluir se os modelos realmente possuem uma habilidade geral para combinar ideias ou se são apenas bons em truques específicos e estreitos.

Os autores da revisão sugerem que esses diferentes resultados acontecem porque algumas características da linguagem são mais fáceis de isolar e usar do que outras. Para a concordância sujeito-verbo, a característica é simples e isolada, então o modelo consegue encontrá-la e usá-la. Para a negação, o modelo consegue encontrar o marcador, mas tem dificuldade em usá-lo para mudar todo o significado. Para combinações complexas, a característica é tão espalhada e difícil de definir que o modelo não consegue sequer isolá-la claramente. Os pesquisadores concluem que não podemos assumir que esses modelos conhecem a linguagem em um sentido geral. Em vez disso, o conhecimento deles é específico para a tarefa. Eles são excelentes em algumas coisas, como combinar verbos, mas são inconsistentes em outras, como entender a negação, e ainda não foram comprovados na tarefa mais complexa de criar novas ideias a partir de partes antigas. Essa descoberta muda a forma como devemos avaliar esses sistemas: não podemos apenas olhar se eles obtêm a resposta correta, mas também devemos verificar se estão usando a lógica correta para chegar lá.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →