Entropy of Ukrainian
Este artigo apresenta o primeiro estudo para estimar a entropia da língua ucraniana ao replicar o experimento de previsão de caracteres de Claude Shannon de 1951 com 184 voluntários, resultando em um limite superior de aproximadamente 1,201 bits por caractere e comparando esse resultado com os atuais Modelos de Linguagem de Grande Escala.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está jogando um jogo de "Adivinhe a Próxima Letra" com um amigo. Você mostra a eles uma frase cortada no meio, como: "O gato sentou-se no..."
Seu amigo tem que adivinhar a próxima letra.
- Se eles adivinharem "m" (para tapete), estão certos. Isso foi fácil.
- Se eles adivinharem "z", estão errados. Eles têm que adivinhar novamente.
- Se eles adivinharem "p" (para travesseiro), estão certos.
Este jogo mede algo chamado Entropia. No mundo da linguagem, a entropia não é sobre calor ou desordem; é uma medida de surpresa.
- Alta Entropia: A próxima letra é uma surpresa total. Você tem que adivinhar muitas vezes antes de acertar. A linguagem parece caótica e imprevisível.
- Baixa Entropia: A próxima letra é óbvia. Você a adivinha imediatamente. A linguagem parece previsível e repetitiva.
O Experimento: Adivinhando o Ucraniano
Durante décadas, cientistas jogaram esse jogo de adivinhação com o inglês. Em 1951, um homem chamado Claude Shannon pediu a pessoas que adivinhassem a próxima letra em frases em inglês. Ele descobriu que o inglês é bastante previsível; você precisa de apenas cerca de 1,2 tentativas em média para acertar a próxima letra.
Mas ninguém jamais havia jogado esse jogo com ucraniano até agora.
Três pesquisadores da Ucrânia (Anton, Mykyta e Markiian) decidiram realizar esse experimento pela primeira vez. Aqui está como eles fizeram, traduzido em termos simples:
1. Os Jogadores (Os Voluntários)
Em vez de contratar trabalhadores profissionais, eles pediram a pessoas comuns nas redes sociais (principalmente no Telegram) que jogassem.
- A Configuração: Eles deram aos voluntários frases de artigos de notícias.
- A Virada: Para manter as pessoas interessadas, eles não começaram do próprio início da frase. Eles mostraram os primeiros 70 caracteres (cerca do comprimento de uma frase curta) e perguntaram: "O que vem a seguir?"
- O Jogo: O voluntário digita uma letra. Se estiver errada, fica vermelha, e eles tentam novamente. Se estiver certa, avançam para a próxima letra.
- O Objetivo: Eles queriam ver quantas "tentativas erradas" foram necessárias antes que as pessoas acertassem a letra correta.
2. Os Resultados: Quão Previsível é o Ucraniano?
Após coletar dados de 184 voluntários que fizeram mais de 17.000 tentativas, os pesquisadores analisaram os números.
- A Pontuação: Eles descobriram que o "nível de surpresa" (entropia) do ucraniano é de aproximadamente 1,201 bits por caractere.
- O que isso significa? Significa que o ucraniano é extremamente semelhante ao inglês em termos de previsibilidade. Assim como o inglês, se você conhece as letras anteriores, a próxima letra no ucraniano é geralmente bastante óbvia.
- Redundância: Como a linguagem é tão previsível, cerca de 76% das letras em uma frase ucraniana são "redundantes". Você poderia realmente remover um grande pedaço do texto, e um falante nativo ainda poderia adivinhar perfeitamente as partes faltantes.
3. O Problema do "Trapaça"
Os pesquisadores tiveram que ter cuidado. Como este era um jogo online, algumas pessoas poderiam:
- Pesquisar a frase completa online.
- Adivinhar aleatoriamente e ter sorte.
- Perder o interesse e parar de jogar pela metade.
Para corrigir isso, eles agiram como um árbitro rigoroso. Eles descartaram os resultados das pessoas que jogaram mal (que poderiam não estar tentando) e das pessoas que jogaram demais perfeitamente (que poderiam ter trapaceado). Mesmo sendo muito rigorosos e removendo muitos dados, o resultado permaneceu em torno de 1,20.
4. A Comparação com IA: Humanos vs. Robôs
Os pesquisadores também pediram a modelos modernos de IA (Modelos de Linguagem Grandes) que jogassem o mesmo jogo.
- A Vantagem da IA: Os modelos de IA foram muito melhores que os humanos. Alguns dos melhores modelos de IA podiam adivinhar a próxima letra com uma pontuação de aproximadamente 0,7.
- O Problema: Os pesquisadores alertam que a IA pode estar "trapaceando" de uma maneira diferente. Como a IA foi treinada em quantidades massivas de dados de notícias (semelhantes às frases usadas no jogo), ela pode ter memorizado as frases específicas em vez de realmente entender a linguagem. É como um aluno que memorizou o gabarito em vez de aprender a matemática.
- A Conclusão: A IA é muito boa, mas como está tão próxima da pontuação "perfeita", é difícil dizer se ela realmente está entendendo o ucraniano ou apenas se ajustando excessivamente aos artigos de notícias específicos usados.
A Grande Conclusão
Este artigo é a primeira vez que temos um número sólido sobre o quão previsível é o ucraniano.
- O ucraniano não é caótico. É altamente estruturado e previsível, assim como o inglês.
- Os humanos são bons nisso. Pessoas comuns podem adivinhar a próxima letra com cerca de 1,2 tentativas.
- A IA é melhor, mas talvez seja demais. Os modelos de IA podem adivinhar ainda mais rápido, mas temos que ter cuidado para não confundir "memorização" com "inteligência".
Os pesquisadores admitem que seu estudo não foi perfeito (eles não tiveram jogadores suficientes, e as frases eram todas de artigos de notícias), mas isso nos dá um ponto de partida muito melhor do que tínhamos antes. Eles até compartilharam seu código e dados para que outros possam tentar melhorar o jogo no futuro.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.