PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing
Este artigo apresenta o PERCEPT, o primeiro corpus de larga escala de mistura de códigos persa-inglês anotado com etiquetas POS de Universal Dependencies, juntamente com uma estrutura de anotação assistida por LLM e uma análise linguística abrangente que revela padrões específicos de plataforma na mistura de códigos através das redes sociais.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine a internet como um parquinho gigante e caótico onde pessoas de todo o mundo estão gritando, sussurrando e conversando ao mesmo tempo. Neste parquinho, muitas pessoas não falam apenas uma língua; elas as misturam como ingredientes em um smoothie. Isso é chamado de "code-mixing" (mistura de códigos). É quando alguém pode começar uma frase em sua língua nativa e, de repente, inserir uma palavra em inglês porque ela parece perfeita, ou porque é a única palavra que conhecem para um novo gadget. Para os computadores, isso é um pescoio. Se um computador estiver tentando entender uma frase, ele espera que as palavras sigam regras estritas. Mas quando as línguas se misturam, o computador fica confuso, como um chef tentando seguir uma receita que de repente muda de xícaras métricas para onças imperiais no meio do preparo de um bolo. Para ensinar os computadores a lidar com essa realidade bagunçada e divertida, os cientistas precisam de um dicionário especial e um conjunto de regras — um "corpus" — que lhes mostre exatamente como essas palavras misturadas funcionam.
Conheça o PERCEPT, um novo projeto que atua como uma biblioteca gigante e organizada para falantes de persa que adoram misturar o inglês em suas postagens. Os pesquisadores, uma equipe de linguistas e cientistas da computação do Irã, notaram que, embora tenhamos mapas para outros pares de línguas misturadas, a mistura persa-inglês era uma floresta escura e inexplorada. Eles queriam construir uma lanterna para ver o que estava acontecendo ali. Assim, coletaram 6.800 postagens de três pontos de encontro digitais populares: X (antigo Twitter), Instagram e Digikala (um enorme site de compras online). Eles não coletaram apenas as palavras; usaram um assistente de IA super inteligente chamado Gemini para atuar como um detetive, rotulando cada palavra em inglês (ou palavra em inglês escrita com letras persas) com seu "trabalho" na frase. Na gramática, esse trabalho é chamado de "Parte do Discurso" (POS - Part-of-Speech). A palavra é um substantivo (uma coisa)? Um verbo (uma ação)? Um adjetivo (uma descrição)? A equipe também pediu à IA para adivinhar sobre o que a postagem estava falando, como "compras", "política" ou "memes engraçados".
Aqui está a parte emocionante: a equipe não apenas construiu a biblioteca; eles entraram nela e começaram a ler os livros para ver quais padrões podiam encontrar. Eles descobriram que, quando os falantes de persa misturam o inglês, eles o utilizam principalmente para substantivos (coisas). É como se estivessem pegando emprestados os "objetos" do inglês, mas mantendo as "ações" e "descrições" em persa. Por exemplo, eles podem dizer: "I bought a new laptop", onde "laptop" é o substantivo emprestado, mas o resto da frase permanece em persa. No entanto, o "sabor" da mistura muda dependendo de onde você está. No site de compras, Digikala, as pessoas misturavam muitos nomes de marcas e modelos de produtos (que são nomes especiais, ou "substantivos próprios"). No X, elas misturavam mais verbos (ações) e no Instagram, elas se inclinavam para adjetivos (descrições).
Os pesquisadores também observaram onde essas palavras misturadas se escondem em uma frase. Eles encontraram uma consistência surpreendente: não importa qual plataforma você use, as palavras misturadas tendem a aparecer no início ou no meio de uma frase, raramente no final. É como se os falantes soltassem a palavra em inglês cedo para preparar o cenário, e depois terminassem o pensamento em persa. Mas a descoberta mais interessante foi sobre o "gatilho" (triggering). No Digikala, se alguém usasse uma palavra em inglês, era muito provável que usasse outra logo em seguida. É como se, uma vez que você comece a falar sobre uma marca ou produto específico, as palavras em inglês simplesmente continuem fluindo. Isso não acontecia tanto no Instagram ou no X.
Finalmente, eles verificaram quais tópicos causavam mais mistura. Sem surpresa, os tópicos de "Indústria e Comércio" e "Marca e Negócios" tiveram a maior quantidade de code-mixing. Quando as pessoas falam sobre compras, tecnologia ou negócios, elas simplesmente não conseguem evitar de salpicar termos em inglês. A equipe confirmou o trabalho de sua IA fazendo com que especialistas humanos revisassem uma amostra, e os humanos concordaram com a IA quase sempre, provando que sua nova biblioteca é confiável.
Em suma, este artigo não fornece apenas um novo conjunto de dados; ele oferece um quadro claro de como os falantes de persa misturam as línguas naturalmente. Ele sugere que, embora os tipos de palavras que eles pegam emprestadas mudem dependendo da plataforma, a maneira como eles misturam segue um ritmo constante. Este mapa agora está aberto para qualquer pessoa usar, ajudando a construir ferramentas de tradução melhores, chatbots mais inteligentes e uma compreensão mais profunda de como nos comunicamos em um mundo onde as línguas estão constantemente dançando juntas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.