The Effect of Scripts and Formats on LLM Numeracy
Este artigo revela que os grandes modelos de linguagem sofrem quedas significativas de precisão ao processar expressões numéricas em escritas ou formatos sub-representados, mas demonstra que estratégias de prompting direcionadas podem mitigar eficazmente essa disparidade.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um aluno brilhante que leu quase todos os livros do mundo. Este aluno é um mestre em matemática, capaz de resolver problemas complexos de adição e multiplicação instantaneamente. Mas há um detalhe: este aluno só viu números escritos da maneira padrão que usamos em inglês (como 1, 2, 3).
Este artigo trata do que acontece quando você pede a esse superinteligente aluno para fazer matemática usando números escritos em diferentes "idiomas" ou "estilos" que ele não conhece muito bem.
A Descoberta Principal: O "Imposto do Script"
Os pesquisadores descobriram que, quando trocavam os números padrão por outros scripts — como १, २, ३ (Devanagari) ou ۱, ۲, ۳ (Perso-Árabe) — as habilidades matemáticas do aluno caíam drasticamente.
Pense nisso desta forma: Se você pedir a um chef para cozinhar um bife perfeito, ele consegue fazer isso facilmente. Mas, se você entregar a ele uma receita escrita em uma língua que ele não lê, ou se disser para ele picar as cebolas com uma colher em vez de uma faca, ele pode derrubar os ingredientes ou queimar o bife. O chef ainda sabe como cozinhar, mas o formato das instruções o confundiu.
O artigo chama isso de "Imposto do Script" (Script Tax). É uma penalidade que a IA paga apenas por ver números em formatos diferentes. Embora o problema matemático seja exatamente o mesmo (ex: "5 + 5"), a IA erra de 66% a 87% mais vezes se os números não estiverem no estilo padrão do inglês.
Por Que Isso Acontece?
O artigo aponta dois principais culpados:
- A "Dieta de Treinamento": A IA foi treinada com uma dieta massiva de textos da internet. A maior parte desse texto usa números padrão em inglês. É como se o aluno tivesse comido apenas maçãs; quando você de repente lhe dá uma pera, ele não sabe como mastigá-la adequadamente.
- O Proble(ma) dos "Tokens": A IA não lê palavras como os humanos; ela divide o texto em pequenos pedaços chamados "tokens".
- Números padrão (como 123) podem ser um ou dois pedaços.
- Alguns outros scripts dividem o mesmo número em muitos pedaços minúsculos e confusos.
- O artigo descobriu que quanto mais "pedaços" um número é dividido, mais difícil fica para a IA fazer a conta. É como tentar resolver um quebra-cabeça onde alguém cortou a imagem em 100 pedacinhos minúsculos em vez de 10 grandes.
A Boa Notícia: Podemos Corrigir Isso com "Dicas"
Os pesquisadores não apenas encontraram um problema; eles encontraram uma maneira de ajudar o aluno. Eles testaram diferentes formas de fazer a pergunta (chamadas de "prompting"):
- Apenas pedir educadamente: "Por favor, resolva isto." -> Ainda falhou.
- Dizer o idioma: "Isto está escrito em tailandês." -> Ainda falhou.
- Dar uma folha de consulta (Mapeamento): Mostrar à IA uma lista como "Este símbolo significa 1, este outro significa 2." -> Melhorou, mas não foi perfeito.
- O Truque Mágico (Few-Shot Prompting): Este foi o vencedor. Os pesquisadores deram à IA alguns exemplos antes.
- Exemplo 1: "Aqui está um problema em tailandês: 1 + 1 = 2. Aqui está a resposta."
- Exemplo 2: "Aqui está outro..."
- Agora: "Resolva este aqui."
Ao mostrar à IA alguns exemplos de como lidar com esses estilos de números estranhos, seu desempenho disparou. É como mostrar ao aluno alguns problemas de prática na nova língua antes do teste real. De repente, ele conseguia fazer a matemática perfeitamente.
A Reviravolta da Formatação
O artigo também observou como os números são agrupados. Nos EUA, escrevemos números grandes como 1,000,000 (vírgulas a cada três dígitos). Na Europa, eles podem escrever 1.000.000 (pontos) ou 1 000 000 (espaços).
A IA ficou confusa com esses estilos também. Ela lidou perfeitamente com o estilo dos EUA, mas teve dificuldades com os estilos europeus. Curiosamente, a IA frequentemente confundiu esses formatos numéricos com coisas como endereços de IP (ex: 192.168.1.1), que são comuns em seus dados de treinamento, mas não são problemas matemáticos.
A Conclusão
O artigo conclui que esses modelos de IA não são "ruins em matemática". Na verdade, eles são muito bons na lógica. O problema é que eles são frágeis. Eles dependem fortemente de ver números na forma específica e familiar em que foram ensinados.
Se você quer que uma IA faça matemática para você em um idioma diferente ou com estilos de números diferentes, você não pode apenas pedir diretamente. Você tem que dar um pequeno empurrão: mostre a ela alguns exemplos primeiro, ou explique exatamente como os símbolos funcionam. Uma vez feito isso, o "Imposto do Script" desaparece, e a matemática torna-se fácil novamente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.