← Últimos artigos
💰 quantitative finance

Can Open-Weight Models Compete on Financial Text Comprehension?

Este artigo avalia os benchmarks atualizados do Financial Touchstone com vinte modelos, revelando que modelos de pesos abertos como o Kimi K2.6 podem rivalizar com sistemas proprietários em compreensão de textos financeiros, apesar de gargalos persistentes de recuperação de informações e comportamentos de recusa geopolítica inconsistentes em modelos chineses.

Autores originais: Jan Spörer

Publicado 2026-08-11
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jan Spörer

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os computadores estão aprendendo a ler, escrever e raciocinar como os humanos. Este campo, chamado Inteligência Artificial (IA), explodiu recentemente com novos modelos que podem conversar, resolver problemas matemáticos e até escrever código. Mas há um porém: muitos desses computadores superinteligentes são "caixas pretas". Sabemos que eles funcionam, mas não sabemos exatamente como foram construídos ou quais segredos guardam dentro de seu código. Recentemente, uma nova onda desses modelos surgiu de laboratórios chineses que são "open-weight" (pesos abertos), o que significa que seus projetos são públicos para que qualquer pessoa possa estudá-los, ao contrário das versões secretas e trancadas das grandes empresas de tecnologia americanas. A grande questão na mente de todos é: esses modelos abertos e públicos podem realmente realizar o trabalho difícil, entediante, mas superimportante de ler relatórios financeiros e encontrar a verdade, ou eles são apenas bons em parecer inteligentes?

Este artigo é como um teste massivo de alto risco para vinte desses modelos de IA. Os pesquisadores estabeleceram um desafio chamado "Financial Touchstone", que é basicamente uma biblioteca gigante de 495 relatórios anuais reais de empresas de todo o mundo, emparelhados com 2.967 perguntas complicadas sobre eles. Pense nisso como dar a um aluno uma pilha de 495 livros didáticos e perguntar: "Quanto lucro a Empresa X obteve em 2022?" ou "Quais são os três principais segmentos de negócio?". O objetivo era ver qual IA conseguiria encontrar as respostas corretas sem inventar coisas (um problema chamado "alucinação") e sem ficar travada por não conseguir encontrar a página certa no livro.

Os resultados foram uma reviravolta total na trama. Por muito tempo, as pessoas pensaram que você precisaria de um cérebro de "raciocínio" especial ou de um modelo proprietário secreto para lidar com matemática financeira complexa. Mas este estudo descobriu que os modelos de pesos abertos estão alcançando o nível rapidamente. Na verdade, o modelo de pesos abertos chamado Kimi K2.6 ficou em terceiro lugar no geral, vencendo vários famosos e secretos modelos americanos! O melhor desempenho foi, na verdade, de um modelo chamado Claude Opus 4.6, que acertou 88,4% das respostas. No entanto, há uma reviravolta na história: enquanto alguns modelos eram ótimos em encontrar a resposta certa, outros eram incríveis em não inventar coisas. O Gemini 2.5 Pro, do Google, teve a menor taxa de mentiras, com uma taxa de alucinação de apenas 0,08%, mas não foi o melhor em encontrar as respostas em primeiro lugar.

Os pesquisadores também descobriram que o maior problema para todos esses modelos de IA não eram seus cérebros, mas sim seus olhos. Quase metade de todos os erros (48,9%) aconteceu porque o computador simplesmente não conseguiu encontrar a página certa no relatório massivo para ler. É como ter um gênio que não consegue encontrar o livro na estante. Outra descoberta estranha é que alguns modelos chineses tinham um "filtro de segurança" que subitamente se recusava a responder perguntas financeiras perfeitamente normais se o relatório mencionasse certas figuras ou eventos políticos, como um aluno se recusando a fazer uma prova porque o tópico o lembrava de uma regra que ele não deveria quebrar.

Então, qual é o veredito? O artigo sugere que os modelos de pesos abertos agora são fortes o suficiente para competir com os melhores modelos secretos do mundo no entendimento de finanças. Eles não precisam ser supercomputadores de "raciocínio" para fazer um ótimo trabalho; às vezes, um modelo aberto e mais simples funciona tão bem quanto. Mas o estudo também alerta que ainda temos um longo caminho a percorrer. Os computadores estão ficando melhores em ler, mas ainda lutam para encontrar a informação certa em documentos enormes, e às vezes são bloqueados por regras de segurança que são sensíveis demais. O autor conclui que, embora estejamos perto de ter assistentes de IA que possam lidar com relatórios financeiros do mundo real, ainda precisamos consertar como eles buscam informações antes de podermos confiar totalmente neles com nosso dinheiro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →