← Últimos artigos
💰 quantitative finance

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

Este artigo apresenta o UniFinEval, o primeiro benchmark multimodal unificado que abrange texto, imagens e vídeos através de cinco cenários financeiros principais, o qual revela que, embora modelos atuais como o Gemini-3-pro-preview liderem em desempenho, eles ainda ficam significativamente atrás de especialistas financeiros no tratamento de informações de alta densidade e raciocínio complexo.

Autores originais: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin
Publicado 2026-02-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um novo assistente para ajudar a administrar uma enorme e de alto risco empresa de investimentos. Este assistente precisa ser um "superanalista" capaz de ler relatórios financeiros espessos, interpretar gráficos complexos, assistir a horas de vídeos de análise de mercado e, então, tomar decisões inteligentes sobre onde aplicar o dinheiro.

Por muito tempo, temos testado esses assistentes de IA com questionários simples — como pedir para eles lerem um único parágrafo ou identificar um gráfico simples. Mas, no mundo real, as finanças são caóticas. É como tentar navegar em um oceano tempestuoso enquanto lê um mapa, ouve uma transmissão de rádio e assiste a um feed de vídeo ao vivo, tudo ao mesmo tempo. Os testes antigos eram fáceis demais e não refletiam o caos do trabalho real.

Apresentamos o "UniFinEval": O Bootcamp Financeiro Definitivo

Os autores deste artigo criaram um teste novo e superdesafiador chamado UniFinEval. Pense nisso como um "curso de sobrevivência" para modelos de IA, projetado especificamente para ver se eles conseguem lidar com o ambiente de alta pressão e sobrecarga de informações das finanças reais.

Veja como eles construíram este bootcamp:

1. Os Cinco Níveis do Bootcamp

Em vez de apenas fazer um tipo de pergunta, o teste é dividido em cinco cenários realistas, tornando-se mais difícil à medida que se avança:

  • Nível 1: O Detetive (Auditoria de Demonstrações Financeiras): Imagine um detetive examinando uma cena de crime bagunçada. A IA tem que encontrar pequenas inconsistências em um relatório financeiro que está repleto de textos, gráficos e layouts confusos. É como encontrar um único erro de digitação em um documento de 100 páginas enquanto alguém grita distrações no seu ouvido.
  • Nível 2: O Investigador (Raciocínio Fundamental da Empresa): Agora a IA tem que descobrir se uma empresa é realmente saudável. Ela precisa extrair números de diferentes relatórios, realizar cálculos complexos e conectar os pontos entre uma descrição textual e um gráfico. É como resolver um quebra-cabeça onde as peças estão em idiomas diferentes.
  • Nível 3: O Rastreador de Tendências (Insights de Tendências do Setor): A IA amplia o foco. Ela não está mais olhando para uma única empresa, mas para todo um setor. Ela tem que comparar dezenas de empresas ao longo do tempo para detectar grandes padrões. É como assistir a um jogo de futebol e prever o vencedor com base no desempenho de cada um dos jogadores em campo, não apenas do quarterback estrela.
  • Nível 4: O Radar (Sensoriamento de Risco Financeiro): Esta é a parte assustadora. A IA tem que assistir a um vídeo de um analista de mercado falando enquanto lê um relatório e observa um gráfico. Ela precisa detectar perigos ocultos (riscos) que estão enterrados no meio do ruído. É como tentar ouvir um sussurro em um furacão.
  • Nível 5: O General (Análise de Alocação de Ativos): O nível do chefe final. A IA tem que pegar tudo o que aprendeu nos quatro níveis anteriores e tomar uma decisão final sobre como investir o dinheiro, equilibrando todos os riscos e regras. É o momento em que o General tem que decidir para onde enviar as tropas.

2. As Regras do Jogo

  • Sem Trapaças: As perguntas do teste não foram escritas por outras IAs (que podem cometer erros ou mentir); elas foram escritas por especialistas humanos reais — pessoas com diplomas avançados e anos de experiência em finanças.
  • A Mistura: O teste utiliza textos, imagens e vídeos juntos. Você não pode apenas ler a resposta; você tem que "ver" o gráfico e "assistir" ao vídeo para entender o contexto.
  • O Tamanho: Eles criaram quase 4.000 dessas perguntas difíceis, tanto em inglês quanto em chinês.

3. Os Resultados: Quem Passou?

Os pesquisadores colocaram 10 dos modelos de IA mais inteligentes (os "alunos") neste bootcamp. Aqui está o que aconteceu:

  • O Melhor Desempenho: Um modelo, o Gemini-3-pro-preview, saiu no topo. Ele acertou cerca de 74% das respostas. Isso parece bom, mas lembre-se: este é um teste muito difícil.
  • A Lacuna: Mesmo a melhor IA ainda comete muitos erros em comparação a um especialista humano, que acertou cerca de 90-95%. A IA é boa em ler o texto, mas tem dificuldade quando precisa conectar os pontos entre um vídeo, um gráfico e um relatório.
  • As Dificuldades:
    • Problemas com Matemática: Muitos modelos erraram cálculos matemáticos simples.
    • Alucinações: Alguns modelos inventaram fatos que não estavam lá (como um aluno chutando a resposta porque estava com medo de dizer "eu não sei").
    • O Problema do "Vídeo": Quando vídeos estavam envolvidos, a maioria dos modelos se perdia. Eles não conseguiam acompanhar a história ao longo do tempo.
    • O Chefe Final: No nível mais difícil (Alocação de Ativos), o desempenho da IA caiu significativamente. Eles conseguiam reunir as informações, mas não consegravam tomar a decisão final e complexa sem se confundirem.

4. A Grande Conclusão

O artigo conclui que, embora a IA esteja ficando muito boa em ler e compreender dados financeiros simples, ela ainda não está pronta para substituir especialistas financeiros humanos em situações complexas do mundo real.

Pense da seguinte forma: a IA é como um aluno brilhante que consegue memorizar uma biblioteca inteira de livros didáticos. Mas, quando você o coloca em uma sala de guerra real, com um feed de vídeo ao vivo, uma mão tremendo e um relógio correndo, ele começa a entrar em pânico e cometer erros.

Os autores criaram o UniFinEval para mostrar exatamente onde a IA falha, para que os desenvolvedores possam corrigir essas fraquezas específicas antes de confiar esses modelos com dinheiro real. Eles não disseram que a IA logo estará comandando o mercado de ações; eles disseram: "Aqui está um mapa dos penhascos, para que saibamos onde a IA provavelmente irá cair".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →