← Últimos artigos
💬 NLP

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

Este artigo apresenta o MM-THEBench, um benchmark abrangente projetado para avaliar alucinações nas etapas de raciocínio intermediárias de modelos de linguagem grandes multimodais, abordando a lacuna nas avaliações existentes que negligenciam os processos de pensamento internos de modelos de raciocínio pós-treinados.

Autores originais: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Publicado 2026-02-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma equipe de detetives super inteligentes e multitalentosos (estes são os Modelos de Linguagem de Grande Escala Multimodais de Raciocínio, ou MLLMs). Esses detetives são ótimos em olhar para uma foto, ler um gráfico ou assistir a um vídeo e, então, resolver um mistério.

No passado, esses detetives apenas gritavam sua resposta final: "O suspeito é o mordomo!". Mas recentemente, eles foram treinados para pensar em voz alta antes de falar. Eles escrevem uma longa lista de pistas e passos lógicos (chamados de Cadeia de Pensamentos ou CoTs) para explicar como chegaram àquela conclusão.

O problema? Às vezes, mesmo que o detetive escreva uma lista longa e sofisticada de passos, alguns desses passos são mentiras totais (alucinações). No entanto, por pura sorte ou ao ignorar as mentiras, eles ainda gritam a resposta correta final.

Este artigo apresenta uma nova ferramenta chamada MM-THEBENCH para pegar esses detetives no ato de mentir durante seu processo de pensamento.

O Novo Campo de Treinamento de Detetives: MM-THEBENCH

Pense no MM-THEBENCH como um "Teste de Detector de Mentiras" de alta tecnologia, projetado especificamente para o processo de pensamento, não apenas para a resposta final.

1. Os Três Tipos de Mentiras (A Taxonomia)
Os autores perceberam que, quando um detetive mente, isso geralmente se encaixa em uma de três categorias. Eles criaram um checklist para detectá-las:

  • A Mentira da "Memória Falsa" (Conhecimento): O detetive inventa um fato que aprendeu na escola. Exemplo: "Eu sei com certeza que a Torre Eiffel fica em Londres." (Não fica).
  • A Mentira da "Visão Ruim" (Percepção): O detetive olha para a foto, mas vê coisas que não estão lá. Exemplo: "Eu vejo um carro vermelho na foto", quando o carro é, na verdade, azul.
  • A Mentira do "Raciocínio Ruim" (Lógica): O detetive vê as coisas certas, mas conecta os pontos de forma errada. Exemplo: "O carro é azul, e carros azuis são rápidos, portanto este carro é uma Ferrari." (Lógica ruim).

2. O Sistema de Notas (Rubricas)
Em vez de apenas verificar se a resposta final está certa ou errada, o MM-THEBENCH decompõe o pensamento do detetive em pequenos passos atômicos.

  • Imagine um problema de matemática. A solução do "Padrão de Ouro" possui 5 passos específicos.
  • O sistema verifica o processo de pensamento de 20 passos do detetive contra esses 5 passos de ouro.
  • Ele pergunta: "Você realmente viu o carro? Você sabia a regra sobre os triângulos? Você fez a conta corretamente?"
  • Ele atribui uma pontuação para cada um dos passos, marcando exatamente onde a "mentira" ocorreu.

O Que Eles Descobriram (Os Resultados)

Os autores testaram 14 dos modelos de detetives mais inteligentes do mundo (incluindo grandes nomes como GPT-5, Claude e Gemini) usando este novo teste. Aqui está o que eles descobriram:

1. A Armadilha da "Resposta Correta"
Só porque um detetive obtém a resposta final correta, não significa que ele pensou corretamente.

  • Analogia: Imagine um aluno fazendo uma prova de matemática. Ele escreve um parágrafo de bobagens, inventa números e usa uma lógica errada, mas depois adivinha o número final e acerta.
  • Descoberta: Muitos modelos obtiveram a resposta correta, embora seus "passos de pensamento" estivessem cheios de alucinações. O processo de pensamento não era uma explicação fiel de como eles resolveram o problema.

2. A Diferença entre "Visão Ruim" e "Lógica Ruim"
Esta foi uma descoberta surpreendente:

  • Alucinações de Percepção (Visão Ruim): Elas acontecem o tempo todo. Os modelos frequentemente identificam objetos ou cores incorretamente. No entanto, isso raramente estraga a resposta final. O modelo pode pensar que um carro é vermelho quando é azul, mas ainda assim consegue entender que o carro está em movimento.
  • Alucinações de Raciocínio (Lógica Ruim): Elas são raras, mas mortais. Se o modelo errar a lógica (ex: "Se A, então B" quando na verdade é "Se A, então C"), a resposta final quase sempre estará errada.
  • Lição: É melhor ter um detetive com visão ruim do que um com o cérebro quebrado.

3. O Problema do "Pensar Demais"
O artigo descobriu que, quando os modelos são forçados a pensar por mais tempo (mais passos), eles não necessariamente ficam mais espertos.

  • Analogia: Imagine um detetive que continua escrevendo notas. As primeiras 5 notas são brilhantes. As próximas 15 são apenas ele divagando, repetindo-se ou inventando novos fatos.
  • Descoberta: À medida que o pensamento se torna mais longo, a "precisão" cai. Os modelos geram muitos passos extras, inúteis ou alucinados apenas para preencher o espaço. Eles estão "pensando demais" e se afastando da verdade.

A Conclusão

O artigo argumenta que não podemos mais confiar apenas na resposta final que um modelo nos dá. Precisamos olhar para como eles chegaram lá.

O MM-THEBENCH é como uma lupa que nos obriga a olhar para o caderno do detetive. Ele mostra que, embora esses modelos de IA estejam ficando melhores em resolver problemas, seu "pensamento" interno é muitas vezes bagunçado, cheio de pequenas mentiras e, às vezes, completamente desconectado da realidade. Para torná-los verdadeiramente confiáveis, precisamos consertar seu processo de pensamento, não apenas suas respostas finais.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →