← Últimos artigos
💻 computer science

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

Este artigo apresenta o PatternEval, um benchmark de diagnóstico que revela um desalinhamento sistemático nos padrões de resposta entre os modos de pensamento e não pensamento de MLLMs de pensamento híbrido, e propõe o PatternRL, um framework de aprendizado por reforço com penalidades específicas de padrão para alinhar esses comportamentos enquanto mantém o desempenho da tarefa.

Autores originais: Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Ya
Publicado 2026-08-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está conversando com um amigo robô superinteligente que consegue ver imagens, ler gráficos e resolver quebra-cabeças complicados. Às vezes, você pede a esse robô para "pensar profundamente" antes de responder, dando a ele tempo extra para trabalhar no problema passo a passo. Outras vezes, você quer uma resposta rápida, então diz a ele para "apenas adivinhar" ou dar uma resposta direta sem o longo processo de pensamento. Este é o mundo dos Modelos de Linguagem de Grande Escala Multimodais (MLLMs) — sistemas de IA que podem entender tanto texto quanto imagens. A grande questão que os cientistas estão fazendo não é apenas "A resposta está certa?", mas "O robô age da mesma forma, quer esteja pensando profundamente ou apenas adivinhando?". Se o robô der uma resposta perfeita após pensar, mas depois deixar escapar seus pensamentos secretos, repetir a si mesmo ou se contradizer quando solicitado a dar uma resposta rápida, isso é um problema. Queremos que nossa IA seja confiável e educada, não importa quanto tempo demos a ela para trabalhar.

Este artigo, intitulado "Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs", mergulha exatamente nesse problema. Os pesquisadores descobriram que mesmo os modelos de IA mais inteligentes têm uma "personalidade dividida" estranha. Quando são permitidos a pensar lentamente, eles se comportam como especialistas calmos e profissionais. Mas quando forçados a ser rápidos e sem pensar, eles frequentemente começam a agir de forma desordenada: eles acidentalmente vazam seu "processo de pensamento" interno para a resposta final, repetem as mesmas frases repetidamente, dizem duas coisas opostas ao mesmo tempo ou fingem raciocinar quando na verdade não estão realizando nenhum trabalho.

Para provar isso, a equipe construiu um teste especial chamado PatternEval, que é como um exame de "pegadinha" projetado especificamente para capturar esses comportamentos desordenados. Eles testaram 25 modelos de IA diferentes (incluindo grandes nomes como Qwen, Kimi e Claude) em 2.415 enigmas complicados de imagem e texto. Os resultados foram reveladores: até os modelos mais avançados mostraram uma enorme lacuna entre seus modos de "pensamento" e "não-pensamento". De fato, para muitos modelos, o modo rápido e de não-pensamento falhou em seguir regras básicas de uma boa conversa quase 48% das vezes, enquanto o modo de pensamento lento era muito mais limpo.

Para corrigir isso, os autores criaram um novo método de treinamento chamado PatternRL. Pense nisso como ensinar um aluno não apenas a acertar a matemática, mas também a escrever de forma nítida, sem rabiscar ou repetir a si mesmo. Eles treinaram uma IA "juíza" (chamada PatternRM) para detectar esses quatro hábitos ruins específicos:

  1. Vazamento de cadeia de pensamento (Chain-of-thought leakage): Revelar os passos secretos do "pensamento" na resposta final.
  2. Repetição de resposta (Response repetition): Dizer a mesma coisa duas vezes sem motivo.
  3. Contradição lógica (Logical contradiction): Dizer "Sim" e "Não" sobre a mesma coisa ao mesmo tempo.
  4. Raciocínio performativo (Performative reasoning): Fingir analisar algo sem realmente usar qualquer evidência real.

Quando aplicaram este novo treinamento a dois modelos específicos (Qwen3-VL-4B e Qwen3-VL-8B), os comportamentos desordenados no modo rápido caíram significativamente — cerca de 13 a 14 pontos percentuais — sem prejudicar a capacidade dos modelos de obter as respostas corretas. No entanto, os pesquisadores também observaram uma pequena compensação: os modelos tornaram-se ligeiramente menos precisos em tarefas de matemática e lógica muito difíceis, sugerindo que forçar o modelo a ser "limpo" às vezes o impede de explorar maneiras criativas (mas desordenadas) de resolver problemas.

Em resumo, o artigo sugere que só porque uma IA pode resolver um problema, não significa que ela esteja pronta para conversar com humanos. Para ser verdadeiramente útil, a IA precisa ser treinada não apenas no que dizer, mas em como dizer, garantindo que ela permaneça educada e consistente, quer esteja levando muito tempo para pensar ou dando uma resposta rápida.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →