← Últimos artigos
💬 NLP

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

O artigo apresenta o Cognitive Chain-of-Thought (CoCoT), um framework de raciocínio multimodal estruturado em três etapas cognitivas (Percepção, Situação e Norma) que melhora a capacidade de modelos de linguagem visuais em tarefas sociais complexas e demonstra que o ajuste fino com esse padrão internaliza o raciocínio estruturado, aumentando a confiabilidade e a alinhamento social dos sistemas.

Autores originais: Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

Publicado 2026-04-21
📖 4 min de leitura☕ Leitura rápida

Autores originais: Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando entender uma cena de um filme mudo, mas com uma pegadinha: os atores estão fazendo algo estranho e você precisa adivinhar o que eles estão pensando ou por que estão agindo assim.

Se você pedir para uma Inteligência Artificial (IA) comum fazer isso, ela muitas vezes "alucina". Ela pode inventar uma história que faz sentido na cabeça dela, mas que ignora o que está realmente acontecendo na tela. É como se ela pulasse direto para a conclusão sem olhar para os detalhes.

Este artigo apresenta uma nova maneira de ensinar essas IAs a pensar, chamada COCOT (Cadeia Cognitiva de Pensamento). Pense no COCOT como um manual de instruções em três passos para transformar uma IA confusa em um detetive social astuto.

Aqui está como funciona, usando uma analogia simples:

O Problema: A IA que Pula Etapas

Normalmente, quando pedimos para uma IA analisar uma imagem social (como duas pessoas conversando), ela tenta fazer tudo de uma vez: "O que vejo? O que isso significa? O que é certo fazer?". O resultado é uma bagunça. Ela mistura o que vê com o que imagina, criando justificativas falsas.

A Solução: O COCOT (Os 3 Passos do Detetive)

Os autores criaram um método que força a IA a pensar em três etapas distintas, como se fosse um processo de maturação do pensamento humano:

1. Percepção (O Olho do Fotógrafo)

  • O que é: A IA só pode descrever o que está fisicamente na imagem. Nada de adivinhar sentimentos ou intenções.
  • A Analogia: Imagine que a IA é uma câmera de segurança. Ela só pode dizer: "Vejo um homem segurando uma xícara de café e uma mulher rindo". Ela não pode dizer: "O homem está nervoso" ou "A mulher está debochando". Ela só registra os fatos crus.
  • Por que importa: Isso impede que a IA invente coisas que não estão lá.

2. Situação (O Diretor de Cinema)

  • O que é: Agora, a IA pega os fatos da etapa 1 e pergunta: "O que está acontecendo aqui?". Ela conecta os pontos para entender o contexto.
  • A Analogia: Agora a IA assume o papel de um diretor de cinema. Ela olha para os fatos (homem com café, mulher rindo) e diz: "Ah, eles estão em uma cafeteria. O homem parece estar tentando explicar algo, mas a mulher está rindo porque a piada dele foi ruim". Ela cria uma história coerente baseada apenas no que foi visto.
  • Por que importa: Isso transforma dados soltos em uma cena compreensível.

3. Norma (O Juiz Social)

  • O que é: Finalmente, a IA usa o contexto da etapa 2 para julgar o que é socialmente aceitável ou qual é a intenção real.
  • A Analogia: Agora a IA é um juiz ou um sábio da comunidade. Ela pergunta: "Dado que a mulher está rindo da piada ruim, qual é a intenção do homem? Ele quer que ela pare de rir? Ou ele está apenas tentando ser engraçado?". Ela aplica as regras sociais (o que é educado, o que é sarcasmo, o que é seguro).
  • Por que importa: Isso garante que a resposta final faça sentido no mundo real, não apenas na lógica fria da máquina.

O Resultado: IAs Mais Espertas e Seguras

O artigo mostra que, ao usar esse método de "3 passos":

  1. Elas acertam mais: Em testes de entender intenções humanas, teoria da mente (o que os outros pensam) e até em tarefas de segurança (não fazer coisas perigosas), as IAs melhoraram muito.
  2. Elas aprendem a pensar: O mais legal é que, quando os pesquisadores treinaram as IAs usando esse método, elas começaram a pensar assim mesmo sem receber as instruções. Foi como se elas internalizassem o hábito de "olhar, entender e julgar" antes de responder.
  3. Elas são mais honestas: Quando a IA erra, é mais fácil saber onde ela errou. Se ela errou na "Percepção", sabemos que ela viu a imagem errada. Se errou na "Norma", sabemos que ela não entendeu a regra social.

Resumo em uma frase

O COCOT ensina as IAs a não pular direto para a conclusão, mas sim a observar o mundo como uma câmera, entender a história como um diretor e julgar a situação como um ser humano, tornando-as mais inteligentes, seguras e fáceis de confiar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →