← Últimos artigos
💻 computer science

Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales

Este artigo apresenta e valida duas novas escalas, a Escala de Cooperatividade Percebida (ECP) e a Escala de Percepção de Trabalho em Equipe (EPTE), que medem efetivamente a qualidade subjetiva do trabalho em equipe humano-IA em diversos contextos por meio de três estudos empíricos.

Autores originais: Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

Publicado 2026-04-28
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando assar um bolo com um novo assistente robótico de alta tecnologia. Às vezes, o robô é incrível: ele sabe exatamente quando misturar, diz se o forno está muito quente e você sente que é uma equipe de confeitaria perfeita. Outras vezes, o robô é confuso: ele queima a massa, ignora suas instruções ou age como se não soubesse o que está fazendo.

Este artigo trata da criação de dois "boletins" especiais (chamados de escalas) para medir exatamente quão boa essa parceria de confeitaria parece, da sua perspectiva. Os pesquisadores, trabalhando com a Honda e a Universidade de Lübeck, quiseram ir além de apenas perguntar: "Você gosta deste robô?" para perguntar: "Quão bem nós realmente trabalhamos juntos?"

Aqui está uma explicação do trabalho deles usando analogias simples:

Os Dois Boletins

Os pesquisadores perceberam que trabalhar com IA acontece de duas maneiras diferentes, então eles construíram duas ferramentas de medição distintas:

1. O Boletim do "Momento Único" (Escala de Cooperatividade Percebida - PCS)

  • O que mede: Quão bem a IA agiu durante uma tarefa específica.
  • A Analogia: Pense nisso como julgar um único movimento de dança. Seu parceiro liderou claramente? Ele seguiu sua liderança? Ele manteve o ritmo apenas para esta música?
  • A Teoria: Baseia-se na "Teoria da Atividade Conjunta". Verifica se a IA foi transparente (você sabia o que ela estava pensando), confiável (ela fez o que disse) e responsiva (ela ouviu você).
  • O Resultado: Eles testaram isso em 409 pessoas em três cenários diferentes: jogando um jogo de cartas cooperativo, conversando com um chatbot e usando o planejador de viagens de um carro. O boletim funcionou muito bem! Foi capaz de distinguir claramente entre um parceiro humano (que obteve pontuações altas), um robô baseado em regras inteligente mas previsível (pontuações médias) e um robô que aprendeu por tentativa e erro e ficou confuso (pontuações baixas).

2. O Boletim da "Equipe de Longo Prazo" (Escala de Percepção de Trabalho em Equipe - TPS)

  • O que mede: A sensação de que você e a IA se tornaram uma verdadeira equipe ao longo do tempo.
  • A Analogia: Isso não é apenas sobre um movimento de dança; é sobre se você sente que faz parte de uma trupe de dança. Você sente que ambos estão investindo esforço? Você sente que compartilham um objetivo comum? Você sente que o robô é um "companheiro de equipe" e não apenas uma ferramenta?
  • A Teoria: Baseia-se na "Teoria da Cooperação Evolutiva". Examina se ambos os lados estão pagando um "custo" (esforço) para ajudar o outro a ter sucesso.
  • O Resultado: Esta escala tem três partes:
    • A Equipe: "Nós somos uma unidade."
    • O Parceiro: "Você está me ajudando."
    • O Eu: "Eu estou ajudando você."
    • O Twist: A parte do "Eu" foi complicada. As pessoas tendiam a se dar notas altas, não importa quão ruim fosse o robô. É como um aluno que pensa: "Estudei muito!" mesmo que não tenha realmente estudado. Os pesquisadores descobriram que esta parte da escala é sensível à situação; funciona melhor quando as pessoas têm mais liberdade para escolher o quanto trabalham duro.

Como Eles Testaram (Os Três Estudos)

Para garantir que seus boletins fossem precisos, eles usaram três "campos de treinamento" diferentes:

  1. O Jogo de Cartas (Hanabi): Imagine um jogo onde você não pode ver suas próprias cartas e deve confiar em dicas do seu parceiro.

    • O Teste: As pessoas jogaram com um humano, um robô que seguia regras estritas e um robô que aprendia por conta própria.
    • A Descoberta: Os boletins classificaram com sucesso: Humano > Robô Baseado em Regras > Robô de Aprendizado. O robô de aprendizado foi frequentemente confuso, então as pessoas não sentiram que estavam cooperando bem.
  2. O Chatbot (LLM): As pessoas usaram um chatbot para verificar fatos em artigos.

    • O Teste: Usaram bots que eram úteis, bots que eram úteis mas faziam alterações indesejadas e bots que falhavam.
    • A Descoberta: As escalas captaram as diferenças em quão "cooperativos" os bots pareciam.
  3. O Planejador de Viagens do Carro: As pessoas usaram um planejador de viagens da Tesla para encontrar estações de carregamento.

    • O Teste: Este foi um "caso limite". O carro não é realmente um "companheiro de equipe"; é apenas uma ferramenta.
    • A Descoberta: O boletim do "Momento Único" (PCS) ainda funcionou bem aqui. No entanto, o boletim da "Equipe de Longo Prazo" (TPS) não foi usado porque um planejador de viagens de carro não tem realmente uma "mente" ou "objetivos" para formar uma equipe. Você não pode realmente sentir que é uma equipe com um GPS.

O Que Eles Aprenderam (As Conclusões)

  • O boletim do "Momento Único" é sólido como rocha. É uma maneira muito confiável de medir quão bem uma IA age durante uma tarefa específica. Funciona para tudo, desde chatbots até bots de jogos.
  • O boletim da "Equipe" é poderoso, mas exige cuidado. Ele mede a sensação profunda de parceria. No entanto, a parte onde as pessoas avaliam sua própria contribuição é um pouco tendenciosa. As pessoas tendem a pensar que são ótimos companheiros de equipe, mesmo quando a IA é terrível. Isso sugere que, em situações rígidas (como um jogo de cartas onde você deve cooperar), as autoavaliações das pessoas não mudam muito.
  • O contexto importa. Se você está apenas usando uma ferramenta (como uma calculadora ou um GPS), a sensação de "Equipe" realmente não se aplica. Mas se você está trabalhando em um projeto complexo onde você e a IA precisam confiar um no outro, essas escalas dizem se essa parceria está funcionando.

Por Que Isso Importa

Antes disso, tínhamos principalmente ferramentas para perguntar: "Você confia na IA?" ou "Esta IA é inteligente?" Este artigo nos dá uma maneira de perguntar: "Quão bem estamos trabalhando juntos agora?" e "Sentimos que somos uma equipe?"

Isso ajuda os designers a construir melhores IAs. Se um robô obtiver pontuações baixas em "previsibilidade", os designers sabem que precisam tornar as ações do robô mais claras. Se a pontuação de "Equipe" for baixa, eles sabem que o robô precisa mostrar mais apoio e objetivos compartilhados.

Em resumo: Os pesquisadores construíram duas réguas. Uma mede quão bem um robô dança em uma única música. A outra mede se você sente que você e o robô estão juntos em uma trupe de dança. Eles testaram essas réguas em 409 pessoas e descobriram que funcionam bem, embora a régua da "trupe de dança" precise ser usada com cuidado, dependendo de quanta liberdade o humano tem para se mover.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →