LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task
A terceira edição da tarefa compartilhada LeWiDi no NLPerspectives avança o desenvolvimento de IA consciente de discordâncias ao expandir o benchmark para quatro tarefas de PLN diversas com esquemas de rotulagem ordinal, introduzindo tanto os paradigmas de avaliação de rótulo suave quanto os perspectivistas com métricas inovadoras, e fornecendo novos recursos e percepções sobre a modelagem da variação do julgamento humano.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um robô a entender a linguagem humana. Por muito tempo, ensinamos os robôs mostrando-lhes exemplos onde todos concordavam com a resposta, como "2 + 2 = 4". Mas, na vida real, os humanos frequentemente discordam. Uma pessoa pode achar uma piada hilária, enquanto outra a acha ofensiva. Uma pessoa pode ver uma frase como uma mentira, enquanto outra a vê como uma opinião inofensiva.
Este artigo descreve a terceira edição de um "concurso" (chamado LeWiDi-2025) projetado para ensinar modelos de IA a lidar com essas discordâncias, em vez de fingir que elas não existem.
Aqui está uma divisão simples do que eles fizeram, usando algumas analogias do cotidiano:
1. O Objetivo: Ensinar a IA a Ouvir a Multidão
Em vez de forçar a IA a escolher apenas uma resposta "correta", os organizadores queriam ver se a IA conseguia entender o quadro completo da opinião humana.
- O Jeito Antigo: Se 10 pessoas votam em um filme, e 6 dizem "Bom" e 4 dizem "Ruim", a IA antiga seria apenas informada: "A resposta é Bom". Ela ignora as 4 pessoas.
- O Jeito Novo: A IA é informada: "Aqui está a história completa: 6 pessoas gostaram, 4 não gostaram. Seu trabalho é entender por que elas se sentiram assim e prever a mistura de opiniões".
2. Os Quatro "Jogos" (Datasets)
O concurso deu aos participantes quatro tipos diferentes de quebra-cabeças para resolver, cada um representando um tipo diferente de discordância humana:
- O Jogo do Sarcasmo (CSC): Imagine ler uma mensagem de texto. É um elogio sincero ou uma cutucada sarcástica? Diferentes pessoas avaliam o quão "sarcástica" ela é em uma escala de 1 a 6.
- O Jogo da Ironia (MP): Um post curto e uma resposta. A resposta está sendo irônica? Isso foi jogado em 9 idiomas diferentes (como inglês, espanhol e árabe), mostrando que a ironia é um problema global.
- O Jogo da Paráfrase (Par): Duas perguntas são feitas. Elas estão perguntando a mesma coisa? Em vez de um simples "Sim/Não", as pessoas avaliaram o quão semelhantes elas eram em uma escala de -5 a 5.
- O Jogo da Lógica (VEN): Uma afirmação e um fato. O fato prova a afirmação, contradiz a afirmação ou não tem nada a ver com ela? Aqui, as pessoas também tiveram que escrever explicações para suas respostas.
3. As Duas Formas de Jogar (Tarefas)
Os participantes tiveram que escolher entre duas formas diferentes de demonstrar o entendimento de sua IA:
- Tarefa A: O "Previsão do Tempo" (Soft-Label)
Em vez de adivinhar uma resposta específica, a IA age como um meteorologista. Ela não diz apenas "Vai chover"; ela diz: "Há 60% de chance de chuva, 30% de sol e 10% de neve". A IA prevê a distribuição de como os humanos votariam. - Tarefa B: O "Leitor de Mentes" (Perspectivista)
Isso é mais difícil. A IA tem que adivinhar o que uma pessoa específica diria. Se você disser à IA: "Aqui está o que a Pessoa X costuma pensar", a IA deve prever: "Com base no histórico da Pessoa X, ela provavelmente dará esta resposta". É como prever se o seu tio rabugento ou sua tia otimista concordaria com uma piada.
4. A Nova Planilha de Pontuação (Métricas)
No passado, os juízes usavam uma régua simples para medir o quão longe a IA estava. Mas essa régua não funcionava bem para coisas como "escalas de sarcasmo" ou "múltiplos idiomas".
- A Nova Régua: Eles inventaram novas formas de medir o sucesso.
- Para as "escalas" (como 1 a 6), eles usaram uma métrica que entende que errar por um ponto (dizer 4 em vez de 5) é melhor do que errar por cinco pontos (dizer 1 em vez de 5).
- Para a tarefa do "leitor de mentes", eles mediram o quão bem a IA conseguia imitar os vieses e hábitos específicos de indivíduos.
5. Os Resultados: Quem Venceu?
Cerca de 15 equipes participaram do concurso. Aqui está o que eles descobriram:
- A Abordagem do "Cérebro Grande": As equipes de topo usaram Modelos de Linguagem de Grande Escala (LLMs) — o mesmo tipo de IA superinteligente que escreve ensaios e conversa com você. Esses modelos foram muito bons em observar exemplos de como diferentes pessoas votaram e copiar esse padrão.
- A Abordagem "Pequeno mas Poderoso": Algumas equipes usaram modelos menores e especializados. Estes tiveram um desempenho surpreendentemente bom nos conjuntos de dados menores e mais complexos.
- O Ingrediente Secreto: Os sistemas vencedores não olharam apenas para o texto; eles olharam para quem estava escrevendo o texto. Eles usaram pistas como a idade, o gênero ou o histórico de votação do anotador para fazer previsões melhores.
- O Bônus da "Explicação": No jogo de lógica, as equipes que alimentaram a IA com as explicações que as pessoas escreveram (não apenas as respostas) tiveram um desempenho muito melhor. É como entender por que alguém votou, não apenas como alguém votou.
6. A Pegadinha (Limitações)
Os autores são honestos sobre o que eles não testaram:
- O Problema do "Novo Rosto": No mundo real, você pode encontrar um estranho cuja opinião você nunca viu antes. Neste concurso, a IA foi testada em pessoas que ela já havia "conhecido" durante o treinamento. Ainda não sabemos se esses modelos conseguem lidar com uma pessoa completamente nova.
- Apenas Texto: O concurso foi apenas sobre ler e escrever. Não sabemos se esses métodos funcionam para imagens, vídeos ou voz.
Resumo
Este artigo é um boletim de notas de um concurso que ensinou a IA a parar de fingir que todos concordam. Ao usar novos métodos de pontuação e focar na realidade desordenada do desacordo humano, os vencedores mostraram que os melhores modelos de IA são aqueles que conseguem olhar para uma multidão, entender as diferentes vozes dentro dela e prever a mistura de opiniões, em vez de apenas escolher um único vencedor.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.