LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task
De derde editie van de LeWiDi shared task bij NLPerspectives breidt de ontwikkeling van disagreement-aware AI uit door de benchmark uit te breiden naar vier diverse NLP-taken met ordinale labelingschema's, zowel soft-label als perspectivistische evaluatieparadigma's met nieuwe metrieken te introduceren, en nieuwe bronnen en inzichten te bieden in het modelleren van variatie in menselijke oordeelsvorming.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij menselijke taal moet begrijpen. Een lange tijd hebben we robots onderwezen door ze voorbeelden te laten zien waarbij iedereen het eens was over het antwoord, zoals "2 + 2 = 4." Maar in het echte leven zijn mensen vaak het oneens. De één vindt een grap hilarisch, terwijl een ander hem beledigend vindt. De één ziet een zin als een leugen, terwijl een ander het als een onschuldige mening beschouwt.
Dit artikel beschrijft de derde editie van een "wedstrijd" (genoemd LeWiDi-2025) die is ontworpen om AI-modellen te leren hoe ze met deze meningsverschillen om moeten gaan, in plaats van te doen alsof ze niet bestaan.
Hier is een eenvoudige uitsplitsing van wat ze hebben gedaan, met behulp van enkele alledaagse analogieën:
1. Het Doel: AI leren naar de menigte te luisteren
In plaats van de AI te dwingen om slechts één "correct" antwoord te kiezen, wilden de organisatoren zien of AI het volledige plaatje van de menselijke opinie kon begrijpen.
- De Oude Manier: Als 10 mensen stemmen op een film en 6 zeggen "Goed" en 4 zeggen "Slecht", dan krijgt de oude AI simpelweg te horen: "Het antwoord is Goed." De 4 mensen worden genegeerd.
- De Nieuwe Manier: De AI krijgt te horen: "Hier is het volledige verhaal: 6 mensen vonden het goed, 4 niet. Jouw taak is om te begrijpen waarom zij dat vonden en om de mix van meningen te voorspellen."
2. De Vier "Spelletjes" (Datasets)
De wedstrijd gaf deelnemers vier verschillende soorten puzzels om op te lossen, die elk een ander soort menselijk meningsverschil vertegenwoordigen:
- Het Sarcasme Spel (CSC): Stel je voor dat je een tekstbericht leest. Is het een oprechte compliment of een sarcastische sneer? Verschillende mensen beoordelen hoe "sarcastisch" het is op een schaal van 1 tot 6.
- Het Ironie Spel (MP): Een korte post en een reactie. Is de reactie ironisch? Dit werd gespeeld in 9 verschillende talen (zoals Engels, Spaans en Arabisch), wat laat zien dat ironie een wereldwijd probleem is.
- Het Parafrase Spel (Par): Er worden twee vragen gesteld. Vragen ze hetzelfde? In plaats van een simpel "Ja/Nee", beoordeelden mensen hoe vergelijkbaar ze waren op een schaal van -5 tot 5.
- Het Logica Spel (VEN): Een bewering en een feit. Bewijst het feit de bewering, spreekt het de bewering tegen, of heeft het er niets mee te maken? Hier moesten mensen ook uitleg schrijven bij hun antwoorden.
3. De Twee Manieren van Spelen (Taken)
Deelnemers moesten kiezen tussen twee verschillende manieren om hun begrip van de AI te tonen:
- Taak A: De "Weervorsteller" (Soft-Label)
In plaats van één specifiek antwoord te raden, gedraagt de AI zich als een weervorsteller. De AI zegt niet alleen "Het gaat regenen"; maar zegt: "Er is een kans van 60% op regen, 30% op zon en 10% op sneeuw." De AI voorspelt de verdeling van hoe mensen zouden stemmen. - Taak B: De "Gedachtenlezer" (Perspectivistisch)
Dit is moeilijker. De AI moet raden wat een specifiek persoon zou zeggen. Als je de AI vertelt: "Hier is wat Persoon X gewoonlijk vindt," moet de AI voorspellen: "Op basis van de geschiedenis van Persoon X, zal deze waarschijnlijk dit antwoord geven." Het is alsoals het voorspellen of je chagrijnige oom of je optimistische tante het met een grap eens zal zijn.
4. De Nieuwe Scorekaart (Metrics)
In het verleden gebruikten de jury's een simpele liniaal om te meten hoe ver de AI ervan af zat. Maar die liniaal werkte niet goed voor zaken als "sarcasmeschalen" of "meerdere talen."
- De Nieuwe Liniaal: Ze hebben nieuwe manieren uitgevonden om succes te meten.
- Voor de "schalen" (zoals 1 tot 6) gebruikten ze een metriek die begrijpt dat een afwijking van één punt (bijvoorbeeld 4 zeggen in plaats van 5) beter is dan een afwijking van vijf punten (1 zeggen in plaats van 5).
- Voor de "gedachtenlezer"-taak maten ze hoe goed de AI de specifieke vooroordelen en gewoonten van individuele mensen kon nabootsen.
5. De Resultaten: Wie Won?
Ongeveer 15 teams namen deel aan de wedstrijd. Dit is wat ze ontdekten:
- De "Groot Brein" Aanpak: De topteams gebruikten Large Language Models (LLM's) — hetzelfde soort superintelligente AI die essays schrijft en met je chat. Deze modellen waren erg goed in het bekijken van voorbeelden van hoe verschillende mensen stemden en het kopiëren van dat patroon.
- De "Klein maar Krachtig" Aanpak: Sommige teams gebruikten kleinere, gespecialiseerde modellen. Deze presteerden verrassend goed op de kleinere, lastigere datasets.
- Het Geheime Ingrediënt: De winnende systemen keken niet alleen naar de tekst; ze keken naar wie de tekst schreef. Ze gebruikten aanwijzingen zoals de leeftijd, het geslacht of de eerdere stemgeschiedenis van de annotator om betere voorspellingen te doen.
- De "Uitleg" Bonus: Bij het logica spel presteerden teams die de uitleg voerden die mensen schreven (en niet alleen de antwoorden) veel beter. Het is alsoals het begrijpen van waarom iemand stemde, niet alleen hoe iemand stemde.
6. De Addertjes onder het Gras (Beperkingen)
De auteurs zijn eerlijk over wat ze niet hebben getest:
- Het "Nieuw Gezicht" Probleen: In de echte wereld kom je misschien een vreemde tegen wiens mening je nog nooit hebt gezien. In deze wedstrijd werd de AI getest op mensen die de AI tijdens de training al "ontmoet" had. We weten nog niet of deze modellen een compleet nieuw persoon kunnen aan.
- Alleen Tekst: De wedstrijd ging alleen over lezen en schrijven. We weten niet of deze methoden ook werken voor afbeeldingen, video's of stem.
Samenvatting
Dit artikel is een rapportcijfer voor een wedstrijd die AI leerde om te stoppen met doen alsof iedereen het met elkaar eens is. Door nieuwe scoremethoden te gebruiken en te focussen op de rommelige realiteit van menselijke onenigheid, lieten de winnaars zien dat de beste AI-modellen de modellen zijn die een menigte kunnen bekijken, de verschillende stemmen daarin kunnen begrijpen en de mix van meningen kunnen voorspellen in plaats van simpelweg één winnaar te kiezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.