CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
Dit artikel introduceert CommonWhy, een dataset van 15.000 op entiteiten gebaseerde "waarom"-vragen die de causale gezondverstandredenering en abductieve verklarende vermogens van grote taalmodellen evalueert en aanzienlijke tekortkomingen in huidige modellen blootlegt, ondanks de beschikbaarheid van ondersteunende kennis in Wikidata.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, goed gelezen robotassistent hebt. Je hebt hem duizenden vragen gesteld zoals: "Is het waar dat Harry Potter kan vliegen?" of "Bezat Aristoteles een laptop?" De robot is erg goed geworden in het beantwoorden van die "Ja" of "Nee"-vragen, omdat hij zijn enorme bibliotheek met feiten kan scannen en het antwoord kan vinden.
Maar stel je nu voor dat je de robot iets veel lastigers vraagt: "Waarom had Katarina Barley geen visum nodig om de finale van de Champions League 2024 te bekijken?"
Hier begint de robot te struikelen. Dit is het probleem dat het paper CommonWhy probeert op te lossen.
Het Probleem: De Robot Kan Geen "Verbanden Leggen"
De auteurs stellen dat robots, hoewel ze geweldig zijn in feitenopvraging (het vinden van een specifiek feit in een boek), vreselijk zijn in causale redenering (het uitzoeken waarom iets is gebeurd door verschillende feiten met gezond verstand te verbinden).
Stel het je zo voor:
- Feitenopvraging is als het opzoeken van een telefoonnummer in een telefoonboek.
- Causale redenering is als een detective zijn. Je moet het telefoonnummer bekijken, beseffen dat de persoon in een ander land woont, onthouden dat dat land een visumvrije overeenkomst heeft met het thuisland van de persoon, en vervolgens concluderen: "Ah, daarom hadden ze geen visum nodig!"
Huidige robots falen vaak in dit detectivewerk. Ze raden misschien het antwoord, verzinnen feiten (hallucinaties) of raken vast omdat het antwoord niet in één zin is opgeschreven in hun trainingsdata.
De Oplossing: Een Nieuw "Detective-examen"
De onderzoekers hebben een nieuwe dataset gemaakt genaamd CommonWhy. Denk hierbij aan een gigantisch "Detective-examen" met 15.000 vragen, speciaal ontworpen om te testen hoe goed deze robots kunnen uitzoeken waarom dingen gebeuren.
Zo hebben ze dit examen opgebouwd:
- De Regels (Axioma's): Eerst gaven ze de AI enkele basisregels van de wereld, zoals: "Als je een burger bent van Land A, en Land B laat burgers van Land A toe zonder visum, dan heb je geen visum nodig."
- De Personages (Entiteiten): Ze namen echte mensen, plaatsen en gebeurtenissen uit een gigantische database genaamd Wikidata (zoals een Wikipedia voor gestructureerde data).
- De Vragen: Ze mengden de regels met de personages om vragen te creëren. Bijvoorbeeld: "Waarom had Persoon X geen visum nodig om naar Evenement Y te gaan?"
- De Antwoorden: Cruciaal was dat ze niet zochten naar één juist antwoord. In de echte wereld zijn er vaak meerdere redenen. Misschien had Persoon X geen visum nodig omdat hij een burger van het gastland was, of misschien omdat hij een diplomaat was. De dataset bevat al deze geldige mogelijkheden.
De Resultaten: De Robots Haalden Het Examen Niet
De onderzoekers toetsten de slimste AI-modellen van vandaag (inclusief de nieuwste "redenerende" modellen) aan dit examen. De resultaten waren verrassend en een beetje zorgwekkend:
- Ze raakten vast: Zelfs de beste modellen hadden slechts ongeveer 68% van de antwoorden goed. Dat is een onvoldoende voor een systeem waarvan we verwachten dat het superintelligent is.
- Ze verzonden dingen: Wanneer de modellen het antwoord wel goed hadden, bevatten ze vaak nepfeiten om er te komen. Het is alsof een student het juiste rekenantwoord krijgt, maar een verzonden formule gebruikt om er te komen.
- Het "Long-Tail"-probleem: De robots deden het nog slechter wanneer de vragen obscure, minder bekende mensen of plaatsen betroffen (de "long-tail"). Ze leken te vertrouwen op het memoriseren van bekende feiten in plaats daadwerkelijk door de logica te redeneren.
- Oude werktuigen werken niet: Ze probeerden standaardwerktuigen die zijn ontworpen voor databasevragen (KGQA), maar die werktuigen faalden jammerlijk. Ze zijn gebouwd om feiten te vinden, niet om uit te leggen waarom dingen gebeuren.
Het Grotere Plaatje
Het paper concludeert dat we te maken hebben met een nieuwe, zeer moeilijke uitdaging voor AI. We kunnen robots niet blijven vragen om feiten te memoriseren of simpele "Waar/Onwaar"-vragen te beantwoorden. Als we willen dat ze effectief met de echte wereld omgaan, moeten we hen leren hoe ze detective zijn—hoe ze harde feiten combineren met gezond verstand om uit te leggen waarom de wereld werkt zoals hij werkt.
CommonWhy is het eerste instrument dat we hebben om te meten of robots eigenlijk beter worden in dit soort denken, of dat ze gewoon beter worden in gokken. Op dit moment zegt het paper dat ze voornamelijk gewoon gokken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.