DOREMI: Optimizing Long Tail Predictions in Document-Level Relation Extraction
Oorspronkelijke auteurs: Laura Menotti, Stefano Marchesin, Gianmaria Silvello
Oorspronkelijke auteurs: Laura Menotti, Stefano Marchesin, Gianmaria Silvello
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: DOREMI – Optimalisatie van Long-Tail Voorspellingen in Document-Level Relation Extraction
Probleemstelling
Document-Level Relation Extraction (DocRE) staat voor twee primaire uitdagingen: de noodzaak van context over meerdere zinnen heen om relaties te identificeren, en de ernstige long-tail distributie van relatietypes. In standaard datasets zoals DocRED en Re-DocRED domineren een klein aantal frequente relaties de trainingsdata, terwijl de meerderheid van de relaties (de long-tail) schaarse trainingsvoorbeelden heeft (vaak minder dan 100 instanties). Deze klassenimbalans bias modellen naar frequente relaties, wat hun vermogen om zeldzame relaties accuraat te identificeren verslechtert. Bestaande benaderingen om ruis in Distant Supervised (DS) datasets te mitigeren, zoals UGDRE, falen vaak in het specifiek aanpakken van long-tail relaties of vertrouwen op grootschalige, ruizige data die de bias verergeren. Hoewel Large Language Models (LLMs) veelbelovend zijn, presteren ze momenteel minder goed dan state-of-the-art sequentiegebaseerde modellen voor deze specifieke taak.
Methodologie: Het DOREMI-framework
De auteurs stellen DOREMI voor (DOcument-level Relation Extraction optiMizing the long taIl), een iteratief, human-in-the-loop framework ontworpen om ondervertegenwoordigde relaties te verbeteren door middel van minimale, gerichte handmatige annotaties. In tegen tegenstelling tot eerdere denoising-strategieën die vertrouwen op heuristische filtering of grootschalige DS-data, selecteert DOREMI actief de meest informatieve voorbeelden om de efficiëntie en robuustheid van de training te verbeteren.
Het framework werkt via de volgende computationele blokken:
- Core Model Ensemble: DOREMI onderhoudt een pool (Γ) van n diverse DocRE core-modellen (specifiek CNN, LSTM, BiLSTM, ContextAware en BERT-gebaseerde modellen). Deze modellen zijn initieel voorgetraind op beschikbare Human-Annotated (HA) data.
- Disagreement Computation: De modellen voorspellen relaties over de ruizige DS-dataset. Voor elk entiteitspaar (s,o) berekent het systeem de onenigheid (ϕΓ) tussen de modellen. De onenigheid wordt berekend op basis van de waarschijnlijkheid dat modellen ofwel allemaal een relatie voorspellen, ofwel allemaal "geen relatie" voorspellen. Om de multi-label aard van DocRE te verwerken, wordt de algehele onenigheid afgeleid van het product van de onenigheid per relatie. Een logaritmische transformatie wordt toegepast om kleine verschillen te vergroten en de interpreteerbaarheid te verbeteren.
- Iterative Sampling and Annotation: Het systeem identificeert "Hard-To-Classify" voorbeelden door de top-k entiteitsparen met de hoogste onenigheidsscores te selecteren. Cruciaal is dat deze sampling beperkt is tot kandidaat long-tail triples (waar ten minste één model een long-tail relatie voorspelt) om ervoor te zorgen dat de annotatie-inspanningen zich richten op de specifieke prestatiebottleneck.
- Label Aggregation: Zodra een stopvoorwaarde is bereikt (ofwel de gemiddelde onenigheid onder een drempelwaarde ϵ zakt, ofwel het annotatiebudget b is uitgeput), worden de voorspellingen geaggregeerd om een Denoised Distantly Supervised (DDS) dataset te construeren. Er wordt een precisie-georiënteerde filter toegepast: een relatie wordt alleen behouden in de uiteindelijke DDS als ten minste één model deze met een hoge mate van vertrouwen (boven een drempelwaarde τ) voorspelt.
- Iterative Training: De geselecteerde samples worden handmatig geannoteerd, toegevoegd aan de trainingspool, en de core-modellen worden gefinetuned op de uitgebreide dataset. Deze cyclus herhaalt zich totdat de stopvoorwaarde is bereikt.
Belangrijkste Bijdragen
- DOREMI Framework: De introductie van een nieuw iteratief systeem dat op long-tail relaties is toegesneden en distantly supervised datasets verbetert door middel van onenigheid-gestuurde annotaties.
- Disagreement als Proxy: De demonstratie dat het meten van onenigheid tussen meerdere modellen een effectieve proxy is voor het identificeren van Hard-To-Classify voorbeelden specifiek voor DocRE, wat substantiële prestatieverbeteringen oplevert met verwaarloosbare menselijke inspanning.
- Nieuwe Datasets: De release van twee nieuwe Denoised Distantly Supervised Datasets (DDS's) gebaseerd op DocRED en Re-DocRED. Deze zijn expliciet geoptimaliseerd voor long-tail relaties en zijn ontworpen om model-agnostisch te zijn, waardoor elk downstream DocRE-model kan profiteren van verbeterde long-tail dekking.
Experimentele Resultaten
De auteurs hebben DOREMI geëvalueerd met state-of-the-art baselines (ATLOP en DREEAM) op zowel de DocRED development set als de Re-DocRED test set.
- DocRED: Het annoteren van slechts 0,001% van de DS-dataset (400 triples) verbeterde de modelprestaties aanzienlijk. Vergeleken met de leidende denoising-techniek (UGDRE), verhoogde DOREMI de algemene precisie met tot wel +8,2% en de F1 met +0,7%. Voor long-tail triples (<100 voorbeelden) steeg de precisie met +76,0% en de F1 met +5,0%. Opvallend genoeg, voor long-tail triples waarbij de entiteitsparen niet in de training voorkwamen, verhoogde DOREMI de ignored F1 (ignF1) met tot wel 28,7% en de ignored Precision (ignPrecision) met 137,6% ten opzichte van UGDRE.
- Re-DocRED: Op de grotere Re-DocRED dataset resulteerde het annoteren van 0,003% (1.200 triples) in een winst van +16,2% op long-tail precisie en +19,2% op ignPrecision. Voor "extreme long-tail" triples (<100 voorbeelden) behaalde DOREMI een stijging van +83,2% in precisie en +207,9% in ignPrecision vergeleken met UGDRE, met een ignF1-winst van +33,5%.
- Hybride Aanpak: Een hybride setting, waarbij DOREMI wordt gecombineerd met UGDRE voor frequente relaties, toonde aan dat DOREMI bestaande denoising-benaderingen effectief aanvult, wat leidt tot verdere verbeteringen in de algemene metrieken.
Betekenis en Claims
Het artikel claimt dat DOREMI een schaalbare en efficiënte oplossing biedt voor het long-tail bias probleem in DocRE. Door in het ontwerp de voorkeur te geven aan precisie boven recall, garandeert DOREMI de betrouwbaarheid van de geëxtraheerde relaties, wat cruciaal is voor downstream Knowledge Base Construction (KBC) taken. De auteurs benadrukken dat hun aanpak significante prestatiewinsten boekt met minimale menselijke annotatiekosten (ongeveer 20 annotator-uren voor het Re-DocRED experiment). Het werk vestigt dat disagreement-gebaseerde active learning een levensvatbare en effectieve strategie is om datasets af te stemmen om generalisatie op zeldzame relaties te verbeteren, waarmee de eerste inspanning wordt geleverd om een dergelijke aanpak specifiek toe te passen op DocRE. De resulterende datasets en methodologie bieden een fundament voor het trainen van willekeurige DocRE-modellen met verbeterde capaciteiten voor het omgaan met long-tail distributies.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste NLP papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.