Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH
Dit artikel schetst een lopend initiatief binnen het LLMs4EU-project en de ALT-EDIC-infrastructuur om foundation models aan te passen voor onderzoek in de sociale wetenschappen en geesteswetenschappen door kennisgrafen en meertalige corpora te integreren, waarbij een rigoureus kwantitatief en kwalitatief evaluatiekader wordt gehanteerd om betrouwbare, ethisch verantwoorde en domeinsensitieve AI-ondersteuning voor wetenschappelijke taken te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: AI leren lezen als een humanist
Stel je voor dat je een superintelligente robotbibliothecaris hebt (een Large Language Model, of LLM) die bijna alles op het internet heeft gelezen. Hij is geweldig in het beantwoorden van vragen over wetenschap, wiskunde en Engels nieuws. Maar als je hem iets vraagt over geschiedenis, filosofie of literatuur in het Frans of Italiaans, gaat hij vaak de mist in. Hij heeft de neiging om boeken te negeren, zich alleen op Engelse wetenschappelijke artikelen te richten en de diepe, complexe, interpretatieve manier waarop menselijke wetenschappers echt denken, te missen.
Dit artikel beschrijft een project genaamd ReSearch_SSH (onderdeel van een groter Europees initiatief genaamd LLMs4EU) dat dit probeert te repareren. Het doel is om die "algemene" robotbibliothecaris te trainen om specifiek de Sociale Wetenschappen en Geesteswetenschappen (SSH) te begrijpen. Ze willen een AI die verschillende talen respecteert, begrijpt dat een boek even belangrijk is als een wetenschappelijk artikel, en weet dat dezelfde tekst op veel verschillende manieren geïnterpreteerd kan worden, afhankelijk van wie het leest.
Het Probleem: De "One-Size-Fits-All" Valstrik
De meeste AI-tools voor onderzoek zijn momenteel als een generieke wereldkaart. Ze zijn grotendeels in het Engels getekend en benadrukken alleen de grootste steden (belangrijke tijdschriften). Als je met deze kaart probeft te navigeren door een klein dorpje in Italië of een specifieke historische discussie in Frankrijk, raak je verdwaald.
De auteurs stellen dat dit niet neutraal is. Het duwt wetenschappers die in andere talen werken of die zaken bestuderen zoals oude manuscripten, digitale blogs of lokale geschiedenis, naar de zijlijn. Het dwingt iedereen om te denken als een "harde wetenschapper" (zoekend naar eenvoudige feiten en citaties) in plaats van een humanist (zoekend naar context, nuance en verschillende perspectieven).
De Oplossing: Een Gespecialiseerde Gereedschapskist
In plaats van een volledig nieuw zoekmechanisme vanaf nul op te bouwen, brengt het team een bestaand Frans onderzoeksplatform genaamd ISIDORE een upgrade. Zie ISIDORE als een enorme, goed georganiseerde bibliotheekkelder. Het team installeert een nieuwe "slimme assistent" in deze kelder.
Hier is hoe ze dit bouwen, met behulp van drie hoofdinstrumenten:
1. De "Gespecialiseerde Leeslijst" (Data)
Je kunt een chef kok niet leren hoe hij Franse keuken bereidt als je hem alleen Amerikaanse recepten geeft. Om de AI te trainen, voeren ze het een enorme, gecureerde dieet van teksten uit de sociale wetenschappen en geesteswetenschappen.
- Het Menu: Ze gebruiken ongeveer 3 miljoen documenten uit een database genaamd ISTEX. Dit omvat boeken, artikelen en data in meer dan 60 talen, waarbij Frans en Engels de hoofdgerechten zijn.
- De Bijgerechten: Om er zeker van te zijn dat de AI de specifieke jargon van de Digital Humanities begrijpt, voegen ze Italiaanse conferentiepapers en gespecialiseerde tijdschriften toe.
- Het Doel: Dit zorgt ervoor dat de AI het specifieke "dialect" van wetenschappers leert, en niet alleen het "dialect" van het internet.
2. De "Feitencontrole-Kaart" (Knowledge Graphs)
Dit is het belangrijkste onderdeel. Standaard AI "hallucineert" vaak (verzint dingen) omdat het antwoorden raadt op basis van patronen. Dit project gebruikt een Knowledge Graph, wat een soort gigantisch, onderling verbonden web van feiten is.
- De Analogie: Stel je voor dat de AI een gids is. Een normale AI zou kunnen raden waar een monument staat. Deze AI houdt echter een gedetailleerde kaart (Wikidata en andere grafen) vast die auteurs verbindt aan hun boeken, boeken aan hun thema's, en thema's aan historische gebeurtenissen.
- Hoe het werkt: Wanneer de AI een vraag beantwoordt, raadt hij niet alleen; hij kijkt op de kaart, vindt de exacte pagina in het boek en zegt: "Ik heb dit antwoord gevonden in dit specifieke document." Dit maakt het antwoord traceerbaar en betrouwbaar.
3. De "Menselijke Feedbackloop" (Evaluatie)
Het team test de AI niet alleen met computerscores; ze testen het met echte menselijke experts.
- Het Panel: Ze hebben een groep experts op het gebied van Digital Humanities uit Frankrijk en Italië samengesteld.
- De Test: Deze experts zullen de AI complexe vragen stellen en controleren of de antwoorden zinvol zijn in een echte onderzoekscontext. Ze controleren: "Is dit antwoord daadwerkelijk nuttig voor een historicus? Is er een cruciale nuance gemist?"
- Het Resultaat: Als de AI faalt, vertellen de experts de AI waarom, en de AI leert om meer te denken als een menselijke wetenschapper.
De Spelregels (Juridisch & Ethiek)
Het artikel benadrukt dat dit geen "wild west"-experiment is. Ze bouwen dit binnen een strikt juridisch kader (zoals de EU AI Act en de AVG/GDPR).
- Geen Wilde Gissingen: De AI is ontworpen als een "onderzoeksassistent", niet als een besluitvormer. De AI doet suggesties, maar mensen beslissen.
- Privacy: Ze zijn voorzichtig om geen persoonlijke gegevens te gebruiken voor het profileren van mensen.
- Auteursrecht: Ze respecteren de regels van de boeken die ze gebruiken. Ze stelen niet zomaar de inhoud; ze gebruiken gelicentieerde data en zorgen ervoor dat de AI terugverwijst naar de oorspronkelijke bron, zodat de auteurs de erkenning krijgen die ze verdienen.
Waar staan ze nu?
Het project bevindt zich momenteel in de voorbereidingsfase.
- Ze verzamelen en zuiveren de data (de "ingrediënten").
- Ze stellen de juridische en ethische regels op (de "keukenveiligheidsprotocollen").
- Ze staan op het punt om de eerste ronde van de training van het model op deze specifieke data te starten.
De Kernboodschap
Dit artikel is een blauwdruk voor het bouwen van een AI die niet alleen "praat" als een mens, maar ook denkt als een wetenschapper. Door een gespecialiseerde bibliotheek van boeken te combineren met een feitencontrole-kaart en een team van menselijke experts, hopen ze een instrument te creëren dat onderzoekers helpt nieuwe ideeën te ontdekken zonder de nuance, taal en ethiek te verliezen die de geesteswetenschappen zo bijzonder maken. Het gaat erom dat de AI de wetenschapper dient, in plaats van dat de wetenschapper gedwongen wordt zijn manier van werken aan te passen om in de AI te passen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.