KRAKEN: A provenance-tracked knowledge graph for multiomic and wellness research
KRAKEN is een schaalbare, op herkomst gebaseerde kennisgraaf die de ondervertegenwoordiging van multiomische en wellness-data aanpakt door diverse biomedische bronnen te integreren in een modulair, 15-miljoen-knooppunten systeem met gestandaardiseerde semantiek, ingebouwde analytische tools en multimodale interfaces voor zowel menselijk als AI-gestuurd onderzoek.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In het uitgestrekte landschap van de moderne biologie zoeken wetenschappers al lang naar een manier om de stippen te verbinden tussen de microscopische machinerie van onze cellen en het bredere beeld van de menselijke gezondheid. Decennialang heeft het onderzoek zich zwaar gericht op het begrijpen van hoe ziekten zich ontwikkelen en hoe bestaande medicijnen kunnen worden hergebruikt om ze te bestrijden. Deze aanpak heeft krachtige kaarten van biologische relaties opgeleverd, maar deze kaarten laten vaak de stillere, alledaagse aspecten van welzijn weg. Ze missen vaak de gedetailleerde chemische handtekeningen van ons metabolisme, de specifieke genetische markers die onze eigenschappen beïnvloeden, en de complexe gegevens die definiëren hoe oud ons lichaam aanvoelt vergeleken met onze werkelijke leeftijd. Zonder een compleet beeld dat deze welzijnsgerichte details bevat, blijft het moeilijk om het volledige verhaal te zien van hoe onze biologie functioneert in een gezonde staat, niet alleen wanneer deze ziek is.
Een nieuw project genaamd KRAKEN heeft als doel deze kloof te dichten door een enorme, onderling verbonden kaart te creëren die de kloof overbrugt tussen ziekteonderzoek en algemeen welzijn. De onderzoekers achter dit werk realiseerden zich dat hoewel bestaande kaarten uitstekend waren voor het vinden van geneesmiddelen, ze incompleet waren voor het begrijpen van de hele persoon. Om dit op te lossen, bouwden zij een systeem dat informatie verzamelt uit veel verschillende bronnen, inclusief gespecialiseerde databases voor lipiden, genetische scores en gestandaardiseerde gezondheidsmetingen. Deze nieuwe kaart somt niet alleen feiten op; het legt ze aan elkaar op een manier die computers in staat stelt om verbindingen te traceren over verschillende soorten gegevens, van de moleculen in ons bloed tot de genetische codes in ons DNA. Het resultaat is een hulpmiddel dat onderzoekers en clinici helpt te zien hoe diverse factoren van gezondheid en welzijn met elkaar verband houden, wat een holistischer beeld biedt van de menselijke biologie dan voorheen in een enkel, verenigd systeem beschikbaar was.
De kern van deze prestatie is een kennisgrafiek die fungeert als een centraal knooppunt voor diverse biologische informatie. Het team combineerde gegevens uit verschillende grote, bestaande netwerken met gespecialiseerde bronnen die zich richten op welzijn, zoals catalogi van polygene scores en maten van biologische leeftijd. Door deze draden samen te weven, creëerden zij een structuur die ongeveer 15 miljoen nodes bevat, die individuele stukjes informatie vertegenwoordigen, en ongeveer 113 miljoen edges, die de relaties tussen hen vertegenwoordigen. Dit netwerk beslaat 62 verschillende soorten entiteiten, variërend van specifieke chemicaliën en genen tot bredere gezondheidsconcepten. Om ervoor te zorgen dat deze enorme collectie gegevens een gemeenschappelijke taal spreekt, gebruikten de onderzoekers een standaard semantisch model dat aansluit bij de bredere inspanningen van de National Institutes of Health om biomedische gegevens gemakkelijker deelbaar en begrijpelijk te maken.
Wat dit systeem bijzonder nuttig maakt, is de flexibiliteit en efficiëntie. De onderzoekers ontwikkelden een boupproces dat licht genoeg is om op standaard computerhardware te draaien, waarbij het pieken onder de 48 gigabyte aan geheugen vereist. Dit ontwerp stelt gebruikers in staat om de gehele grafiek snel opnieuw op te bouwen of om alleen specifieke delen van de gegevens te selecteren die relevant zijn voor hun specifieke interessegebied. Of een wetenschapper nu een specifieke metabole route bestudeert of naar brede welzijnstrends kijkt, het systeem kan worden afgestemd om zich op dat domein te concentreren zonder de volledige dataset te hoeven verwerken. Deze modulariteit zorgt ervoor dat het hulpmiddel toegankelijk en praktisch blijft voor een breed scala aan onderzoeksvragen, in plaats van een statisch, onhandelbaar archief te zijn.
Buiten het simpelweg opslaan van informatie, bevat KRAKEN een reeks hulpmiddelen die gebruikers helpen de gegevens te verkennen. Deze hulpmiddelen maken multi-hop redeneren mogelijk, wat betekent dat het systeem een keten van verbindingen kan volgen om indirecte relaties te vinden tussen twee ogenschijnlijk ongerelateerde concepten. Gebruikers kunnen ook zoekopdrachten uitvoeren met tekst, vectoren, of een combinatie van beide om specifieke entiteiten of patronen binnen de grafiek te vinden. Het platform ondersteunt verrijkingsanalyses, die helpen identificeren of bepaalde groepen gegevens vaker samen voorkomen dan men op basis van toeval zou verwachten. Al deze mogelijkheden zijn toegankelijk via een interactieve webinterface en een standaard applicatieprogrammeerinterface (API), waardoor de gegevens beschikbaar zijn voor zowel menselijke onderzoekers als geautomatiseerde systemen.
Het project introduceert ook een Model Context Protocol server, een functie waarmee kunstmatige intelligentie-agenten en grote taalmodellen direct met de grafiek kunnen interageren. Deze capaciteit stelt deze geavanceerde systemen in staat om de gestructureerde gegevens te consumeren en ze te gebruiken om complexe vragen te beantwoorden of inzichten te genereren zonder dat ze specifiek op de dataset getraind hoeven te worden. Door de gegevens op deze manier beschikbaar te stellen, openen de onderzoekers de deur naar nieuwe typen geautomatiseerde analyse die de volledige diepte van de welzijns- en multiomische informatie die in de grafiek is opgenomen, kunnen benutten. Het gehele systeem is gratis beschikbaar voor het publiek, waardoor iedereen met een internetverbinding deze verbindingen kan verkennen en kan bijdragen aan het groeiende begrip van de menselijke gezondheid en het welzijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.