← Nieuwste papers
🧬 biology

LucaCell: a sequence-centric foundation model for cross-species single-cell analysis

LucaCell is een sequentie-gecentreerd fundatiemodel dat gebruikmaakt van vooraf getrainde mRNA-sequentie-embeddings in plaats van vaste gen-identificatoren om robuuste cross-species, cross-modale en cross-contextuele single-cell analyse mogelijk te maken, inclusief nauwkeurige celtype-transfer, differentiatie van microbiële soorten en voorspelling van gastheer-virusinteracties.

Oorspronkelijke auteurs: Yan Sun, Yong He, Minsi Ren, Yanhui Wang, Penghao Xu, Yong Hou, Yu Kang, Tingjun Hou, Jieping Ye, Huanming Yang, Zheng Wang

Gepubliceerd 2026-09-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yan Sun, Yong He, Minsi Ren, Yanhui Wang, Penghao Xu, Yong Hou, Yu Kang, Tingjun Hou, Jieping Ye, Huanming Yang, Zheng Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

In elke levende cel bevindt zich een complexe bibliotheek van instructies die bepaalt hoe die cel functioneert, groeit en reageert op zijn omgeving. Deze instructies zijn geschreven in een chemische taal genaamd RNA, die fungeert als een boodschapper die orders overbrengt van de blauwdruk van de cel. Decennialang hebben wetenschappers instrumenten ontwikkeld om deze berichten te lezen, waardoor ze de verschillende soorten cellen in het menselijk lichaam kunnen catalogiseren en kunnen begrijpen hoe ziekten hun normale werking verstoren. Echter, een grote hindernis is altijd aanwezig gebleven: deze instrumenten vertrouwen op vaste namen en labels voor genen, vergelijkbaar met een bibliotheek die alleen werkt als elk boek een specifiek, vooraf toegewezen oproepnummer heeft. Als een wetenschapper een menselijke cel probeert te vergelijken met een muiscel, of een menselijke cel met een microbe, falen de oude systemen vaak omdat de namen niet overeenkomen, of omdat de gegevens afkomstig zijn van een geheel ander type meting. Deze beperking heeft het moeilijk gemaakt om een enkel, universeel begrip van het leven op te bouwen dat werkt over verschillende soorten en biologische contexten heen.

Een team van onderzoekers heeft nu een nieuwe aanpak geïntroduceerd die deze naamgevingsproblemen volledig omzeilt. In plaats van te vertrouwen op statische labels, hebben zij een computermodel gebouwd dat direct leert van de ruwe sequentie van letters die de genetische code vormen. Door het model te leren de patronen in de chemische letters zelf te herkennen, hebben de onderzoekers een systeem gecreëerd dat de essentie van een gen kan begrijpen zonder de specifieke naam of de soort te hoeven kennen. Dit nieuwe model, genaamd LucaCell, behandelt de genetische code als een continue taal in plaats van een lijst met losstaande items. Het resultaat is een hulpmiddel dat biologische informatie tussen soorten kan vertalen, kan voorspellen hoe cellen zullen reageren op veranderingen, en zelfs infecties kan identificeren voordat ze duidelijk worden, wat een flexibelere en krachtigere manier biedt om de bouwstenen van het leven te bestuderen.

De kern van deze doorbraak ligt in de manier waarop het model genen representeert. Traditionele methoden behandelen elk gen als een uniek symbool, vergelijkbaar met een woord in een woordenboek. Als het woordenboek verandert of als je een boek in een andere taal leest, maken de symbolen niet langer zin. LucaCell kijkt echter naar de werkelijke sequentie van letters die het gen vormen. Het gebruikt een vooraf getraind systeem om deze sequenties om te zetten in wiskundige vormen die hun betekenis en relaties vastleggen. Wanneer het model een gen tegenkomt, begrijpt het de functie ervan op basis van de chemische structuur, niet op basis van het label. Dit stelt het model in staat om te herkennen dat een gen in een menselijke nier en een vergelijkbaar gen in een muisnier aan elkaar gerelateerd zijn, zelfs als ze verschillende namen hebben of als de gegevens met verschillende technologieën zijn verzameld. De onderzoekers testten dit door het model te trainen op een enorme dataset van vijfentachtig miljoen cellen van mensen en muizen, die tientallen weefsels en ziektestaten beslaat. Deze training gaf het model een diep, algemeen begrip van hoe cellen zich gedragen.

Eenmaal getraind, werd het model getest in verschillende uitdagende scenario's waarin oudere systemen doorgaans moeite hebben. In één experiment vroegen de onderzoekers het model om celtypen te identificeren in de nieren van mensen, muizen en een kleine primaat, de grijze muismaki. Het model slaagde erin om celtypen over deze verschillende soorten heen te matchen, zelfs wanneer de gegevens afkomstig waren van verschillende soorten metingen, zoals het direct aflezen van de genetische code versus het aflezen van de toegankelijkheid van het DNA. Het presteerde bijzonder goed op de onbekende muisgegevens, wat suggereert dat de sequentiegebaseerde aanpak fundamentele biologische waarheden vastlegt die van toepassing zijn over verschillende soorten heen. Het model bleek ook in staat te zijn om met microben te werken. In een test met individuele bacteriën analyseerde het model ruwe genetische reads zonder deze eerst te hoeven uitlijnen met een referentiegenoom. Het onderscheidde succesvol meer dan vijftig verschillende bacteriesoorten en kon zelfs subtiele veranderingen in de interne staat van de bacteriën detecteren, zoals hun reactie op antibiotische stress, simpelweg door naar de patronen in hun genetische sequenties te kijken.

De kracht van dit sequentiegecentreerde perspectief strekte zich ook uit tot het voorspellen van hoe cellen reageren op specifieke veranderingen. De onderzoekers gebruikten het model om te simuleren wat er zou gebeuren als een specifiek gen zou worden uitgeschakeld of gewijzigd, een proces dat bekend staat als perturbatie. In deze tests voorspelde het model de resulterende veranderingen in genactiviteit nauwkeuriger dan eerdere systemen. Het kon ook rekening houden met minuscule variaties in de genetische code tussen individuen, bekend als enkel-nucleotide polymorfismen. Door deze kleine verschillen in te voegen, verbeterde het model zijn vermogen om genexpressieniveaus voor specifieke mensen te voorspellen, wat aantoont dat zelfs kleine veranderingen in de genetische sequentie meetbare effecten kunnen hebben op hoe een cel functioneert. Dit niveau van detail suggereert dat het model nuances vastlegt die bredere, op labels gebaseerde systemen vaak missen.

Misschien wel een van de meest opvallende toepassingen was in het domein van gastheer-virusinteracties. De onderzoekers trainden het model om de virale belasting in individuele cellen te voorspellen die geïnfecteerd zijn met verschillende stammen van het influenzavirus. Wanneer het werd geconfronteerd met nieuwe virus-gastheercombinaties die het nog nooit eerder had gezien, presteerde het model beter dan alle bestaande tools, waarbij het infectiepatronen correct identificeerde waar anderen faalden. Het was zelfs in staat om naar cellen te kijken die niet aan het virus waren blootgesteld en een kleine subpopulatie te identificeren die al de genetische handtekeningen van een aanstaande infectie vertoonde. Deze bevinding suggereert dat het model subtiele, reeds aanwezige toestanden in cellen kan detecteren die hen vatbaarder maken voor infectie, een capaciteit die cruciaal kan zijn voor het begrijpen van hoe ziekten zich op cellulair niveau verspreiden.

Het succes van LucaCell suggereert dat de sequentie van genetische letters een overdraagbare basis bevat voor het begrijpen van biologie. Door af te stappen van vaste identificatoren en te focussen op de onderliggende chemische taal, hebben de onderzoekers een model gecreëerd dat aanpasbaarder en robuuster is. Hoewel de huidige versie afhankelijk is van menselijke en muisgegevens en een vereenvoudigd beeld van de genetische sequentie gebruikt, geven de resultaten aan dat deze aanpak de kloof tussen soorten, datatypen en biologische contexten kan overbruggen. Het biedt een nieuwe manier om de cellulaire wereld te zien, een wereld waarin de fundamentele taal van het leven direct wordt begrepen, zonder de noodzaak voor vertaling of rigide categorisering. Deze verschuiving van labels naar sequenties kan wel eens de standaard worden voor toekomstige ontdekkingen in hoe cellen opereren, interageren en reageren op de uitdagingen van het leven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →