← Nieuwste papers
🧬 biology

Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models

Dit artikel toont aan dat het vervangen van softmax door sigmoid-attention in single-cell foundation-modellen leidt tot superieure representatiekwaliteit, snellere trainingstijden en verbeterde stabiliteit door theoretisch gebonden afgeleiden, ondersteund door een sterk geoptimaliseerde Triton-kernel-implementatie.

Oorspronkelijke auteurs: Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Het Grote Geheel: Een Beter Manier om de "Taal van het Leven" te Lezen

Stel je voor dat je probeert een computer te leren de "taal" van een menselijke cel te begrijpen. In deze taal is elk gen een woord, en is de hele cel een zin. Wetenschappers hebben een krachtig hulpmiddel gebruikt, genaamd een Transformer (hetzelfde type AI dat essays schrijft of met jou chat), om deze celszinnen te lezen.

Echter, het standaardhulpmiddel dat deze computers gebruiken om relaties tussen woorden te begrijpen, heet Softmax Attention. De auteurs van dit artikel betogen dat voor de biologie dit standaardhulpmiddel is alsof je probeert een streng, star reglement te gebruiken dat niet past bij de rommelige realiteit van levende cellen. Zij stellen voor om dit te vervangen door een nieuw hulpmiddel genaamd Sigmoid Attention, wat volgens hen sneller, stabieler is en de AI daadwerkelijk helpt beter te leren.

Hier is hoe ze het uiteenleggen:

1. Het Probleem: Het "Zero-Sum" Spel

De Oude Manier (Softmax):
Stel je voor dat je een leraar bent met een beperkte hoeveelheid "aandachtstokens" (zoals 100 stickers) om uit te delen aan leerlingen in een klas. Als je 50 stickers aan Leerling A geeft, moet je ze noodzakelijk van iedereen else afpakken. Zo werkt Softmax. Het dwingt de AI om te beslissen: "Ik zal me sterk richten op Gen X, dus ik moet Gen Y negeren."

Waarom dit slecht is voor de biologie:
In een echte cel werken genen vaak samen. Een enkel gen kan tegelijkertijd door meerdere verschillende regelaars worden beheerst. Het is alsof een leerling tegelijkertijd hulp nodig heeft van drie verschillende leraren. De "zero-sum" regel van Softmax dwingt de AI om slechts één leraar te kiezen, wat niet overeenkomt met hoe biologie eigenlijk werkt.

De Nieuwe Manier (Sigmoid):
Sigmoid Attention is alsof je elke leerling een sticker geeft als ze die verdienen, zonder limiet. Als Leerling A, Leerling B en Leerling C allemaal hulp nodig hebben, kan de leraar ze allemaal stickers geven. Dit stelt de AI in staat om te zeggen: "Dit gen is belangrijk, EN dat gen is ook belangrijk," zonder dat ze er één moeten negeren om zich op de ander te richten.

2. Het Stabiliteitsprobleem: De "Draadloopster"

De Oude Manier (Softmax):
Softmax is als een draadloopster die zeer gevoelig is voor wind. Als de getallen te groot worden (wat gebeurt bij lange sequenties van genen), kan de wiskunde uit de hand lopen. De "wind" blaast de loopster van het touw, waardoor het trainen crasht. In het artikel testten ze dit door veiligheidsnetten (gradient clipping) te verwijderen en zeer lange sequenties te gebruiken. Het Softmax-model viel van de klif, waarbij de wiskunde met een factor 10.000 explodereerde.

De Nieuwe Manier (Sigmoid):
Sigmoid is als een wandelaar op een brede, vlakke brug. Het heeft ingebouwde leuningen. Hoe groot de getallen ook worden, de wiskunde blijft binnen een veilig, voorspelbaar bereik. Bij dezelfde test "zonder veiligheidsnet" bleef het Sigmoid-model perfect lopen en crashte het nooit.

3. Het Snelheidsprobleem: De "Gebroken Puzzel"

De Uitdaging:
Biologische data is rommelig. De ene cel heeft misschien 500 genen (een korte zin), terwijl de andere er 10.000 heeft (een lange roman). Om ze samen te verwerken, moeten computers de korte vaak vullen met "lege ruimte" (nullen) zodat ze allemaal dezelfde lengte hebben. Dit is alsof je probeert een kort gedicht en een lange roman in dezelfde doos te proppen door het gedicht vol te proppen met verpakkingspeanuts.

De Oplossing:
De auteurs bouwden een nieuwe, supersnelle motor genaamd TritonSigmoid.

  • De Analogie: Stel je een bezorgvrachtwagen voor die normaal gesproken naar elk huis in een wijk moet rijden, zelfs de lege huizen (padding). TritonSigmoid is een slimme vrachtwagen die precies weet welke huizen leeg zijn en ze volledig overslaat.
  • Het Resultaat: Deze nieuwe motor is ongelooflijk snel. Op de nieuwste supercomputerchips (NVIDIA H100) draait het op 515 TFLOPS (biljoenen berekeningen per seconde). Dit is sneller dan de huidige beste motoren voor Softmax en zelfs sneller dan eerdere pogingen met Sigmoid. Het maakt het trainen van deze biologische modellen tot 10% sneller.

4. De Resultaten: Betere Hersenen, Sneller Trainen

Het team trainde vier verschillende AI-modellen om te zien welke het beter leerde. Ze gebruikten een enorme dataset van 131 miljoen cellen.

  • Beter Leren: De modellen die Sigmoid gebruikten, leerden niet alleen sneller; ze leerden beter. Ze konden verschillende celtypen onderscheiden (zoals een hartcel van een hersencel) 25% beter dan de Softmax-modellen.
  • Minder Fouten: De Sigmoid-modellen maakten minder fouten bij het voorspellen van genpatronen.
  • Geen Crashes: Bij de stresstests crashten de Softmax-modellen en moesten ze opnieuw worden gestart, wat tijd en geld kostte. De Sigmoid-modellen deden de klus zonder enige storing.

Samenvatting

Het artikel stelt dat voor het begrijpen van de complexe, rommelige en variabele data van single-cell biologie, het standaard "Softmax" attentiemechanisme te star en instabiel is. Door over te schakelen naar Sigmoid Attention, hebben ze een systeem gecreëerd dat:

  1. Meerdere verbindingen toelaat (genen kunnen tegelijkertijd door veel factoren worden beïnvloed).
  2. Stabiel blijft zelfs als de wiskunde intens wordt (geen crashes meer).
  3. Sneller draait door slim leegte data (padding) over te slaan.

Ze hebben deze nieuwe, snellere motor (TritonSigmoid) gratis beschikbaar gesteld zodat andere wetenschappers het kunnen gebruiken om betere biologische modellen te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →