← Nieuwste papers
🤖 machine learning

HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads

Dit artikel presenteert HYDRA, een uitgebreid framework voor het verkennen van de ontwerpplek die heterogene chiplet-architecturen en dynamische runtime-beleid gezamenlijk optimaliseert om de doorvoer en latentie voor het bedienen van hybride Transformer-Mamba grote taalmodellen aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Jiahao Lin, Alish Kanani, Sangwan Lee, Jaehyun Park, Umit Ogras

Gepubliceerd 2026-08-21
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiahao Lin, Alish Kanani, Sangwan Lee, Jaehyun Park, Umit Ogras

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De moderne wereld draait op een nieuw soort digitale intelligentie, grote taalmodellen die verhalen kunnen schrijven, problemen kunnen oplossen en gesprekken kunnen voeren. Deze systemen zijn zo omvangrijk geworden dat de computerchips die ontworpen zijn om ze aan te sturen, moeite hebben om het tempo bij te houden. Jarenlang vertrouwde de industrie op één enkele, massieve processor om elke taak af te handelen, maar naarmate deze modellen complexer worden, loopt die aanpak tegen een muur aan. De chips worden te duur om te bouwen, te heet om te koelen en simpelweg te traag om de chaotische mix van taken te beheren die nodig is om miljoenen gebruikers tegelijkertijd te bedienen. Om dit op te lossen, stappen ingenieurs over op een modulaire aanpak, waarbij de computer wordt opgedeeld in kleinere, gespecialiseerde stukjes die chiplets worden genoemd. Stel je een hoogwaardig voertuig voor waarbij de motor, de transmissie en de brandstoftank aparte, geoptimaliseerde modules zijn die kunnen worden verwisseld of herschikt, in plaats van één onveranderlijk blok metaal. Dit maakt een meer flexibel en efficiënt systeem mogelijk, maar het introduceert een nieuw probleem: uitzoeken hoe je deze stukjes precies arrangeert en hoe je de datastroom tussen hen beheert, is een ongelooflijk moeilijke puzzel.

Onderzoekers hebben een nieuw framework ontwikkeld genaamd HYDRA om dit puzzelstuk op te lossen. Het is een geavanceerd hulpmiddel dat ontworpen is om de enorme hoeveelheid manieren te verkennen waarop deze modulaire chips geassembleerd kunnen worden en hoe ze tijdens het draaien beheerd moeten worden. De uitdaging is dat het aantal mogelijke arrangementen zo enorm is dat het testen van ze allemaal één voor één jaren zou duren, zelfs met krachtige computers. Bovendien is het werk dat deze modellen doen niet constant; het verandert voortdurend afhankelijk van wat gebruikers vragen. Soms moet het systeem snel een lang document lezen, en op andere momenten moet het een antwoord woord voor woord genereren. Deze verschillende fasen vereisen verschillende middelen, en de mix van binnenkomende verzoeken van gebruikers is onvoorspelbaar. Als het systeem niet perfect is afgestemd, verspilt het energie en tijd, waardoor gebruikers moeten wachten op antwoorden.

Het team achter HYDRA heeft een methode ontwikkeld om deze complexiteit te navigeren zonder alle mogelijkheden te hoeven testen. In plaats van te proberen elk detail van elk mogelijk ontwerp te simuleren, wat traag en omslachtig is, hebben ze een snelle, slimme estimator gebouwd. Dit hulpmiddel fungeert als een bekwame navigator die snel het landschap van potentiële ontwerpen scant om de meest veelbelovende paden te vinden. Het gebruikt een wiskundige benadering gebaseerd op hoe het systeem tussen verschillende staten van activiteit beweegt, waardoor het prestaties kan voorspellen in minuten in plaats van weken. Zodra dit hulpmiddel de beste kandidaten heeft geïdentificeerd, laten de onderzoekers vervolgens gedetailleerde, tragere simulaties draaien op alleen die topkeuzes om te bevestigen dat ze werken zoals verwacht. Dit tweestaps-proces stelt hen in staat om een ontwerpopruimte te verkennen die voorheen te groot was om te hanteren, waarbij configuraties worden gevonden die snelheid en efficiëntie balanceren op manieren die voorheen niet duidelijk waren.

De resultaten van deze verkenning zijn significant. Wanneer de onderzoekers hun beste ontwerpen testten tegen de meest geavanceerde bestaande systemen, ontdekten ze dat de nieuwe aanpak 1,55 keer meer werk kon verrichten in dezelfde tijd. Tegelijkertijd daalde de tijd die een gebruiker nodig heeft om het eerste woord van een reactie te ontvangen met bijna de helft. In sommige specifieke scenario's was de verbetering zelfs nog dramatischer, waarbij het systeem meer dan twee keer de werklast van voorheen kon afhandelen. Deze winsten komen voort uit een zorgvuldige co-design van de hardware en de software die eroverheen draait. De onderzoekers ontdekten dat het simpelweg toevoegen van meer vermogen niet genoeg is; het systeem moet zo worden gerangschikt dat de juiste stukjes dicht bij de gegevens staan die ze nodig hebben, en de software moet flexibel genoeg zijn om middelen onmiddellijk te verschuiven wanneer het type werk verandert.

Een belangrijke ontdekking in dit werk is dat de arrangement van de fysieke componenten net zo belangrijk is als de componenten zelf. De onderzoekers ontwikkelden een strategie om de verschillende chiplets op de siliciumplaat te plaatsen op basis van hoeveel ze met elkaar moeten communiceren. Door de stukken die het meest met elkaar communiceren dichter bij elkaar te groeperen, hebben ze de tijd die data door het systeem moet reizen verminderd. Deze communicatie-bewuste plaatsing, gecombineerd met een dynamische manier om gebruikersverzoeken te groeperen, zorgde ervoor dat het systeem veel soepeler liep. De software wacht niet alleen op een volledige batch verzoeken voordat het aan het werk gaat; het accepteert nieuwe verzoeken zodra er middelen vrij zijn, waardoor het systeem constant bezig en efficiënt blijft. Deze flexibiliteit is cruciaal omdat het voorkomt dat het systeem stilstaat terwijl het wacht op de volgende groep gebruikers.

De studie keek ook naar hoe goed deze ontwerpen zouden werken als het specifieke type model dat wordt gebruikt zou veranderen. Ze testten configuraties die geoptimaliseerd zijn voor één specifiek model tegen andere, verschillende modellen. Ze ontdekten dat een ontwerp dat gebouwd is voor één specifiek model slecht presteerde wanneer het gevraagd werd om een ander model te draaien. Echter, een ontwerp dat geoptimaliseerd is om een mix van verschillende modellen te kunnen afhandelen, presteerde bijna net zo goed als de gespecialiseerde ontwerpen bij hun eigen taken, terwijl het robuust bleef wanneer het werd geconfronteerd met nieuwe, ongeziene modellen. Dit suggereert dat voor een systeem dat vele verschillende gebruikers en toepassingen moet bedienen, een flexibel, algemeen ontwerp waardevoller is dan een zeer gespecialiseerd ontwerp. Het biedt een vangnet, waardoor het systeem efficiënt blijft, zelfs naarmate de soorten kunstmatige intelligentie die het ondersteunt evolueren.

Uiteindelijk demonstreert dit werk dat de toekomst van het draaien van grote taalmodellen ligt in het partnerschap tussen hardware-architectuur en softwarebeheer. Je kunt niet simpelweg een snellere chip bouwen en verwachten dat het het probleem oplost; je moet ook een slimmere manier bouwen om de informatiestroom door die chip te beheren. Het HYDRA-framework biedt een blauwdruk voor deze co-design, waarbij wordt aangetoond dat door zorgvuldig te overwegen hoe de stukjes in elkaar passen en hoe ze in realtime worden beheerd, het mogelijk is om systemen te bouwen die aanzienlijk sneller en efficiënter zijn. De onderzoekers hebben hun tools beschikbaar gesteld aan anderen, in de hoop de ontwikkeling van de volgende generatie computersystemen die de kunstmatige intelligentie van de toekomst zullen aandrijven, te versnellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →