BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal
Het artikel introduceert BaseRT, een native Metal-inferentieruntime voor Apple Silicon die chipspecifieke optimalisaties benut om een recordbrekende doorvoer voor grote taalmodellen te bereiken, waarbij het bestaande frameworks zoals llama.cpp en MLX met wel 1,56x overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Een Custom Raceauto Bouwen
Stel je voor dat je een raceauto (een Large Language Model, of LLM) wilt besturen op een heel specif으로 specifiek circuit (Apple Silicon-chips zoals de M3 of M4).
Momenteel besturen de meeste mensen deze auto's met een "universele adapter" of een "huurauto-kit" (bestaande software zoals llama.cpp of MLX). Deze kits zijn geweldig omdat ze op veel verschillende circuits werken, maar ze zijn niet perfect afgestemd op dit specifieke Apple-circuit. Ze hebben extra gewicht, onnodige stappen en een bestuurder die de korte routes niet kent.
BaseRT is een nieuwe, custom-built raceauto die alleen is ontworpen voor het Apple-circuit. Het team van Base Compute heeft de zware adapters weggehaald en een voertuig vanaf de grond opgebouwd om te passen bij de unieke bochten en regels van het circuit. Het resultaat? De auto rijdt aanzienlijk sneller.
Het Probleem: Waarom Huidige Software "Traag" is
Het paper beargumenteert dat bestaande software voor het draaien van AI op Macs lijkt op een bezorgwagen die te veel stops maakt.
- Het "Middelman"-probleem: De meeste software gebruikt een "framework" (zoals een tussenpersoon) om met de grafische chip (de GPU) van de computer te communiceren. Deze tussenpersoon voegt extra stappen toe, zoals een manager die voor elke taak een klembord controleert.
- Het "Geheugen"-probleem: Apple-computers hebben een speciale functie genaamd "Unified Memory", waarbij de CPU en GPU hetzelfde grote deel van het RAM delen. Bestaande software behandelt ze vaak alsof ze in aparte kamers zijn, waardoor data onnodig heen en weer moet lopen.
De Oplossing: Hoe BaseRT Werkt
BaseRT snijdt de tussenpersoon eruit en bouwt een directe snelweg tussen de hersenen en de spieren. Dit zijn de vier belangrijkste trucs die ze hebben gebruikt:
Het "Data-gestuurde" Blauwdruk:
In plaats van een nieuwe set instructies te schrijven voor elk ander AI-model (zoals Qwen, Llama of Gemma), gebruikt BaseRT een enkele, flexibele blauwdruk. Denk aan een universele afstandsbediening die automatisch detecteert naar welke tv je wijst en direct de knoppen aanpast, in plaats van dat je voor elk merk een andere afstandsbediening nodig hebt. Dit houdt de motor draaiende zonder te stoppen voor een herconfiguratie.De "Zonder-Stop" Lus:
Wanneer je een AI vraagt om een zin te schrijven, genereert het één woord tegelijk. Bij oude software moet de computer voor elk nieuw woord dat het creëert, een parkeerplaats zoeken (geheugentoewijzing). BaseRT reserveert alle parkeerplaatsen al voordat de race begint. Zodra de AI begint te praten, stopt hij nooit meer om een parkeerplaats te zoeken; hij blijft gewoon doorrijden. Dit elimineert "files" veroorzaakt door geheugenbeheer.De "Fusie"-Keuken:
Normaal gesproken moet een AI ingrediënten in aparte potten bereiden (Matrixvermenigvuldiging, Attention, Normalisatie) en het eten tussen de potten verplaatsen. BaseRT voegt deze stappen samen tot één grote pan. Het bereidt de ingrediënten samen in één beweging, wat de tijd bespaart die nodig is om het eten te verplaatsen.De "Custom Chauffeur":
De software weet precies op welke Apple-chip hij draait (M1, M2, M3, etc.). Hij past zijn rijstijl aan op basis van de specifieke motorinhoud, zodat hij de maximale kracht uit elke druppel brandstof haalt.
De Resultaten: Wie Won de Race?
Het team heeft BaseRT getest tegen de twee grootste concurrenten: llama.cpp (de meest populaire open-source runner) en MLX (Apple's eigen officiële framework).
- Snelheid: BaseRT was de snelste in bijna elke test.
- Op kleine modellen was het tot wel 1,56 keer sneller dan
llama.cpp. - Op grote "Mixture-of-Experts"-modellen (complexe AI-hersenen) was het tot wel 1,78 keer sneller bij het verwerken van de initiële prompt.
- Op kleine modellen was het tot wel 1,56 keer sneller dan
- De "Small Model" Sweet Spot: De grootste winsten vonden plaats op kleinere modellen. Dit komt omdat bij kleine modellen de "overhead" (de tijd die wordt verspild aan administratieve taken) een groot deel van de totale tijd beslaat. Door die verspilling weg te snijden, maakte BaseRT een enorm verschil.
- De "Big Model" Realiteit: Bij zeer grote modellen wordt de snelheid vooral beperkt door hoe snel data door het geheugen kan bewegen (bandbreedte). Zelfs met een perfecte motor kun je niet sneller gaan dan de snelheidslimiet van de weg. BaseRT slaagde er echter nog steeds in om hier extra snelheid uit te persen, wat bewijst dat vorige software de weg niet efficiënt gebruikte.
Waarom Dit Er Toe Doet (De "Edge" Verschuiving)
Het paper suggereert dat we bewegen naar een toekomst waarin AI op je eigen apparaat draait (je laptop of telefoon) in plaats van op een verre cloudserver.
- Privacy: Je gegevens verlaten je computer nooit.
- Snelheid: Geen wachten tot het internet je verzoek heen en weer stuurt.
- Kosten: Je betaalt geen maandelijk via een abonnement per woord; je betaalt gewoon één keer voor de hardware.
BaseRT bewijst dat Apple Silicon veel krachtiger is voor het lokaal draaien van AI dan we dachten, als je software gebruikt die er specifiek voor gebouwd is.
Wat BaseRT Niet Doet (De Beperkingen)
Het paper is eerlijk over wat dit hulpmiddel nog niet is:
- Alleen voor één gebruiker: Het is ontworpen voor één persoon die de AI tegelijkertijd gebruikt. Het gaat niet om het afhandelen van honderden mensen die tegelijkertijd vragen stellen (serverbelasting).
- Alleen voor Apple: Het werkt alleen op Macs en iPads. Het werkt nog niet op Windows, Android of NVIDIA-videokaarten.
- Nog geen "Visie": Het gaat momenteel over tekstmodellen, niet over modellen die afbeeldingen kunnen "zien".
De Kernboodschap
De auteurs hebben een custom motor gebouwd (BaseRT) die alle onnodige bagage verwijdert bij het draaien van AI op Apple-computers. Door dit te doen, hebben ze het volledige snelheidspotentieel van de hardware vrijgemaakt, waardoor lokale AI sneller, privater en efficiënter is dan ooit tevoren. Je kunt het zelf proberen op GitHub.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.