← Ultimi articoli
🤖 AI

BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

Il documento presenta BaseRT, un runtime di inferenza Metal nativo per Apple Silicon che sfrutta ottimizzazioni specifiche del chip per raggiungere un throughput record per i modelli linguistici di grandi dimensioni, superando framework esistenti come llama.cpp e MLX fino a 1,56x.

Autori originali: Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

Pubblicato 2026-07-02
📖 5 min di lettura🧠 Approfondimento

Autori originali: Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'Idea Centrale: Costruire un'Auto da Corsa su Misura

Immaginate di voler guidare un'auto da corsa (un Large Language Model, o LLM) su una pista molto specifica (i chip Apple Silicon come l'M3 o l'M4).

Attualmente, la maggior parte delle persone guida queste auto usando un "adattatore universale" o un "kit per auto a noleggio" (software esistenti come llama.cpp o MLX). Questi kit sono ottimi perché funzionano su molte piste diverse, ma non sono perfettamente tarati per questa specifica pista Apple. Hanno un peso extra, passaggi inutili e un pilota che non conosce le scorciatoie.

BaseRT è un'auto da corsa nuova, costruita su misura, progettata solo per la pista Apple. Il team di Base Compute ha rimosso gli adattatori pesanti e ha costruito un veicolo da zero per adattarsi alle curve e alle regole uniche di quella pista. Il risultato? Guida significativamente più veloce.

Il Problema: Perché l'attuale software è "lento"

Il paper sostiene che l'attuale software per eseguire l'IA sui Mac sia come un camion per le consegne che fa troppe fermate.

  • Il problema del "Intermediario": La maggior parte del software utilizza un "framework" (come un intermediario) per comunicare con il chip grafico (la GPU) del computer. Questo intermediario aggiunge passaggi extra, come un manager che controlla una cartella clinica prima di ogni singola attività.
  • Il problema della "Memoria": I computer Apple hanno una funzione speciale chiamata "Memoria Unificata", dove la CPU e la GPU condividono lo stesso grande pool di RAM. Il software esistente spesso tratta i due componenti come se fossero in stanze separate, costringendo i dati a camminare avanti e indietro inutilmente.

La Soluzione: Come funziona BaseRT

BaseRT elimina l'intermediario e costruisce un'autostrada diretta tra il cervello e il muscolo. Ecco i quattro trucchi che hanno utilizzato:

  1. Il Progetto "Guidato dai Dati":
    Invece di scrivere un nuovo set di istruzioni per ogni diverso modello di IA (come Qwen, Llama o Gemma), BaseRT utilizza un unico progetto flessibile. Pensatelo come un telecomando universale che rileva automaticamente verso quale TV state puntando e cambia i suoi tasti istantaneamente, invece di aver bisogno di un telecomando diverso per ogni marca. Questo mantiene il motore in funzione senza fermarsi per riconfigurarsi.

  2. Il Ciclo "Senza Fermate":
    Quando chiedete a un'IA di scrivere una frase, essa genera una parola alla volta. Con il vecchio software, il computer deve trovare un posto per parcheggiare (allocazione della memoria) per ogni singola nuova parola che crea. BaseRT pre-parcheggia tutti i posti prima dell'inizio della gara. Una volta che l'IA inizia a parlare, non si ferma mai a cercare un posto dove parcheggiare; continua semplicemente a guidare. Questo elimina i "traffici" causati dalla gestione della memoria.

  3. La Cucina della "Fusione":
    Di solito, un'IA deve cucinare gli ingredienti in pentole separate (Moltiplicazione di Matrici, Attention, Normalizzazione) e spostare il cibo tra di esse. BaseRT fonde questi passaggi in un'unica grande pentola. Cucina gli ingredienti insieme in un unico movimento, risparmiando il tempo necessario per spostare il cibo.

  4. Il "Pilota Personalizzato":
    Il software sa esattamente quale chip Apple sta utilizzando (M1, M2, M3, ecc.). Regola il suo stile di guida in base alla dimensione specifica del motore, assicurandosi di ottenere la massima potenza da ogni goccia di carburante.

I Risultati: Chi ha vinto la gara?

Il team ha testato BaseRT contro i suoi due principali concorrenti: llama.cpp (il runner open-source più popolare) e MLX (il framework ufficiale di Apple).

  • Velocità: BaseRT è stato il più veloce in quasi tutti i test.
    • Sui modelli piccoli, è stato fino a 1,56 volte più veloce di llama.cpp.
    • Sui modelli grandi "Mixture-of-Experts" (cervelli IA complessi), è stato fino a 1,78 volte più veloce nell'elaborazione del prompt iniziale.
  • Il "Punto Dolce" dei Modelli Piccoli: Le vittorie più grandi sono avvenute sui modelli piccoli. Questo perché, sui modelli piccoli, l' "overhead" (il tempo sprecato in compiti amministrativi) costituisce una grande fetta del tempo totale. Eliminando questo spreco, BaseRT ha fatto una differenza enorme.
  • La Realtà dei Modelli Grandi: Sui modelli molto grandi, la velocità è limitata principalmente dalla velocità con cui i dati possono muoversi attraverso la memoria (larghezza di banda). Anche con un motore perfetto, non si può andare più veloci del limite di velocità della strada. Tuttavia, BaseRT è riuscito comunque a estrarre velocità extra anche qui, dimostrando che il software precedente non stava usando la strada in modo efficiente.

Perché questo è importante? (Lo spostamento verso l'"Edge")

Il paper suggerisce che ci stiamo muovendo verso un futuro in cui l'IA gira sul proprio dispositivo (il proprio laptop o telefono) piuttosto che in un lontano server nel cloud.

  • Privacy: I vostri dati non lasciano mai il vostro computer.
  • Velocità: Niente attese per l'invio della richiesta e il ritorno tramite internet.
  • Costo: Non pagate una quota mensile per parola; pagate l'hardware una volta sola.

BaseRT dimostra che l'Apple Silicon è molto più potente per eseguire l'IA localmente di quanto pensassimo, se si utilizza un software costruito specificamente per esso.

Cosa NON fa BaseRT (Le Limitazioni)

Il paper è onesto riguardo a ciò che questo strumento non è ancora:

  • Solo Utente Singolo: È progettato per una persona alla volta che usa l'IA. Non gestisce centinaia di persone che fanno domande simultaneamente (carico del server).
  • Solo Apple: Funziona solo su Mac e iPad. Non funziona su Windows, Android o schede grafiche NVIDIA per ora.
  • Niente "Vision" ancora: Attualmente gestisce modelli di testo, non modelli in grado di "vedere" le immagini.

In sintesi

Gli autori hanno costruito un motore personalizzato (BaseRT) che rimuove tutto il bagaglio inutile dall'esecuzione dell'IA sui computer Apple. Facendo così, hanno sbloccato il pieno potenziale di velocità dell'hardware, rendendo l'IA locale più veloce, più privata ed efficiente che mai. Potete provarlo voi stessi su GitHub.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →