← Últimos artículos
🤖 AI

BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

El artículo presenta BaseRT, un entorno de ejecución de inferencia nativo de Metal para Apple Silicon que aprovecha optimizaciones específicas del chip para lograr un rendimiento sin precedentes para modelos de lenguaje extensos, superando a marcos de trabajo existentes como llama.cpp y MLX hasta en 1.56x.

Autores originales: Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

Publicado 2026-07-02
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Construir un Coche de Carreras Personalizado

Imagina que quieres conducir un coche de carreras (un Modelo de Lenguaje Grande, o LLM) en una pista muy específica (chips Apple Silicon como el M3 o el M4).

Actualmente, la mayoría de la gente conduce estos coches usando un "adaptador universal" o un "kit de coche de alquiler" (software existente como llama.cpp o MLX). Estos kits son excelentes porque funcionan en muchas pistas diferentes, pero no están perfectamente ajustados para esta pista específica de Apple. Tienen peso extra, pasos innecesarios y un conductor que no conoce los atajos.

BaseRT es un nuevo coche de carreras construido a medida, diseñado solo para la pista de Apple. El equipo de Base Compute eliminó los adaptadores pesados y construyó un vehículo desde cero para que coincida con las curvas y reglas únicas de la pista. ¿El resultado? Conduce significativamente más rápido.

El Probleما: Por qué el software actual es "lento"

El artículo argumenta que el software existente para ejecutar IA en Macs es como un camión de reparto que hace demasiadas paradas.

  • El problema del "intermediario": La mayoría del software utiliza un "framework" (como un intermediario) para hablar con el chip de gráficos (la GPU) de la computadora. Este intermediario añade pasos extra, como un gerente revisando una tabla de anotaciones antes de cada tarea.
  • El problema de la "memoria": Las computadoras Apple tienen una característica especial llamada "Memoria Unificada", donde la CPU y la GPU comparten un mismo gran depósito de RAM. El software existente a menudo los trata como si estuvieran en habitaciones separadas, obligando a los datos a caminar de un lado a otro innecesariamente.

La Solución: Cómo funciona BaseRT

BaseRT elimina al intermediario y construye una autopista directa entre el cerebro y el músculo. Aquí están los cuatro trucos principales que utilizaron:

  1. El plano "impulsado por datos":
    En lugar de escribir un nuevo conjunto de instrucciones para cada modelo de IA diferente (como Qwen, Llama o Gemma), BaseRT utiliza un plano único y flexible. Piensa en esto como un control remoto universal que detecta automáticamente a qué televisor estás apuntando y cambia sus botones instantáneamente, en lugar de necesitar un control remoto diferente para cada marca. Esto mantiene el motor funcionando sin detenerse a reconfigurarse.

  2. El bucle de "Cero Paradas":
    Cuando le pides a una IA que escriba una frase, esta genera una palabra a la vez. En el software antiguo, la computadora tiene que encontrar un lugar de estacionamiento (asignación de memoria) para cada nueva palabra que crea. BaseRT pre-estaciona todos los lugares antes de que comience la carrera. Una vez que la IA empieza a hablar, nunca se detiene a buscar un lugar de estacionamiento; simplemente sigue conduciendo. Esto elimina los "atascos de tráfico" causados por la gestión de la memoria.

  3. La cocina de "Fusión":
    Normalmente, una IA tiene que cocinar los ingredientes en ollas separadas (Multiplicación de Matrices, Atención, Normalización) y mover la comida entre ellas. BaseRT fusiona estos pasos en una sola olla gigante. Cocina los ingredientes juntos en un solo movimiento, ahorrando el tiempo que se tarda en mover la comida de un lado a otro.

  4. El "Conductor Personalizado":
    El software sabe exactamente en qué chip de Apple se está ejecutando (M1, M2, M3, etc.). Ajusta su estilo de conducción según el tamaño específico del motor, asegurando que obtenga la máxima potencia de cada gota de combustible.

Los Resultados: ¿Quién ganó la carrera?

El equipo probó BaseRT contra sus dos mayores competidores: llama.cpp (el ejecutor de código abierto más popular) y MLX (el propio framework oficial de Apple).

  • Velocidad: BaseRT fue el más rápido en casi todas las pruebas.
    • En modelos pequeños, fue hasta 1.56 veces más rápido que llama.cpp.
    • En modelos grandes de "Mezcla de Expertos" (cerebros de IA complejos), fue hasta 1.78 veces más rápido al procesar el prompt inicial.
  • El punto ideal de los "Modelos Pequeños": Las mayores victorias ocurrieron en los modelos más pequeños. Esto se debe a que, en los modelos pequeños, el "overhead" (el tiempo perdido en tareas administrativas) constituye una gran parte del tiempo total. Al eliminar ese desperdicio, BaseRT marcó una diferencia masiva.
  • La realidad de los "Modelos Grandes": En modelos muy grandes, la velocidad está limitada principalmente por la rapidez con la que los datos pueden moverse a través de la memoria (ancho de banda). Incluso con un motor perfecto, no puedes ir más rápido que el límite de velocidad de la carretera. Sin embargo, BaseRT logró extraer velocidad extra aquí, demostrando que el software anterior no estaba usando la carretera de manera eficiente.

¿Por qué es esto importante? (El cambio hacia el "Edge")

El artículo sugiere que nos dirigimos hacia un futuro donde la IA se ejecuta en tu propio dispositivo (tu laptop o teléfono) en lugar de en un servidor remoto en la nube.

  • Privacidad: Tus datos nunca salen de tu computadora.
  • Velocidad: Sin esperar a que el internet envíe tu solicitud de ida y vuelta.
  • Costo: No pagas una cuota mensual por palabra; simplemente pagas por el hardware una vez.

BaseRT demuestra que Apple Silicon es mucho más potente para ejecutar IA localmente de lo que pensábamos, si utilizas software construido específicamente para ello.

Lo que BaseRT No hace (Las Limitaciones)

El artículo es honesto sobre lo que esta herramienta aún no es:

  • Solo para un usuario: Está diseñado para una persona usando la IA a la vez. No maneja a cientos de personas haciendo preguntas simultáneamente (carga del servidor).
  • Solo para Apple: Solo funciona en Macs e iPads. Aún no funciona en Windows, Android o tarjetas gráficas NVIDIA.
  • Sin "Visión" todavía: Actualmente maneja modelos de texto, no modelos que puedan "ver" imágenes.

La Conclusión

Los autores construyeron un motor personalizado (BaseRT) que elimina todo el equipaje innecesario de ejecutar IA en computadoras Apple. Al hacerlo, desbloquearon todo el potencial de velocidad del hardware, haciendo que la IA local sea más rápida, más privada y más eficiente que nunca. Puedes probarlo tú mismo en GitHub.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →