
BaseRT es el runtime de LLM más rápido en Apple Silicon. Instálalo con un solo comando y ejecuta modelos locales en tu propio dispositivo.
BaseRT es un runtime de alto rendimiento para LLM diseñado específicamente para Apple Silicon. Se instala con un solo comando en la terminal y te permite ejecutar modelos de lenguaje grandes completamente en tu propio dispositivo, sin dependencia en la nube, sin claves API y sin que los datos salgan de tu máquina. Diseñado para la velocidad y la privacidad local, BaseRT se posiciona como el runtime más rápido disponible para los chips de la serie M de Apple.
BaseRT se instala con un solo comando curl: curl -LsSf https://basecompute.co/install.sh | sh. Sin compilación manual, sin lidiar con dependencias, solo una tubería de shell y estarás listo para servir modelos.
En tareas de decodificación, BaseRT supera a MLX hasta en un 33% y a llama.cpp en un margen similar. En tareas de prellenado, la brecha se amplía drásticamente: hasta 6.4 veces más rápido que llama.cpp y 3.9 veces más rápido que MLX, medido en un Apple M5 Pro con modelos como Qwen3 30B-A3B y Gemma 4 E2B.
BaseRT incluye un complemento que convierte tu modelo local en un agente de codificación. Sirve un modelo con basert serve basecompute/gemma-4-E4B-it, instala el complemento y ejecuta pi; todo permanece en tu máquina. Sin claves API, sin que los datos salgan de tu dispositivo.
BaseRT admite una amplia gama de modelos de código abierto, incluyendo Qwen3, Qwen3.5, Qwen3.6, Llama 3.1, Llama 3.2, Gemma 3, Gemma 4, Mistral, Phi-3 y Nomic BERT. Se añaden nuevos modelos a través de la comunidad y lanzamientos oficiales.
BaseRT es el runtime de LLM más rápido en Apple Silicon: hasta 6.4 veces más rápido en prellenado que llama.cpp.
Esa ventaja de rendimiento no es solo un número llamativo. Para desarrolladores que ejecutan agentes de codificación o aplicaciones interactivas, un prellenado más rápido significa menor latencia en el procesamiento de indicaciones, lo que se traduce directamente en una experiencia de usuario más ágil. Las mejoras en la velocidad de decodificación también significan un mayor rendimiento para respuestas en streaming. Combinado con la instalación de un solo comando y la operación solo local, BaseRT ofrece una combinación poco común de velocidad y simplicidad difícil de encontrar en otros runtimes.
Trabajas en Apple Silicon y necesitas la inferencia local más rápida posible, especialmente para agentes de codificación, cargas de trabajo sensibles a la privacidad o cualquier escenario donde quieras mantener los datos en el dispositivo sin sacrificar el rendimiento. Si has estado usando MLX o llama.cpp y quieres ver si un aumento del 15–33% en decodificación y hasta 6.4 veces más rápido en prellenado marca la diferencia en tu flujo de trabajo, BaseRT merece una oportunidad.
Loading comments…
Creador
kettle_dev
Visitar sitio web
basecompute.co/getbasert
Información del proyecto
Palabras clave del producto
Comparar con
Logro