
BaseRT est le runtime LLM le plus rapide sur Apple Silicon. Installez-le en une seule commande et exécutez des modèles locaux sur votre propre appareil.
BaseRT est un runtime LLM haute performance spécialement conçu pour Apple Silicon. Il s'installe avec une seule commande dans le terminal et vous permet d'exécuter des modèles de langage volumineux entièrement sur votre propre appareil, sans dépendance au cloud, sans clés API et sans que vos données ne quittent votre machine. Conçu pour la vitesse et la confidentialité locale, BaseRT se positionne comme le runtime le plus rapide disponible pour les puces de la série M d'Apple.
BaseRT s'installe avec une seule commande curl : curl -LsSf https://basecompute.co/install.sh | sh. Pas de compilation manuelle, pas de gestion des dépendances, juste un pipe shell et vous êtes prêt à servir des modèles.
Sur les tâches de décodage, BaseRT surpasse MLX jusqu'à 33 % et llama.cpp d'une marge similaire. Sur les tâches de préremplissage, l'écart se creuse considérablement : jusqu'à 6,4 fois plus rapide que llama.cpp et 3,9 fois plus rapide que MLX, mesuré sur un Apple M5 Pro avec des modèles comme Qwen3 30B-A3B et Gemma 4 E2B.
BaseRT est livré avec un plugin qui transforme votre modèle local en agent de codage. Servez un modèle avec basert serve basecompute/gemma-4-E4B-it, installez le plugin et exécutez pi : tout reste sur votre machine. Pas de clés API, pas de données quittant votre appareil.
BaseRT prend en charge une large gamme de modèles open source, notamment Qwen3, Qwen3.5, Qwen3.6, Llama 3.1, Llama 3.2, Gemma 3, Gemma 4, Mistral, Phi-3 et Nomic BERT. De nouveaux modèles sont ajoutés via la communauté et les versions officielles.
BaseRT est le runtime LLM le plus rapide sur Apple Silicon, jusqu'à 6,4 fois plus rapide sur le préremplissage que llama.cpp.
Cet avantage en termes de performances n'est pas qu'un simple chiffre d'accroche. Pour les développeurs exécutant des agents de codage ou des applications interactives, un préremplissage plus rapide signifie une latence réduite lors du traitement des invites, ce qui se traduit directement par une expérience utilisateur plus réactive. Les améliorations de la vitesse de décodage signifient également un débit plus élevé pour les réponses en streaming. Combiné à l'installation en une commande et au fonctionnement local uniquement, BaseRT offre une combinaison rare de rapidité et de simplicité difficile à trouver dans d'autres runtimes.
Vous travaillez sur Apple Silicon et avez besoin de l'inférence locale la plus rapide possible, en particulier pour les agents de codage, les charges de travail sensibles à la confidentialité ou tout scénario où vous souhaitez conserver les données sur l'appareil sans sacrifier les performances. Si vous avez utilisé MLX ou llama.cpp et souhaitez voir si un gain de décodage de 15 à 33 % et un préremplissage jusqu'à 6,4 fois plus rapide font une différence dans votre flux de travail, BaseRT mérite d'être essayé.
Loading comments…
Créateur
kettle_dev
Visiter le site web
basecompute.co/getbasert
Infos du projet
Mots-clés du produit
Comparer avec
Récompense