
BaseRT é o runtime de LLM mais rápido no Apple Silicon. Instale-o com um único comando e execute modelos locais no seu próprio dispositivo.
O BaseRT é um runtime LLM de alto desempenho projetado especificamente para Apple Silicon. Ele é instalado com um único comando no terminal e permite executar modelos de linguagem grandes inteiramente no seu próprio dispositivo — sem dependência de nuvem, sem chaves de API e sem que seus dados saiam da sua máquina. Projetado para velocidade e privacidade local, o BaseRT é posicionado como o runtime mais rápido disponível para os chips da série M da Apple.
O BaseRT é instalado com um único comando curl: curl -LsSf https://basecompute.co/install.sh | sh. Sem compilação manual, sem gerenciamento de dependências — apenas um pipe no shell e você está pronto para servir modelos.
Em tarefas de decodificação, o BaseRT supera o MLX em até 33% e o llama.cpp em uma margem semelhante. Em tarefas de preenchimento, a diferença aumenta drasticamente: até 6,4x mais rápido que o llama.cpp e 3,9x mais rápido que o MLX, medido em um Apple M5 Pro com modelos como Qwen3 30B-A3B e Gemma 4 E2B.
O BaseRT vem com um plugin que transforma seu modelo local em um agente de codificação. Sirva um modelo com basert serve basecompute/gemma-4-E4B-it, instale o plugin e execute pi — tudo permanece na sua máquina. Sem chaves de API, sem dados saindo do seu dispositivo.
O BaseRT suporta uma grande variedade de modelos de código aberto, incluindo Qwen3, Qwen3.5, Qwen3.6, Llama 3.1, Llama 3.2, Gemma 3, Gemma 4, Mistral, Phi-3 e Nomic BERT. Novos modelos são adicionados através da comunidade e de lançamentos oficiais.
O BaseRT é o runtime LLM mais rápido no Apple Silicon — até 6,4x mais rápido no preenchimento do que o llama.cpp.
Essa vantagem de desempenho não é apenas um número de destaque. Para desenvolvedores que executam agentes de codificação ou aplicações interativas, um preenchimento mais rápido significa menor latência no processamento de prompts, o que se traduz diretamente em uma experiência de usuário mais ágil. As melhorias na velocidade de decodificação também significam maior taxa de transferência para respostas em streaming. Combinado com a instalação de um único comando e operação apenas local, o BaseRT oferece uma combinação rara de velocidade e simplicidade difícil de encontrar em outros runtimes.
Você trabalha com Apple Silicon e precisa da inferência local mais rápida possível — especialmente para agentes de codificação, cargas de trabalho sensíveis à privacidade ou qualquer cenário onde você queira manter os dados no dispositivo sem sacrificar o desempenho. Se você tem usado MLX ou llama.cpp e quer ver se um aumento de 15–33% na decodificação e até 6,4x mais rapidez no preenchimento faz diferença no seu fluxo de trabalho, o BaseRT vale a tentativa.
Loading comments…
Criador
kettle_dev
Visitar site
basecompute.co/getbasert
Informações do projeto
Palavras-chave do produto
Comparar com
Conquista