
BaseRT 是 Apple Silicon 上最快的 LLM 运行时。通过一条命令即可安装,并在您自己的设备上运行本地模型。
BaseRT 是一款专为 Apple Silicon 打造的高性能大语言模型运行时。只需一条终端命令即可安装,让您完全在本地设备上运行大语言模型——无需依赖云端、无需 API 密钥,且数据不会离开您的设备。BaseRT 专为速度和本地隐私而设计,被誉为 Apple M 系列芯片上可用的最快运行时。
BaseRT 通过一条 curl 命令即可安装:curl -LsSf https://basecompute.co/install.sh | sh。无需手动编译,无需处理依赖关系——只需一个 shell 管道,即可开始服务模型。
在解码任务中,BaseRT 比 MLX 快 33%,与 llama.cpp 相比也有类似优势。在预填充任务中,差距更为显著:在 Apple M5 Pro 上使用 Qwen3 30B-A3B 和 Gemma 4 E2B 等模型测试,比 llama.cpp 快 6.4 倍,比 MLX 快 3.9 倍。
BaseRT 附带一个插件,可将您的本地模型转变为编码助手。使用 basert serve basecompute/gemma-4-E4B-it 服务模型,安装插件,然后运行 pi——一切都在您的设备上完成。无需 API 密钥,数据不会离开您的设备。
BaseRT 支持多种开源模型,包括 Qwen3、Qwen3.5、Qwen3.6、Llama 3.1、Llama 3.2、Gemma 3、Gemma 4、Mistral、Phi-3 和 Nomic BERT。新模型通过社区和官方发布不断添加。
BaseRT 是 Apple Silicon 上最快的大语言模型运行时——预填充速度比 llama.cpp 快 6.4 倍。
这一性能优势并非只是宣传数字。对于运行编码助手或交互式应用的开发者来说,更快的预填充意味着更低的提示处理延迟,直接带来更流畅的用户体验。解码速度的提升也意味着流式响应具有更高的吞吐量。结合一键安装和纯本地运行的特点,BaseRT 提供了其他运行时难以企及的速度与简洁性的罕见组合。
您在 Apple Silicon 上工作,并且需要尽可能快的本地推理——尤其是用于编码助手、隐私敏感型工作负载,或任何希望在设备上保留数据而不牺牲性能的场景。如果您一直在使用 MLX 或 llama.cpp,并想看看 15–33% 的解码提升和高达 6.4 倍的预填充加速是否能为您的工作流程带来改变,那么 BaseRT 值得一试。
Loading comments…
制作者
kettle_dev
项目信息
产品关键词