
BaseRT는 Apple Silicon에서 가장 빠른 LLM 런타임입니다. 한 줄 명령어로 설치하고 자체 기기에서 로컬 모델을 실행하세요.
BaseRT는 Apple Silicon에 특화된 고성능 LLM 런타임입니다. 단일 터미널 명령어로 설치되며, 클라우드 의존성, API 키, 데이터 유출 없이 자체 기기에서 대규모 언어 모델을 실행할 수 있습니다. 속도와 로컬 프라이버시를 위해 설계된 BaseRT는 Apple M 시리즈 칩에서 사용 가능한 가장 빠른 런타임으로 자리매김하고 있습니다.
BaseRT는 단일 curl 명령어로 설치됩니다: curl -LsSf https://basecompute.co/install.sh | sh. 수동 컴파일이나 종속성 관리가 필요 없으며, 셸 파이프 하나로 모델 서빙 준비가 완료됩니다.
디코드 작업에서 BaseRT는 MLX보다 최대 33%, llama.cpp와 유사한 수준으로 더 뛰어난 성능을 보입니다. 프리필 작업에서는 격차가 더욱 벌어집니다: Apple M5 Pro에서 Qwen3 30B-A3B 및 Gemma 4 E2B와 같은 모델로 측정 시 llama.cpp보다 최대 6.4배, MLX보다 3.9배 더 빠릅니다.
BaseRT는 로컬 모델을 코딩 에이전트로 전환하는 플러그인을 제공합니다. basert serve basecompute/gemma-4-E4B-it으로 모델을 서빙하고, 플러그인을 설치한 후 pi를 실행하면 모든 작업이 기기 내에서 이루어집니다. API 키가 필요 없고 데이터가 기기를 벗어나지 않습니다.
BaseRT는 Qwen3, Qwen3.5, Qwen3.6, Llama 3.1, Llama 3.2, Gemma 3, Gemma 4, Mistral, Phi-3, Nomic BERT를 포함한 다양한 오픈소스 모델을 지원합니다. 커뮤니티 및 공식 릴리스를 통해 새로운 모델이 지속적으로 추가됩니다.
BaseRT는 Apple Silicon에서 가장 빠른 LLM 런타임으로, 프리필 작업에서 llama.cpp보다 최대 6.4배 빠릅니다.
이 성능 우위는 단순한 수치에 그치지 않습니다. 코딩 에이전트나 대화형 애플리케이션을 실행하는 개발자에게 더 빠른 프리필은 프롬프트 처리 지연 시간을 줄여 더욱 빠른 사용자 경험을 제공합니다. 디코드 속도 향상은 스트리밍 응답의 처리량 증가로 이어집니다. 원클릭 설치와 로컬 전용 작동 방식과 결합하여 BaseRT는 다른 런타임에서 찾기 어려운 속도와 단순함의 드문 조합을 제공합니다.
Apple Silicon에서 작업하며 가능한 가장 빠른 로컬 추론이 필요할 때—특히 코딩 에이전트, 프라이버시에 민감한 워크로드, 또는 성능 저하 없이 데이터를 기기 내에 유지하려는 모든 시나리오에서 유용합니다. MLX나 llama.cpp를 사용해 왔으며 15~33%의 디코드 향상과 최대 6.4배 빠른 프리필이 워크플로에 어떤 차이를 만드는지 확인하고 싶다면 BaseRT를 시도해볼 가치가 있습니다.
Loading comments…
제작자
kettle_dev
프로젝트 정보
제품 키워드