

순수 Keras 3로 구현된 사전 학습된 트랜스포머 모델로, JAX, PyTorch 및 TensorFlow에서 실행할 수 있습니다.
Loading comments…
제작자
sleepyfox
웹사이트 방문
imvision12.github.io/KerasFormers/
프로젝트 정보
제품 키워드
KerasFormers는 순수 Keras 3로 완전히 구축된 사전 훈련된 트랜스포머 모델 라이브러리로, 원본 체크포인트에서 가중치를 변환했습니다. 객체 탐지와 세그멘테이션부터 음성 인식과 대규모 언어 모델까지 118개 모델 패밀리를 다루며, JAX, PyTorch 또는 TensorFlow 백엔드에서 동일한 코드를 실행합니다. 런타임에 transformers나 torch 의존성이 필요 없어, 현대 아키텍처를 다루기 위한 가볍고 프레임워크에 구애받지 않는 대안을 제공합니다.
모든 모델은 from_weights로 구축된 후 프로세서가 생성하는 입력을 그대로 받습니다. 탐지기, 깊이 추정기 또는 LLM을 실행하든 워크플로는 동일하므로, 작업 전환 시 학습 곡선이나 코드 변경 비용이 들지 않습니다.
from_weights는 자동으로 분기합니다: Hub의 사전 변환된 Keras 저장소, 업스트림 체크포인트를 즉석에서 변환하는 기본 변형 이름, 또는 hf: 접두사 뒤의 호환 가능한 Hugging Face 저장소를 허용합니다. 클래스 수와 같은 아키텍처 세부 사항은 저장소 구성에서 읽히므로, 미세 조정된 모델도 추가 설정 없이 작동합니다.
가중치 전용 int8, int4, fp8 및 mxfp4는 모든 모델에서 동일한 from_weights 호출의 인수입니다. GPT-OSS 120B와 같은 대규모 체크포인트는 MoE 전문가가 MXFP4로 패킹되고 즉석에서 역양자화된 bfloat16으로 로드되어, fp32의 약 130GB 대신 메모리를 약 66GB로 유지합니다.
모델 페이지의 모든 수치와 인쇄된 결과는 표시된 실제 이미지나 오디오 클립에서 옆에 있는 스니펫을 실제로 실행하여 얻은 것입니다. 그럴듯해 보이도록 수작업으로 작성된 것이 없으며, 읽은 내용은 직접 실행했을 때 정확히 얻는 결과입니다.
"어떤 모델이든, 어떤 백엔드에서든 실행하세요."
이것은 마케팅 과장이 아닙니다. KerasFormers는 118개 모델 패밀리를 순수 Keras 3로 포팅하고 변환된 가중치를 제공한 다음, 단일 환경 변수로 JAX, PyTorch, TensorFlow 사이를 전환할 수 있게 함으로써 이를 실현합니다. 폭, 백엔드 유연성, 정직하고 재현 가능한 문서화의 조합은 ML 라이브러리 공간에서 드문 발견입니다.
Keras로 구축하면서 생태계를 떠나지 않고 현대 트랜스포머에 접근하려는 경우, 또는 이식성을 위해 여러 백엔드에서 실행되는 하나의 코드베이스가 필요한 경우에 적합합니다. 또한 대규모 모델을 다루면서 간단한 양자화 옵션을 원하거나, 손으로 만든 예시가 아닌 실제 실행 가능한 결과를 반영한 문서화를 중시하는 경우에도 강력한 선택입니다.
고려해볼 만한 다른 도구