

纯 Keras 3 实现的预训练 Transformer 模型,可在 JAX、PyTorch 和 TensorFlow 上运行。
Loading comments…
制作者
sleepyfox
访问网站
imvision12.github.io/KerasFormers/
项目信息
产品关键词
KerasFormers 是一个完全基于纯 Keras 3 构建的预训练变换器模型库,其权重从原始检查点转换而来。它涵盖了 118 个模型家族——从目标检测、分割到语音识别和大型语言模型——并且同一套代码可在 JAX、PyTorch 或 TensorFlow 后端上运行。运行时无需 transformers 或 torch 依赖,使其成为处理现代架构的轻量级、框架无关的替代方案。
每个模型都通过 from_weights 构建,然后输入其处理器生成的任何内容。无论您运行的是检测器、深度估计器还是大型语言模型,工作流程都是相同的——因此在任务之间切换不会增加学习成本或代码更改。
from_weights 自动分派:它接受 Hub 上预转换的 Keras 仓库、一个裸变体名称(可即时转换上游检查点),或任何兼容的 Hugging Face 仓库(带 hf: 前缀)。架构细节(如类别数量)从仓库配置中读取,因此微调模型无需额外设置即可工作。
仅权重的 int8、int4、fp8 和 mxfp4 量化是同一 from_weights 调用的参数,适用于任何模型。像 GPT-OSS 120B 这样的大型检查点以 bfloat16 加载,MoE 专家以 MXFP4 打包并即时反量化,内存占用保持在约 66 GB 附近,而不是 fp32 下的约 130 GB。
模型页面上的每个图表和打印结果都来自实际运行旁边代码片段在所示真实图像或音频剪辑上的结果。没有任何内容是手工编写以显得合理的——您读到的就是您自己运行时所得到的。
“在任何后端上运行任何模型。”
这并非营销噱头。KerasFormers 通过将 118 个模型家族移植到纯 Keras 3 并转换权重,然后让您通过一个环境变量在 JAX、PyTorch 和 TensorFlow 之间切换,兑现了这一承诺。广度、后端灵活性和诚实、可复现的文档相结合,使其在机器学习库领域独树一帜。
您正在使用 Keras 构建,并希望在不离开生态系统的情况下访问现代变换器,或者您需要一套代码库跨多个后端运行以实现可移植性。如果您处理大型模型并希望获得简单的量化选项,或者您重视反映真实、可运行结果而非手工制作示例的文档,它也非常适合您。
其他您可能感兴趣的工具