


Inkling 是 Thinking Machines 推出的首个开放权重模型,拥有 975B MoE 架构、41B 活跃参数、100 万上下文长度,支持文本、图像和音频的原生推理,并具备可控思考深度。您可以在 Tinker 上对其进行微调,或下载 Apache 2.0 许可的权重文件。
Inkling 是 Thinking Machines 发布的首款开放权重模型,采用 Apache 2.0 许可证。它是一款混合专家(MoE)Transformer 模型,总参数量达 9750 亿,每次前向传播激活 410 亿参数。Inkling 支持高达 100 万 token 的上下文窗口,并在 45 万亿 token 的数据集上完成预训练,涵盖文本、图像、音频和视频。它能跨这些模态进行原生推理,并提供可控的思考深度,让用户平衡成本与性能。该模型可在 Tinker 平台上进行微调,完整权重可直接下载。
Inkling 采用混合专家架构,每个 token 仅激活总参数的一小部分。这种设计在保持推理计算效率和低延迟的同时,提供了大型模型的能力。
模型支持高达 100 万 token 的上下文,适用于长文档分析、扩展对话以及需要单次推理大量信息的任务。
Inkling 在文本、图像、音频和视频上完成预训练,并能跨这些模态进行原生推理,无需为不同输入类型配备独立的编码器或流水线。
用户可调整模型在生成答案前用于推理的计算量,从而精细控制响应质量与成本或延迟之间的权衡。
Inkling 并非当前最强的整体模型——相反,多种特性的结合使其成为一款适合定制的优秀开放权重基础模型。
这种坦诚的定位让 Inkling 脱颖而出。Thinking Machines 并未追求顶尖的基准测试分数,而是专注于构建一款均衡、灵活的基础模型,作为微调的绝佳起点。该模型可在 Tinker 上直接定制,团队通过让 Inkling 自我微调——自行编写训练任务、运行并评估结果——在 Tinker 平台上展示了这一能力。
你正在寻找一款采用宽松许可证、开放权重的模型,它兼具多模态能力与高效推理,并且你重视对模型进行微调和定制的能力。如果你希望尝试可控的推理深度,或需要一款能处理跨文本、图像和音频的长上下文模型,Inkling 尤其值得探索。
其他您可能感兴趣的工具
在 Claude Code 中运行最先进的开源模型(GLM 5.1、Kimi K2.7 Code、MiniMax M2.7 等),速度提升高达 4 倍(最高 200 tok/s),每月仅需 29 美元。几分钟即可完成设置,无需修改代码。
全球的计算能力建设速度已无法满足AI需求的增长。因此,我们另辟蹊径。ZeroGPU是一种AI基础设施,由运行在混合边缘网络上的小型语言模型驱动,复用现有计算资源。并非所有任务都需要前沿模型。我们专为边缘场景优化的定制模型,运行速度快10倍、成本低50%,可将70%-80%的生产任务分流至小型模型,同时保持前沿级别的准确性。
当智能体需要部署某些内容时,它会直接撞上为人类设计的壁垒。今天,我们在 Cloudflare Workers 上推出了临时账户功能。现在,任何智能体都可以运行 wrangler deploy — temporary,在几秒内获得一个实时 Worker。
GitHits 让编码代理能够访问你的应用所依赖的开源代码。获取真实的实现示例、依赖源码导航、包检查及文档。代理可以搜索并读取你的代码库,但它们无法搜索并读取你的应用所依赖的开源代码。这正是它们开始猜测、重试和循环的地方。GitHits 按需构建版本感知索引。代理可以搜索、导航并检查其依赖背后的代码。CLI:npx githits@latest init
Loading comments…
制作者
neon_dev
访问网站
thinkingmachines.ai/news/introducing-inkling/
项目信息
产品关键词