

Inkling est le premier modèle à poids ouverts de Thinking Machines, un MoE de 975B avec 41B de paramètres actifs, un contexte de 1M, un raisonnement natif sur le texte, les images et l'audio, ainsi qu'un effort de réflexion contrôlable. Affinez-le sur Tinker ou téléchargez les poids sous licence Apache 2.0.
Loading comments…
Infos du projet
Mots-clés du produit
Inkling est le premier modèle à poids ouverts de Thinking Machines, publié sous licence Apache 2.0. Il s'agit d'un transformateur à mélange d'experts (MoE) avec 975 milliards de paramètres au total et 41 milliards de paramètres actifs par passage avant. Inkling prend en charge une fenêtre de contexte allant jusqu'à 1 million de jetons et a été pré-entraîné sur 45 000 milliards de jetons couvrant du texte, des images, de l'audio et de la vidéo. Il raisonne de manière native sur ces modalités et offre un effort de réflexion contrôlable, permettant aux utilisateurs d'équilibrer le coût et les performances. Le modèle est disponible pour un réglage fin sur Tinker, et ses poids complets peuvent être téléchargés directement.
Inkling utilise une architecture de mélange d'experts qui n'active qu'une fraction de ses paramètres totaux par jeton. Cette conception offre la capacité d'un grand modèle tout en maintenant une inférence efficace et une latence gérable.
Le modèle prend en charge jusqu'à 1 million de jetons de contexte, ce qui le rend adapté à l'analyse de longs documents, aux conversations prolongées et aux tâches nécessitant un raisonnement sur de grandes quantités d'informations en un seul passage.
Inkling a été pré-entraîné sur du texte, des images, de l'audio et de la vidéo, et il raisonne de manière native sur ces modalités. Il ne repose pas sur des encodeurs ou des pipelines séparés pour différents types d'entrée.
Les utilisateurs peuvent ajuster la quantité de calcul que le modèle consacre au raisonnement avant de générer une réponse. Cela permet un contrôle précis du compromis entre la qualité de la réponse et le coût ou la latence.
Inkling n'est pas le modèle le plus performant disponible aujourd'hui — c'est plutôt une combinaison de qualités qui en fait une bonne base à poids ouverts pour la personnalisation.
Ce positionnement honnête distingue Inkling. Plutôt que de chercher les meilleurs scores de référence, Thinking Machines s'est concentré sur la construction d'un modèle de base équilibré et flexible qui excelle comme point de départ pour le réglage fin. Le modèle est disponible sur Tinker pour une personnalisation immédiate, et l'équipe l'a démontré en faisant en sorte qu'Inkling s'affine lui-même — en écrivant son propre travail d'entraînement, en l'exécutant et en évaluant le résultat — le tout au sein de la plateforme Tinker.
Vous recherchez un modèle à poids ouverts sous licence permissive qui équilibre la capacité multimodale avec une inférence efficace, et vous appréciez la possibilité d'affiner et de personnaliser le modèle pour vos propres cas d'utilisation. Inkling mérite particulièrement d'être exploré si vous souhaitez expérimenter avec un effort de réflexion contrôlable ou si vous avez besoin d'un modèle capable de gérer de longs contextes couvrant du texte, des images et de l'audio.
D'autres outils que vous pourriez envisager
Exécutez des modèles open-source de pointe (GLM 5.1, Kimi K2.7 Code, MiniMax M2.7, et plus) dans Claude Code jusqu'à 4 fois plus vite (jusqu'à 200 tok/s) pour un tarif fixe de 29 $/mois. Configuration en quelques minutes, aucune modification de code nécessaire.
Le monde ne peut pas construire de capacité de calcul assez rapidement pour suivre la demande en IA. Nous avons donc emprunté une voie différente. ZeroGPU est une infrastructure IA alimentée par de petits modèles de langage fonctionnant sur un réseau hybride en périphérie, réutilisant la puissance de calcul déjà existante. Toutes les tâches n'ont pas besoin d'un modèle de pointe. Nos modèles spécialisés et optimisés pour la périphérie sont 10 fois plus rapides, 50 % moins chers et déchargent 70 à 80 % des tâches de production vers de petits modèles avec une précision de niveau supérieur.
Le moment où un agent doit déployer quelque chose, il se heurte de plein fouet à un mur conçu pour les humains. Aujourd'hui, nous déployons les comptes temporaires sur Cloudflare Workers. N'importe quel agent peut désormais exécuter wrangler deploy — temporary et obtenir un Worker en ligne en quelques secondes.
GitHits permet aux agents de codage d'accéder au code open source dont votre application dépend. Obtenez des exemples d'implémentation concrets, une navigation dans les sources des dépendances, une inspection des packages et de la documentation. Les agents peuvent parcourir et lire votre codebase. Mais ils ne peuvent pas parcourir et lire le code open source dont votre application dépend. C'est là qu'ils commencent à deviner, à réessayer et à boucler. GitHits construit un index tenant compte des versions à la demande. Les agents peuvent rechercher, naviguer et inspecter le code derrière leurs dépendances. CLI : npx githits@latest init
Créateur
neon_dev
Loading comments…