
Le raisonnement continu rencontre l'exécution dans le monde réel. Grok 4.6 apporte des améliorations majeures aux flux de travail agentiques, à l'ingénierie logicielle et à la génération interactive d'applications web—à un tarif inchangé et économique de 2 $ / 6 $ par million de jetons. Créez des flux de travail d'agents IA de longue durée avec Grok 4.6 sur l'API xAI et les réseaux partenaires !
Loading comments…
Infos du projet
Mots-clés du produit
Grok 4.6 est le dernier modèle frontalier de xAI, conçu pour les flux de travail agentiques de longue durée et les projets interactifs ambitieux. Il s'appuie directement sur Grok 4.5 avec un accent renforcé sur les tâches multi-étapes soutenues—recherche dans des domaines inconnus, analyse d'informations complexes, travail sur des bases de code entières, et transformation d'idées de produits brutes en applications fonctionnelles et soignées. Le modèle est disponible dès aujourd'hui via l'API xAI, Cursor et Grok Build, et maintient un tarif économique de 2 $ pour 1 M de jetons d'entrée et 6 $ pour 1 M de jetons de sortie.
Grok 4.6 est spécialement conçu pour des trajectoires qui s'étendent sur de nombreuses étapes. Il reste concentré sur des tâches complexes—qu'il s'agisse de rechercher un sujet, d'analyser des informations ou de travailler sur une base de code—sans perdre sa cohérence ni s'écarter de l'objectif initial.
Face à une idée de produit concrète, Grok 4.6 établit la structure et le langage visuel d'une application en une seule passe. Cela le rend particulièrement efficace pour les projets où le chemin le plus rapide vers un bon résultat consiste à partir de quelque chose de substantiel et à itérer en boucle.
Sur des trajectoires plus longues, Grok 4.6 vérifie de plus en plus son propre travail avant de progresser. Ce comportement de vérification émergent réduit la propagation des erreurs et rend le modèle plus fiable pour les flux de travail autonomes et multi-étapes.
Grok 4.6 égalise GPT-5.6 Sol sur l'indice Artificial Analysis Intelligence (un composite de neuf références) et affiche des scores solides sur les évaluations de codage agentique comme CursorBench v3.2 et DeepSWE v1.1, avec une force particulière dans GDPVal-AA v2 où il mène à 1753.
Grok 4.6 transforme des idées générales en projets fonctionnels—puis continue de les affiner jusqu'à ce qu'ils soient terminés.
La capacité du modèle à rechercher des domaines inconnus, structurer une application, implémenter des interactions principales et continuer à s'améliorer à travers plusieurs cycles de retour est ce qui le distingue des modèles qui excellent uniquement dans des tâches isolées. Combiné au tarif inchangé de 2 $/6 $, Grok 4.6 offre une capacité agentique frontalière à un prix qui rend les flux de travail de longue durée économiquement viables. La pile de sécurité améliorée, calibrée pour correspondre aux capacités élargies du modèle, permet également aux équipes de le déployer dans des domaines sensibles comme la correction de vulnérabilités sans compromettre l'utilité.
Vous construisez des systèmes agentiques qui doivent maintenir leur concentration sur de nombreuses étapes, ou vous souhaitez un modèle capable de prendre une idée de produit brute et de la transformer en une première version fonctionnelle sans nécessiter de longues instructions. Si vous utilisez déjà Cursor ou Grok Build, la première semaine offre 2 fois l'utilisation incluse, ce qui en fait un moment à faible risque pour évaluer si les forces à long horizon de Grok 4.6 correspondent à votre flux de travail. C'est également un excellent candidat si vous êtes sensible aux coûts mais avez besoin de performances de niveau frontalier sur les références de codage et de travail de connaissances.
D'autres outils que vous pourriez envisager
Le moment où un agent doit déployer quelque chose, il se heurte de plein fouet à un mur conçu pour les humains. Aujourd'hui, nous déployons les comptes temporaires sur Cloudflare Workers. N'importe quel agent peut désormais exécuter wrangler deploy — temporary et obtenir un Worker en ligne en quelques secondes.
GitHits permet aux agents de codage d'accéder au code open source dont votre application dépend. Obtenez des exemples d'implémentation concrets, une navigation dans les sources des dépendances, une inspection des packages et de la documentation. Les agents peuvent parcourir et lire votre codebase. Mais ils ne peuvent pas parcourir et lire le code open source dont votre application dépend. C'est là qu'ils commencent à deviner, à réessayer et à boucler. GitHits construit un index tenant compte des versions à la demande. Les agents peuvent rechercher, naviguer et inspecter le code derrière leurs dépendances. CLI : npx githits@latest init
Vous utilisez plus d'agents de codage que jamais, mais vous n'arrivez pas à les suivre. C'est là qu'AgentPeek intervient. Il remonte chaque session en direct dans l'encoche de votre Mac. Jetez un coup d'œil, approuvez une invite, surveillez l'utilisation des jetons et gérez l'ensemble du flux sans interrompre votre vidéo YouTube. Tout en local, rien qu'à vous.
Découvrez Mellum, une famille de modèles linguistiques rapides, incluant un modèle de nouvelle génération pour une inférence à très faible latence et haute performance.
Créateur
indie_inkwell
Loading comments…