
GLM-5.3 est le dernier modèle de Z.ai, conçu pour des tâches de codage complexes et à long terme. Grâce à un post-entraînement à grande échelle, il atteint un niveau de référence open-source en matière de codage agentique et démontre des capacités émergentes dans la découverte de vulnérabilités et la cyberdéfense.
Loading comments…
Infos du projet
Mots-clés du produit
GLM-5.3 est le dernier modèle frontalier de Z.ai, conçu spécifiquement pour les tâches complexes de codage et d'agents à long horizon. Il partage le même modèle de base que son prédécesseur, GLM-5.2 — chaque amélioration provient d'un scaling massif du post-entraînement plutôt que de changements architecturaux. Le résultat est une performance SOTA open-source en codage agentique, ainsi que des capacités émergentes en découverte de vulnérabilités et en cyberdéfense qui n'étaient pas explicitement ciblées lors de l'entraînement.
Les gains de GLM-5.3 proviennent entièrement du scaling du post-entraînement sur la pile construite pour GLM-5.2 : IndexShare pour un traitement efficace des contextes longs, SAO pour l'apprentissage par renforcement sur des tâches à long horizon, et slime pour l'entraînement asynchrone à grande échelle. Au cours du dernier mois, Z.ai a augmenté les environnements, la diversité des tâches et la puissance de calcul — sans aucune modification du modèle de base.
Pour aller au-delà des benchmarks construits à la main, Z.ai a développé des pipelines qui synthétisent des environnements exécutables et vérifiables de bout en bout. Des agents de recherche collectent des schémas de tâches issus du travail réel et les convertissent en environnements à long horizon avec des dépendances multi-étapes et un état caché. Un agent juge vérifie la résolvabilité, et les vérificateurs sont synthétisés sans accès aux solutions de référence, fermant ainsi les raccourcis de récompense.
Grâce à l'entraînement sur des workflows proches de la production, GLM-5.3 a développé des forces inattendues en découverte de vulnérabilités et en cyberdéfense. Il obtient 84,5 sur CyberGym et 54,4 sur ExploitBench — un bond significatif par rapport aux 29/39 de GLM-5.2 sur les tâches 2h/6h d'ExploitGym — démontrant que le scaling du post-entraînement sur un travail d'expert diversifié peut débloquer des capacités au-delà des objectifs d'entraînement initiaux.
La stratégie SAO avec compaction est reprise de GLM-5.2, aidant les gains à persister sur des tâches étendues plutôt que de s'estomper sur des tâches courtes. L'amélioration est spectaculaire : Terminal-Bench 3.0 est passé de 4,6 à 28,3, et DeepSWE v1.1 de 46,2 à 66,9.
GLM-5.3 prouve que le scaling du post-entraînement seul — et non l'architecture — est la nouvelle frontière pour le codage agentique et les capacités cybernétiques.
C'est la meilleure performance open-source à ce jour sur les benchmarks de codage agentique, et les résultats cybernétiques sont véritablement surprenants. Le pipeline d'environnements synthétisés est également une réalisation d'infrastructure majeure : il déplace le goulot d'étranglement de la capacité du modèle vers la génération d'environnements, et Z.ai travaille déjà à rendre ce processus plus autonome. Pour les équipes ayant besoin d'un modèle ouvert capable de prendre en charge un travail substantiel de bout en bout, GLM-5.3 est actuellement la référence à battre.
Vous développez des outils de codage agentique, des workflows de recherche en sécurité, ou de l'automatisation à long horizon nécessitant un modèle capable de prendre réellement en charge des tâches. Si vous attendiez un modèle ouvert qui approche les modèles frontaliers fermés sur le codage complexe et le travail cybernétique, GLM-5.3 mérite une évaluation sérieuse.
D'autres outils que vous pourriez envisager
Bob's CLI fonctionne sur votre propre matériel, sans aucun coût d'API, et sans que vos données ne quittent votre machine. Bob vit dans votre terminal, voit vos fichiers réels et écrit du code uniquement avec votre approbation explicite. Ce qui le rend unique : détection automatique des modèles d'IA locaux, profilage comportemental ADN qui s'adapte à VOTRE façon de travailler, révision de code autonome + correction automatique, bifurcation de conversations, analyses approfondies et SovereignLink — exécution à distance depuis n'importe quel appareil pendant que votre code reste chez vous. Gratuit pour commencer. Souverain par conception.
GitHits permet aux agents de codage d'accéder au code open source dont votre application dépend. Obtenez des exemples d'implémentation concrets, une navigation dans les sources des dépendances, une inspection des packages et de la documentation. Les agents peuvent parcourir et lire votre codebase. Mais ils ne peuvent pas parcourir et lire le code open source dont votre application dépend. C'est là qu'ils commencent à deviner, à réessayer et à boucler. GitHits construit un index tenant compte des versions à la demande. Les agents peuvent rechercher, naviguer et inspecter le code derrière leurs dépendances. CLI : npx githits@latest init
La plupart des agents réussissent leurs évaluations mais échouent en production. Prefactor est la couche d'évaluation qui comble cet écart. Nous notons chaque exécution d'agent en temps réel, mettons en évidence les régressions de qualité et les dérives dès qu'elles surviennent, et montrons aux équipes d'ingénierie exactement comment leurs agents se comportent à grande échelle. Conçu pour les équipes qui déploient des agents auprès de leurs clients.
Harness Starter Kit aide les équipes à transformer des invites de codage IA fragiles en règles de dépôt durables : AGENTS.md, vérifications de dérive, mémoire des échecs, rapports d'adoption et profils de pile pour une collaboration plus sûre entre agents.
Créateur
blueprint_b
Alternatives
Loading comments…