
GLM-5.3 es el modelo más reciente de Z.ai, diseñado para tareas de codificación complejas y de largo alcance. Gracias a un escalado masivo de post-entrenamiento, alcanza el estado del arte en código abierto en codificación agéntica y demuestra capacidades emergentes en detección de vulnerabilidades y ciberdefensa.
Loading comments…
Información del proyecto
Palabras clave del producto
GLM-5.3 es el último modelo frontera de Z.ai, creado específicamente para tareas complejas de codificación de largo alcance y tareas agénticas. Comparte el mismo modelo base que su predecesor, GLM-5.2 — cada mejora proviene de un escalado masivo de post-entrenamiento en lugar de cambios arquitectónicos. El resultado es un rendimiento SOTA de código abierto en codificación agéntica, además de capacidades emergentes en descubrimiento de vulnerabilidades y defensa cibernética que no fueron objetivo explícito durante el entrenamiento.
Las mejoras de GLM-5.3 provienen enteramente de escalar el post-entrenamiento en la pila construida para GLM-5.2: IndexShare para procesamiento eficiente de contexto largo, SAO para aprendizaje por refuerzo en tareas de largo alcance, y slime para entrenamiento asíncrono a gran escala. Durante el último mes, Z.ai escaló entornos, diversidad de tareas y cómputo — sin cambios en el modelo base.
Para escalar más allá de los benchmarks construidos manualmente, Z.ai construyó pipelines que sintetizan entornos ejecutables y verificables de extremo a extremo. Los agentes de investigación recopilan patrones de tareas del trabajo real y los convierten en entornos de largo alcance con dependencias de múltiples pasos y estado oculto. Un agente juez verifica la resolubilidad, y los verificadores se sintetizan sin acceso a soluciones de referencia, cerrando atajos de recompensa.
A través del entrenamiento en flujos de trabajo similares a los de producción, GLM-5.3 desarrolló fortalezas inesperadas en descubrimiento de vulnerabilidades y defensa cibernética. Obtiene 84.5 en CyberGym y 54.4 en ExploitBench — un salto significativo desde el 29/39 de GLM-5.2 en las tareas de 2h/6h de ExploitGym — demostrando que escalar el post-entrenamiento en trabajo experto diverso puede desbloquear capacidades más allá de los objetivos de entrenamiento originales.
La estrategia SAO con compactación se mantiene de GLM-5.2, ayudando a que las mejoras persistan en tareas extendidas en lugar de desvanecerse en las cortas. La mejora es dramática: Terminal-Bench 3.0 saltó de 4.6 a 28.3, y DeepSWE v1.1 subió de 46.2 a 66.9.
GLM-5.3 demuestra que escalar solo el post-entrenamiento — no la arquitectura — es la nueva frontera para la codificación agéntica y la capacidad cibernética.
Esta es la demostración de código abierto más sólida hasta ahora en benchmarks de codificación agéntica, y los resultados cibernéticos son genuinamente sorprendentes. El pipeline de entornos sintetizados también es un logro importante de infraestructura: mueve el cuello de botella de la capacidad del modelo a la generación de entornos, y Z.ai ya está trabajando en hacer ese proceso más autónomo. Para equipos que necesitan un modelo abierto capaz de asumir trabajo sustancial de extremo a extremo, GLM-5.3 es actualmente el benchmark a superar.
Estás construyendo herramientas de codificación agéntica, flujos de trabajo de investigación de seguridad o automatización de largo alcance que necesitan un modelo que pueda asumir responsabilidad real de las tareas. Si has estado esperando un modelo abierto que se acerque a los modelos frontera cerrados en codificación compleja y trabajo cibernético, GLM-5.3 merece una evaluación seria.
Otras herramientas que podrías considerar
Bob's CLI se ejecuta en tu propio hardware sin costos de API, sin que ningún dato salga de tu máquina. Bob vive en tu terminal, ve tus archivos reales y escribe código solo con tu aprobación explícita. Lo que lo hace diferente: detección automática de modelos de IA locales, perfilado de ADN conductual que se adapta a CÓMO trabajas, revisión de código autónoma + corrección automática, bifurcación de conversaciones, análisis profundos y SovereignLink — ejecución remota desde cualquier dispositivo mientras tu código permanece en casa. Gratuito para empezar. Soberano por diseño.
GitHits permite a los agentes de codificación acceder al código de código abierto del que depende tu aplicación. Obtén ejemplos de implementación reales, navegación por el código fuente de las dependencias, inspección de paquetes y documentación. Los agentes pueden buscar y leer tu base de código. Pero no pueden buscar ni leer el código de código abierto del que depende tu aplicación. Ahí es donde empiezan a adivinar, reintentar y entrar en bucles. GitHits crea un índice consciente de la versión bajo demanda. Los agentes pueden buscar, navegar e inspeccionar el código detrás de sus dependencias. CLI: npx githits@latest init
La mayoría de los agentes pasan sus evaluaciones y fallan en producción. Prefactor es la capa de evaluación que cierra esa brecha. Puntuamos cada ejecución de agente en tiempo real, detectamos regresiones de calidad y desviaciones en el momento en que ocurren, y mostramos a los equipos de ingeniería exactamente cómo están funcionando sus agentes a escala. Diseñado para los equipos que lanzan agentes a sus clientes.
Harness Starter Kit ayuda a los equipos a convertir frágiles indicaciones de codificación de IA en reglas de repositorio duraderas: AGENTS.md, comprobaciones de desviación, memoria de fallos, informes de adopción y perfiles de pila para una colaboración de agentes más segura.
Creador
blueprint_b
Alternativas
Loading comments…