
GLM-5.3은 복잡하고 장기적인 코딩 작업을 위해 설계된 Z.ai의 최신 모델입니다. 대규모 사후 학습 확장을 통해 에이전트 기반 코딩에서 오픈소스 최고 수준(SOTA)을 달성했으며, 취약점 발견 및 사이버 방어에서 새로운 능력을 입증하고 있습니다.
Loading comments…
제작자
blueprint_b
웹사이트 방문
z.ai/blog/glm-5.3
프로젝트 정보
제품 키워드
GLM-5.3은 Z.ai의 최신 프론티어 모델로, 복잡하고 장기적인 코딩 및 에이전트 작업을 위해 특별히 설계되었습니다. 이전 모델인 GLM-5.2와 동일한 기본 모델을 공유하며, 모든 개선은 아키텍처 변경이 아닌 대규모 사후 학습 확장에서 비롯됩니다. 그 결과 에이전트 코딩 분야에서 오픈소스 최고 수준의 성능을 달성했으며, 학습 중 명시적으로 목표하지 않았던 취약점 발견 및 사이버 방어 분야에서도 새로운 능력이 나타났습니다.
GLM-5.3의 성능 향상은 전적으로 GLM-5.2용으로 구축된 스택에서 사후 학습을 확장한 데서 비롯됩니다: 효율적인 장문맥 처리를 위한 IndexShare, 장기 작업에 대한 강화 학습을 위한 SAO, 대규모 비동기 학습을 위한 slime. 지난 한 달 동안 Z.ai는 환경, 작업 다양성, 컴퓨팅 자원을 확장했으며 기본 모델에는 변경이 없습니다.
수작업으로 구축된 벤치마크를 넘어 확장하기 위해 Z.ai는 종단 간 실행 가능하고 검증 가능한 환경을 합성하는 파이프라인을 구축했습니다. 연구 에이전트는 실제 작업에서 작업 패턴을 수집하고 이를 다단계 의존성과 숨겨진 상태를 가진 장기 환경으로 변환합니다. 판정 에이전트가 해결 가능성을 검증하고, 검증자는 참조 솔루션에 접근하지 않고 합성되어 보상 지름길을 차단합니다.
생산 환경과 유사한 워크플로우 학습을 통해 GLM-5.3은 취약점 발견 및 사이버 방어 분야에서 예상치 못한 강점을 개발했습니다. CyberGym에서 84.5점, ExploitBench에서 54.4점을 기록하며 — GLM-5.2의 ExploitGym 2시간/6시간 작업에서 29/39점에서 크게 도약 — 다양한 전문가 작업에 대한 사후 학습 확장이 원래 학습 목표를 넘어서는 능력을 발휘할 수 있음을 입증합니다.
압축 기능을 갖춘 SAO 전략은 GLM-5.2에서 이어져, 단기 작업에서 성능이 감소하지 않고 확장된 작업에서도 개선 효과가 지속됩니다. 그 개선은 극적입니다: Terminal-Bench 3.0은 4.6에서 28.3으로, DeepSWE v1.1은 46.2에서 66.9로 상승했습니다.
GLM-5.3은 아키텍처가 아닌 사후 학습 확장만으로도 에이전트 코딩과 사이버 역량의 새로운 프론티어를 열 수 있음을 증명합니다.
에이전트 코딩 벤치마크에서 현재까지 가장 강력한 오픈소스 성과이며, 사이버 결과는 정말 놀랍습니다. 합성 환경 파이프라인은 또한 주요 인프라 성과입니다: 병목 현상을 모델 능력에서 환경 생성으로 이동시켰으며, Z.ai는 이미 이 프로세스를 더 자율적으로 만들기 위해 노력하고 있습니다. 종단 간 실질적인 작업을 주도할 수 있는 오픈 모델이 필요한 팀에게 GLM-5.3은 현재 기준점(benchmark)입니다.
에이전트 코딩 도구, 보안 연구 워크플로우, 또는 작업을 실질적으로 주도할 수 있는 모델이 필요한 장기 자동화를 구축 중인 경우. 복잡한 코딩 및 사이버 작업에서 폐쇄형 프론티어 모델에 근접한 오픈 모델을 기다려 왔다면, GLM-5.3은 진지한 평가를 받을 가치가 있습니다.
고려해볼 만한 다른 도구