GLM-5.3의 기술 사양
| 사양 | GLM-5.3 |
|---|---|
| 개발사 | Z.ai / Zhipu AI |
| 출시 | 2026년 8월 14일 |
| 모델 유형 | 플래그십 파운데이션 모델 |
| 입력 | 텍스트 |
| 출력 | 텍스트 |
| 컨텍스트 윈도우 | 1,000,000 토큰 |
| 최대 출력 | 128,000 토큰 |
| 추론 | 다중 모드 |
| 스트리밍 | 예 |
| 함수 호출 | 예 |
| 구조화된 출력 | 예 |
| 컨텍스트 캐싱 | 예 |
| MCP | 예 |
| 주요 적용 분야 | 코딩, 에이전트, 엔지니어링, 사이버보안 |
Z.ai의 공개 모델 저장소에는 여전히 다운로드 가능한 GLM-5.3 아티팩트가 아닌 GLM-5.2가 두드러지게 표시되어 있으므로, 아직 공개되지 않은 사양은 미확정으로 명시적으로 표기되어야 합니다.
GLM-5.3란 무엇인가?
GLM-5.3는 Z.ai의 GLM 패밀리 최신 세대로, 복잡한 보안 및 엔지니어링 작업을 자율적으로 수행할 수 있는 AI 시스템으로의 전환을 보여줍니다.
이 발표가 특히 주목받는 이유는 사이버보안이 단순히 또 하나의 벤치마크 카테고리로 제시된 것이 아니기 때문입니다. Z.ai는 GLM-5.3를 통해 소프트웨어 취약점을 발견하고 공격 개발 워크플로에 참여할 수 있는 AI 시스템을 시연하고 있습니다.
로이터는 Z.ai가 보안 평가를 완료한 뒤 모델을 공개적으로 배포할 계획이며, 더 고도화된 기능은 초기에는 신뢰된 접근 메커니즘을 통해 제한적으로 제공될 것이라고 보도했습니다.
이는 GLM-5.2에서 강조점이 크게 바뀐 것입니다.
GLM-5.2는 주로 장기 지평의 소프트웨어 엔지니어링과 에이전트형 코딩을 중심으로 포지셔닝되었습니다. Z.ai의 6월 연구 페이지는 GLM-5.2를 “장기 과업을 위해 설계됨”이라고 설명합니다.
GLM-5.3는 그 에이전트 지향 철학을 훨씬 더 민감한 영역으로 확장합니다:
소프트웨어 엔지니어링 → 취약점 발견 → 사이버 방어 → 통제된 공격적 보안
GLM-5.3의 주요 기능은?
사이버보안 중심의 추론
핵심 역량은 사이버보안입니다.
GLM-5.3는 다음을 달성했습니다:
CyberGym 84.5%
CyberGym은 AI 시스템의 소프트웨어 취약점 식별 능력을 평가합니다. 이 결과는 Mythos 5가 보고한 **83.8%**를 소폭 상회합니다.
이는 중요합니다. 사이버보안은 단순히 문법적으로 올바른 코드를 생성하는 것을 넘어서는 역량을 요구하기 때문입니다.
유능한 보안 에이전트는 다음을 수행할 수 있어야 합니다:
- 낯선 코드를 이해한다.
- 공격 표면을 식별한다.
- 취약점에 대한 가설을 세운다.
- 데이터 및 제어 흐름을 추적한다.
- 가설을 검증한다.
- 적절한 개념 증명을 개발한다.
- 해당 취약점이 실제로 악용 가능한지 판단한다.
GLM-5.3의 CyberGym 점수는 이 연쇄 과정의 초기 단계에서 의미 있는 진전을 시사합니다.
강력한 취약점 발견
84.5%의 CyberGym 점수는 초기 결과 중 가장 인상적인 부분일 수 있습니다.
이는 취약점 식별에서 GLM-5.3를 Mythos 5보다 약간 앞서게 합니다:
| 모델 | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
격차는 0.7 퍼센트포인트에 불과하므로, GLM-5.3가 결정적으로 우월하다고 묘사하는 것은 부정확합니다.
더 흥미로운 점은 Z.ai의 오픈 웨이트 모델이 고도로 제한된 사이버보안 시스템과 유사한 성능 영역에 진입하고 있다는 사실입니다.
익스플로잇 개발은 여전히 약점
GLM-5.3가 모든 사이버보안 작업에서 우세한 것은 아닙니다.
ExploitBench에서는:
| 모델 | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
이는 23.6포인트의 격차입니다.
이는 중요한 구분을 드러냅니다:
취약점을 찾는 것과 그것을 신뢰성 있게 악용하는 것은 다른 문제다.
GLM-5.3는 약점을 식별하는 데 매우 유능해 보이지만, 초기 결과는 이러한 발견을 신뢰할 수 있는 익스플로잇 개발로 전환하는 것이 여전히 상당히 더 어렵다는 점을 보여줍니다.
기업 보안 팀에게 이는 단순한 공격 자동화 엔진이 아니라, 방어적 취약점 분석 어시스턴트로서 모델을 흥미롭게 만듭니다.
GLM-5.3 vs GLM-5.2
GLM-5.2가 가장 유용한 확인된 기준선을 제공합니다.
| 기능 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| 상태 | 출시됨 | 발표됨 |
| 주요 포지셔닝 | 장기 지향 에이전트 | 사이버보안 + 에이전트 |
| 코딩 | 우수 | 강세 유지 예상 |
| 사이버보안 | 강한 잠재력 | 플래그십 핵심 초점 |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| 컨텍스트 | 1M | 미확정 |
| 파라미터 | ~753B | 미확정 |
| 라이선스 | MIT | 오픈 웨이트 발표 |
| API 가격 | 공개됨 | 아직 미공개 |
| 공개 가중치 | 사용 가능 | 계획됨 |
GLM-5.2의 확정된 아키텍처는 약 753B 파라미터이며, 공개 모델 카탈로그에는 여전히 753B 모델과 FP8 버전이 나열되어 있습니다.
또한 GLM-5.2는 Z.ai의 모델 평가 자료를 기반으로 한 서드파티 보도에 따르면 Terminal-Bench 2.1에서 81.0, SWE-bench Pro에서 62.1을 달성했습니다.
하지만 이러한 수치는 GLM-5.2의 벤치마크로 남아야 하며, GLM-5.3에 귀속되어서는 안 됩니다.
GLM-5.3 vs Mythos 5
현재로서는 가장 의미 있는 벤치마크 비교입니다.
| 벤치마크 | GLM-5.3 | Mythos 5 | 차이 |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
결과는 미묘한 결론을 도출합니다.
GLM-5.3는 취약점 식별에서 우세합니다.
하지만:
Mythos 5는 익스플로잇 개발에서 여전히 크게 우수합니다.
따라서 “GLM-5.3가 Mythos 5를 이긴다”고 말하는 것은 가용 데이터에 대한 부정확한 해석이 됩니다.
더 나은 설명은 다음과 같습니다:
GLM-5.3는 취약점 발견에서 Mythos 5 수준의 성능에 도달했지만, 익스플로잇 개발에서는 여전히 뒤처진다.
이는 훨씬 설득력이 크며 개발자들에게 더 유용합니다.