GLM 5.3
GLM-5.3은 GLM-5.2의 베이스 모델을 그대로 사용하면서 장기 코딩과 에이전트 작업을 위한 후속 학습을 확장한 Z.ai의 최신 모델입니다.
조사 기준과 현재 상태
이 문서는 Z.ai가 GLM-5.3을 발표한 2026년 8월 14일의 공식 발표문과 모델 문서를 기준으로 작성했습니다. 표준 API는 아직
Coming soon으로 안내되며, 가중치는 출시 뒤 2주 이내 공개할 예정입니다. Jiminbox에서glm-5.3을 선택할 수 있다는 뜻은 아니므로, 실제 제공 여부와 모델 ID는 New API의 모델 목록에서 확인하세요.
한눈에 보기
| 항목 | GLM-5.3 공식 정보 |
|---|---|
| 베이스 모델 | GLM-5.2와 동일 |
| 개선 방식 | 장기 작업 환경을 확대한 후속 학습과 강화학습 |
| 컨텍스트 | 100만 토큰 |
| 최대 출력 | 12.8만 토큰 |
| 사고 모드 | 항상 켜짐 |
| 사고 강도 | low · high · max, 기본값 max |
| 공식 기능 | 스트리밍, 함수 호출, 컨텍스트 캐시, 구조화 출력, MCP |
| 출시 시점 이용 경로 | Z.ai Coding Plan |
| 표준 API | 2026년 8월 14일 기준 출시 예정 |
| 공개 가중치 | 안전성 평가와 보강 뒤 2주 이내 공개 예정 |
GLM-5.3 공식 발표 · GLM-5.3 공식 모델 문서
무엇이 달라졌나요
GLM-5.3은 새로운 사전 학습 모델이 아닙니다. GLM-5.2에서 마련한 긴 문맥 처리용 IndexShare, 장기 작업 강화학습용 SAO, 비동기 대규모 학습 프레임워크 slime을 유지하면서 더 많고 다양한 실제 작업 환경으로 후속 학습을 확장했습니다.
공급사가 공개한 훈련 환경은 짧은 코딩 문제보다 실제 엔지니어의 업무 흐름에 가깝습니다. 모델이 문제를 파악하고 해결책을 세운 뒤 코드를 수정하고, 실행 결과를 확인하며, 실패 원인을 고쳐 최종 결과물을 전달하는 전체 과정을 학습합니다. 일부 과제는 숙련된 엔지니어가 며칠 동안 수행할 정도의 작업량을 담고 있습니다.
2.3배는 모델 응답 속도가 아닙니다Z.ai가 공개한
2.3배 이상개선은 장기 코딩 강화학습의 학습 처리량입니다. GLM-5.3의 실제 API 응답 속도가 GLM-5.2보다 2.3배 빨라졌다는 뜻이 아닙니다.
GLM-5.2 대비 얼마나 달라졌나요
아래 표는 Z.ai가 같은 발표문에 공개한 결과입니다. 변화는 두 점수의 단순 차이이며, 서로 다른 벤치마크 사이의 숫자는 직접 비교할 수 없습니다.
| 평가 | GLM-5.2 | GLM-5.3 | 변화 | 주로 확인하는 능력 |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7점 | 실제 터미널 환경에서 명령을 실행해 과제를 끝내는 능력 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7점 | 새로운 저장소 과제를 장시간 분석하고 수정하는 능력 |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5점 | 거의 해결되지 않은 어려운 프로그래밍 문제 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1점 | 긴 소프트웨어 공학 작업을 이어 가는 능력 |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0점 | 여러 앱과 도구를 연결한 업무 자동화 |
| Agents’ Last Exam CLI | 23.8 | 28.5 | +4.7점 | 다양한 산업의 장기·검증형 에이전트 과제 |
| GDPval-AA v2 | 1508 | 1769 | +261점 | 여러 직업의 전문 업무 결과물 품질 |
| CyberGym | 77.2 | 84.5 | +7.3점 | 실제 코드의 취약점을 찾고 재현하는 능력 |
| ExploitBench | 24.4 | 54.4 | +30.0점 | 취약점을 더 깊은 공격 단계로 이어 가는 능력 |
Terminal-Bench 3.0은 4.6 → 28.3으로 약 6.2배, ExploitBench는 24.4 → 54.4로 약 2.2배가 됐습니다. 이 수치는 단순 코드 생성보다 실행 환경에서 여러 단계를 계속 수행하고 결과를 검증하는 행동이 크게 달라졌음을 보여줍니다.
다른 프론티어 모델과 비교하면
아래 비교도 Z.ai 발표문 한 표의 결과입니다. 같은 행 안에서 현재 위치를 파악하는 용도로만 사용하세요.
| 평가 | GLM-5.3 | Kimi K3 | DeepSeek V4 Pro 0813 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 88.3 | 87.9 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 17.4 | - | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 67.5 | 62.7 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 58.0 | 61.1 | 69.7 | - | - |
| AutomationBench v1.0.6 | 48.2 | 46.7 | 43.2 | 41.0 | 46.2 | 45.8 |
| Agents’ Last Exam CLI | 28.5 | 27.6 | 25.7 | 25.7 | 23.8 | 28.6 |
| GDPval-AA v2 | 1769 | 1682 | 1590 | 1588 | 1743 | 1730 |
GLM-5.3은 Terminal-Bench 2.1에서 최상위 모델들과 비슷한 구간에 있고, 더 어려운 Terminal-Bench 3.0에서는 Kimi K3와 Opus 4.8보다 높지만 Fable 5와 GPT-5.6 Sol보다는 낮습니다. DeepSWE에서는 Kimi K3와 가깝고 Fable 5와 GPT-5.6 Sol보다는 낮습니다. 반면 NL2Repo에서는 DeepSeek V4 Pro 0813과 Opus 4.8보다 낮아, 모든 종류의 코드 생성과 저장소 구현에서 가장 앞선다고 해석할 수는 없습니다.
에이전트·업무 평가에서는 AutomationBench와 GDPval-AA v2가 비교 모델 가운데 가장 높고, Agents’ Last Exam CLI는 GPT-5.6 Sol과 거의 같습니다. 공개된 결과만 놓고 보면 GLM-5.3의 가장 뚜렷한 강점은 긴 작업을 실행하고 검증하며 끝까지 이어 가는 능력입니다.
출처: Z.ai 비교 모델 성능표
공급사 표의 한계
위 비교는 Z.ai가 공개한 결과이며 독립 기관이 모든 모델을 한 번에 재평가한 표가 아닙니다. 벤치마크마다 에이전트 도구, 사고 강도, 제한 시간과 재시도 횟수가 다르고 Fable 5 결과에는 일부 fallback이 포함됩니다. 실제 모델 선택은 같은 코드와 도구로 직접 비교하세요.
벤치마크가 무엇을 보는지 이해하기
- Terminal-Bench는 모델이 격리된 터미널에서 명령을 실행하고 테스트를 통과해 실제 과제를 완료하는지 평가합니다. 단순 코드 정답보다 에이전트와 실행 환경의 결합을 봅니다. Terminal-Bench 저장소
- DeepSWE v1.1은 공개된 과거 수정 내역을 재사용하기보다 새로 만든 장기 소프트웨어 공학 과제를 사용합니다. 113개 과제에서 저장소를 이해하고 여러 파일을 수정해 검증기를 통과하는 능력을 봅니다. DeepSWE · 논문
- Agents’ Last Exam CLI는 재현 가능한 샌드박스에서 여러 산업의 장기 전문 업무를 수행하고 숨겨진 기준으로 결과물을 평가합니다. ALE 설명
- AutomationBench는 여러 도구와 앱을 연결한 실제 자동화 흐름을 끝까지 수행하는 능력을 봅니다.
- CyberGym은 실제 오픈소스 코드의 취약점을 분석하고 오류를 유발하는 입력을 만들어 취약점을 재현하는지 평가합니다. CyberGym 저장소
- ExploitBench와 ExploitGym은 발견한 취약점을 실제 공격 단계로 얼마나 이어 갈 수 있는지 봅니다. ExploitGym은 869개의 실제 취약점에서 무단 코드 실행까지 도달하는 과제를 사용합니다. ExploitBench 논문 · ExploitGym
보안 능력은 어떻게 해석해야 하나요
| 평가 | GLM-5.3 | GLM-5.2 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | 84.5 | 77.2 | 83.8 | 83.6 |
| ExploitBench | 54.4 | 24.4 | 78.0 | 76.5 |
| ExploitGym 2시간 / 6시간 완료 수 | 105 / 130 | 29 / 39 | 181 / 247 | 216 / 293 |
GLM-5.3은 취약점 발견과 재현을 보는 CyberGym에서 표의 비교 모델보다 높습니다. 그러나 더 깊은 공격 과정을 보는 ExploitBench와 ExploitGym에서는 Fable 5와 GPT-5.6 Sol보다 차이가 큽니다. 따라서 보안 분야 전체에서 최고라기보다 화이트박스 코드 검토와 취약점 발견이 강하고, 완전한 공격 체인에는 개선 여지가 남아 있다고 보는 편이 정확합니다.
허가된 환경에서만 사용하세요
보안 기능은 자신의 시스템이나 명시적으로 허가받은 점검 환경에서만 사용해야 합니다. 제3자 시스템의 취약점을 찾거나 공격하는 데 사용해서는 안 됩니다.
Z.ai Code Bench가 보여 주는 변화
Z.ai의 비공개 Code Bench에서 GLM-5.3은 max 강도 기준 완료율 34.5%와 과제당 약 7.5만 출력 토큰을 기록했습니다. GLM-5.2는 23.4%와 약 9.6만 토큰이었습니다. high 강도에서는 GLM-5.3이 31.4%와 약 5만 토큰, Opus 4.8은 29.5%와 약 12만 토큰이었습니다. Fable 5는 max 강도에서 39.5%로 GLM-5.3보다 높았습니다.
이 결과는 완료율과 출력 토큰 효율이 함께 개선됐다는 공급사의 근거입니다. 다만 비공개 평가이므로 외부에서 과제와 채점 결과를 재현할 수 없으며, 공개 벤치마크보다 더 조심해서 해석해야 합니다.
어떤 작업에 적합한가요
복잡한 코드베이스 작업
여러 파일을 고치고 테스트를 반복하며 리팩터링, 버그 수정이나 기능 구현을 끝까지 진행하는 작업에 적합합니다. 작은 코드 조각 한 번보다 터미널과 도구를 연결한 에이전트 환경에서 장점이 더 잘 드러날 가능성이 큽니다.
장기 에이전트와 전문 업무
긴 문맥 안에서 상태를 추적하고 여러 도구를 순서대로 사용하는 자동화, 조사와 결과물 제작에 적합합니다. 다만 모델만으로 결과를 보장할 수는 없으며 사용하는 에이전트 도구와 검증 절차가 함께 갖춰져야 합니다.
창작과 장편 글쓰기
GLM-5.2는 EQ-Bench 장편 창작 평가에 공개 결과가 있지만, GLM-5.3은 발표 시점에 독립적인 창작·장편 글쓰기 평가가 없습니다. 같은 베이스 모델을 사용하므로 문장 자체의 문학성이 자동으로 좋아졌다고 단정할 수 없습니다.
장기 작업 후속 학습이 세계관 상태 추적, 여러 장의 계획 유지와 반복 수정에 도움이 될 가능성은 있습니다. 그러나 이는 훈련 방향을 바탕으로 한 추론입니다. 짧은 장면의 문체, 감정 표현과 대화 품질은 실제 원고로 GLM-5.2나 다른 창작 모델과 직접 비교하세요. EQ-Bench도 창작 평가는 주관적이며 샘플을 함께 읽어야 한다고 안내합니다. Creative Writing v3 방법론
API를 준비할 때 주의할 점
GLM-5.3은 사고 모드를 끌 수 없습니다. Z.ai 표준 API를 직접 연결하는 애플리케이션은 다음처럼 설정합니다.
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}reasoning_effort는low,high,max를 지원하며 기본값은max입니다.- 복잡한 코딩에는
max, 비교적 가벼운 작업에는low나high부터 시험할 수 있습니다. - 기존 앱이
thinking.type: "disabled"를 사용한다면 모델 ID를 바꾸기 전에enabled와low로 수정해야 합니다. 그렇지 않으면 요청이 실패한다고 공식 문서가 안내합니다. - Jiminbox 게이트웨이가 같은 필드를 그대로 전달하는지는 별도로 확인해야 합니다. 표준 API 문서의 기능이 New API 경로에서 자동으로 보장되는 것은 아닙니다.
Jiminbox에서 사용할 때
- New API Key와 사용량 가이드에서 모델 목록을 확인합니다.
glm-5.3이 실제로 표시될 때만 해당 ID를 사용합니다. 비슷한 이름을 임의로 입력하지 마세요.- 처음에는 작은 저장소와 검증 가능한 과제로 함수 호출, MCP, 최대 출력과 차감량을 확인합니다.
reasoning_effort전달 여부를 연결한 앱에서 확인합니다. 지원하지 않는 앱에서는 공급사의 기본값인max가 적용될 수 있습니다.- 운영에 넣기 전 같은 과제를
glm-5.2,deepseek-v4-pro등 현재 제공 모델과 비교합니다.
claude-*호환 ID와는 별개입니다현재 Jiminbox의
claude-sonnet-4-6과claude-opus-4-8호환 ID는 GLM-5.2로 연결됩니다. GLM-5.3 발표만으로 이 라우팅 대상이 자동 변경됐다고 해석하면 안 됩니다.
결론
GLM-5.3은 GLM-5.2의 지식을 새로 만든 모델이라기보다, 같은 베이스 모델이 실제 환경에서 더 오래 계획하고 실행하며 검증하도록 후속 학습을 확장한 업데이트입니다. 공개 결과는 장기 코딩, 터미널 작업, 자동화와 취약점 발견에서 큰 개선을 보여 줍니다. 반면 모든 코드 평가에서 폐쇄형 프론티어 모델을 앞서는 것은 아니며, 창작 글쓰기 개선도 아직 검증되지 않았습니다.
Jiminbox에서는 실제 모델 목록에 glm-5.3이 나타나는지 먼저 확인하고, 제공되기 전까지는 현재 활성화된 glm-5.2를 사용하세요.