VIBECODING 365 / DICTIONARY
GLM-5.3
GLM-5.3
DEFINITION
GLM-5.3은 중국 지푸 AI(Zhipu, 브랜드 Z.ai)가 공개한 GLM 계열 플래그십이다. 공식 개요는 복잡한 소프트웨어 공학과 에이전트 능력을 앞세운 최신 모델이라고 적는다. 5.2와 같은 베이스를 쓰고, 체감과 벤치 상승은 전부 후훈련에서 온다고 못 박는다. 가중치와 서빙 안내는 GitHub zai-org/GLM-5와 Hugging Face zai-org/GLM-5.3이 원천이고, API 가이드는 docs.z.ai와 智谱 문서다. 입력은 텍스트만이며, 컨텍스트는 1M 토큰, 최대 출력은 128K 토큰이다.
같은 베이스에서 후훈련만 키운 릴리즈
GitHub 다운로드 표는 본체를 744B-A40B(활성 약 40B)로, Flash를 320B-A18B로 적는다. 아키텍처를 키운 새 사전학습이 아니라, 같은 MoE 베이스 위에 긴 작업 환경과 강화학습을 늘린 결과라는 것이 제작사 서술이다. 내부 Z.ai Code Bench에서는 5.2 대비 약 50% 향상을 주장한다. 공개 벤치(제작사 표)는 Terminal-Bench 3.0이 4.6에서 28.3, DeepSWE v1.1이 46.2에서 66.9, Agents Last Exam이 23.8에서 28.5다. 사내 Code Bench의 Max effort에서는 과제당 출력 약 75K로 34.5%, 5.2는 약 96K로 23.4%라고 적는다. 숫자는 벤더 공개값이므로 독립 재현 전에는 제작사 주장으로 읽는다.
생각을 끄면 요청이 실패한다
API 모델 id는 glm-5.3이다. OpenAI Chat Completions, Responses, Anthropic Messages 호환 엔드포인트를 안내하고, GLM Coding Plan으로 코딩 에이전트에 붙이는 경로를 둔다. 추론은 상시 켜져 있다. 공식 가이드는 thinking.type에 enabled만 허용하고, disabled를 넣으면 요청이 실패한다고 적는다. 5.2에서 생각을 끄던 코드는 enabled로 바꾸고 reasoning_effort를 low로 둔 뒤 모델 id를 옮겨야 한다. 강도는 low, high, max이며 기본은 max다. 코딩처럼 복잡한 작업에는 max를 권한다. 채팅 템플릿에서 clear_thinking 기본은 false라, 대화 장면에서는 true를 명시하라고 Hugging Face 카드가 적는다.
취약점 벤치와 가중치 라이선스
제작사는 후훈련 규모가 커지며 취약점 발견 능력이 예상보다 빨리 올랐다고 적는다. CyberGym에서 84.5(5.2는 77.2)를 주장하고, exploitation 계열 벤치에서는 5.2 대비 큰 폭 상승을 주장한다. 가중치는 Hugging Face에 공개되어 있다. 카드의 라이선스 필드는 other이고 이름은 glm-5.3이다. MIT 한 줄로 단정하지 말고 카드의 LICENSE를 읽는다. Flash와 본체를 이름만으로 섞지 않는다.
카탈로그에 보이는 이름
Neuralwatt 같은 추론 클라우드의 가격표, flex 접미, Preview 배지는 호스터 정책이다. Z.ai 로드맵과 벤치, 라이선스와 한 문장에 섞지 말고, 견적과 라우팅만 호스터 문서로 확인한다.
관련
이어서 볼 문서
RELATED TERMS
연관 용어
Anthropic Messages API
Anthropic SDK·Claude Code용 Messages 형식. Neuralwatt /v1/messages는 문서상 전 계정 GA.
ai DeepSeek V4 FlashDeepSeek-V4-Flash
DeepSeek가 2026년 4월에 연 V4 Preview의 빠른 축이다. 가중치는 총 284B·활성 13B·1M 컨텍스트다. 지금 공식 API에서 같은 문자열은 V4.1-Flash로 임시 넘어간다.
ai Flex 티어Flex Tier
Neuralwatt가 같은 모델에 붙이는 할인 티어다. 여유 용량이 있으면 바로 시작하고, 바쁠 때는 스트림을 유지한 채 잠시 홀드한다. 스트리밍이 아니면 표준 요금으로 조용히 폴백한다.