3200억을 180억만 켭니다 | DAKER 커뮤니티
Z.ai가 2026년 8월 26일 공식 블로그에 올린 소식은 한 줄입니다. GLM-5.3-Flash는 GLM-5 시리즈 첫 네이티브 멀티모달이며 총 파라미터 3200억·활성 180억으로, GLM-5.2를 약 1/10 가격에 웃돌고 코딩·에이전트에서 Claude Opus 4.8에 근접한다고 합니다. 원문은 GLM-5.3-Flash입니다. 문서 모델 가이드·요금 pricing을 같이 보십시오.

나온 것
1. 총 320B·활성 18B의 하이브리드 구조입니다. 원문은 새 베이스, 희소+선형 어텐션 하이브리드, mHC, 30T 토큰 멀티모달 사전학습을 적습니다. 문서는 희소와 선형 어텐션을 결합한 첫 오픈소스 프론티어 모델이라고 소개합니다. 「3200억을 180억만 켠다」는 활성 파라미터 관점의 요약입니다.
2. OpenCode·OpenRouter에서 ox-alpha로 익명 테스트됐고 그 주 가장 인기 있었으며 트래픽 전부가 중국 AI 칩에서 돌았다고 적혀 있습니다. 칩 벤더 이름을 원문 밖으로 단정하지 마십시오.
3. AA Intelligence Index v4.1.1에서 57점·태스크당 $0.045(할인)이며 이전 대비 약 10배 저렴했다고 원문이 적습니다. DeepSWE v1.1 63.4 대 GLM-5.2 46.2, AutomationBench 48.8 대 26.2입니다. Z.ai Code Bench v1.0 최대 노력 29.0 대 Opus 4.8 29.5입니다.
4. GLM-4.5와 비교하면 총량은 비슷하고(320B 대 355B) 활성은 18B 대 32B, 레이어는 45 대 92입니다. IndexPool은 인덱서 키 4개를 가중합으로 1개로 모아 1M 컨텍스트를 지원한다고 적혀 있습니다.
5. GLM-5.3 대비 어텐션 연산 3.0배 감소·KV 캐시 4.4배 축소입니다. GLM-5.3·DeepSeek-V4-Flash·Kimi-K3 대비 어텐션 연산이 가장 낮고, KV는 Kimi-K3·V4-Flash보다 약간 크다고 적혀 있습니다.
6. 베이스 표 숫자는 MMLU 88.1, BBH 86.6, HellaSwag 87.1, LiveCodeBench-Base 37.6, SimpleQA 33.5입니다. 비교 열은 블로그 표의 GLM-4.5-Base·GLM-5-Base·V4-Flash-Base를 따릅니다. 표를 원문 밖으로 재구성하지 마십시오.
7. 코딩 루프에 비전을 넣습니다. 렌더·검사·수정, CUA, 환경 피드백이 있는 프론트엔드 RL이 적혀 있습니다. 「이미지만 보는 별도 모델」과 혼동하지 마십시오. 네이티브 멀티모달 시리즈의 한 모델입니다.
8. 중국 칩 서빙은 전용 SGLang 엔진, GLM-5.3 인프라 에이전트의 커널 도움, EPD 분리, 동일 하드웨어에서 초기 대비 종단 3배, 비용은 주류 NVIDIA와 비교 가능하다고 회사 주장으로 적혀 있습니다. 제3자 감사 숫자를 원문이 붙이지 않았으므로 「검증된 동가」로 단정하지 마십시오.

9. Coding Plan은 모든 사용자에게 열리고 GLM-5.3 대비 쿼터 3배, 비피크·주말 전체 포인트 50%입니다. 요금 페이지의 API 단가와 Coding Plan 쿼터를 한 표로 섞지 마십시오.
10. 가중치는 Hugging Face에 공개되었습니다. SGLang·vLLM·TokenSpeed를 지원한다고 적혀 있습니다. 이 잡담에서는 라이선스 이름을 붙이지 않습니다. 원문·문서가 MIT 등 구체 이름을 이 페이지에서 밝히지 않은 채로 「가중치 공개」만 확인됐을 때, 라이선스명을 지어내지 말라는 지침을 따릅니다.
11. 모델 코드는 glm-5.3-flash입니다. 입력은 비디오·이미지·텍스트·파일, 출력은 텍스트, 컨텍스트 1M, 최대 출력 128K입니다. thinking.type은 enabled만 가능하고 끌 수 없습니다. temperature 1, top_p 0.95, reasoning_effort max를 권장한다고 문서가 적습니다.
12. 공식 요금은 입력 $0.15 정가 / $0.075 프로모, 캐시 입력 $0.03/$0.015, 출력 $0.50/$0.25입니다. 50% 할인은 2026년 9월 9일 24:00 UTC+8(싱가포르)에 끝납니다. 캐시 스토리지는 한시 무료라고 적혀 있습니다.
13. 블로그 벤치 표(Z.ai 표로 인용)입니다. TB2.1 84.3, DeepSWE 63.4, NL2Repo 56.3, Toolathlon 78.4, Automation 48.8, ALE 26.3, HLE tools 55.3, GDPval-AA 1773, OfficeQA 62.4, CharXiv 89.4, Chartography 78.0, BabyVision 53.4, MVbench 77.8, MMVU 80.5. 각 평가에는 특정 하네스가 있다는 각주를 따르십시오.
활성 18B는 「작은 모델」이 아니라 MoE식 활성입니다. 총 320B와 활성을 한 숫자로 합치지 마십시오. 제목의 3200억·180억은 총·활성을 억 단위로 읽은 표현입니다.
Opus 4.8 근접은 코딩·에이전트 축의 회사 평가입니다. 모든 벤치에서 동급이라고 쓰지 마십시오. Code Bench 29.0 대 29.5처럼 원문 숫자를 옆에 두십시오.
ox-alpha 인기는 OpenRouter·OpenCode 주간 맥락입니다. 전 세계 API 점유율 1위로 확장하지 마십시오. 중국 칩 전량 서빙 주장과 인기 순위를 한 인과로 단정하지 않습니다.
IndexPool·1M 컨텍스트는 장문 워크로드용입니다. 1M을 기본 호출마다 채우면 비용이 커집니다. 캐시 프로모·스토리지 한시 무료 종료일을 요금표와 같이 보십시오.
thinking을 끌 수 없다는 제약은 문서에 명시되어 있습니다. 「빠른 모드로 thinking off」를 가정한 클라이언트를 수정하십시오. temperature·top_p·reasoning_effort 권장값을 기본 프리셋에 넣으십시오.
MiniMax H3·DeepSeek vision·Qwen4 뼈대 소식과 제목을 섞지 마십시오. 오늘은 GLM-5.3-Flash 멀티모달·가격·벤치입니다.
SGLang·vLLM·TokenSpeed는 추론 스택 선택지입니다. 세 스택의 동등 성능표를 원문이 제공하지는 않습니다. 자사 하드웨어에서 처리량·지연을 재십시오.
프로모 종료는 2026-09-09 24:00 UTC+8입니다. 한국시간으로 환산해 예산 마감을 표시하십시오. 정가 $0.15/$0.50와 프로모 $0.075/$0.25를 나란히 적으십시오.
비전 코딩 루프는 렌더 후 검사·수정입니다. 「스크린샷만 올리면 자동 배포」까지 원문이 보장하지는 않습니다. CUA·프론트엔드 RL은 제품 설명의 일부로만 인용하십시오.
Hugging Face 가중치 공개는 자체 호스팅 경로입니다. API 요금·Coding Plan 쿼터와 별개입니다. 자체 호스팅 비용(칩·전력·엔지니어링)은 원문 요금표에 없습니다.
TB2.1 84.3과 HLE tools 55.3은 같은 표의 다른 행입니다. 한 점수로 평균 내지 마십시오. GDPval-AA 1773도 스케일이 다르므로 코딩 벤치와 순위를 합치지 않습니다.
CharXiv 89.4·Chartography 78.0·BabyVision 53.4·MVbench 77.8·MMVU 80.5는 비전·문서 축입니다. DeepSWE 63.4와 직접 비교하지 마십시오. 하네스 각주를 같이 옮기십시오.
EPD 분리와 종단 3배는 동일 하드웨어 기준 회사 측정입니다. 자사 랙에 그대로 적용된다고 쓰지 마십시오. 커널·엔진 버전을 맞춘 뒤 재측정하십시오.
비디오 입력이 가능하다고 문서가 적습니다. 최대 길이·해상도·요금 배수까지 이 잡담에서 숫자로 채우지 않습니다. 문서·요금표의 최신 행을 확인하십시오.
아닌 것
MiniMax H3 Max 영상 속도 발표가 아닙니다. Sep2 각도와 다릅니다.
DeepSeek 비전 단독 소식도 아닙니다. Aug·Sep 다른 글과 섞지 마십시오.
Qwen4 뼈대 티저도 아닙니다. 오늘은 GLM-5.3-Flash입니다.
라이선스 이름을 MIT로 확정한 공지도 아닙니다. Hugging Face에 가중치가 공개되었다는 사실만 적습니다.
모든 벤치에서 Opus 4.8을 넘어섰다는 뜻도 아닙니다. 코딩·에이전트 근접과 Code Bench 29.0/29.5를 정확히 인용하십시오.
오늘 할 일
첫째, 블로그·문서·요금표를 읽고 모델 코드와 단가를 메모하십시오. Z.ai — GLM-5.3-Flash (2026-08-26) · docs · pricing을 표시하십시오.
둘째, glm-5.3-flash로 짧은 멀티모달·코딩 호출을 해 보십시오. thinking 고정·temperature 1·top_p 0.95·reasoning_effort max를 확인하십시오.
셋째, 프로모 종료(2026-09-09 24:00 UTC+8) 전후 단가를 예산에 넣으십시오. 캐시 스토리지 한시 무료도 같이 표시하십시오.
넷째, Coding Plan 쿼터 3배·주말 50%가 팀에 유리한지 API 정가와 비교하십시오. 두 과금축을 한 청구서로 오해하지 마십시오.
다섯째, 자체 호스팅이 필요하면 Hugging Face 가중치와 SGLang·vLLM 경로를 검토하십시오. 라이선스 페이지를 HF에서 직접 확인하되, 이 잡담 본문에는 라이선스명을 쓰지 않습니다.
여섯째, 벤치 인용과 설정 메모를 공개 링크로 남기십시오. DAKER에는 빌더와 대회 기록이 쌓여 있습니다. 올린 링크가 제출입니다.
한 페이지 요약
2026년 8월 26일 Z.ai는 GLM-5.3-Flash(총 320B·활성 18B)를 발표했습니다. 원문은 https://z.ai/blog/glm-5.3-flash입니다. 희소+선형·30T·1M 컨텍스트, DeepSWE 63.4, Automation 48.8, Code Bench 29.0(Opus 4.8 29.5), AA Index 57·$0.045/task, 입력 $0.15/$0.075·출력 $0.50/$0.25(프로모 ~09-09 UTC+8), HF 가중치 공개, thinking 고정입니다. MiniMax·DeepSeek vision·Qwen4와 다릅니다. 라이선스명은 적지 않습니다. 오늘 할 일은 원문·호출 프리셋·프로모 만료·Coding Plan 비교·HF 경로·공개 링크 제출입니다.
출처: Z.ai — GLM-5.3-Flash (2026-08-26) · GLM-5.3-Flash docs · Z.ai pricing