옥 알파의 정체가 플래시였습니다 | DAKER 커뮤니티
Z.ai가 2026년 8월 26일 공식 블로그에 올린 소식은 한 줄입니다. OpenCode와 OpenRouter에서 익명으로 돌던 ox-alpha의 정체가 GLM-5.3-Flash였습니다. 원문은 GLM-5.3-Flash: Frontier Intelligence, Flash Cost입니다. 이미 다룬 GLM-5.3과 다른 모델입니다.

나온 것
1. GLM-5 시리즈 첫 네이티브 멀티모달이고, 총 320B·활성 18B입니다. Z.ai는 GLM-5.3-Flash를 GLM-5 시리즈의 첫 네이티브 멀티모달 모델로 소개합니다. 총 파라미터 320B, 활성 파라미터 18B입니다. 공식 글은 이 모델이 벤치마크와 실제 워크로드에서 GLM-5.2를 앞서며, 가격은 GLM-5.2의 10분의 1 수준이라고 적습니다. 코딩·에이전트 벤치에서는 Claude Opus 4.8에 근접한다고 적혀 있습니다. “더 싸서 성능도 낮다”는 문장으로 바꾸어 쓰지 않습니다. 원문이 적은 범위는 성능과 비용의 균형입니다.
2. 출시 전 이름은 ox-alpha였고, 그 주 가장 인기 있는 모델이었습니다. 공식 글은 출시 전에 OpenCode와 OpenRouter에서 익명으로 테스트했다고 밝힙니다. 그 이름이 ox-alpha입니다. 빠르게 그 주 가장 인기 있는 모델이 되었고, 그 트래픽 전부는 중국 AI 칩에서 서빙되었다고 적혀 있습니다. 제목의 “옥 알파”는 이 익명 이름을 가리킵니다. 다른 벤더의 익명 모델과 섞어 적지 않습니다. 인기 순위 문장은 Z.ai가 공식 글에 적은 주장입니다. 우리가 다시 집계한 순위가 아닙니다.
3. Artificial Analysis Intelligence Index v4.1.1에서 57점, 할인 기준 작업당 0.045달러입니다. 공식 글은 AA Intelligence Index v4.1.1에서 점수 57, 할인된 작업당 비용 0.045달러라고 적습니다. 같은 문장은 이 수준의 지능이 예전에는 대략 10배 비용에서나 가능했다고 적습니다. 이 글에서 인용하는 달러 숫자는 이 AA 작업당 수치와, GLM-5.2 대비 10분의 1 가격 주장뿐입니다. 백만 토큰당 입력·출력 단가를 여기서 만들지 않습니다. 2차 보도에 나온 다른 단가도 오늘 본문에 넣지 않습니다.
4. 코딩·에이전트 표에서 GLM-5.2를 크게 앞서고, Opus 4.8에 가깝습니다. 공식 글이 적은 비교만 옮깁니다. DeepSWE v1.1은 63.4 대 46.2, AutomationBench는 48.8 대 26.2입니다. 비교 대상은 GLM-5.2입니다. Z.ai Code Bench v1.0을 Claude Code 2.1.207에서 돌린 결과에서는, 최대 노력(max effort)에서 Claude Opus 4.8에 거의 근접합니다. 숫자는 29.0 대 29.5입니다. 코딩·에이전트 표의 Terminal Bench 2.1은 Flash 84.3, GLM-5.2 81.0, Opus 4.8 85.0입니다. DeepSWE는 Flash 63.4, GLM-5.2 46.2, Opus 4.8 58.0입니다. 표에 없는 칸을 채우지 않습니다. 우리 저장소에서 다시 돌린 점수가 아닙니다.
5. 하이브리드 어텐션·mHC·30T 멀티모달 사전학습, IndexPool로 효율을 줄였습니다. 아키텍처는 희소 어텐션과 선형 어텐션을 섞은 하이브리드입니다. Manifold-Constrained Hyper-Connections(mHC)를 도입했고, 사전학습 코퍼스는 30T 토큰 규모 멀티모달입니다. GLM-4.5 시리즈와 비교하면 총 파라미터는 비슷합니다. 320B 대 355B입니다. 활성 파라미터는 18B 대 32B로 거의 절반이고, 레이어 수는 45 대 92로 거의 절반입니다. IndexPool은 인덱서 키 벡터 네 개를 하나로 압축합니다. GLM-5.3과 비교하면 어텐션 연산은 3.0배 줄고, KV 캐시는 4.4배 작아진다고 적혀 있습니다. 비교군(DeepSeek-V4-Flash, Kimi-K3 포함) 가운데 어텐션 연산량이 가장 낮다고 공식 글이 적습니다. KV 캐시는 여전히 Kimi-K3·DeepSeek-V4-Flash보다 약간 크다고 스스로 적혀 있습니다.
6. 베이스 표·비전 코딩·중국 칩 서빙까지 같은 글에 적혀 있습니다. GLM-5.3-Flash-Base 표는 활성 18B·총 320B, MMLU 88.1, BBH 86.6, HellaSwag 87.1, LiveCodeBench-Base 37.6, SimpleQA 33.5입니다. 비교 열은 GLM-4.5-Base, GLM-5-Base, DeepSeek-V4-Flash-Base입니다. DeepSeek-V4-Flash-Base는 Z.ai 내부 평가 프레임워크로 돌렸다고 각주가 있습니다. 비전 쪽은 프론트엔드·게임·3D, CUA, 시각적 자기검증을 다룹니다. 서빙은 SGLang 위에 중국 칩용 전용 추론 엔진을 만들었고, GLM-5.3 기반 인프라 에이전트가 커널 작업에 도왔다고 적혀 있습니다. Encode–Prefill–Decode(EPD) 분리 아키텍처를 씁니다. 같은 하드웨어 초기 기준 대비 종단 서빙이 3배 개선되었고, 효율이 주류 NVIDIA GPU와 비교 가능하다고 Z.ai가 주장합니다. 그 비교는 벤더 주장입니다. 우리가 재현한 수치가 아닙니다.
7. Coding Plan 전원에게 열렸고, 할당량은 GLM-5.3의 3배입니다. 가중치도 공개되었습니다. 공식 글은 모든 GLM Coding Plan 사용자에게 롤아웃했다고 적습니다. 사용 가능 할당량은 GLM-5.3의 3배입니다. 시작 안내는 z.ai/subscribe입니다. ZCode에서는 Browser Use와 Computer Use로 멀티모달 에이전트 기능을 씁니다. 가중치는 Hugging Face에 공개되어 있습니다. 로컬은 SGLang, vLLM, TokenSpeed를 지원한다고 적혀 있습니다. 이 점은 이전에 다룬 GLM-5.3 API 공지와 다릅니다. 그 글에서는 오픈 웨이트가 아직이었습니다. 오늘 Flash 글은 Flash 가중치가 공개되었다고 적습니다. GLM-5.3 오픈 웨이트 일정을 이 글이 확정하지는 않습니다.

아닌 것
이미 올린 GLM-5.3 공지를 다시 쓴 글이 아닙니다. GLM-5.3은 “점수보다 조건표를 먼저 읽으세요”로 따로 다뤘습니다. Flash는 다른 모델입니다. 총 320B·활성 18B, 네이티브 멀티모달, 하이브리드 어텐션, ox-alpha 익명 테스트는 Flash 쪽 사실입니다. 두 모델 이름을 한 제목에 섞지 않습니다. 슬랙에 옛 5.3 글을 다시 올리지 말고, Flash URL을 붙이십시오.
백만 토큰당 API 단가표를 오늘 원문이 숫자로 준 것도 아닙니다. 오늘 본문이 인용하는 달러는 AA 할인 기준 작업당 0.045달러와, GLM-5.2 대비 10분의 1 가격 주장뿐입니다. 2차 보도의 다른 입력·출력 단가를 공식 숫자처럼 붙이지 않습니다. 견적서에 없는 단가를 넣지 않습니다.
표에 없는 칸을 채운 글도 아닙니다. Terminal Bench·DeepSWE·AutomationBench·Code Bench처럼 원문에 있는 숫자만 옮깁니다. 비어 있는 셀을 추측하지 않습니다. DeepSeek-V4-Flash-Base 점수는 Z.ai 내부 프레임워크 평가라고 각주가 있습니다. 그 점을 빼고 “외부 공인 점수”처럼 쓰지 않습니다.
GLM-5.3 오픈 웨이트가 오늘 풀렸다고 적힌 것도 아닙니다. 이 블로그가 공개 가중치를 말하는 대상은 GLM-5.3-Flash입니다. GLM-5.3 가중치 일정을 이 글로 확정하지 않습니다. Hugging Face에서 Flash를 받았다고 해서 5.3 웨이트도 같이 왔다고 쓰지 않습니다.
“중국 칩이 NVIDIA를 이겼다”를 우리 측정으로 단정한 글도 아닙니다. 공식 글은 같은 하드웨어 초기 기준 대비 3배 개선, 주류 NVIDIA GPU와 비교 가능한 효율이라고 적습니다. 벤더 주장입니다. 우리 클러스터에서 재현한 수치가 아닙니다. 하드웨어 비교 문장을 README 제목처럼 쓰지 않습니다.
오늘 할 일
첫째, 원문을 직접 읽으십시오. z.ai GLM-5.3-Flash 글(2026-08-26)에 파라미터, AA 지수, 코딩·에이전트 표, 베이스 표, 아키텍처, 서빙, Coding Plan 안내가 모두 있습니다. 요약 카드만 보고 모델 이름을 바꾸지 않습니다. GLM-5.3 문서와 탭을 섞어 열지 않습니다.
둘째, Coding Plan이 있으면 Flash를 켜고 할당량을 확인하십시오. 공식 글은 모든 Coding Plan 사용자에게 롤아웃했고, 사용 가능 할당량이 GLM-5.3의 3배라고 적습니다. 시작은 z.ai/subscribe입니다. 5.3과 Flash를 같은 기본값으로 두지 않습니다. 어느 모델을 켰는지 로그 첫 줄에 적습니다.
셋째, ZCode Browser Use·Computer Use로 한 화면을 끝까지 가 보십시오. 공식 글은 에이전트가 웹 페이지를 클릭하며 시각적으로 검증하고, 데스크톱 앱을 조작한다고 적습니다. 프론트엔드·게임·3D처럼 렌더 결과가 보이는 일 하나를 고릅니다. 텍스트만 되고 화면 검증이 빠지면 Flash의 멀티모달 주장을 팀에 옮긴 것이 아닙니다.
넷째, 로컬이 필요하면 Hugging Face 가중치와 SGLang·vLLM·TokenSpeed만 공식 목록으로 적으십시오. 다른 런타임을 “이미 된다”고 쓰지 않습니다. 공식 글은 나머지는 곧 준비된다고만 적습니다. 설치 성공 여부, 프레임워크 이름, 컨텍스트 길이를 한 줄에 남깁니다.
다섯째, 벤치 숫자를 README 점수처럼 붙이지 마십시오. DeepSWE 63.4, AutomationBench 48.8, Code Bench 29.0, Terminal Bench 84.3, AA 57은 원문·벤더·AA 쪽 숫자입니다. 우리 작업이 이어지는지만 적습니다. 백만 토큰 단가를 이 글에서 읽었다고 쓰지 않습니다. 인용할 달러는 작업당 0.045달러(할인)와 10분의 1 가격 주장뿐입니다.
여섯째, 만든 결과는 공개 링크로 남기십시오. Coding Plan 호출, ZCode 시각 검증, 로컬 서빙 중 하나를 다른 사람이 열 수 있는 주소로 올립니다. DAKER에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다. 스크린샷만 채팅에 남기고 주소를 비우지 않습니다.
실무에서 헷갈리기 쉬운 지점
GLM-5.3과 GLM-5.3-Flash를 한 줄에 묶지 않습니다. 5.3은 이전에 API·조건표 중심으로 다룬 모델입니다. Flash는 네이티브 멀티모달, 320B/18B, ox-alpha, Coding Plan 3배 할당량, Hugging Face 가중치가 같은 공지에 있습니다. 회의록에 모델 아이디를 하나만 적습니다. “5.3 계열”로 뭉개면 다음 사람이 호출 대상을 모릅니다.
AA 작업당 0.045달러와 토큰 단가를 같은 칸에 넣지 않습니다. 전자는 Artificial Analysis Intelligence Index v4.1.1의 할인 기준 작업당 비용입니다. 후자는 오늘 공식 블로그가 숫자로 주지 않은 항목입니다. 견적서에 토큰 단가가 필요하면 별도 공식 문서를 확인합니다. 확인 전에는 칸을 비웁니다.
베이스 표와 코딩·에이전트 표를 한 표로 합치지 않습니다. 베이스 표는 MMLU·BBH·HellaSwag·LiveCodeBench-Base·SimpleQA입니다. 코딩·에이전트 표는 Terminal Bench·DeepSWE·AutomationBench 등입니다. Code Bench 29.0은 Claude Code 2.1.207·최대 노력 조건입니다. 조건을 빼고 Opus 4.8을 “이겼다”고 쓰지 않습니다. 원문은 29.0 대 29.5로 거의 근접한다고 적습니다.
중국 칩 서빙 문장을 하드웨어 순위표로 바꾸지 않습니다. SGLang 전용 엔진, EPD 분리, 초기 기준 대비 3배, NVIDIA와 비교 가능 효율은 모두 공식 글의 문장입니다. 우리 클러스터 로그가 없으면 “검증 완료”라고 쓰지 않습니다. 인프라 에이전트가 커널을 도왔다는 문장도 벤더 설명입니다.
익명 테스트 기간의 인기를 제품 SLA로 읽지 않습니다. “그 주 가장 인기”는 출시 전 OpenCode·OpenRouter 피드백 문장입니다. 가동률·지연·한도를 그 문장에서 끌어내지 않습니다. 팀에 공유할 때는 날짜 2026-08-26과 URL을 같이 붙입니다.
한 페이지 요약
2026년 8월 26일 Z.ai 공식 글의 핵심만 다시 적습니다. OpenCode·OpenRouter의 ox-alpha는 GLM-5.3-Flash였습니다. GLM-5 시리즈 첫 네이티브 멀티모달이며 총 320B·활성 18B입니다. GLM-5.2보다 앞서고 가격은 10분의 1 수준이며, 코딩·에이전트에서 Claude Opus 4.8에 근접한다고 적혀 있습니다. AA Intelligence Index v4.1.1은 57점, 할인 기준 작업당 0.045달러입니다. DeepSWE v1.1은 63.4 대 46.2, AutomationBench는 48.8 대 26.2입니다. Code Bench 최대 노력은 29.0 대 Opus 4.8의 29.5입니다. Terminal Bench 2.1은 84.3 대 5.2의 81.0·Opus의 85.0입니다. 아키텍처는 하이브리드 어텐션·mHC·30T 멀티모달 사전학습·IndexPool입니다. GLM-5.3 대비 어텐션 연산 3.0배·KV 캐시 4.4배 감소입니다. 베이스 표는 MMLU 88.1 등입니다. 비전 코딩·CUA·시각 자기검증이 있고, 중국 칩에서 SGLang·EPD로 서빙하며 초기 대비 3배라고 적혀 있습니다. Coding Plan 전원 롤아웃, 할당량 GLM-5.3의 3배, Hugging Face 가중치, SGLang·vLLM·TokenSpeed가 안내되어 있습니다. 이미 다룬 GLM-5.3과 다른 모델입니다. 백만 토큰 단가는 이 글에서 만들지 않습니다. 원문 주소는 z.ai/blog/glm-5.3-flash 하나입니다. 확인이 끝난 호출·화면·로컬 결과는 공개 링크로 남깁니다. 그 링크가 제출입니다.
출처: Z.ai — GLM-5.3-Flash: Frontier Intelligence, Flash Cost (2026-08-26)