Z.ai GLM Infra Agent — 10만 장 국산 가속기 위에 Flash 서빙을 2주 만에 올렸습니다 | DAKER 커뮤니티
모델이 스스로 서빙 스택을 고치기 시작하면, 인프라 팀의 하루가 달라집니다. Z.ai가 9월 17일 공개한 연구 글은 GLM Infra Agent가 GLM-5.3-Flash의 추론 인프라를 국산 AI 가속기 10만 장 규모 클러스터 위에 올린 과정을 담고 있습니다. 첫 기동부터 프로덕션까지 2주도 채 걸리지 않았고, 종단 처리량은 초기에 비해 약 3배가 됐다고 합니다. 이 글에서는 공식 글이 밝힌 사실과, 숫자 밖으로 남겨 둔 한계를 함께 읽습니다.
무엇을 만들었나
목표는 새 하드웨어에서 모델을 처음 돌리는 수준이 아니라, 실제 트래픽을 받을 프로덕션급 추론 서비스였습니다. 모든 프로덕션 추론이 중국산 가속기 10만 장 이상 클러스터에서 돌아간다고 적혀 있습니다. 칩 메모리·대역폭 제약, 1M 컨텍스트, 멀티모달 요청, 미성숙한 커널 생태계를 동시에 넘겨야 했습니다.
출시 직후 OpenCode와 OpenRouter에 Ox-Alpha라는 익명 이름으로 올라간 Flash는 6일 동안 62조 토큰 이상을 처리하며 두 플랫폼에서 가장 많이 쓰인 모델이 됐다고 Z.ai는 썼습니다. 이 숫자는 업체 보고이며, 독립 벤치마크 표와는 별개입니다.
밀집 피드백이 핵심이었다
글의 중심 주장은 “강한 코딩 모델”만으로는 부족하고, 에이전트가 다음 행동을 고를 수 있게 피드백을 잘게 쪼개야 한다는 것입니다. 정확도 테스트, 런타임 로그, 실행 트레이스, 마이크로벤치, 종단 지표를 가설에 맞게 고르게 했습니다.
종단 지표는 나빠졌다는 사실만 알려 줍니다. 어느 계층이 원인인지는 국소 피드백이 답합니다.
사례로 KDA 커널의 Context Parallel 경로에서 TF32 누적 오차를 찾아 input_precision을 tf32x3로 고친 일, DeepEP가 GIL을 붙잡은 탓에 KV Transfer가 겹치지 못하던 문제를 고친 일, 타일 병합으로 중복 연산을 줄인 일이 나옵니다. 엔지니어는 목표와 경계를 정하고 위험 변경을 검토하며, 에이전트는 가설·패치·실험을 반복합니다.
우리 팀에 남기는 질문
국내 팀이 같은 규모의 국산 가속기 클러스터를 갖고 있지 않더라도, 방법론은 옮길 수 있습니다. 에이전트에게 저장소만 주지 말고, “이 시나리오에서 Prefill+KV Transfer 성능 저하 5% 이내”처럼 검증 가능한 제약을 주세요. 커널·스케줄·통신을 한 로그에 섞지 말고, 가설마다 맞는 관측을 붙입니다.
목표·경계·위험 판단은 사람이 잡고, 에이전트는 그 안에서 실험한다.
Z.ai도 RSI(재귀적 자기 개선)에 아직 도달하지 않았다고 분명히 적었습니다. 과장된 “AI가 인프라를 접수했다” 헤드라인보다, 피드백 루프를 제품화한 엔지니어링 후기로 읽는 편이 정확합니다.
최적화 기법으로는 노드 내부 텐서 병렬, ReplaySSM, W8A8, 혼합 정밀도 캐시, Encode-Prefill-Decode 분리 구조가 언급됐습니다. 하드웨어 이용 효율과 토큰당 비용이 주류 NVIDIA GPU와 비슷한 수준에 도달했다고도 적혀 있습니다. 이 역시 업체 주장으로, 독립 측정표와 나란히 두고 읽어야 합니다.
마치며
이 소식의 실무 포인트는 새 Flash 단가가 아니라, 에이전트가 고칠 수 있게 관측을 설계했느냐입니다. 다음 스프린트에서 마이크로벤치 하나와 실패 시나리오 하나를 에이전트 워크플로에 넣어 보시면 됩니다. 여러분 팀의 추론·서빙 개선은 어떤 피드백부터 잘게 쪼개고 계십니까?
출처
- Z.ai, Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure (2026년 9월 17일): https://z.ai/blog/glm-built-its-inference-infrastructure