SKT가 에이전트용 688B 오픈웨이트를 공개합니다 | DAKER 커뮤니티
2026년 8월 31일 SK Telecom(SKT)이 에이전트 응용을 위해 처음부터 학습한 688B 파라미터 MoE 오픈웨이트 A.X K2 기술 보고서를 arXiv에 공개했습니다. 토큰마다 활성은 33B입니다. A.X K1의 후속이며, 총 학습 토큰은 약 8.5T(사전학습 약 8.2T)로 K1의 약 10T보다 적습니다. 더 작고 품질이 높은 혼합에 에이전트·소프트웨어 공학 데이터를 늘렸습니다. K1 대비 전 구간에서 개선되고, 일부 벤치에서는 30퍼센트포인트 이상 올랐습니다. Hugging Face에 가중치가 공개되어 있습니다.
논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30181에서 확인할 수 있습니다. 영문 제목은 A.X K2 Technical Report입니다. 저자는 SK Telecom(SKT)입니다. PDF는 같은 번호의 pdf입니다. 가중치는 Hugging Face skt/A.X-K2에 있습니다. 한국 주권 AI(과학기술정보통신부·정보통신산업진흥원 과제 PJT-26-010018)로 표기되어 있습니다. 오늘 본문은 제공된 사실 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
에이전트용으로 처음부터 학습합니다
A.X K2는 688B 파라미터 MoE이고 활성은 33B입니다. 에이전트 응용을 목표로 처음부터 학습했습니다. 구조는 61계층, 헤드 64, 은닉 7168, 라우팅 전문가 256개 중 활성 8개, 공유 전문가 1개, 어휘 163840, 문맥은 네이티브 128K이며 YaRN으로 256K입니다. NVIDIA B200 512장에서 약 70일 학습했습니다.
Think-Fusion으로 사고 모드와 비서고 모드를 한 모델에 통합했습니다. Sparse Gated Attention(SGA)과 Gated Norm(GN)을 씁니다. SGA는 자체 희소 top-k에 대한 인덱서 워밍업으로 네이티브 128K를 지원하며, 밀집 대비가 아닙니다. 각 쿼리는 2,048개 위치를 읽습니다. RULER 전체는 256K까지 94.6입니다. LongBench는 SGA 이전 62.80에서 이후 62.99입니다.
DACON과 DAKER 팀이 에이전트 데모를 올릴 때는 “총 파라미터”와 “활성 33B”와 “문맥 128K/256K”를 한 항목에 섞지 마십시오. K1 대비 토큰을 줄이고 품질·에이전트 데이터를 늘린 선택도 README에 한 줄로 남깁니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 에이전트용으로 설계·학습한 오픈웨이트를, 제출 표의 모델 항목에 같은 형식으로 적습니다.
사고 모드 벤치와 한국어 축
사고 모드 Table 6에서 K1·Qwen3.5-397B-A17B와 비교합니다. AIME26은 97.1(K1 91.3, Qwen 92.5), Apex 45.8(K1 1.0, Qwen 13.5), KMMLU-Pro 80.5(K1 68.9, Qwen 78.4), CLIcK 91.6(K1 85.3, Qwen 88.4), KoBALT 73.0(K1 51.0, Qwen 69.9)입니다. LiveCodeBench v6 84.0(K1 74.9, Qwen 82.6), HLE 27.8(K1 8.3), GPQA Diamond 85.6(K1 76.4, Qwen 89.3), IFBench 75.9(K1 63.2, Qwen 78.8), AA-LCR 66.0(K1 26.0)입니다.
GDPval Elo는 1031(K1 500)입니다. τ²-Bench Telecom은 98.0(K1 86.0, Qwen 95.6)으로 비교군 중 최고입니다. Terminal Bench v2.1은 36.0으로 Qwen 51.3보다 낮아 격차가 남습니다. IMO 2025는 35/42로 금메달 기준선에 해당하고, 앞 다섯 문제는 7/7입니다. KMO26 2차 라운드는 8문제 모두 맞혔습니다.
KS-Eval은 Common Sense 57.45, Instruction Following 71.67(비교군 중 1위), Long Context 66.85, STEM 75.47입니다. K1 대비 이득은 각각 +19.47, +27.98, +27.11, +13.46퍼센트포인트입니다. 제조 벤치 전체 F1은 69.0(Qwen 67.4)이고, 기권 F1 61.1이 앞서며, 사용자 주장 67.8·문서 주장 41.4입니다.
서빙 메모리와 안전
GN 덕분에 4비트 NVFP4 서빙이 FP8과 한 점 안쪽으로 가깝습니다. Table 14에서 NVFP4 78.19 대 FP8 78.95로 99.0%를 유지하고, 하락은 0.76입니다. 메모리는 K1 BF16 1038GB, K2 FP8 646GB, NVFP4 370GB입니다. 해커톤 인프라 표에는 정밀도별 GB를 나란히 적습니다.
레드팀 ASR은 비서고 12.1(K1 59.4, Qwen 21.9)로 낮고, 사고 모드는 33.9로 Qwen 21.0보다 높습니다. 사고 모드만 켜고 안전 항목을 비우지 마십시오. 모드별로 ASR을 분리해 적습니다.
DAKER 월간 해커톤과 DACON 제출에서는 Hugging Face 주소와 정밀도·활성·문맥을 같은 페이지에 둡니다. 배포가 제출입니다. 올린 링크가 제출입니다. Terminal Bench처럼 아직 뒤지는 축을 숨기지 말고 표에 “갭”으로 남깁니다.
빌더 팀에 옮기는 점검
팀이 오늘 할 일은 K2를 “688B 오픈웨이트”로만 적지 말고, 활성 33B·SGA 128K·Think-Fusion·NVFP4 370GB를 체크리스트로 두는 것입니다. 에이전트 데모 README에 τ²-Bench Telecom 최고와 Terminal Bench 갭을 한 표에 같이 적습니다.
한국어 축(KMMLU-Pro·CLIcK·KoBALT·KS-Eval)을 영문만 보는 표와 분리하십시오. Instruction Following 71.67이 비교군 1위라는 사실을, 우리 프롬프트 회귀 테스트의 형식만 복제하는 데 씁니다. 초록 숫자를 우리 실측처럼 쓰지 않습니다.
학습 토큰이 K1보다 적은데도 전 구간 개선·일부 30퍼센트포인트 이상이라는 문장을 팀 회고에 넣습니다. “더 오래 학습”만이 답이 아니라는 신호입니다. 데이터 혼합·에이전트·SW 공학 비중을 우리 데이터 카드에 적습니다.
서브에이전트를 돌리는 팀이면 메인 모델 항목에 K2 사고/비서고를 나누고, 도구 호출 로그 URL을 공개합니다. SGA가 쿼리당 2,048 위치를 읽는다는 점을 긴 로그 설계에 반영하되, 없는 지연 숫자를 만들지 않습니다.
주권 AI 과제 번호를 출처 줄에 두면 재현 문서가 분명해집니다. PJT-26-010018과 arXiv 번호를 같은 줄에 둡니다. 다른 팀 데모를 받을 때도 HF 주소가 없으면 모델 항목을 비웁니다.
에이전트 해커톤에서 Think-Fusion을 쓸 때는 사고 모드와 비서고 모드의 제출 로그를 날짜별로 나눕니다. 같은 프롬프트라도 모드가 바뀌면 τ²-Bench Telecom·Terminal Bench·레드팀 ASR이 같이 움직입니다. 팀 회고에는 “모드 고정 주”와 “모드 비교 주”를 캘린더에 적습니다. K1 대비 30퍼센트포인트 이상 오른 축이 있어도 Terminal Bench 36.0 대 Qwen 51.3 갭을 같은 주에 점검합니다.
서빙 표를 만들 때는 BF16 1038GB(K1)·FP8 646GB·NVFP4 370GB를 인프라 예산 항목에 나란히 둡니다. GN이 NVFP4를 FP8 대비 99.0%로 유지한다는 문장을 용량 계획 문서에 인용할 때는 Table 14와 하락 0.76을 같이 적습니다. 없는 토큰 단가를 붙이지 않습니다.
한국어 Sovereign AI 과제 번호 PJT-26-010018을 내부 위키 출처에 두면, 나중에 가중치 카드를 갱신할 때 arXiv와 HF 주소를 한 줄에서 추적할 수 있습니다. 서브에이전트 풀에 K2를 넣을 때는 활성 33B와 문맥 128K·256K YaRN을 Worker 고정본 옆에 적습니다.
이 글이 아닌 것입니다
모든 벤치에서 Qwen3.5-397B-A17B를 이긴다는 주장이 아닙니다. GPQA Diamond·IFBench·Terminal Bench처럼 Qwen이 앞서는 지표가 있습니다.
토큰을 줄이면 항상 성능이 오른다는 법칙이 아닙니다. K2는 약 8.5T로 K1 약 10T보다 적지만, 품질·에이전트 데이터 확장이 함께 있습니다.
NVFP4가 FP8과 완전 동일하다는 보증이 아닙니다. Table 14 기준 78.19 대 78.95, 유지율 99.0%, 하락 0.76입니다.
사고 모드가 항상 더 안전하다는 주장이 아닙니다. 레드팀 ASR은 비서고 12.1·사고 33.9입니다.
특정 제품 출시 행사 공지가 아닙니다. 기술 보고서·오픈웨이트·벤치 숫자 안내입니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.30181와 pdf를 같은 탭에 둡니다. 요약 카드만 보고 K2를 정의하지 않습니다. SKT와 제출일 2026-08-31을 메모 첫 줄에 적습니다.
둘째, Hugging Face 가중치를 북마크하십시오. skt/A.X-K2와 카드·라이선스를 저장합니다. 다운로드만 하고 출처 URL을 비우지 않습니다.
셋째, 모델 카드에 총·활성·문맥·정밀도 GB를 쓰십시오. 688B / 33B / 128K·256K / FP8 646GB·NVFP4 370GB를 나눕니다. DAKER 해커톤이나 DACON 제출 가운데 하나에 맞춥니다.
넷째, Table 6·KS-Eval·제조·레드팀 표를 형식으로만 복제하십시오. 초록 숫자를 우리 점수처럼 쓰지 않습니다. 앞선 지표와 갭 지표를 같은 날짜에 적습니다.
다섯째, Think-Fusion 모드별 안전 항목을 만드십시오. 비서고·사고 ASR을 분리합니다. 모드를 바꾼 실험과 프롬프트만 바꾼 실험을 섞지 않습니다.
여섯째, SGA·GN·구조 표를 README에 남기십시오. 61계층·256/8 전문가·쿼리당 2,048 위치·RULER 94.6을 출처와 함께 적습니다.
일곱째, HF 주소와 점검 표를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2608.30181 — A.X K2 Technical Report (2026-08-31) · PDF · Hugging Face