토큰마다 6B를 켜도 397B급 전작을 따라잡습니다 | DAKER 커뮤니티

2026년 8월 31일 Qwen Team이 Qwen3.8-Flash-Next 아키텍처 설계 논문을 arXiv에 공개했습니다. 모델은 희소 MoE 총 125B 규모이며 토큰마다 활성 파라미터는 6B입니다. 가속기 밖에 두는 n-gram 임베딩 테이블 51B가 추가로 있습니다. 비교 대상인 전작 397B-A17B(Qwen3.7-Plus)보다 활성 파라미터·학습 토큰은 약 1/3, 학습 FLOPs는 약 1/9인데도 사전학습 벤치마크 열네 개 가운데 여덟에서 앞서고, 나머지 여섯에서는 최대 2.6점 차이로만 뒤집니다. 오늘 팀은 “큰 모델만”이 아니라 “무엇을 켜고 무엇을 호스트에 둘지”를 표에 적어야 합니다.

토큰마다 6B를 켜도 397B급 전작을 따라잡습니다

논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30320에서 확인할 수 있습니다. 영문 제목은 On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability입니다. 저자 표기는 Qwen Team이며, 핵심 기여자로 Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bo Zheng, Dayiheng Liu가 적혀 있습니다. PDF는 같은 번호의 pdf입니다. FlashQLA 코드는 GitHub QwenLM/FlashQLA에 공개되어 있습니다. 오늘 본문은 제공된 사실 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

토큰마다 6B를 켜도 397B급 전작을 따라잡습니다 본문

활성 6B와 호스트 n-gram을 나눕니다

Qwen3.8-Flash-Next는 희소 MoE로 총 파라미터가 125B이고, 토큰마다 켜지는 양은 6B입니다. 백본 밖 용량으로 단일 n-gram 임베딩 계층이 있으며, 테이블은 호스트 메모리에서 미리 가져옵니다. 가속기 밖에 51B 분량의 n-gram 임베딩 테이블을 둔다는 점이 설계의 한 축입니다. 전작 397B-A17B와 비교하면 활성 파라미터와 학습 토큰은 대략 1/3, 학습 FLOPs는 대략 1/9입니다.

평가 축은 세 가지입니다. 손실과 다운스트림 성능, 학습·프리필·디코드 비용, 최적 하이퍼파라미터와 학습 안정성에 미치는 영향입니다. 손실과 정확도가 항상 같은 방향으로 움직이지는 않습니다. n-gram 어휘를 키우면 손실은 단조롭게 낮아지지만, 다운스트림은 포화합니다. 팀이 학습 곡선만 보고 제출 품질을 적으면 이 불일치를 놓칩니다.

DACON과 DAKER처럼 짧은 기간에 모델을 고르고 데모를 올리는 자리에서는, “총 파라미터”와 “토큰당 활성”과 “호스트에 둔 테이블”을 한 항목에 섞지 마십시오. 오늘 팀이 가져갈 한 줄은 이것입니다. 활성 6B로 397B급 전작을 따라잡는 설계를, 우리 제출 README의 모델 항목에 같은 형식으로 적습니다.

GDN 혼합과 QSA로 토큰을 섞습니다

토큰 혼합은 계층별 하이브리드입니다. Gated DeltaNet(GDN)과 전역 어텐션을 섞고, 네 계층마다 전역 어텐션 하나를 둡니다. 계속 사전학습 단계에서는 전역 어텐션 계층을 Qwen Sparse Attention(QSA)으로 바꿉니다. QSA는 압축된 가벼운 인덱서로 마이크로 블록을 점수화합니다. 1M 문맥에서 QSA는 커널 기준으로 밀집 어텐션 대비 프리필 7.6배, 디코드 4.9배 빠릅니다.

잔차는 네 갈래로 넓히고, 원소별 게이트를 쓰는 Gated Residual(GR)입니다. 아키텍처와 Muon 옵티마이저는 최적 학습률과 배치 크기를 위로 옮기고, 배치 크기 워밍업을 불필요하게 만들며, 스트레스 테스트에서 안정성을 높입니다. 이전 구조는 최적 학습률의 4배에서 자주 튀는데, 새 조합은 안정적입니다. 전체 규모 학습에서 손실 스파이크가 한 번도 없었고, qk-clip이나 SwiGLU-clip도 쓰지 않았습니다.

GDN 하이브리드 제거 실험(25B-A3B)에서 평균은 53.81이고, 전역 어텐션만은 49.87, SWA는 51.15입니다. QSA와 전역 어텐션 평균은 76.8 대 75.9입니다. RULER 512K–1M은 93.00 대 90.08입니다. FlashQLA는 GPU에서 Triton 기준 대비 순전파 2–3배, 역전파 약 2배입니다.

Table 11 숫자만 표로 옮깁니다

Flash-Next-Base / Qwen3.8-27B-Base / Qwen3.7-Plus-Base 순으로 옮깁니다. MMLU 90.36 / 87.51 / 90.43, MMLU-Pro 73.23 / 68.60 / 70.90, SuperGPQA 51.36 / 44.86 / 48.42, BBH 90.87 / 89.56 / 89.41, GPQA 51.42 / 45.01 / 51.52입니다. GSM8K 93.29 / 93.18 / 92.95, MATH 72.78 / 60.54 / 74.38, EvalPlus 78.76 / 76.05 / 78.06, MultiPL-E 79.09 / 74.50 / 81.68입니다.

SWEBench-Pretrain 50.99 / 41.66 / 49.24, MGSM 89.33 / 86.37 / 85.42, MMMLU 84.86 / 79.74 / 84.53, INCLUDE 78.40 / 74.37 / 78.90입니다. Flash-Next가 27B 밀집보다 여러 축에서 앞서고, Plus-Base와는 과제마다 앞뒤가 갈립니다. MATH처럼 Plus가 앞서는 지표도 있습니다. 없는 순위를 붙이지 않습니다. 표에 적힌 숫자만 옮깁니다.

해커톤 제출 문서에는 “우리 점수가 초록 Table 11과 같다”고 쓰지 마십시오. 같은 벤치 이름과 같은 비교 열만 복제합니다. DAKER 월간 해커톤 README의 모델 항목에 총 파라미터·활성·호스트 테이블·문맥 처리를 나누어 적습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 모델 카드에 “토큰당 활성 6B”와 “호스트 n-gram 51B”를 분리해 적는 것입니다. 총 125B만 적으면 Flash-Next의 설계 의도가 가려집니다. 학습 안정성 항목에는 Muon, 최적 학습률·배치 상향, 배치 워밍업 불필요, 손실 스파이크 없음을 한 줄로 남깁니다.

긴 문맥 데모를 올릴 때는 QSA의 1M 프리필·디코드 배속을 우리 실측처럼 쓰지 말고, 출처에 arXiv 번호를 둡니다. FlashQLA 저장소를 클론한 뒤에는 Triton 대비 배수 측정 조건을 README에 적습니다. DACON 알고리즘 대회와 DAKER 바이브코딩 해커톤 모두, 다른 사람이 열 수 있는 주소에 측정 로그를 둡니다.

손실만 내려간다고 제출을 서두르지 마십시오. n-gram 어휘 확대가 손실을 낮추면서 다운스트림이 포화한다는 보고를 팀 회고에 넣습니다. 하이퍼파라미터 표를 주간으로 고정하고, 아키텍처를 바꾼 주와 옵티마이저만 바꾼 주를 섞지 않습니다.

전작 397B-A17B와의 비교 문장을 쓸 때는 “약 1/3 활성·토큰, 약 1/9 FLOPs”와 “열네 개 중 여덟에서 선행, 나머지 최대 2.6점 차”를 같이 둡니다. 한쪽만 적으면 과장입니다. 우리 내부 A/B에도 같은 쌍 비교 형식을 씁니다.

Controller·Worker를 나누는 팀이면, 모델 선택 표에 Flash-Next식 “활성/호스트 분리” 항목을 추가하십시오. 루프 지시와 모델 카드가 한 프롬프트에 섞이면 재현이 깨집니다. 지시 커밋 해시와 모델 카드 해시를 나란히 적습니다.

이 글이 아닌 것입니다

모든 과제에서 397B 전작을 이긴다는 주장이 아닙니다. 열네 개 사전학습 벤치 중 여덟에서 앞서고, 나머지 여섯은 최대 2.6점 차로 뒤집니다.

활성 6B만으로 125B 전체가 한 번에 돌아간다는 설명이 아닙니다. 토큰마다 켜지는 양이 6B이고, n-gram 테이블 51B는 호스트에 둡니다.

손실이 내려가면 다운스트림도 항상 오른다는 법칙이 아닙니다. n-gram 어휘를 키우면 손실은 단조 감소하고 다운스트림은 포화합니다.

FlashQLA가 모든 하드웨어에서 2–3배라는 보증이 아닙니다. GPU에서 Triton 기준 대비 순전파 2–3배·역전파 약 2배라는 보고입니다.

특정 대회 우승 공지가 아닙니다. 아키텍처·효율·안정성 논문과 공개 커널 코드 안내입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.30320pdf를 같은 탭에 둡니다. 요약 카드만 보고 Flash-Next를 정의하지 않습니다. Qwen Team과 제출일 2026-08-31을 메모 첫 줄에 적습니다.

둘째, FlashQLA 코드를 북마크하십시오. QwenLM/FlashQLA와 라이선스·README를 저장합니다. 클론만 하고 출처 URL을 비우지 않습니다.

셋째, 모델 카드에 총·활성·호스트 테이블을 세 항목으로 쓰십시오. 125B / 6B / 51B n-gram을 분리합니다. DAKER 월간 해커톤이나 DACON 코드 제출 과제 가운데 하나에 맞춰 적습니다.

넷째, Table 11 비교 열을 우리 표 형식으로만 복제하십시오. Flash-Next-Base·27B-Base·Plus-Base 숫자를 우리 실측처럼 쓰지 않습니다. 벤치 이름과 열 구조만 가져옵니다.

다섯째, 학습 안정성 점검을 한 페이지로 적으십시오. Muon, 학습률·배치 상향, 워밍업 생략, 스파이크 없음을 체크리스트로 둡니다. qk-clip·SwiGLU-clip 미사용도 메모합니다.

여섯째, 긴 문맥 측정 조건을 README에 남기십시오. QSA 1M 프리필 7.6배·디코드 4.9배는 커널 수준 보고입니다. 우리 환경 실측과 섞지 않습니다.

일곱째, 분리된 모델 카드와 측정 로그를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.30320 — On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability (2026-08-31) · PDF · FlashQLA