큐웬4 뼈대가 먼저 공개됐습니다 | DAKER 커뮤니티
Qwen 팀이 2026년 8월 Hugging Face 모델 카드와 블로그에 올린 소식은 한 줄입니다. Qwen3.8-Flash-Next가 Qwen4를 받칠 아키텍처의 실험 미리보기로 공개됐습니다. 원문은 Qwen3.8-Flash-Next 블로그와 Hugging Face 모델 카드입니다.

나온 것
1. Qwen3.8-Flash-Next는 Qwen4 아키텍처의 실험 미리보기입니다. 모델 카드는 This experimental preview of the architecture that will underpin Qwen4라고 적습니다. 블로그 인용 제목은 Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency이고, 월은 August, 연도는 2026입니다. 기술 보고 제목은 On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability이며 기관은 Alibaba Group입니다. 오늘 본문이 다루는 범위는 이 미리보기 공개입니다. GLM-5.3-Flash 옥 알파 소식과 한 제목에 묶지 않습니다. 팀에 공유할 때도 두 URL을 같이 고정하십시오.
2. 파라미터는 1,250억이고 활성은 60억이며, n-gram 임베딩 510억과 MTP 40억이 더 있습니다. 모델 카드 Number of Parameters 항목은 125B with 6B activated, plus 51B n-gram embedding and 4B MTP입니다. 히든 차원은 2560, 레이어는 48, 토큰 임베딩은 248320입니다. n-gram 항목 수는 20,000,000이고 2번 레이어의 바이그램·트라이그램이라고 적혀 있습니다. 네 숫자를 한 줄로 “1250억 모델”만 남기지 않습니다. 활성 60억과 n-gram 510억을 같은 활성 파라미터로 섞어 적지 않습니다. 모델 크기 표기 180B params는 카드 하단 Safetensors 표시입니다. 아키텍처 항목의 125B+51B+4B와 한 숫자로 합쳐 공식 파라미터라고 새로 정의하지 않습니다.
3. 컨텍스트는 기본 262,144 토큰이고, 1,000,000 토큰까지 늘릴 수 있다고 적혀 있습니다. 원문 문장은 Context Length: 262,144 natively and extensible up to 1,000,000 tokens입니다. 상용 쪽 안내 문장은 Qwen3.8-Flash가 Next를 바탕으로 한 공식 버전이며, 기본 1M 컨텍스트와 공식 내장 도구가 있다고 적습니다. Next와 Flash를 같은 제품으로 적지 않습니다. Next는 미리보기 가중치, Flash는 더 많은 상용 기능이 있는 공식 버전입니다. 긴 입력은 YaRN 등 RoPE 스케일 안내가 카드에 있습니다. 설정 값을 이 본문에서 임의로 바꾸지 않습니다.
4. 하이브리드 어텐션은 Gated DeltaNet과 Qwen Sparse Attention(QSA)입니다. QSA는 토큰 하나가 아니라 마이크로 블록 단위로 고른다고 적혀 있습니다. 긴 컨텍스트 지연을 줄이는 것이 목적이고, 에이전트 작업이 늘수록 이 이득이 중요하다고 적습니다. Gated Residual은 잔차 흐름을 읽기 게이트와 쓰기 게이트로 조절합니다. 분기는 4개, 병목 랭크는 320입니다. Mixture of Experts는 전문가 512명, 활성은 라우트 10 + 공유 1입니다. 레이아웃은 12 × (3 × (Gated DeltaNet → MoE) → 1 × (QSA → MoE))입니다. 블록 이름을 이 글에서 줄여 다른 모델 구조처럼 적지 않습니다.
5. n-gram 임베딩은 MoE보다 계산이 적고 오프로드에 맞다고 적혀 있습니다. 짧은 n-gram으로 색인해 메모리 제약이 있는 가속기에서 파라미터를 늘리는 축이라고 소개합니다. 학습 레시피는 가중치 종류에 Muon과 AdamW를 나누어 쓰고, 배치 워밍업 없이 목표 배치부터 시작한다고 적혀 있습니다. 옵티마이저 하이퍼파라미터 값을 이 본문에서 만들지 않습니다. 서빙은 Hugging Face Transformers, vLLM, SGLang, TokenSpeed와 맞다고 적혀 있습니다. 관리형 추론은 Qwen Cloud 공식 API를 가리킵니다.
6. 모델 유형은 비전 인코더가 있는 인과 언어 모델입니다. Type 항목은 Causal Language Model with Vision Encoder입니다. 학습 단계는 Pre-training & Post-training입니다. 기본은 사고 모드이고, 사고 내용을 남긴 뒤 답을 씁니다. reasoning_effort 기본은 xhigh이며 단계는 xhigh, medium, low입니다. enable_thinking, preserve_thinking으로 사고 동작을 조절한다고 적혀 있습니다. 사고 모드 샘플링은 temperature 1.0, top_p 0.95, top_k 20입니다. Instruct(비사고)는 temperature 0.7, top_p 0.80, top_k 20, presence_penalty 1.5입니다. 프레임워크마다 샘플링 지원이 다르다고 적혀 있습니다. 없는 온도를 공식 값처럼 추가하지 않습니다.
7. 모델 카드가 공개한 표 숫자는 카드 평가이며, 이 글이 다시 측정한 값이 아닙니다. 언어 표에서 SWE-bench Pro는 62.5, CoWorkBench는 73.9, GPQA Diamond는 91.7, LiveCodeBench v6는 91.9입니다. 비전 표에서 AndroidWorld는 84.5, LVBench는 76.6입니다. 각주는 하네스·온도·컨텍스트 256K 등 평가 조건을 적습니다. 빈 항목(--)은 아직 없거나 해당 없음입니다. 표의 비교 열(Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, Claude-Opus-4.6 Max)을 이 글이 재실험했다고 쓰지 않습니다. 점수를 반올림하거나 순위를 새로 매기지 않습니다. 상세 조건은 카드 각주를 확인하십시오.

아닌 것
GLM-5.3-Flash 옥 알파 공개를 다시 쓴 글이 아닙니다. 그 소식은 이미 따로 다룬 각도입니다. 오늘 제목과 원문은 Qwen3.8-Flash-Next입니다. 두 모델을 한 제목에 묶지 않습니다.
DeepSeek-V4-Flash-Vision-Exp 발표 글도 아닙니다. 카드 비교 열에 DeepSeek-V4-Flash-0731 점수가 있어도, 그 모델 출시 공지를 오늘 본문으로 옮기지 않습니다. 비교 열 숫자를 DeepSeek 공식 발표처럼 적지 않습니다.
Qwen3.8-Flash 상용 버전의 모든 기능이 Next와 같다는 공지가 아닙니다. 카드는 Flash가 Next를 바탕으로 한 공식 버전이며, 기본 1M 컨텍스트와 공식 내장 도구가 있다고 적습니다. Next 가중치만 받아 상용 Flash와 같다고 팀에 알리지 않습니다.
제3자 독립 벤치마크 재측정이 아닙니다. 표는 모델 카드가 공개한 값입니다. 각주가 적은 하네스와 온도를 빼고 점수만 옮기지 않습니다. 없는 벤치마크 이름을 추가하지 않습니다.
기본 컨텍스트가 이미 100만이라는 문장도 Next에 해당하지 않습니다. Next의 기본은 262,144이고, 100만은 확장 가능 상한입니다. 기본 1M은 Flash 상용 안내에 있습니다. 두 숫자를 한 제품의 기본값으로 섞지 않습니다.
사고 모드를 끄면 항상 더 빠르고 더 정확하다는 공지도 아닙니다. 카드는 멀티턴 에이전트에서 낮은 추론이 턴당 응답은 빠를 수 있으나, 분석 부족·재시도로 총 지연과 토큰이 늘 수 있다고 적습니다. 기본 xhigh를 임의로 low로 바꿔 공식 설정처럼 적지 않습니다.
오늘 할 일
첫째, 원문 두 곳을 순서대로 읽으십시오. Qwen3.8-Flash-Next 블로그와 Hugging Face 모델 카드에서 125B·6B 활성·51B n-gram, 262,144→1,000,000, QSA, Next와 Flash 구분을 표시해 두십시오. 요약 카드만 보고 가중치를 받지 않습니다.
둘째, Next와 Flash를 표로 나누십시오. Next는 실험 미리보기 가중치입니다. Flash는 Next 기반 공식 버전이고 기본 1M과 내장 도구가 있다고 적혀 있습니다. 같은 체크리스트에 한 줄로 합치지 않습니다. 관리형 추론이 필요하면 카드가 가리키는 Qwen Cloud를 확인합니다.
셋째, 서빙은 카드가 권한 엔진 가운데 하나로 한 번만 올리십시오. 예는 vLLM, SGLang, TokenSpeed입니다. 샘플링은 사고 모드와 Instruct 값을 섞지 않습니다. reasoning_effort 기본 xhigh를 바꾸면 바꾼 이유를 한 줄로 남깁니다. 100만이 필요하면 카드의 YaRN 안내를 따르고, 짧은 입력에 같은 factor를 기본으로 두지 말라는 주의도 같이 읽습니다.
넷째, 점수를 인용할 때는 카드 표와 각주를 같이 적으십시오. SWE-bench Pro 62.5, GPQA Diamond 91.7처럼 숫자만 옮기고 하네스를 빼지 않습니다. 빈 항목을 0점처럼 채우지 않습니다. 이 글이 재측정했다고 쓰지 않습니다.
다섯째, 비전 입력이 필요하면 카드의 이미지·영상 예를 한 번만 재현하십시오. 유형이 비전 인코더 포함 인과 언어 모델이라는 문장을 과제 범위에 그대로 옮깁니다. 영상 longest_edge 권장값은 카드가 긴 영상에 적습니다. 그 값을 짧은 클립의 기본처럼 적지 않습니다.
여섯째, 호출 로그·설정 파일·짧은 재현 가운데 하나를 공개 링크로 남기십시오. DAKER에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다. 스크린샷만 채팅에 남기고 주소를 비우지 않습니다. API 키를 링크에 넣지 않습니다.
한 페이지 요약
Qwen 팀은 Qwen3.8-Flash-Next를 Qwen4를 받칠 아키텍처의 실험 미리보기로 공개했습니다. 원문은 https://qwen.ai/blog?id=qwen3.8-flash-next와 https://huggingface.co/Qwen/Qwen3.8-Flash-Next입니다. 파라미터는 125B, 활성 6B, n-gram 임베딩 51B, MTP 4B입니다. 기본 컨텍스트는 262,144 토큰이고 1,000,000까지 확장할 수 있습니다. 구조는 Gated DeltaNet과 QSA 하이브리드, Gated Residual, n-gram 임베딩, 전문가 512·활성 10+1입니다. 유형은 비전 인코더가 있는 인과 언어 모델이고, 기본은 사고 모드·reasoning_effort xhigh입니다. Qwen3.8-Flash는 Next 기반 공식 버전으로 기본 1M과 내장 도구가 있다고 적혀 있습니다. 카드 표의 SWE-bench Pro 62.5, GPQA Diamond 91.7 등은 카드 평가이며 이 글의 재측정이 아닙니다. GLM 옥 알파 재탕도, DeepSeek 발표 전재도 아닙니다. 오늘 할 일은 원문 확인, Next·Flash 구분, 서빙 한 번, 점수 인용 규칙, 비전 재현, 공개 링크 제출입니다. 확인이 끝난 결과는 링크로 남깁니다. 그 링크가 제출입니다.
출처: Qwen — Qwen3.8-Flash-Next (2026-08) · Hugging Face — Qwen/Qwen3.8-Flash-Next