2.4조 웨이트가 공짜로 풀렸다 | DAKER 커뮤니티

이번 주에 중국발 대형 모델 소식이 두 개입니다. 커뮤니티에 딥시크 글이 이미 있습니다. 프리뷰가 끝나고 V4-Pro가 정식이 됐다는 그 이야기입니다. 오늘은 그 글이 아닙니다. 알리바바 큐웬 팀이 Max급 오픈 웨이트를 공개했습니다. 모델 이름은 Qwen3.8-2.4T-A95B입니다. 클라우드 API는 8월 초부터 있었고, 이번 주는 웨이트 파일 다운로드입니다.

이 구분을 놓치면 오늘 작업을 잘못된 경로에 붙입니다. 딥시크는 프리뷰를 종료하고 정식 API를 연 쪽입니다. 큐웬은 이미 서비스 중이던 클라우드 Max의 핵심 웨이트를, 처음으로 받을 수 있는 파일로 공개한 쪽입니다. 둘 다 중국발 플래그십이고, 둘 다 에이전트를 말합니다. 다만 오늘 다루는 대상은 다릅니다. 웨이트를 받았다고 제출했다고 쓰지 않습니다. 배포가 제출입니다. 여기서 제출은 올린 링크입니다.

무엇이 공개됐습니다

큐웬 공식 저장소 QwenLM/Qwen3.8 변경 기록의 날짜는 다음과 같습니다. 2026년 8월 12일, Qwen3.8-2.4T-A95B가 Hugging Face랑 ModelScope에 올라왔습니다. 공식 페이지는 세 곳입니다. 블로그 qwen.ai/blog?id=qwen3.8, 허브 Qwen/Qwen3.8-2.4T-A95B, 그리고 ModelScope 같은 이름.

클라우드 쪽이 더 빨랐습니다. 알리바바 클라우드 커뮤니티 글은 8월 3일, Qwen3.8-Max를 QwenCloud API로 공식 출시한다고 썼습니다. 그때 문장은 분명했습니다. 웨이트는 다음 주에 공개한다고 했습니다. 그 다음 주가 이번 주입니다. 클라우드 API가 먼저 공개되고, 웨이트 파일이 그다음에 나온 순서입니다. 이 순서를 바꿔 말하지 않습니다.

모델 카드에 적힌 사양은 이렇습니다. 총 파라미터 2.4조, 토큰마다 활성화 950억. 레이어 92개. 히든 차원 8192. MoE 전문가 512개, 토큰마다 라우팅 10개랑 공유 1개. 하이브리드 백본은 23번 반복되는 블록이고, 한 블록 안에서 게이트 델타넷(선형 어텐션)이 세 번, 게이트 어텐션(풀 어텐션)이 한 번입니다. 네이티브(기본) 컨텍스트는 262,144토큰, 확장하면 1,010,000토큰까지 카드에 적혀 있습니다. MTP(멀티토큰 예측)도 학습에 넣었다고 적습니다.

2.4조는 파일에 저장된 전체 파라미터입니다. 토큰 하나를 계산할 때는 그중 950억만 씁니다. 매번 2.4조 전부를 계산에 넣는 모델이 아닙니다. 그래도 활성화 950억은 작지 않습니다. 서빙은 전문가 512개를 두 노드에 나누고, 토큰마다 11개(라우팅 10개 + 공유 1개)를 계산에 넣는 일입니다. “MoE라서 랩탑”은 27B 이야기입니다. 그걸 2.4T에 갖다 붙이지 않습니다.

큐웬은 이 체크포인트를 “처음으로 Qwen-Max급을 오픈 릴리스한다”고 썼습니다. 그 문장은 큐웬이 자기 제품을 그렇게 부른 것입니다. 이 글이 밖에서 순위를 다시 잰 결과가 아닙니다. 다만 파일이 실제로 허브에 올라와 있고, 카드가 Transformers 형식이며 vLLM·SGLang·TokenSpeed와 맞춘다고 명시한 것은 사실입니다.

서빙 도구 쪽은 당일 지원(Day-0)을 직접 공지했습니다. vLLM 블로그는 2026년 8월 12일, Qwen 3.5 아키텍처를 재사용해 구조 변경 없이 당일 지원한다고 썼습니다. 공식 체크포인트는 FP8이랑 BF16입니다. SGLang 팀도 같은 날 LMSYS 블로그에서 Day-0 지원을 올렸습니다. 설치 절차가 공개됐다는 뜻이지, 내 클러스터에서 바로 실행된다는 뜻이 아닙니다.

클라우드 Max랑 오픈 웨이트는 같은 제품이 아닙니다

여기가 오늘 구분의 핵심입니다. 같은 세대이고 파라미터 숫자는 같지만, 제공하는 기능은 다릅니다.

모델 카드는 이렇게 나눠 둡니다. Qwen3.8-Max는 Qwen3.8-2.4T-A95B를 바탕으로 한 공식 서비스 버전입니다. 클라우드 쪽에 더 있는 건 비전 입력, 논-싱킹 지원, 기본 1M 컨텍스트, 공식 빌트인 툴입니다. 오픈 체크포인트는 텍스트 전용입니다. 멀티모달 입력은 없습니다. 싱킹 모드는 끌 수 없습니다. 매 응답은 생각 블록을 먼저 열고, 그다음에 답을 씁니다.

생각의 깊이는 reasoning_effort로만 줄입니다. 기본값은 xhigh, 고를 수 있는 건 medium이랑 low입니다. preserve_thinking은 기본으로 켜져 있고, 이전 대화의 추론을 남깁니다. 끌 수 없는 생각과 줄일 수 있는 생각은 다른 설정입니다. 클라우드 Max는 논-싱킹을 지원한다고 카드가 적습니다. 오픈 웨이트에서는 생각 모드를 끌 수 없습니다.

이 차이 때문에 배포 경로가 달라집니다. 스크린샷을 보고 화면을 고쳐야 하는 작업, 씽킹을 끄고 짧게 답해야 하는 작업, 공식 웹검색·코드 인터프리터를 바로 붙여야 하는 작업은 클라우드 Max 쪽입니다. 텍스트만 넣고, 생각을 항상 켜 둔 채, 파일을 자기 장비에 두는 작업이 웨이트 쪽입니다. 클라우드 모델 이름과 웨이트 이름을 같다고 쓰면 설정이 어긋납니다.

API 모델 아이디는 qwen3.8-max입니다. 웨이트 아이디는 Qwen/Qwen3.8-2.4T-A95B입니다. extra_body 넣는 자리도 다릅니다. 셀프호스트는 chat_template_kwargs 안에 enable_thinking이랑 preserve_thinking을 넣고, Qwen Cloud는 그 두 값을 extra_body 최상위에 넣으라고 카드가 적습니다. 복사해서 넣는 위치가 틀리면 생각 내용이 비어 나옵니다.

권장 샘플링은 카드랑 vLLM 배포 팁이 같습니다. temperature 1.0, top_p 0.95, top_k 20, min_p 0.0, presence_penalty 0.0, repetition_penalty 1.0. 에이전트 작업에는 출력 예산을 넉넉히 잡으라고 합니다. 100만 토큰 컨텍스트 안에서 추론 최대 262,144, 최종 답 최대 131,072. 컨텍스트(토큰 한도)가 넓다고 답을 길게 쓰는 것이 아닙니다. 화면에 안 보이는 생각 토큰이 한도를 먼저 채웁니다. max_tokens를 짧게 제한하면 에이전트 작업이 중간에 끊깁니다.

공식 벤치는 공식 주장입니다

모델 카드에는 Opus 4.8, Fable 5, GPT 5.6 Sol, Qwen3.7-Max, Qwen3.8-Max를 한 표에 올려 둔 숫자가 있습니다. Terminal Bench 2.1에서 Qwen3.8-Max 86.6, PaperBench 93.0, SWE-bench Pro 67.7처럼 적혀 있습니다. 각주가 깁니다. 하네스가 다르고, 타임아웃이 다르고, 어떤 항목은 인하우스 벤치입니다. WideSearch는 상대를 클로드 코드로, 자기들을 Qwen-Agent로 쟀다고 적혀 있습니다.

이 글은 그 표를 보고 승자를 정하지 않습니다. 독립적으로 다시 돌린 결과가 이 글 안에 없습니다. 그러니까 공식 주장입니다. 공식 주장을 오늘의 제출 근거로 쓰지 않습니다. 오늘 근거는 실제로 돌아가는 저장소 링크입니다.

장시간 자율 코딩, 논문 재현 뒤 개선, 대회 24시간, 칩 설계를 수백 번 돌린 이야기, 365일 이커머스 시뮬레이션 같은 스토리도 공식 블로그의 사례입니다. 인상은 강합니다. 재현은 직접 해야 합니다. “10일 혼자 코딩했다”는 문장을 주말 해커톤의 약속처럼 옮기지 않습니다.

셀프호스트, 실제로 얼마나 무거운지

웨이트 파일을 받았다는 것만으로는 바로 돌릴 수 없습니다. 서빙에 필요한 장비가 큽니다.

vLLM은 이 모델을 지금까지 나온 가장 큰 오픈웨이트 중 하나로 적고, 추론에 최소 NVIDIA B300 또는 AMD MI355X 두 노드가 필요하다고 썼습니다. FP4 양자화본은 한 노드로도 된다고 덧붙였습니다. NVIDIA 기술 블로그는 데이터센터 급 가속 장비가 필요하다고 분명히 쓰고, GB300 NVL72에서 FP8 Day-0로 GPU당 초당 4천 토큰 이상, 사용자당 초당 350토큰 이상을 냈다고 주장합니다. 그 숫자는 NVIDIA의 측정입니다. 노트북 벤치가 아닙니다.

SGLang은 하이브리드 어텐션이 기존 서빙 방식과 맞지 않는다고 썼습니다. 풀 어텐션 KV, GDN 순환 상태, 컨볼루션 윈도우를 한꺼번에 관리해야 합니다. Day-0에 NVFP4 체크포인트, 프리필-디코드 분리, MTP, 프리필 파이프라인 병렬을 같이 올렸습니다. 그들이 올린 파레토 숫자도 SGLang의 측정입니다. 내 클러스터의 SLA가 아닙니다.

파트너 양자화도 있습니다. Inferact가 MXFP4랑 NVFP4를 올렸고, SGLang 쪽은 RadixArk의 NVFP4를 Day-0에 공개했다고 썼습니다. 공식 카드의 기본은 BF16이랑 FP8입니다. 양자화본을 기본 경로처럼 말하지 않습니다. 품질 주장은 각자 벤치 각주랑 같이 읽어야 합니다. vLLM이 공개한 GSM8K·AIME25 비교도 양자화 검증용 초기 숫자이고, 추론 예산을 늘려야 재현된다고 적어 두었습니다.

한 줄로 줄이면 이렇습니다. 2.4T 셀프호스트는 오늘 밤 해커톤 자리에서 바로 돌릴 일이 아닙니다. 클러스터를 쓸지 먼저 정하는 일입니다. 노드가 없으면 경로는 API입니다.

워크스테이션에서 오늘 받고 싶다면 다른 경로가 있습니다. 공식 변경 기록은 8월 14일 Qwen3.8-27B를 같은 허브에 올렸다고 적습니다. 27B는 덴스이고, 비전을 받으며, Apache-2.0입니다. Max급 2.4T가 아닙니다. 그 경로를 2.4T인 것처럼 말하지 않습니다. 오늘 작업의 세 경로는 클라우드 API, 2.4T 클러스터, 27B 워크스테이션입니다. 네 번째, “노트북에서 Max급”은 없습니다.

오늘은 셀프호스트입니까, 아니면 API입니까

오늘 질문은 어느 모델이 더 좋은가가 아닙니다. 오늘 결과물을 어디에 붙이느냐입니다.

API로 가는 조건은 이렇습니다. 주말 안에 배포 URL이 필요합니다. 스크린샷, PDF, 화면 피드백이 들어갑니다. 씽킹을 끄거나 줄여 비용을 통제해야 합니다. 공식 툴이 이미 있는 쪽이 빠릅니다. 클러스터가 없습니다. 이 조건이면 Qwen Cloud의 qwen3.8-max가 오늘 경로입니다. 클로드 코드, 코덱스, Qwen Code, OpenClaw 연결 예시는 공식 블로그가 이미 적어 두었습니다. 프로토콜은 OpenAI 호환이랑 Anthropic 호환이 같이 있습니다. 리전 베이스 URL은 베이징·싱가포르·버지니아처럼 다르니, API 키와 엔드포인트는 같은 리전으로 맞춰 고정합니다.

큐웬 출시 안내에 적힌 클라우드 리스트 가격은 입력 100만 토큰당 2달러, 출력 6달러, 암시적 캐시 0.25달러입니다. 프리뷰 할인 요금이랑 헷갈리지 않습니다. 콘솔이랑 리전 페이지에서 다시 확인하는 게 오늘 할 일입니다. 이 글은 영수증을 대신하지 않습니다.

셀프호스트로 가는 조건은 이렇습니다. 데이터가 바깥으로 나가면 안 됩니다. 체크포인트를 직접 후학습해야 합니다. 추론 경로를 자기 장비에 고정해야 합니다. 텍스트만으로 충분하고, 항상 생각하는 모델이 맞습니다. 라이선스를 읽을 사람이 있습니다. B300/MI355X급 노드가 실제로 있습니다. 이 조건이 하나라도 빠지면, 오늘은 API입니다.

여기서 착각하기 쉬운 점이 있습니다. “오픈이니까 공짜”가 아닙니다. 전기, 엔지니어, 대기열, 장애, 양자화 검증, 프롬프트 캐시, 컨텍스트 비용이 안으로 들어옵니다. “Max급이니까 바로 이긴다”도 아닙니다. 공식 표는 주장이며, 하네스가 점수입니다. “받았으니까 제출이다”는 더 아닙니다. 받은 파일은 아직 배포가 아닙니다. 원본 파일일 뿐입니다.

비용 감각만 하나 적어 둡니다. 클라우드 리스트 가격을 적힌 숫자 그대로 쓰면, 입력 4만·출력 2천 토큰짜리 에이전트 한 번 요청은 대략 8센트에 1.2센트입니다. 캐시가 붙으면 입력이 줄어듭니다. 셀프호스트는 그 센트 대신 노드 시간이랑 사람 시간을 냅니다. 한 주짜리 해커톤에서는 클라우드 센트 비용이 더 낫습니다. 석 달짜리 내부 도구에서는 자체 노드가 더 나을 수 있습니다. 오늘 작업이 어느 쪽인지 먼저 씁니다.

경로를 골랐으면 오늘 작업 조건을 파일 첫 세 줄에 적습니다. 목표, 금지 경로, 완료 증거. 목표가 “Max급 받아보기”이면 오늘 목표는 잘못된 것입니다. 목표는 “다른 사람이 열 수 있는 링크”여야 합니다. 금지 경로는 벤치 표 자랑, 27B를 2.4T로 부르는 일, 라이선스 파일 안 열고 배포하는 일입니다. 완료 증거는 스크린샷이 아니라 URL입니다.

90분 안에 경로 잡고 배포합니다

오늘 작업은 벤치 읽기가 아닙니다. 경로를 고르고, 한 번 성공하는 링크를 남기는 일입니다. 90분을 세 구간으로 나눕니다.

첫 20분. 공식 카드랑 라이선스만 엽니다. Hugging Face든 ModelScope든 한 페이지입니다. 파라미터, 텍스트 전용, 싱킹 강제, 컨텍스트, 라이선스 이름 다섯 줄을 노트에 옮깁니다. 벤치 표는 보지 않습니다. 공식 주장을 오늘 할 일 목록에 넣지 않습니다. 딥시크 V4-Pro 글이랑 탭을 나란히 두지 않습니다. 모델 아이디가 섞입니다.

다음 20분. 경로는 하나만 고릅니다. 클러스터가 없으면 API입니다. 노드가 있고 데이터가 못 나가면 2.4T입니다. 한 대의 워크스테이션에서 비전까지 오늘 받으려면 27B입니다. 세 경로를 동시에 켜면 작업이 세 갈래로 나뉘고, 월요일에 보낼 링크가 없어집니다. 고른 경로를 파일 첫 줄에 적습니다. “오늘은 qwen3.8-max로 배포 URL”처럼 분명히 적습니다.

남은 50분. 구현만 합니다. API면 공식 블로그의 클로드 코드 또는 코덱스 연결을 그대로 따릅니다. 모델 환경 변수는 qwen3.8-max, 베이스 URL은 키랑 같은 리전, reasoning_effort는 기본 작업에서 medium으로 시작해 봅니다. 어려운 이슈 하나만 xhigh입니다. 모든 요청을 xhigh로 두면 출력 토큰이 먼저 끝납니다. 공식 안내가 기본값을 xhigh로 둔 것은 카드의 권장이지, 주말 예산의 권장이 아닙니다.

셀프호스트를 골랐다면 다운로드 진행률을 자랑하지 않습니다. vLLM 또는 SGLang Day-0 레시피의 플래그를 그대로 씁니다. vLLM이 예시로 올린 값에는 --reasoning-parser qwen3, --tool-call-parser qwen3_coder, MTP 스펙 설정이 들어 있습니다. 파서를 빼면 생각 블록이 답 본문에 그대로 섞여 나오고, 툴 호출이 깨집니다. 샘플 클라이언트의 타임아웃을 한 시간으로 잡아 둔 이유를 일시 오류로 보지 않습니다. 긴 추론이 기본인 모델입니다.

하이브리드 어텐션은 자랑이 아니라 운영 메모입니다. 풀 어텐션 레이어는 KV가 늘고, 선형 어텐션 레이어는 고정 크기 상태를 남깁니다. SGLang이 Day-0에 radix 캐시랑 GDN 체크포인트를 같이 이야기한 이유가 여기입니다. 긴 에이전트 작업에서 “컨텍스트가 100만 토큰이니까 로그까지 다 넣자”는 가장 비싼 실수입니다. 시스템 프롬프트랑 도구 스키마만 고정 프리픽스로 두고, 로그는 파일로 뺍니다. 컨텍스트 안에 로그를 쌓으면 생각 토큰이랑 같이 돈이 나갑니다.

제출 직전 한 번만 확인합니다. 다른 계정, 다른 브라우저, 시크릿 모드. 로그인 없이 첫 화면이 뜹니까. 버튼 하나가 실제로 동작합니까. 모델 이름을 제목에 넣었습니까, 아니면 동작하는 링크를 넣었습니까. 전자는 자랑이고 후자는 제출입니다. 자랑은 커뮤니티 글에 남겨도 됩니다. 이 글처럼. 해커톤 제출란에는 링크만 넣습니다.

라이선스 읽기 전에 배포하지 않습니다

2.4T 카드의 라이선스 이름은 qwen3.8-max입니다. Apache-2.0이 아닙니다. 같은 세대 27B가 Apache-2.0인 것과 섞지 않습니다. 파일을 받기 전에 LICENSE를 엽니다.

Qwen3.8-Max License는 사용, 수정, 배포, 호스팅, 파인튜닝을 허용합니다. 다만 조건이 있습니다. 상업 제품의 월간 활성 이용자가 1억을 넘거나 월 매출이 2천만 달러를 넘으면 모델 이름을 화면에 드러내야 합니다. 라이선시랑 계열사의 최근 12개월 합산 매출이 5천만 달러를 넘는 상태에서 Model as a Service나 AI Work Assistant 사업을 하면, 상업적 사용 전에 큐웬과 별도 라이선스를 받아야 합니다. 내부 사용은 그 조항의 예외로 적혀 있습니다. 다만 모델이나 출력을 제3자에게 공개하면 내부가 아닙니다.

해커톤 한 주의 내부 실험은 대체로 이 문턱 아래입니다. 그래도 가정하지 말고 파일을 읽습니다. 라이선스 질문은 model-business@notice.qwencloud.com입니다. 이 글은 법률 의견이 아닙니다.

오늘 작업에 넣을 것

모델이 좋아지면 기능 소개와 벤치만 보다가 시간이 갑니다. 오늘은 그 소개를 건너뛰고, 오늘 실제로 쓸 경로만 고릅니다.

배포가 제출입니다. Max급을 받았다는 스크린샷은 제출이 아닙니다. 다른 사람이 링크를 열어 한 번 성공하는 지점까지 갑니다. 주말에 만들고 월요일에 링크를 보냅니다. 더 좋은 모델을 기다리는 동안, 이미 있는 모델을 어디에 붙일지 고르는 쪽이 먼저입니다.

공식 블로그: Qwen3.8-Max — A New Bar for Coding and Cowork

오픈 웨이트: Hugging Face Qwen3.8-2.4T-A95B · ModelScope · QwenLM/Qwen3.8

Day-0 서빙: vLLM · SGLang · NVIDIA GB300 NVL72

클라우드 출시(8월 3일): Alibaba Cloud Community