활성 2B로 물리 AI용 장문맥 기반 모델을 만듭니다 | DAKER 커뮤니티

2026년 8월 31일 Xpeng Inc. Foundation Model Team이 TuringLLM 논문을 arXiv에 공개했습니다. Turing-20B-A2B는 20B MoE이며 토큰마다 활성은 약 2B입니다. 물리 AI와 지연에 민감한 응용(주행, 신체화)을 겨냥합니다. 네이티브 문맥 128K이고 YaRN으로 512K까지 확장합니다. Quantile Routing으로 동적 top-k와 토큰 적응 전문가를 쓰며, 평균 약 8개의 라우팅 전문가(전체 256)와 공유 전문가 1개를 켭니다. 오늘은 “작은 활성으로 장문맥 기반 모델을 물리 AI 쪽에 붙이는” 설계를 팀 표에 옮기는 글입니다.

활성 2B로 물리 AI용 장문맥 기반 모델을 만듭니다

논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30567에서 확인할 수 있습니다. 영문 제목은 TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI입니다. 저자 표기는 Foundation Model Team, Xpeng Inc.이며, 핵심으로 Yuheng Zhang, Yizhao Wang, Da Zhu와 팀이 있고, 프로젝트 리드 Qiman Wu, 자문 Hang Zhang, HongGou Yang, Xianming Liu가 적혀 있습니다. PDF는 같은 번호의 pdf입니다. 제공된 사실에 공개 Hugging Face·코드 URL은 없습니다. 오늘 본문은 사실 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

활성 2B로 물리 AI용 장문맥 기반 모델을 만듭니다 본문

활성 약 2B와 하이브리드 어텐션

구조는 24계층, 은닉 2048, 헤드 16·차원 128입니다. 첫 계층은 밀집 FFN이고 나머지는 MoE입니다. 하이브리드 어텐션은 6계층마다 Lightning Attention 5개와 전역 어텐션 1개로, 합계 Lightning 20·전역 4입니다. Quantile Routing은 동적 top-k로 토큰 적응 전문가를 고르고, 이용을 균형 맞추며 평균 연산을 제어합니다. 사전학습 중에는 dropless이고, 프롬프트 프리필에는 용량 제약 라우팅(γ=1.25)을 씁니다.

정규화는 엣지·Turing 칩을 위해 DyT를 RMSNorm 대신 씁니다. 메인 사전학습은 H800 512장에서 약 22일입니다. 3단계로, 770k 스텝 약 6.5T 토큰 뒤 180k+180k 스텝에서 각 약 1.5T입니다. 시퀀스 4096, 스텝당 약 8.4M 토큰입니다.

DACON과 DAKER 팀이 지연에 민감한 데모를 올릴 때는 총 20B와 활성 약 2B를 한 항목에 섞지 마십시오. 오늘 팀이 가져갈 한 줄은 이것입니다. 물리 AI용 장문맥 기반 모델의 활성·문맥·라우팅 제약을 제출 README에 같은 형식으로 적습니다.

Base 벤치와 RULER

Qwen3-8B Base 대비 Turing Base는 MMLU 79.83 대 78.92, CMMLU 84.17 대 81.28, DROP 82.61 대 79.03, HellaSwag 90.44 대 81.39, MATH 62.20 대 56.12, GPQA 37.05 대 34.82입니다. GSM8K는 74.53 대 90.07로 뒤집니다. 앞선 축만 골라 쓰지 마십시오.

Qwen3.5-9B Base와는 전반적으로 근접합니다. CMMLU 84.17 대 81.13, MATH 62.20 대 53.38, HellaSwag 90.44 대 89.57, MMLU 79.83 대 81.02입니다. RULER에서 Qwen3-8B 대비 32K 93.16 대 89.26, 64K 90.00 대 74.83, 128K 84.87 대 61.56입니다. Qwen3.5-9B 대비 RULER 128K 84.87 대 88.89, 256K 81.31 대 81.81이며, Turing 512K는 YaRN으로 77.38입니다.

프리필은 H800 FP16에서 Qwen3 대비 32K 약 1.2배, 64K 1.6배, 128K 2.2배입니다. MoE 모듈은 기존 top-k 대비 16K–256K에서 평균 1.53배 속도( CF=1.25 )입니다. 응용으로 VLA 2.0 주행, 콕핏, XPeng Iron 로봇이 적혀 있고, 앞으로 TuringViT 멀티모달이 언급됩니다.

해커톤·배포 표에 옮깁니다

제공된 사실에 공개 가중치 URL이 없으므로, 재현은 arXiv와 자체 측정에 의존합니다. 없는 HF 링크를 만들지 마십시오. DAKER 쇼케이스에 물리·로봇·주행 데모를 올릴 때도 활성·문맥·프리필 배수 출처를 분리합니다. 배포가 제출입니다. 올린 링크가 제출입니다.

GSM8K처럼 뒤지는 지표를 표에서 지우지 않습니다. RULER 장문맥 이득과 GSM8K 격차를 같은 날짜에 적습니다. γ=1.25 용량 제약 라우팅을 프리필 설정 항목에 남깁니다.

엣지 배포를 말하는 팀이면 DyT 선택을 README에 한 줄로 적습니다. RMSNorm과의 차이를 우리 칩 실측 없이 단정하지 않습니다. 학습 일정(약 22일·3단계 토큰)은 인프라 계획 참고용이며, 우리 클러스터 일수와 같다고 쓰지 않습니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 모델 카드에 20B / 활성 약 2B / 평균 라우팅 전문가 약 8 / 공유 1 / 128K·512K를 나누는 것입니다. Lightning 20·전역 4 비율도 어텐션 항목에 둡니다.

지연 민감 데모에서는 프리필 배수(1.2 / 1.6 / 2.2)와 MoE 1.53배를 우리 실측 열과 논문 열로 분리합니다. H800 FP16 조건을 빠뜨리면 비교가 무효입니다.

VLA 2.0·콕핏·Iron 로봇 이름을 마케팅 문장으로만 쓰지 말고, 어떤 지연 예산 항목에 붙일지 표로 적습니다. TuringViT는 미래 항목으로만 표시합니다. 없는 벤치 점수를 붙이지 않습니다.

Quantile Routing의 동적 top-k를 “항상 8전문가”로 단정하지 마십시오. 평균 약 8입니다. 토큰 적응이라는 점을 실험 로그에 남깁니다. dropless 사전학습과 프리필 용량 제약을 혼동하지 않습니다.

DACON 알고리즘 제출과 DAKER 바이브코딩 모두, 장문맥 평가를 32K·64K·128K 열로 나눕니다. RULER 숫자만 크게 적고 GSM8K 74.53을 숨기면 리뷰가 거절합니다.

물리 AI 데모 일정에는 프리필 구간과 디코드 구간을 나눕니다. H800 FP16에서 문맥이 길수록 Qwen3 대비 프리필 배수가 1.2에서 2.2로 커진다는 보고를, 우리 지연 예산 표의 논문 열에만 적습니다. MoE 모듈 평균 1.53배(16K–256K, CF=1.25)도 같은 방식으로 분리합니다.

학습 3단계(약 6.5T 뒤 각 약 1.5T)를 데이터 믹스 회의 안건으로 옮길 때는 스텝 수 770k·180k·180k와 시퀀스 4096·스텝당 약 8.4M 토큰만 적습니다. 없는 데이터셋 이름을 만들지 않습니다. 첫 계층 밀집 FFN·나머지 MoE·Lightning 20·전역 4 구조를 아키텍처 다이어그램 캡션에 고정합니다.

Qwen3.5-9B와 RULER 128K·256K가 근접하고 512K YaRN 77.38이 보고된 점을, 장문맥 회귀 테스트의 길이 열 설계에만 사용합니다. VLA 2.0 주행·콕핏·Iron 로봇은 응용 예시 목록으로만 두고, 없는 성공률을 붙이지 않습니다. TuringViT는 미래 항목으로 표시합니다.

이 글이 아닌 것입니다

활성 2B가 모든 벤치에서 8B·9B를 이긴다는 주장이 아닙니다. GSM8K는 Qwen3-8B보다 뒤지고, MMLU는 Qwen3.5-9B보다 낮습니다.

공개 가중치·코드가 포함되어 있다는 안내가 아닙니다. 제공된 사실에 HF·코드 URL이 없습니다.

프리필이 항상 2.2배라는 보증이 아닙니다. H800 FP16에서 문맥 길이에 따라 약 1.2·1.6·2.2배입니다.

512K가 네이티브 문맥이라는 설명이 아닙니다. 네이티브 128K이고 YaRN으로 512K입니다.

특정 차량·로봇 출시 공지가 아닙니다. 물리 AI를 향한 기반 모델 설계 논문 안내입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.30567pdf를 같은 탭에 둡니다. 요약 카드만 보고 TuringLLM을 정의하지 않습니다. Xpeng Foundation Model Team과 제출일 2026-08-31을 메모 첫 줄에 적습니다.

둘째, 모델 카드에 총·활성·전문가·문맥을 쓰십시오. 20B / 약 2B / 평균 약 8+공유 1 / 128K·YaRN 512K. DAKER·DACON 과제 중 하나에 맞춥니다.

셋째, Base 비교 표를 형식으로만 복제하십시오. Qwen3-8B·Qwen3.5-9B 대비 숫자를 우리 실측처럼 쓰지 않습니다. 앞선 축과 GSM8K 격차를 같이 둡니다.

넷째, RULER 길이별 열을 만드십시오. 32K·64K·128K·256K·512K를 나누고 YaRN 표기를 남깁니다.

다섯째, 프리필·MoE 속도 측정 조건을 README에 적으십시오. H800 FP16, γ=1.25·CF=1.25를 논문 열에만 둡니다.

여섯째, DyT·용량 제약 라우팅·dropless를 배포 체크리스트에 넣으십시오. 엣지와 학습 설정을 섞지 않습니다.

일곱째, 데모 URL과 모델 카드를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.30567 — TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI (2026-08-31) · PDF