AMD에서 학습한 16B 완전 공개 MoE를 공개합니다 | DAKER 커뮤니티

2026년 9월 1일 AMD가 Instella-MoE 기술 보고서를 arXiv에 공개했습니다. 총 16B·토큰당 활성 2.8B인 완전 공개 MoE이며, AMD Instinct MI300X·MI325X에서 스크래치로 학습했습니다. Gated MLA와 FarSkip-Collective를 넣었고, 사전학습은 7.1T 토큰, 문맥은 4K에서 64K로 확장합니다. base 평균은 76.7로 완전 공개 비교군에서 선두로 보고했고, Think 평균은 73.2입니다. FarSkip/EP로 사전학습 처리량은 +12.7%, TTFT 처리량은 +39.2%입니다. 단계별 체크포인트·설정·데이터 믹스·코드를 공개했습니다. 오늘 팀은 “완전 공개”와 “오픈웨이트만”을 한 칸에 섞지 말고, 활성 파라미터와 학습 레시피를 README에 나란히 적습니다.

AMD에서 학습한 16B 완전 공개 MoE를 공개합니다

논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.00791에서 확인할 수 있습니다. 영문 제목은 Instella-MoE Technical Report입니다. 저자는 Jiang Liu, Sudhanshu Ranjan 외 (AMD)입니다. PDF는 같은 번호의 pdf입니다. 가중치·카드는 Hugging Face amd/Instella-MoE-16B-A3B-Base에 공개되어 있습니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

16B 총량·활성 2.8B를 AMD GPU에서 학습합니다

Instella-MoE는 희소 MoE로 총 파라미터가 16B이고, 토큰마다 켜지는 양은 2.8B입니다. 학습은 AMD Instinct MI300X와 MI325X에서 처음부터 진행했습니다. 아키텍처 축은 Gated Multi-head Latent Attention(Gated MLA)과 FarSkip-Collective입니다. Gated MLA는 MLA에 입력 조건 게이트를 더해 표현력을 보강하고, FarSkip-Collective는 전문가 병렬 통신과 계산을 겹칩니다.

파이프라인은 사전학습, 미드트레이닝, 장문맥 확장, 피드백 기반 SFT, DPO, 강화학습(멀티 교사 온폴리시 증류 포함)으로 이어집니다. 사전학습 토큰은 7.1T입니다. 문맥 길이는 4K에서 64K로 늘립니다. 단계마다 체크포인트와 설정, 데이터 믹스, 코드를 공개한다고 적혀 있습니다. Hugging Face 카드 이름은 amd/Instella-MoE-16B-A3B-* 시리즈입니다.

DACON과 DAKER처럼 모델을 고르고 데모를 올리는 자리에서는 “총 16B”만 적고 끝내지 마십시오. 오늘 팀이 가져갈 한 줄은 이것입니다. 활성 2.8B와 완전 공개 레시피를, 제출 README의 모델 항목에 같은 형식으로 적습니다.

base 76.7·Think 73.2와 처리량 개선

base 체크포인트 평균은 76.7입니다. 보고에 따르면 완전 공개 비교군에서 선두이며, 같은 활성 규모대의 오픈웨이트 MoE·밀집 모델과도 경쟁합니다. 사후학습을 거친 Think 체크포인트 평균은 73.2입니다. 지시 따르기·추론·수학·코딩·채팅 벤치를 묶은 평균입니다.

효율 쪽에서는 FarSkip-Collective와 전문가 병렬이 사전학습 처리량을 +12.7% 올렸고, TTFT 처리량은 +39.2%까지 올렸다고 적습니다. 품질 숫자와 처리량 숫자를 한 문장에 섞어 “더 빠르면서 무조건 더 좋다”고 쓰지 마십시오. 각각 출처 표를 따릅니다.

해커톤 문서에는 Hugging Face 카드 이름을 그대로 적습니다. Base와 Think를 구분해 적고, 우리가 쓴 체크포인트 해시를 남깁니다. 배포가 제출입니다. 올린 링크가 제출입니다.

완전 공개와 오픈웨이트를 나눕니다

완전 공개는 가중치만 올리는 오픈웨이트와 다릅니다. 이 보고는 단계별 가중치, 학습 설정, 데이터 믹스, 학습 코드, 평가 절차를 함께 공개한다고 명시합니다. 팀이 “오픈 모델”이라고 쓸 때는 이 다섯 가지 중 무엇을 실제로 받았는지 표로 나눕니다.

장문맥은 4K에서 64K입니다. 긴 로그를 넣는 에이전트 데모에서는 우리 실측 길이와 논문 확장 길이를 섞지 않습니다. 확장에 쓴 기법은 본문 설정을 참고하되, 없는 배속을 만들지 않습니다.

학습 인프라는 MI300X·MI325X로 보고되었습니다. 추론·서빙 환경은 카드와 코드를 따릅니다. DAKER 제출 환경이 CUDA인지 ROCm인지 README 첫 줄에 적습니다. AMD에서 학습했다는 사실과 우리 런타임 GPU를 한 문장에 섞어 단정하지 않습니다.

데이터 믹스와 중간 체크포인트를 재현 실험에 쓸 계획이면, 공개된 단계 목록을 체크박스로 만듭니다. 사전학습만 받고 SFT를 우리 데이터로 대체하는 경우 그 사실을 명시합니다. 단계 이름은 카드에 적힌 그대로 씁니다.

공개 체크포인트에는 Pretrain·Midtrain·Base·SFT·DPO·Think 단계가 포함된다고 보고합니다. 팀이 하나만 받아도 README에 단계 이름을 적습니다. 완전 공개 비교군에서 선두라는 문장은 base 평균 76.7을 말할 때 출처와 함께 적고, Think 73.2와 섞지 않습니다. 오픈웨이트 Moonlight·Qwen 계열과의 비교는 본문 표를 직접 확인한 뒤에만 인용합니다.

빌더 팀에 옮기는 점검

모델 카드에 총 파라미터 16B와 활성 2.8B를 분리해 적습니다. Gated MLA와 FarSkip-Collective를 한 줄로 요약하고, 원문 섹션을 링크로 둡니다. base 76.7과 Think 73.2를 우리 벤치 점수처럼 쓰지 않습니다.

+12.7%·+39.2%는 보고된 처리량 개선입니다. 우리 서버 초당 요청 수처럼 적지 말고, 측정 조건이 다르면 별도 표를 만듭니다. HF 시리즈 이름을 복사한 뒤 라이선스 문구를 확인합니다.

Controller·Worker를 나누는 팀이면, Worker에 활성 2.8B급을 두고 Controller 프롬프트에 모델 카드 해시를 적으십시오. 루프 지시와 가중치 파일이 한 디렉터리에 섞이면 재현이 깨집니다.

장문맥 데모를 넣을 때는 64K 확장 체크포인트를 쓰는지, 4K base를 쓰는지 표에 분리합니다. 토큰 사용량 로그를 공개 가능한 주소에 둡니다. DACON 코드 제출과 DAKER 바이브코딩 제출 모두 같은 규칙을 씁니다.

공개 자료에는 사전학습 7.1T 토큰과 문맥 4K→64K 확장이 같이 적혀 있습니다. 팀이 장문맥 데모만 보여줄 때도, 사전학습 규모와 활성 2.8B를 같은 표에 둡니다. FarSkip-Collective가 통신을 겹친다는 설명과, Gated MLA가 어텐션 출력을 게이트한다는 설명을 한 문장으로 압축해 README에 넣습니다. base 평균 76.7과 Think 평균 73.2는 서로 다른 단계의 숫자입니다. 하나를 다른 단계 이름으로 부르지 않습니다. +12.7%와 +39.2%도 각각 사전학습 처리량과 TTFT 처리량입니다. 배포 지연과 섞지 마십시오. Hugging Face amd/Instella-MoE-16B-A3B-* 시리즈에서 우리가 받은 파일 목록을 체크박스로 남깁니다. DACON 제출과 DAKER 제출 모두, 라이선스와 단계 이름을 첫 페이지에 둡니다. 완전 공개라고 적었으면 설정·데이터 믹스·코드 링크가 실제로 열리는지 확인합니다.

이 글이 아닌 것입니다

모든 벤치에서 오픈웨이트 대형 모델을 이긴다는 주장이 아닙니다. base 평균 76.7과 Think 평균 73.2는 보고된 비교 설정에서의 평균입니다.

활성 2.8B만으로 16B 전체가 동시에 돌아간다는 설명이 아닙니다. 토큰마다 켜지는 양이 2.8B입니다.

처리량 +12.7%·+39.2%가 모든 배치 크기에서 보장된다는 약속이 아닙니다. FarSkip/EP 관련 보고입니다.

특정 대회 우승 공지가 아닙니다. 완전 공개 MoE 기술 보고서와 가중치·코드 안내입니다.

CUDA 없는 환경에서도 동일 처리량이라는 확장이 아닙니다. 학습·서빙 조건은 본문과 카드를 따릅니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.00791pdf를 같은 탭에 둡니다. AMD와 제출일 2026-09-01을 메모 첫 줄에 적습니다.

둘째, HF 카드를 북마크하십시오. amd/Instella-MoE-16B-A3B-Base와 시리즈 페이지, 라이선스를 저장합니다.

셋째, 모델 카드에 총·활성을 두 칸으로 쓰십시오. 16B / 2.8B를 분리합니다. DAKER 월간 해커톤이나 DACON 코드 제출 과제 가운데 하나에 맞춥니다.

넷째, base 76.7과 Think 73.2를 인용 형식으로만 복제하십시오. 우리 실측처럼 쓰지 않습니다.

다섯째, 처리량 개선을 조건과 함께 적으십시오. +12.7%·+39.2% 옆에 FarSkip/EP를 병기합니다.

여섯째, 완전 공개 항목 체크리스트를 만드십시오. 가중치·설정·데이터 믹스·코드·평가를 칸으로 둡니다.

일곱째, 선택한 체크포인트와 로그를 공개 링크로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.00791 — Instella-MoE Technical Report (2026-09-01) · PDF · 코드/가중치