확산으로 AR 품질을 유지한 채 추론을 최대 3배 빠르게 합니다 | DAKER 커뮤니티
2026년 9월 4일 Uno 논문이 arXiv에 공개되었습니다. 자동회귀(AR) 모델의 분포는 그대로 두고, 확산(diffusion)으로 여러 토큰을 한꺼번에 뽑아 추론을 가속하는 diffusion-augmented LLM을 제안합니다. AR 가중치는 다음 토큰 예측으로 두고, 가벼운 확산 가중치만 Diffusion Distillation으로 학습합니다. Ψ-Spec 샘플러로 무손실 가속과 고정 문맥 길이에서 추론 시간 확장을 지원한다고 적습니다. 별도 draft 모델이 필요 없고, 기반 AR 품질을 희생하지 않는다고 주장합니다. 기존 오픈웨이트 AR LLM을 증강하거나 처음부터 학습할 수 있습니다. 평가한 모든 배치 크기에서 주요 speculative decoding보다 높은 처리량을 보고하며, 기기 지원 최대 배치에서도 기반 AR 대비 최대 3배 속도를 냅니다. 8B Uno가 26B DiffusionGemma와 Mercury 2보다 agentic tool use·코딩·장문맥 추론 벤치에서 앞선다고 적습니다. 코드와 체크포인트는 프로젝트 페이지에 공개합니다. 오늘 팀은 “속도 숫자”와 “품질 보존 조건”을 README에 나눕니다.

논문은 2026-09-04 arXiv에 올라왔습니다. 초록은 arXiv:2609.04010에서 확인할 수 있습니다. 영문 제목은 Unlocking Lossless Speedups in LLMs via Discrete Diffusion입니다. 저자는 Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham 외 14명입니다. PDF는 같은 번호의 pdf입니다. 프로젝트 페이지는 s-sahoo.github.io/uno입니다. 오늘 본문은 제공된 사실과 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
AR 분포를 유지한 채 확산을 붙입니다
Uno는 자동회귀 모델이 정의하는 분포는 유지하면서, 확산으로 여러 토큰을 병렬로 샘플링하는 구조를 둡니다. 파라미터를 두 묶음으로 나눕니다. AR 가중치는 표준 다음 토큰 예측으로 학습하고, 가벼운 확산 가중치는 여러 토큰을 동시에 만들도록 학습합니다. 확산 가중치는 Diffusion Distillation 단계로 배우며, 기존 LLM 학습 파이프라인에 부담이 크지 않다고 적습니다.
Ψ-Spec은 무손실 가속과 고정 문맥 길이에서의 추론 시간 확장을 위한 샘플러 계열입니다. speculative decoding처럼 별도 draft 모델을 두지 않습니다. 확산 LLM(d-LLM)처럼 기반 AR 품질을 바꾸는 경로가 아니라, 같은 AR 품질을 유지한 채 생성을 가속한다고 구분합니다.
DACON 알고리즘 대회와 DAKER 바이브코딩 해커톤에서 추론 비용을 줄일 때도, “몇 배 빠르다”만 쓰지 말고 배치 크기·무손실 조건·draft 모델 유무를 표로 남깁니다.
보고된 속도와 비교 축
초록은 평가한 모든 배치 크기에서 주요 speculative decoding 방법보다 높은 처리량을 낸다고 적습니다. 기기에서 지원하는 최대 배치 크기에서도 기반 AR 모델 대비 최대 3배 속도를 보고합니다. 세부 벤치 표의 초당 토큰 수나 GPU 모델명은 초록에 없으므로 오늘 본문에 쓰지 않습니다.
8B Uno가 오픈 d-LLM로 든 26B DiffusionGemma와 상용 Mercury 2를, agentic tool use·코딩·장문맥 추론 평가에서 앞선다고 적습니다. 개별 벤치 이름과 점수는 초록에 없으므로 추측해 채우지 마십시오.
해커톤 README에 속도를 옮길 때는 “최대 3배”, “모든 평가 배치에서 speculative decoding 대비 높은 처리량”, “8B vs 26B/Mercury 2 비교 축”만 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.
빌더 팀에 옮기는 점검
팀이 오늘 할 일은 추론 가속을 “별도 draft 서버”가 아니라 “AR 가중치 + 확산 가중치 + Ψ-Spec 샘플러”로 나누어 적는 것입니다. 오픈웨이트 기반 모델을 증강할지, 처음부터 학습할지 선택지를 문서 상단에 둡니다.
Diffusion Distillation이 기존 학습에 얼마나 붙는지 측정 로그를 남깁니다. 무손실이라고 주장하는 조건을 체크리스트로 옮깁니다. 배치 크기를 바꿀 때마다 처리량과 품질 회귀 테스트를 같은 표에 둡니다.
프로젝트 페이지에서 코드와 체크포인트를 받을 때는 라이선스와 실행 명령을 먼저 저장합니다. 출처 arXiv 번호와 PDF 링크를 README 상단에 둡니다. DAKER 월간 해커톤 데모라면 배포 주소와 배치 크기·샘플러 설정을 같이 올립니다.
Controller와 Worker를 나누는 팀이면, 추론 가속 설정과 모델 카드 파일을 한 프롬프트에 섞지 마십시오. 체크포인트 해시와 벤치 로그 해시를 나란히 둡니다.
공유 GPU를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. API 키를 프롬프트나 공개 저장소에 넣지 않습니다.
가속 주장을 제출 문서로 옮기는 방법
Uno가 강조하는 점은 속도만이 아니라 AR 품질을 유지한 채 가속한다는 점입니다. 팀 문서에도 같은 구조를 둡니다. AR 학습, 확산 증류, Ψ-Spec 샘플러, 배치별 처리량, 품질 비교 축을 절로 나눕니다.
speculative decoding과 비교할 때는 draft 모델이 없다는 점을 먼저 적습니다. d-LLM과 비교할 때는 기반 AR 분포를 유지한다는 문장을 그대로 인용합니다. 8B가 26B·Mercury 2를 앞선다는 문장은 초록에 나온 영역(agentic tool use·코딩·장문맥 추론)만 옮깁니다.
데모 페이지에는 “최대 3배” 숫자를 크게 두고, 바로 옆에 배치 조건과 프로젝트 URL을 둡니다. 없는 HF 경로를 만들지 마십시오. 공개 주소는 초록과 프로젝트 페이지에서 확인한 것만 씁니다.
팀 회고에는 “속도 개선”과 “품질 회귀 없음 검증”을 서로 다른 항목에 적습니다. 한 항목에 섞으면 재현이 어렵습니다.
제출 전에 로컬에서 같은 프롬프트로 AR 기준선과 Uno 출력을 나란히 저장합니다. 차이는 로그로만 남기고 과장 문구를 붙이지 않습니다.
오픈웨이트 증강 경로를 문서에 고정합니다
Uno는 처음부터 학습하거나 기존 오픈웨이트 AR LLM을 증강할 수 있다고 적습니다. 팀 선택지를 README 상단에 두 갈래로 적습니다. 증강 경로를 고르면 기반 체크포인트 해시와 확산 가중치 학습 구간을 같은 표에 둡니다. 처음부터 학습하는 경로를 고르면 데이터 단계와 NTP 구간을 먼저 적습니다.
Ψ-Spec을 켤 때는 고정 문맥 길이 조건을 한 줄로 남깁니다. speculative decoding 대비 draft 서버가 없다는 점을 인프라 다이어그램에 표시합니다. 처리량 측정은 배치 크기별로 반복하고, 최대 배치에서의 최대 3배 주장은 초록 인용으로만 둡니다.
품질 회귀는 agentic tool use·코딩·장문맥 추론 축을 우리 내부 스모크 테스트로 옮기되, 8B가 26B·Mercury 2를 앞선다는 문장을 우리 실측처럼 쓰지 않습니다. 프로젝트 페이지에서 받은 실행 스크립트 버전을 고정합니다.
공유 클러스터에서는 샘플러 설정을 환경 변수 파일이 아니라 커밋된 설정 파일로 둡니다. 실험이 끝나면 처리량 CSV와 품질 로그를 같은 폴더에 묶습니다.
이 글이 아닌 것입니다
모든 배치·모든 GPU에서 정확히 3배라는 보증이 아닙니다. 초록은 최대 3배와 평가한 배치에서의 처리량 우세를 보고합니다.
세부 벤치 점수표를 이 글이 확정한다는 뜻이 아닙니다. 초록에 없는 항목은 쓰지 않습니다.
모든 d-LLM과 speculative decoding을 대체한다는 주장이 아닙니다. 보고된 비교 축만 옮깁니다.
DACON·DAKER 공식 우승 공지가 아닙니다. 빌더가 옮길 수 있는 방법과 숫자 안내입니다.
프로젝트 페이지 외의 다운로드 URL을 이 글이 만든다는 뜻이 아닙니다. 확인된 링크만 씁니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.04010와 pdf를 같은 탭에 둡니다. 제출일 2026-09-04를 메모 첫 줄에 적습니다.
둘째, 프로젝트 페이지에서 코드·체크포인트를 확인하십시오. s-sahoo.github.io/uno만 추적합니다. 초록에 없는 URL은 만들지 않습니다.
셋째, 우리 추론 파이프라인을 AR·확산·샘플러 표로 옮기십시오. draft 모델 유무 열을 만듭니다. DAKER 월간 해커톤이나 DACON 제출 과제에 맞춥니다.
넷째, 속도 숫자는 조건과 같이 인용하십시오. 최대 3배와 배치 조건을 우리 실측과 섞지 않습니다.
다섯째, 8B 비교 문장은 영역만 옮기십시오. agentic tool use·코딩·장문맥 추론 축을 명시합니다.
여섯째, Diffusion Distillation 추가 비용을 재현 노트에 적으십시오. 학습 로그 해시를 남깁니다.
일곱째, 데모와 설정 파일을 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.04010 — Unlocking Lossless Speedups in LLMs via Discrete Diffusion (2026-09-04) · PDF · 프로젝트