이미지 생성 학습 레시피와 가중치를 전부 공개합니다 | DAKER 커뮤니티
2026년 9월 3일 LLaDA-Image 논문이 arXiv에 공개되었습니다. 6B Diffusion Transformer(DiT)를 처음부터 학습하고, 동결된 LLaDA2.0-Mini 기반 비전–언어 이해 모듈과 묶은 통합 틀입니다. 이미지 단독 사전학습·미드트레이닝으로 시각 생성 사전을 먼저 만든 뒤 텍스트 정렬을 이어 갑니다. LLaDA-Image-Turbo로 증류하면 2–4 샘플링 스텝으로 빠른 추론이 가능하다고 적습니다. Qwen-Image-Bench에서 영어 트랙 overall 53.53, 중국어 트랙 53.38로 오픈소스 모델 중 양 트랙 SOTA를 보고합니다. 가중치·학습 코드·상세 레시피를 공개한다고 밝힙니다. 오늘 팀은 “벤치 숫자”와 “재현 레시피 URL”을 README에 나눕니다.

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.03796에서 확인할 수 있습니다. 영문 제목은 LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes입니다. 저자는 Chuyan Chen, Haoxing Chen, Kun Chen 외 30명입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 제공된 사실과 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
이미지 생성 레시피를 처음부터 엽니다
LLaDA-Image는 처음부터 학습한 6B DiT와, LLaDA2.0-Mini 확산 언어 모델 백본 위에 올린 동결 비전–언어 이해 모듈을 한 프레임워크로 묶습니다. 처음부터 이미지–텍스트 쌍에만 의존하지 않고, 이미지 단독 사전학습과 미드트레이닝으로 시각 생성 사전을 먼저 구축한 뒤 텍스트 정렬로 넘어갑니다.
최적화에는 DiT 전역에 파라미터 없는 RMSNorm과 Muon 옵티마이저를 씁니다. 결과 모델은 사실적인 이미지를 만들면서도 세분 편집 지시를 따른다고 보고합니다. 이어서 LLaDA-Image-Turbo로 증류해 2–4 샘플링 스텝 추론을 가능하게 합니다.
DACON 알고리즘 대회와 DAKER 바이브코딩 해커톤에서 생성 모델을 쓸 때도, “예쁜 샘플 몇 장”만 올리지 말고 학습 단계·옵티마이저·증류 여부·벤치 트랙을 표로 남깁니다.
보고된 벤치와 공개 범위
Qwen-Image-Bench에서 영어 트랙 overall 53.53, 중국어 트랙 overall 53.38을 보고합니다. 초록은 오픈소스 모델 중 두 트랙 모두에서 새 최고 수준이라고 적습니다. 하위 세부 점수는 초록에 없으므로 오늘 본문에도 쓰지 않습니다.
초록은 모델 가중치, 학습 코드, 상세 레시피를 공개한다고 밝힙니다. 다만 구체 Hugging Face URL이나 GitHub 주소는 초록에 없습니다. URL을 추측해 만들지 마십시오. PDF와 프로젝트 공지에서 확인한 주소만 씁니다.
해커톤 README에 점수를 옮길 때는 벤치 이름·트랙·overall만 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.
빌더 팀에 옮기는 점검
팀이 오늘 할 일은 생성 파이프라인을 “최종 샘플 폴더”가 아니라 “사전학습 → 미드트레이닝 → 정렬 → (선택) 증류” 단계로 나누는 것입니다. 각 단계에서 쓴 데이터 종류(이미지 단독인지 쌍인지)를 명시합니다. DiT 크기(6B)와 이해 모듈이 동결인지 여부를 체크리스트에 둡니다.
Turbo 경로를 쓸 계획이 있으면 샘플링 스텝 수(2–4)와 품질 트레이드오프를 별도 절로 적습니다. Qwen-Image-Bench 숫자를 우리 실측처럼 쓰지 말고, 비교 축만 복제합니다.
공개 가중치·코드를 받을 때는 라이선스와 재현 명령을 먼저 저장합니다. 출처 arXiv 번호와 PDF 링크를 README 상단에 둡니다. DAKER 월간 해커톤 데모라면 배포 주소와 프롬프트·시드·스텝을 같이 올립니다.
Controller와 Worker를 나누는 팀이면, 생성 요청과 모델 카드·레시피 파일을 한 프롬프트에 섞지 마십시오. 레시피 커밋 해시와 샘플 로그 해시를 나란히 둡니다.
도구 권한과 공유 GPU를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. API 키를 프롬프트나 공개 저장소에 넣지 않습니다.
레시피를 제출 문서로 옮기는 방법
LLaDA-Image가 강조하는 점은 모델 점수만이 아니라 학습 레시피 공개입니다. 팀 문서에도 같은 구조를 둡니다. 데이터 단계, 옵티마이저(Muon), 정규화(parameter-free RMSNorm), 증류(Turbo 2–4 스텝), 평가(Qwen-Image-Bench EN/CN)를 다섯 칸으로 고정합니다.
영어 53.53과 중국어 53.38은 트랙을 구분해 인용합니다. 한 평균으로 합치지 마십시오. “오픈소스 SOTA” 문장은 초록의 보고 범위 안에서만 쓰고, 우리 서비스가 그 점수라는 식으로 바꾸지 않습니다.
구체 코드 URL이 아직 없다면 “초록에 구체 URL이 없다”고 적고, PDF·공식 공지가 올라오면 그때 링크를 채웁니다. 임의 GitHub 주소를 만들지 않습니다.
DAKER 바이브코딩 해커톤에서 이미지 생성 기능을 넣을 때도 배포 링크가 곧 제출입니다. 샘플 갤러리, 프롬프트 목록, 스텝·시드를 한 페이지에 모읍니다.
오픈 레시피를 팀 표준으로 고정합니다
LLaDA-Image가 빌더에게 주는 실무 가치는 “점수가 높다”보다 “학습 순서를 공개한다”에 있습니다. 팀 위키에 사전학습·미드트레이닝·정렬·증류 네 절을 고정하고, 각 절에 데이터 종류와 동결 모듈 여부를 한 줄로 적습니다. 6B DiT와 LLaDA2.0-Mini 기반 이해 모듈을 우리 스택의 어느 컴포넌트에 대응시킬지 표로 남깁니다.
Qwen-Image-Bench 영어 53.53과 중국어 53.38은 트랙 이름을 반드시 붙입니다. “overall만 올렸다”는 문장으로 합치지 마십시오. Turbo 경로는 2–4 스텝 조건을 README 배지처럼 보이게 두고, 원본 경로와 샘플을 나란히 비교할 때 어떤 축을 보는지(속도·주관 품질)만 적습니다.
Muon과 parameter-free RMSNorm은 재현 노트의 옵티마이저 칸에만 옮깁니다. 우리 학습이 같은 설정이라고 단정하지 않습니다. 공개 가중치·코드 공지가 나오면 라이선스·체크섬·커밋 해시를 같은 표에 추가합니다.
DAKER 바이브코딩 해커톤에서 이미지 생성 기능을 넣을 때는 배포 주소, 프롬프트 세트, 시드, 스텝 수를 한 페이지에 모읍니다. DACON 제출물이면 재현 스크립트와 arXiv 링크를 상단에 둡니다. 배포가 제출입니다. 올린 링크가 제출입니다.
이 글이 아닌 것입니다
모든 이미지 벤치 1등 선언이 아닙니다. Qwen-Image-Bench 영어·중국어 overall만 옮깁니다.
세부 하위 점수나 HF URL을 이 글이 확정한다는 뜻이 아닙니다. 초록에 없는 항목은 쓰지 않습니다.
Turbo 2–4 스텝이 모든 품질 축에서 원본과 같다는 보증이 아닙니다. 빠른 추론을 위한 증류 보고입니다.
DACON·DAKER 공식 우승 공지가 아닙니다. 빌더가 옮길 수 있는 방법과 숫자 안내입니다.
6B DiT가 모든 상용 생성기를 대체한다는 주장이 아닙니다. 오픈 레시피·가중치 공개 보고입니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.03796와 pdf를 같은 탭에 둡니다. 제출일 2026-09-03을 메모 첫 줄에 적습니다.
둘째, 공개 범위를 확인하십시오. 가중치·학습 코드·상세 레시피 공지 위치만 추적합니다. 초록에 없는 URL은 만들지 않습니다.
셋째, 우리 생성 파이프라인을 단계 표로 옮기십시오. 이미지 단독 사전학습·정렬·증류 열을 만듭니다. DAKER 월간 해커톤이나 DACON 제출 과제에 맞춥니다.
넷째, Qwen-Image-Bench 숫자는 트랙별로만 인용하십시오. 영어 53.53·중국어 53.38을 우리 실측과 섞지 않습니다.
다섯째, Turbo 사용 시 스텝 수와 품질 노트를 남기십시오. 2–4 스텝 조건을 명시합니다.
여섯째, 옵티마이저·정규화 설정을 재현 노트에 적으십시오. Muon과 parameter-free RMSNorm을 체크합니다.
일곱째, 데모와 레시피 링크를 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.03796 — LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes (2026-09-03) · PDF