Inductor NVGEMM이 CUTLASS 에필로그 융합·NVFP4로 mm·addmm·scaled_mm 후보를 고릅니다 | DAKER 커뮤니티
한 줄 요약
PyTorch 2.14 Inductor의 NVGEMM은 CuTeDSL·CUTLASS 경로로 mm·addmm·scaled_mm 후보를 만들고, bias·활성화·축소 같은 에필로그를 커널 안에 붙입니다. NVFP4 전역 스케일도 에필로그에서 처리됩니다. max_autotune 아래에서 Triton·ATen과 같이 겨룹니다.
작은 GEMM·addmm 벤치를 하나 고른 뒤, NVGEMM을 max_autotune_gemm_backends에 넣고 끈 상태를 같은 형태로 비교해 보십시오. 노트에는 PyTorch·CUTLASS DSL 버전, 도형, 선택된 백엔드 이름을 남깁니다.
재현해 볼 실험 조건
nvidia-cutlass-dsl4.6+가 있는 환경에서 작은mm/addmm루프를 만듭니다.max_autotune과NVGEMM백엔드를 켠 채 컴파일하고, 끈 채와 스텝 시간·커널 이름을 비교합니다.- 에필로그( bias·pointwise )가 따로 남지 않았는지 프로파일만 확인합니다. NVFP4는 Blackwell에서만 시험합니다.
이전에 다룬 combo kernel·reorder_for_locality와는 다른 축입니다. 오늘은 GEMM 에필로그 융합 후보만 봅니다.
실무에서 바로 볼 포인트
- 학습·추론 GEMM 핫패스에서 autotune 후보에 NVGEMM을 올립니다.
- 표현 못 하는 에필로그는 Triton으로 돌아가니, 실패를 성능 회귀로만 보지 마십시오.
- API·DSL 버전이 민감하니 재현 노트에 패키지 버전을 고정합니다.
관련 DAKER 학습
설명용 생성 이미지입니다. 동작은 로컬 GPU에서 NVGEMM on/off 스텝 시간으로 확인하십시오.