Inductor NVGEMM이 CUTLASS 에필로그 융합·NVFP4로 mm·addmm·scaled_mm 후보를 고릅니다 | DAKER 커뮤니티

NVGEMM 에필로그
설명용 생성 이미지입니다.

한 줄 요약
PyTorch 2.14 Inductor의 NVGEMM은 CuTeDSL·CUTLASS 경로로 mm·addmm·scaled_mm 후보를 만들고, bias·활성화·축소 같은 에필로그를 커널 안에 붙입니다. NVFP4 전역 스케일도 에필로그에서 처리됩니다. max_autotune 아래에서 Triton·ATen과 같이 겨룹니다.

작은 GEMM·addmm 벤치를 하나 고른 뒤, NVGEMMmax_autotune_gemm_backends에 넣고 끈 상태를 같은 형태로 비교해 보십시오. 노트에는 PyTorch·CUTLASS DSL 버전, 도형, 선택된 백엔드 이름을 남깁니다.

재현해 볼 실험 조건

  1. nvidia-cutlass-dsl 4.6+가 있는 환경에서 작은 mm/addmm 루프를 만듭니다.
  2. max_autotuneNVGEMM 백엔드를 켠 채 컴파일하고, 끈 채와 스텝 시간·커널 이름을 비교합니다.
  3. 에필로그( bias·pointwise )가 따로 남지 않았는지 프로파일만 확인합니다. NVFP4는 Blackwell에서만 시험합니다.

이전에 다룬 combo kernel·reorder_for_locality와는 다른 축입니다. 오늘은 GEMM 에필로그 융합 후보만 봅니다.

실무에서 바로 볼 포인트

관련 DAKER 학습

설명용 생성 이미지입니다. 동작은 로컬 GPU에서 NVGEMM on/off 스텝 시간으로 확인하십시오.