Karpathy makemore WaveNet 실습: shape-first로 깊은 문자 모델 쌓기 | DAKER 커뮤니티

Karpathy makemore WaveNet 실습은 MLP 문자 모델을 더 깊게 만들며 tensor shape를 먼저 읽는 훈련입니다. 지금 중요한 이유는 모델을 깊게 쌓을수록 코드보다 (B, T, C) 차원 추적이 먼저 무너지기 때문입니다.

shape-first 학습이란, layer를 추가하기 전에 입력과 출력 tensor 차원을 먼저 쓰고 검증하는 방식을 의미합니다.

DAKER 학습 Karpathy makemore WaveNet shape-first 대표 카드

문자 문맥을 두 글자씩 묶어 tree-like 구조로 깊게 보는 makemore WaveNet NotebookLM 카드.

오늘 배울 것은 무엇인가요?

한 줄 요약: WaveNet식 makemore는 멋진 이름보다, 이웃한 문자 문맥을 어떻게 묶고 shape가 어떻게 바뀌는지 보는 실습입니다.

핵심 개념은 무엇인가요?

2026년 6월 26일 KST 기준 DAKER 학습 디렉터리에는 작은 모델, micrograd, makemore bigram, MLP, BatchNorm 진단 글이 이어지는 Karpathy 학습 흐름으로 공개되어 있습니다. 이미 makemore bigram 글makemore MLP 글에서 문자 모델의 입력, loss, 과적합을 다뤘습니다. 오늘은 그 모델을 더 깊게 만들되, layer 복붙보다 shape 출력과 작은 블록 확인을 먼저 둡니다.

핵심 개념은 문맥을 한 번에 펼치지 않고 계층적으로 묶는 것입니다. Embedding 뒤의 tensor를 두 글자씩 묶고, Linear와 BatchNorm1d, Tanh를 통과시키며 다시 묶으면 tree-like 구조로 더 깊은 모델을 만들 수 있습니다.

개발 순서

좋은 시작

막히는 시작

Layer 추가

shape 출력 후 1개 추가

여러 layer를 한 번에 복붙

문맥 처리

두 글자씩 계층적으로 묶음

전체 문맥을 바로 펼침

검증

B, T, C 변화와 sample 확인

loss 숫자만 비교

따라 해볼 실습은 무엇인가요?

  1. makemore MLP 글에서 block size와 train/dev/test split을 복습합니다.

  2. 입력 batch의 shape를 먼저 출력하고 B, T, C가 무엇인지 적습니다.

  3. FlattenConsecutive(2) 하나만 넣어 T가 줄고 C가 늘어나는지 확인합니다.

  4. Linear, BatchNorm1d, Tanh를 한 묶음으로 통과시킨 뒤 다시 shape를 출력합니다.

  5. Sequential로 묶기 전에 작은 샘플 출력과 loss를 확인합니다.

DAKER 학습 Karpathy makemore WaveNet FlattenConsecutive 실습 흐름 카드

Embedding, FlattenConsecutive(2), Linear, BatchNorm1d, Tanh, sample 확인으로 이어지는 NotebookLM 워크플로 카드.

자주 막히는 지점은 어디인가요?

다음 학습 연결은 무엇인가요?

WaveNet 실습은 다음 GPT from scratch로 넘어가기 전 좋은 중간 단계입니다. 작은 모델 학습 글의 원칙처럼 너무 큰 Transformer를 바로 외우기보다, 문자 모델에서 context, embedding, layer, shape가 이어지는 감각을 먼저 만드세요.

공식 출처는 어디에서 확인하나요?

공식 출처는 Karpathy Zero to Hero Part 5와 공개 nn-zero-to-hero 노트북을 기준으로 확인했습니다. DAKER 공개 본문에는 워크스페이스 정책에 따라 DAKER 학습 디렉터리와 확인된 내부 연결만 남깁니다.

FAQ

WaveNet 실습은 원 논문 구현인가요?

아닙니다. Karpathy 강의 흐름에서는 WaveNet과 비슷한 계층적 구조를 문자 모델에 적용해 shape와 torch.nn 감각을 배우는 실습입니다.

FlattenConsecutive(2)는 무엇을 확인하나요?

이웃한 시간축 항목을 묶어 T는 줄이고 feature 차원은 늘리는 변화를 확인합니다. 이 변화가 다음 Linear 입력 크기를 결정합니다.

왜 shape를 먼저 봐야 하나요?

깊은 모델 오류는 수식보다 차원 불일치에서 먼저 터지는 경우가 많습니다. shape를 기록하면 디버깅 시작점이 빨라집니다.

DAKER에서 어떤 글 다음에 보면 좋나요?

makemore bigram, makemore MLP, BatchNorm 진단, Backprop Ninja 순서 다음에 보면 연결이 좋습니다.

오늘은 layer를 많이 쌓기보다 FlattenConsecutive(2) 전후 shape 한 줄을 정확히 설명하는 것부터 시작해 보세요.

Redirecting to Karpathy makemore WaveNet 실습: shape-first로 깊은 문자 모델 쌓기 | DAKER 커뮤니티...