Claude Code 상세 사용법 36: Prompt Caching으로 긴 세션 비용 줄이기 | DAKER 커뮤니티
Claude Code 상세 사용법 36: Prompt Caching으로 긴 세션 비용 줄이기
Claude Code 공식 Prompt caching 문서는 Claude Code가 전체 대화와 프로젝트 컨텍스트를 매 turn 다시 보내지만, 앞부분 prefix가 같으면 서버 측 cache를 재사용한다고 설명한다. 긴 바이브코딩 세션에서 체감 속도와 비용을 좌우하는 것은 “무엇을 읽느냐”보다 “중간에 prefix를 얼마나 흔드느냐”다.
위 SVG는 Mermaid 흐름을 DAKER 편집기용 튜토리얼 이미지로 옮긴 것이다.
1. 세션 시작 전에 흔들릴 값을 고정한다
모델 변경, effort 변경, fast mode 진입, MCP 서버 연결/해제, 일부 plugin reload, bare tool deny rule 변경, /compact는 cache miss를 만들 수 있다. 그래서 큰 작업은 시작 전에 모델, permission mode, MCP 연결, plugin 상태를 정한다.
claude
/model
/mcp
/permissions작업 중간에 “잠깐 모델만 바꿔볼까?”를 반복하면 같은 대화라도 첫 turn처럼 느려질 수 있다.
2. /compact는 자연스러운 경계에서 쓴다
공식 문서상 /compact는 대화 이력을 요약으로 바꾸기 때문에 conversation layer를 새로 만든다. 나쁜 사용법은 버그 수정 도중 자동 compaction에 끌려가는 것이다. 좋은 사용법은 한 작업이 끝난 직후 다음 작업으로 넘어가기 전에 요약 지시를 붙이는 것이다.
/compact focus on the auth migration decisions, failing tests, and files changed완전히 다른 작업으로 갈 때는 /clear가 낫다. 이전 대화가 매 요청의 비용이 되는 것을 막는다.
3. 프로젝트 지침 수정은 다음 시작까지 기다린다
프로젝트 루트와 사용자 지침 파일은 세션 시작 때 읽힌다. 중간에 고쳐도 cache를 깨지는 않지만, 즉시 적용되지도 않는다. 새 규칙을 바로 쓰려면 /clear, /compact, 또는 재시작이 필요하다.
이번 세션에서는 기존 프로젝트 지침 기준으로만 작업해줘.
새로 추가한 규칙은 다음 세션에서 검증하겠다.4. 실제 신호를 본다
상태줄이나 telemetry에서 cache_read_input_tokens가 높고 cache_creation_input_tokens가 반복적으로 낮으면 cache가 잘 맞고 있다. 반대로 매 turn creation이 크면 prefix가 계속 바뀌는 것이다.
Senior takeaway: Claude Code 비용 최적화는 “짧게 물어보기”만이 아니다. 모델, MCP, plugin, compaction,
session boundary를 의식하는 것이 agentic coding의 운영 습관이다. 긴 AI 코딩 루프일수록 cache를 따뜻하게 유지하는 사람이 더 빠르게 검증한다.