Claude Sonnet 5.5 공개 — 가격은 그대로, 속도는 30% 빠르고 작업당 비용은 최대 30% 줄었습니다 | DAKER 커뮤니티

Claude Sonnet 5.5 설명용 생성 이미지

가격은 그대로인데 더 빠르고, 일은 더 싸게 끝납니다. Anthropic이 9월 28일 공개한 Claude Sonnet 5.5를 한 문장으로 줄이면 이렇습니다. 요즘 AI로 코드를 고치고 문서를 다듬는 일이 많은 팀이라면, 기본 모델을 바꿀지 한 번쯤 고민하게 되는 소식입니다. 이 글에서는 무엇이 바뀌었는지, 숫자는 어떻게 읽어야 하는지, 우리 팀에 들일 때 무엇부터 해 보면 좋은지를 차례로 정리했습니다.

Sonnet 5.5는 어떤 모델인가

Sonnet 5.5는 Claude 5.5 계열에서 두 번째로 나온 모델입니다. 먼저 나온 Opus 5.5가 복잡하고 오래 고민해야 하는 일을 맡는 모델이라면, Sonnet 5.5는 범위가 분명한 일상 작업을 빠르게 처리하는 모델입니다. Anthropic이 꼽은 강점도 버그 수정, 문서와 슬라이드 다듬기, 스프레드시트 정리처럼 매일 반복되는 일들입니다. 디자인 감각이 좋아졌다는 점도 따로 언급했습니다.

여기서 중요한 점은 Sonnet 5.5가 Opus를 대신하는 모델이 아니라는 것입니다. Anthropic도 열린 형태의 복잡한 작업에서는 Opus가 여전히 더 강하다고 분명히 밝혔습니다. 두 모델을 나란히 두고, 일의 성격에 따라 나눠 쓰는 그림에 가깝습니다. 대용량·저비용용인 Haiku 5.5도 몇 주 안에 합류할 예정이라, 5.5 계열은 세 모델이 역할을 나누는 구성이 됩니다.

빨라진 속도, 줄어든 비용

가장 눈에 띄는 변화는 속도입니다. Sonnet 5.5는 이전 모델인 Sonnet 5보다 답을 30% 넘게 빨리 써 냅니다.

비용 이야기는 조금 더 들여다봐야 합니다. 100만 토큰당 목록 가격은 Sonnet 5와 똑같습니다. 입력은 2달러, 출력은 10달러, 캐시 읽기는 0.20달러입니다. 그런데도 비용이 줄어드는 이유는 같은 일을 더 적은 토큰으로 끝내기 때문입니다. Anthropic 테스트에서는 작업 하나에 드는 비용이 최대 30%가량 줄었다고 합니다.

그래서 사내 보고서나 대시보드에 "단가가 내렸다"고 적으면 틀립니다. "작업당 토큰이 줄었다"가 정확한 표현입니다.

속도와 품질 사이의 균형은 노력도(effort) 설정으로 조절합니다. 낮추면 더 빠르고 싸게, 높이면 더 오래 검토하고 답합니다. 기본값은 Claude 앱이 Medium, 개발자용 Claude Platform이 High입니다.

벤치마크 숫자, 이렇게 읽으세요

Anthropic이 공개한 주요 성능 지표는 다음과 같습니다.

지표Sonnet 5.5비교 대상
Terminal-Bench 4.070.6%Sonnet 5: 10.3%
CursorBench 4.055.5%Sonnet 5: 34.1%
FrontierCode 1.1 MainMax 46.2% / Xhigh 52.1%-
GDPval-AA v2.11844Opus 5.5: 1846 / Sonnet 5: 1449
OSWorld 2.1 (partial)80.1%-
Chartography (도구 없음)61.6%-

터미널 작업 지표가 10.3%에서 70.6%로 뛴 것이 가장 크게 보입니다. 하지만 이 숫자만 보고 "이제 코딩은 알아서 다 해 준다"고 받아들이면 곤란합니다. 벤치마크는 정해진 과제에서의 결과일 뿐, 우리 저장소의 복잡한 사정까지 반영하지는 않습니다.

FrontierCode 결과도 눈여겨볼 만합니다. 가장 높은 설정인 Max가 한 단계 낮은 Xhigh보다 점수가 낮습니다. Anthropic은 오래 고민하다가 범위 밖까지 고치거나 시간을 넘긴 경우가 있었다고 설명합니다. 설정을 끝까지 올린다고 늘 결과가 좋아지지는 않는다는 뜻입니다.

GDPval 점수가 Opus 5.5와 거의 같다는 점도 과장하지 않는 편이 좋습니다. 특정 지표에서 비슷하다는 것이지, Sonnet이 Opus를 따라잡았다는 뜻은 아닙니다.

함께 알아둘 안전장치

이번 모델은 사이버 보안 능력이 상위 모델인 Opus 5 수준에 가까워졌습니다. 그래서 Sonnet 계열로는 처음으로 사이버 안전장치가 붙었습니다. 일반적인 소프트웨어 개발에는 영향이 없고, 위험도가 높은 보안 관련 요청만 이전 모델인 Sonnet 5가 대신 처리합니다. 생물학 관련 안전장치는 Sonnet 5와 같습니다.

추론 과정을 빼내려는 시도를 막는 분류기와, 대화의 사고 흐름을 이어가는 preserved thinking 기능도 확장됐습니다. 다만 계정을 옮겨 대화를 이어갈 때는 제약이 있을 수 있어, Claude Code 계정을 자주 바꿔 쓰는 팀이라면 운영 계정을 하나로 정해 두는 편이 안전합니다.

우리 팀에 들인다면: 3단계 도입 가이드

1단계. 쓸 수 있는지부터 확인합니다

Sonnet 5.5는 Claude Platform뿐 아니라 AWS, GCP, Azure에서도 쓸 수 있고, 모델 ID는 claude-sonnet-5-5입니다. 먼저 콘솔에서 이 ID가 보이는지 확인하세요. 그동안 thinking 기능을 끈 채 Sonnet을 써 왔다면, 새로 생긴 between_tools 설정으로 옮기는 작업이 필요합니다. 제로 데이터 리텐션은 이전과 똑같이 지원됩니다.

2단계. 직접 세 건만 비교해 봅니다

발표 자료보다 우리 코드에서 나온 결과가 더 믿을 만합니다. 평소에 자주 하는 버그 수정 작업 세 건을 골라 Sonnet 5와 Sonnet 5.5에 똑같이 맡겨 보세요. 이때 걸린 시간, 사용한 토큰, 도구 호출 횟수, 그리고 사람이 결과를 고치는 데 든 시간을 함께 적어 두면 좋습니다. 초기 테스터들은 5.5가 도구 호출을 묶어서 처리하고 토큰도 덜 쓴다고 말하는데, 그 말이 우리 환경에서도 맞는지 여기서 확인할 수 있습니다.

3단계. 기준을 한 문장으로 정합니다

비교가 끝나면 팀 위키에 모델 사용 기준을 한 문장으로 적어 두세요. 예를 들면 이렇습니다.

일상적인 버그 수정, 문서, 슬라이드, 표 작업은 Sonnet 5.5를 쓰고, 모호한 설계와 오래 걸리는 판단은 Opus 5.5를 쓴다. 비용은 작업당 토큰으로 본다.

이 한 문장만 있어도 "전부 Opus로 하자", "전부 Sonnet으로 하자" 같은 논쟁이 크게 줄어듭니다. 전체 전환이 부담스럽다면 파일럿 팀 하나만 먼저 옮겨 보는 것도 방법입니다. 새 사이버 안전장치에 대해서는 보안팀에도 미리 알려 두시기 바랍니다.

마치며

Sonnet 5.5는 화려한 신기능보다는 매일 쓰는 모델이 더 빠르고 더 싸졌다는 데 의미가 있는 업데이트입니다. Opus와 경쟁하기보다는 Opus 옆에서 일상 업무를 맡는 모델로 보는 것이 정확합니다. 당장 할 일은 많지 않습니다. 모델 ID를 확인하고, 필요하면 설정을 옮기고, 세 건만 직접 비교해 보면 됩니다. 여러분 팀에서는 Sonnet 5.5를 어떤 작업에 먼저 써 보실 건가요? 비교해 본 결과가 있다면 댓글로 나눠 주세요.

참고 자료