Grok 4.7 공개 — 가격은 4.6 그대로, 긴 코딩과 지식 업무가 강해졌습니다 | DAKER 커뮤니티

Grok 4.7 설명용 생성 이미지

값은 그대로 두고, 오래 걸리는 일을 더 잘하게 만들었습니다. xAI가 9월 21일 공개한 Grok 4.7의 핵심은 이것입니다. 여러 시간이 걸리는 코딩 작업이나 긴 문서 업무를 AI에 맡기는 팀이라면 눈여겨볼 만한 업데이트입니다. 무엇이 바뀌었는지, 숫자는 어떻게 읽어야 하는지, 팀에 들일 때 무엇부터 해 보면 좋은지 정리했습니다.

Grok 4.7은 무엇이 달라졌나

xAI는 Grok 4.7을 코딩과 지식 업무에서 가장 강한 자사 모델로 소개했습니다. 달라진 점은 세 가지로 요약됩니다. 어려운 일을 더 오래 붙잡고 있을 수 있고, 스스로 결과를 더 꼼꼼히 점검하며, 지금까지 가운데 가장 잘 조율된 안전장치를 갖췄다는 것입니다.

이를 위해 기반 모델을 키우고, 여러 시간이 걸리는 문제에 비중을 둔 강화학습을 더 오래 진행했다고 합니다. xAI의 에이전트 실행 환경을 기본으로 이해하도록 학습해, 대화형 업무나 일반 지식 업무에도 맞췄다는 설명도 덧붙였습니다.

가격과 쓸 수 있는 곳

가격은 Grok 4.6과 같습니다. 100만 토큰당 입력은 2달러부터, 출력은 6달러이고 속도도 같습니다. 출력 속도가 두 배인 빠른 버전도 있는데, 가격도 두 배입니다.

Grok 4.7은 Cursor, Grok Build, Grok API에서 쓸 수 있고, 외부 코딩 도구와 모델 라우터, 클라우드에서도 제공됩니다. 9월 28일에는 AWS가 Amazon Bedrock에서도 Grok 4.7을 쓸 수 있다고 발표했습니다. Bedrock에서는 컨텍스트 50만 토큰과 네 단계 추론 강도(low, medium, high, xhigh)를 지원합니다.

xAI 발표(9월 21일)와 AWS 발표(9월 28일)는 날짜가 다릅니다. "한꺼번에 어디서나 출시됐다"고 전하면 사실과 어긋납니다.

벤치마크, 이렇게 읽으세요

xAI가 공개한 주요 지표는 다음과 같습니다.

지표Grok 4.7비교
CursorBench 4.046.3%Grok 4.6: 40.4%
Terminal-Bench 4.037.6%Grok 4.6: 20.3%
DeepSWE v1.1 (high effort)71.0%-
EEBench64.0%-
AA Briefcase v1.11,657-
Harvey Legal Agent19.6%-
HealthBench Professional56.7%-

터미널 작업 지표가 20.3%에서 37.6%로 가장 크게 올랐습니다. 다만 이런 숫자를 합치거나 "세계 1위"처럼 바꿔 말하는 것은 피해야 합니다. 발표 표에는 다른 회사 모델도 함께 실려 있지만, 이 글에서는 Grok 4.7이 이전 버전보다 얼마나 나아졌는지만 다뤘습니다.

"두 배 빠르고 절반 가격" 같은 문구를 볼 때도 주의가 필요합니다. 무엇과 비교한 숫자인지 함께 보지 않으면 오해하기 쉽습니다. xAI가 실제로 강조한 것은 같은 가격에서 긴 코딩과 문서 작업 능력이 올랐다는 점입니다.

안전장치

xAI는 위험한 요청을 거절하고 우회 시도를 막는 능력과, 보안·생명과학처럼 좋은 용도와 나쁜 용도가 섞인 분야의 균형을 함께 강조했습니다. LatchBio 바이오 안전 평가에서는 62.4%를 기록했고, HackerBench v0.3에서 위험한 프롬프트가 통과된 비율은 3.3%였다고 합니다. 공격 연구용 접근은 선별된 파트너에게만 초대 형식으로 열립니다.

우리 팀에 들인다면: 3단계 도입 가이드

1단계. 쓸 수 있는지와 비용부터 확인합니다

지금 쓰는 IDE나 모델 라우터에 Grok 4.7이 보이는지 확인하고, 입력 2달러·출력 6달러라는 단가를 팀 비용표에 적어 두세요. 모델 별칭이 여전히 4.6을 가리키고 있지는 않은지도 점검해야 합니다. Bedrock을 쓰는 조직이라면 AWS 공지와 리전 문서를 따로 확인하는 것이 좋습니다.

2단계. 긴 작업 한 건으로 비교해 봅니다

여러 파일을 고쳐야 하는 긴 작업 하나를 골라, Grok 4.6과 4.7에 같은 프롬프트로 맡겨 보세요. 걸린 시간, 토큰, 재시도 횟수, 사람이 고친 시간을 기록하면 됩니다. 긴 작업이 중간에 멈춘다면 모델을 탓하기 전에 컨텍스트 창 크기와 도구 실패 기록부터 살펴보시기 바랍니다.

3단계. 팀 기준을 한 문장으로 정합니다

비교가 끝나면 사용 기준을 위키에 적어 두세요. 예를 들면 이렇습니다.

긴 멀티파일 수정과 문서 초안에는 Grok 4.7을 쓰고, 빠른 버전은 데모 직전에만 켠다. Bedrock 경로는 인프라팀이 리전 문서를 확인한 뒤에 연다.

해커톤 기간이라면 제출 마감 하루 전에 모델 설정을 고정해 두는 것이 안전합니다. 마감 직전에 모델을 바꾸면 결과를 재현하기 어려워집니다.

마치며

Grok 4.7은 가격을 올리지 않고 긴 작업 능력을 키운 업데이트입니다. 짧은 질의응답만 쓴다면 체감 차이가 크지 않을 수 있지만, 여러 시간짜리 에이전트 작업을 돌리는 팀이라면 한 번 비교해 볼 가치가 있습니다. 여러분 팀에서는 어떤 작업으로 먼저 시험해 보실 건가요? 결과를 댓글로 나눠 주세요.

참고 자료