Grok 4.6, 모델을 키운 업데이트가 아니라 에이전트가 덜 끊기게 만든 업데이트 | DAKER 커뮤니티
새 이름만 보고 모델이 더 커졌다고 읽으면 핵심을 놓치기 쉽습니다. 2026년 8월 12일 xAI가 내놓은 Grok 4.6은 4.5의 크기를 키운 모델이 아니라, 4.5 위에 후훈련을 얹은 업데이트입니다. 초점도 분명합니다. 긴 작업에서 에이전트가 중간에 멈추는 버릇을 줄이는 쪽입니다.
그래서 이 글에서 볼 것은 리더보드의 한 줄이 아닙니다. 실제 작업 세션이 몇 시간째 이어지는지, 조사에서 구현으로 넘어가고 수정과 테스트까지 버티는지입니다. 긴 작업을 자주 맡는 팀이라면 지금 읽을 이유가 여기에 있습니다.
Grok 4.6에서 실제로 나온 것
xAI 공식 발표는 4.6을 4.5를 기반으로 한 업데이트로 소개합니다. 초점은 오래 이어지는 에이전트와 더 욕심 나는 시각·인터랙티브 작업입니다. 주제를 조사하고, 정보를 읽고, 코드베이스를 넘나들고, 아이디어를 실제 앱으로 밀어 넣는 구간에서 중간에 멈추지 않게 만들겠다는 설명입니다.
4.6은 모델을 키운 업데이트가 아니라, 중간에 멈추지 않고 더 오래 일하게 만든 업데이트입니다.
학습 순서는 공식 글에 나온 범위만 보면 됩니다. 먼저 4.5보다 긴 보충 학습을 돌렸고, 그다음 4.5가 추론 노력·에이전트 실행 환경(하네스)·STEM·소프트웨어 공학·지식 업무 구간의 지도 미세조정(SFT) 작업 기록을 다시 만들었습니다. 문제 있는 기록은 모델 검사로 걸러냈다고 적혀 있습니다. 그 위에 에이전트 환경에서 강화학습(RL)을 돌렸고, 지식 업무, 일반 코딩, 커널 최적화, 웹 개발, CAD 같은 도메인 환경이 포함됐습니다.
쓸 수 있는 조건도 함께 공개됐습니다. 추론 노력에는 xhigh가 있고, 컨텍스트는 50만 토큰입니다. 표준 가격은 입력 백만 토큰당 2달러, 출력 6달러로 4.5와 같습니다. 다만 프롬프트가 20만 토큰을 넘으면 그 요청 전체의 단가가 두 배가 됩니다. 빠른 변형도 두 배 가격입니다.
배포 자리도 비교적 분명합니다. Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare에서 바로 붙습니다. 첫 주에는 Cursor와 Grok Build에서 포함 사용량이 두 배입니다. 반면 소비자용 웹·앱·X 안의 Grok은 나중에 올라간다고 모델 카드에 적혀 있습니다. 오늘 바로 쓸 수 있는 자리는 에디터와 빌드 도구 쪽입니다.
벤치마크 숫자는 어디까지 읽어야 하나
공개된 숫자는 xAI가 제시한 범위만 보면 됩니다. Artificial Analysis Intelligence Index는 61로 GPT-5.6 Sol Max와 동률입니다. 4.5 High는 56이었습니다. CursorBench 3.2는 69.9퍼센트로 4.5의 66.7보다 높습니다. DeepSWE 1.1은 65.9퍼센트로 4.5의 54보다 올랐습니다. Terminal-Bench 3.0은 26퍼센트로 4.5의 15.7보다 높지만, GPT-5.6 Sol Max의 34.6에는 못 미칩니다.
이 숫자들이 말해 주는 방향은 한쪽으로 기울어져 있습니다. CursorBench와 DeepSWE처럼 에디터와 소프트웨어 작업에 가까운 구간에서는 4.6이 4.5를 분명하게 앞섭니다. 반면 Terminal-Bench처럼 셸과 환경 조작에 가까운 구간에서는 개선됐지만 여전히 뒤처집니다.
에디터에서 이기고 셸에서 지는 모델을 코딩 1등으로 부르기는 어렵습니다.
그래서 평균 점수 한 줄로 정리하면 실제 작업에서 왜 막히는지 설명하지 못합니다. 같은 모델이라도 작업의 모양이 다르면 성적표가 갈라집니다. 빌더에게 중요한 것은 전체 평균보다 자기 작업이 놓인 자리입니다.
무엇이 아닌지도 분명합니다
이번 발표는 더 큰 모델을 내놓은 발표가 아닙니다. 모든 코딩 벤치에서 1등을 가져간 발표도 아닙니다. 터미널 작업은 여전히 뒤처져 있고, 시각·인터랙티브 작업의 첫 패스가 좋아졌다고 해서 그 결과물이 완제품이라는 뜻도 아닙니다.
xAI도 긴 작업에서 자기 테스트와 검증을 더 보기 시작했다고 적었을 뿐입니다. 이것은 약속이라기보다 관측에 가깝습니다. 그 문장만 보고 팀 기본 모델을 바꾸기보다는, 실제 세션에서 다시 재보는 것이 맞습니다.
50만 토큰 컨텍스트 역시 오해하기 쉬운 지점입니다. 길어진 컨텍스트는 무조건 많이 넣으라는 뜻이 아닙니다. 20만 토큰을 넘는 순간 입력·출력 단가가 두 배가 됩니다. 오래 이어가는 모델과 오래 넣는 청구서는 같이 옵니다. 캐시 입력이 더 싸더라도, 컨텍스트를 채운 만큼 다음 요청이 비싸지는 구조는 그대로입니다.
가격이 4.5와 같다는 점도 마찬가지입니다. 단가가 같다고 같은 일이 되는 것은 아닙니다. 에이전트가 한 세션을 더 오래 이어 가고, 자기 테스트를 한 바퀴 더 돌리면 전체 토큰은 늘어납니다. 같은 단가에서 더 오래 일할 수 있는 모델이라는 뜻에 가깝습니다. xhigh도 기본값처럼 켜기보다, 실제로 끊기던 작업에만 쓰는 편이 좋습니다.
긴 작업에서 체감 차이가 나는 자리
xAI가 강조한 장면은 벤치 표보다 구체적입니다. 넓은 제품 아이디어를 동작하는 첫 버전으로 밀어 가는 일, 낯선 도메인을 조사하고 앱 구조를 잡고 핵심 인터랙션을 구현한 뒤 피드백을 여러 바퀴 받으며 다듬는 일입니다. 시각 언어를 한 패스에서 세우는 일도 여기에 포함됩니다.
빌더에게 중요한 질문은 따로 있습니다. 우리 세션은 어디서 끊기는가입니다. 조사에서 끊기는지, 구현에서 길을 잃는지, 수정 단계에서 같은 파일만 다시 만지는지, 끝에서 테스트를 건너뛰는지 봐야 합니다.
이 업데이트의 핵심은 한 번에 맞는 답보다 몇 번째 도구 호출까지 목표를 유지하는가에 있습니다.
에이전트가 멈추는 이유는 대부분 모른다기보다 흐름을 잃기 때문입니다. 계획 다음 검색에서 길을 잃고, 작성 다음 검토를 건너뛰고, 실행 다음 피드백을 자기 칭찬으로 닫아 버립니다. 4.6이 이 연쇄를 더 오래 이어 간다면, 짧은 질문으로는 차이가 잘 보이지 않습니다.
비교는 크게 벌일 필요가 없습니다. 어제 4.5에서 끊긴 작업을 그대로 가져오면 됩니다. 같은 저장소, 같은 이슈, 같은 도구에서 모델만 4.6으로 바꿔 봅니다. 그리고 처음 계획이 30분 뒤에도 남아 있는지, 중간 수정이 같은 파일을 다시 건드리는지, 끝에서 테스트를 실제로 돌리는지를 적어 두면 됩니다.
반대로 한 파일, 한 함수, 한 커밋으로 끝나는 짧은 일은 체감 차이가 작을 수 있습니다. 이런 경우에는 모델을 갈아끼우는 비용이 먼저 느껴질 가능성이 큽니다. 그래서 교체 기준은 더 센 모델이 아니라, 끊기던 작업이 이어지는가로 옮겨 두는 편이 낫습니다.
목표가 빠지는지 재는 가장 현실적인 방법
기록은 길지 않아도 됩니다. 목표, 지금 파일, 통과한 테스트. 세션 끝에 이 세 줄만 남겨도 다음 사람이 같은 에이전트를 이어받을 수 있습니다. 기록이 없으면 4.6이 버텼는지 4.5가 버텼는지보다, 팀에 남는 것이 없다는 문제가 더 커집니다.
세션 시작에는 목표 한 문장을 적고, 30분마다 그 문장을 다시 읽어 보면 됩니다. 에이전트가 지금 만지는 파일이 그 문장과 맞는지 확인하고, 맞으면 유지, 벗어나면 이탈로 적습니다. 이탈이 두 번이면 프롬프트만 탓하기보다 컨텍스트에 쌓인 로그를 줄여 보는 것이 좋습니다. 반대로 이탈이 없는데도 테스트가 없다면, 목표는 붙잡았지만 검증을 건너뛴 실패로 봐야 합니다.
재는 시점도 미리 정해 두면 좋습니다. 30분, 90분, 세 시간. 이 세 지점에서 같은 질문을 던집니다. 목표가 남아 있는지, 같은 파일을 다시 고치는지, 테스트를 실제로 돌리는지입니다. 한 시점에서만 버티고 다음 시점에서 끊기면, 공개 벤치의 개선이 우리 팀의 개선과 같다고 보기는 어렵습니다.
터미널 작업은 따로 보는 편이 맞습니다. Terminal-Bench는 26퍼센트로 올랐지만 여전히 GPT-5.6 Sol Max의 34.6에는 못 미칩니다. 셸 중심 파이프라인에서 4.6을 바로 기본값으로 올리면, 에디터에서 본 이득을 터미널에도 그대로 옮긴 착각이 생길 수 있습니다.
오늘 DAKER 빌더가 바로 볼 포인트
팀 기본값을 바꾸는 논의는 조금 늦어도 됩니다. 먼저 개인 실험으로 긴 작업 두 개, 짧은 작업 두 개만 기록해도 교체 여부를 가늠할 수 있습니다. 중요한 것은 모델 이름을 바꾼 채팅 로그가 아니라, 다른 사람이 링크를 열어 한 번 성공하는 지점까지 가는지입니다.
- Cursor에서 4.6을 한 세션 붙여 보고, 짧은 질문보다 조사·구현·수정이 이어지는 작업을 넣어 보면 됩니다. 첫 주 포함 사용량이 두 배인 Cursor와 Grok Build가 이런 시험에 맞는 자리입니다.
- 더 큰 모델이 왔다고 가정하지 않고, 프롬프트와 도구를 그대로 둔 채 모델만 바꿔 비교하는 것이 좋습니다.
- 긴 작업에서는 30분, 90분, 세 시간 지점에서 목표 유지, 같은 파일 재수정 여부, 실제 테스트 실행 여부를 적어 두면 됩니다.
- 터미널 작업은 따로 보고, 셸 중심 파이프라인은 실패 로그를 먼저 모은 뒤 판단하는 편이 안전합니다.
- 20만 토큰 구간은 견적에 미리 넣어 두는 것이 좋습니다. 컨텍스트를 길게 쓰는 에이전트는 단가가 두 배가 될 수 있습니다.
- xhigh는 끊기던 작업에만 켜는 편이 낫습니다. 추론 노력을 올리면 시간과 토큰이 먼저 움직입니다.
- 시각·인터랙티브 작업은 스크린샷보다 클릭과 새로고침이 실제로 되는지 로그에 남겨 두는 것이 중요합니다.
공식 발표와 xAI 개발자 문서만으로도 컨텍스트, 가격 구간, 추론 노력은 확인됩니다. 50만 토큰, 20만 토큰에서 단가 두 배, 입력 2달러, 출력 6달러, xhigh까지는 여기서 바로 확인할 수 있습니다. 오늘 필요한 것은 더 많은 점수표보다, 어제 끊기던 한 개의 긴 작업을 다시 넣어 보는 일입니다.
해커톤 주간이라면 이 구분이 더 선명해집니다. 심사위원이 여는 것은 모델 목록이 아니라 URL입니다. 4.6을 켰다는 문장 자체는 가산점이 아닙니다. 조사에서 구현으로, 구현에서 수정으로 이어져 배포까지 갔는지가 남습니다.
배포가 제출입니다.
한 줄로 줄이면 이렇습니다. 4.6은 모델을 키운 업데이트가 아닙니다. 중간에 멈추지 않고 더 오래 일하게 만든 업데이트입니다. 그 변화가 우리 저장소에서 실제로 버티는지는 벤치마크가 아니라 오늘의 한 세션이 말해 줍니다.
참고 자료
Introducing Grok 4.6 — xAI, 2026년 8월 12일
xAI 개발자 문서
여러분 팀에서는 에이전트가 가장 자주 끊기는 지점이 조사, 구현, 수정, 테스트 중 어디인지 궁금합니다.