모델은 안 키웠다. 에이전트가 안 끊기게 만들었다 | DAKER 커뮤니티

새 이름만 보고 모델이 커졌다고 읽으면 틀립니다. 2026년 8월 12일 xAI가 내놓은 Grok 4.6은 4.5의 크기를 키운 모델이 아닙니다. 4.5 위에 후훈련을 얹었습니다. 긴 작업에서 에이전트가 중간에 멈추는 버릇을 줄이는 쪽을 골랐습니다. 오늘 볼 것은 리더보드가 아닙니다. 그 작업 세션이 몇 시간째 이어지느냐입니다.

4.5 칩에서 계획·검색·작성·검토·실행·피드백·개선으로 이어지는 Grok 4.6 에이전트 체인

공식 한 줄이 제목과 같습니다. xAI 공식 발표는 4.6을 4.5를 기반으로 한 업데이트로 소개합니다. 초점은 둘입니다. 오래 이어지는 에이전트. 더 욕심 나는 시각·인터랙티브 작업. 주제를 조사하고, 정보를 읽고, 코드베이스를 넘나들고, 아이디어를 실제 앱으로 밀어 넣는 그 구간에서 중간에 멈추지 않게 만들겠다는 선언입니다. 모델을 키운 업데이트가 아닙니다. 중간에 멈추지 않고 더 오래 일하게 만든 업데이트입니다.

무엇이 실제로 나왔나

학습 순서만 공식 글대로 적습니다. 4.5보다 긴 보충 학습을 먼저 돌렸습니다. 그다음 4.5가 추론 노력·에이전트 실행 환경(하네스)·STEM·소프트웨어 공학·지식 업무 구간의 지도 미세조정(SFT) 작업 기록을 다시 만들었습니다. 문제 있는 기록은 모델 검사로 걸러냈다고 적혀 있습니다. 그 위에 에이전트 환경에서 강화학습(RL)을 돌렸습니다. 지식 업무, 일반 코딩, 커널 최적화, 웹 개발, CAD 같은 도메인 환경이 그 목록에 있습니다. 학습 순서를 여기서 더 보태지 않습니다. 긴 보충 학습, 작업 기록 재생성, 필터, 강화학습. 이 순서가 4.6입니다.

쓸 수 있는 면도 같이 나왔습니다. 추론 노력에는 xhigh가 있습니다. 컨텍스트는 50만 토큰입니다. 표준 가격은 입력 백만 토큰당 2달러, 출력 6달러입니다. 4.5와 같습니다. 프롬프트가 20만 토큰을 넘으면 그 요청 전체의 단가가 두 배가 됩니다. 빠른 변형도 두 배 가격입니다. 컨텍스트가 길어졌다고 공짜가 된 게 아닙니다. 단가가 같다고 일이 같은 것도 아닙니다. 컨텍스트 길이와 가격 구간, 두 줄을 처음부터 같이 적습니다.

오늘 바로 붙는 자리도 정해져 있습니다. Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare. 첫 주에는 Cursor와 Grok Build에서 포함 사용량이 두 배입니다. 시험 사용을 권하는 신호가 제품 안에 이미 들어가 있습니다. 소비자용 웹·앱·X 안의 Grok은 나중에 올라간다고 모델 카드가 적어 두었습니다. 오늘 바로 쓸 수 있는 자리는 에디터와 빌드 도구입니다. 해커톤 주간에 새 모델을 기다리다 끝나는 패턴과 반대입니다. 도구를 오늘부터 쓸 수 있습니다. 이미 쓸 수 있는 자리에 어제 끊긴 작업을 넣는 쪽이 오늘 일입니다.

숫자는 xAI가 공개한 네 줄만 적습니다. Artificial Analysis Intelligence Index는 61입니다. GPT-5.6 Sol Max와 동률입니다. 4.5 High는 56이었습니다. CursorBench 3.2는 69.9퍼센트입니다. 4.5는 66.7이었습니다. DeepSWE 1.1은 65.9퍼센트입니다. 4.5는 54였습니다. Terminal-Bench 3.0은 26퍼센트입니다. 4.5의 15.7보다 올랐습니다. 그래도 GPT-5.6 Sol Max의 34.6에는 못 미칩니다. 이 네 줄 밖 점수는 여기서 만들지 않습니다. 표를 더 많아 보이게 하려고 숫자를 보태는 순간, 이 글은 보도자료를 베끼는 글로 바뀝니다.

점수 방향도 한쪽에 치우쳐 있습니다. CursorBench와 DeepSWE는 에디터와 소프트웨어 작업에 가깝습니다. 여기서 4.6은 4.5를 분명하게 앞섭니다. Terminal-Bench는 셸과 환경 조작에 가깝습니다. 여기서는 올랐지만 아직 뒤처져 있습니다. 코딩이 좋아졌다고 한 줄로 묶으면, 내일 터미널에서 막히는 이유를 설명하지 못합니다. 같은 모델이라도 작업의 모양이 다르면 성적표가 갈라집니다. 빌더는 평균이 아니라 자기 작업의 자리를 봅니다. 에디터에서 이기고 셸에서 지는 모델을 코딩 1등으로 부르지 않습니다.

무엇이 아닌가

더 큰 모델을 기다린 사람에게는 실망이 될 수 있습니다. 파라미터를 키운 발표가 아닙니다. 모든 코딩 벤치에서 1등을 가져간 발표도 아닙니다. 터미널 작업은 여전히 뒤처져 있습니다. 시각·인터랙티브 작업의 첫 패스가 좋아졌다고 해서, 그 첫 화면이 완제품이라는 뜻도 아닙니다. xAI 스스로도 긴 작업에서 자기 테스트와 검증을 더 보기 시작했다고 적었을 뿐입니다. 그 문장은 약속이 아닙니다. 관측입니다. 그 문장만 보고 팀 기본 모델을 바꾸지 않습니다. 오늘 우리 세션에서 다시 잽니다.

50만 토큰 컨텍스트도 한 번에 다 넣고 잊어버리라는 뜻이 아닙니다. 컨텍스트가 길어지면 요금 구간이 바뀝니다. 20만 토큰을 넘는 순간 입력·출력 단가가 두 배가 됩니다. 오래 이어가는 모델과 오래 넣는 청구서는 같이 옵니다. 컨텍스트를 자랑처럼 채우면 에이전트는 안 끊깁니다. 대신 예산이 먼저 끊깁니다. 캐시 입력은 더 쌉니다. 그래도 컨텍스트를 채운 만큼 다음 요청이 비싸집니다. 긴 컨텍스트는 재료를 더 넣는 면이 아닙니다. 남길 파일과 버릴 로그를 먼저 나누는 면입니다.

가격이 4.5와 같다는 점도 오해하기 쉽습니다. 단가가 같으니 같은 일이라는 뜻이 아닙니다. 에이전트가 한 세션을 더 오래 이어 갑니다. 자기 테스트를 한 바퀴 더 돌립니다. 그러면 토큰은 늘어납니다. 싼 모델이 들어온 게 아닙니다. 같은 단가에서 더 오래 일할 수 있는 모델입니다. 그 차이를 견적에 안 적으면 다음 주 청구서가 설명해 줍니다. xhigh를 기본값처럼 켜는 것도 같은 함정입니다. 추론 노력을 올리는 스위치는 품질이 아니라 시간과 토큰을 먼저 움직입니다. 끊기던 작업에만 켭니다. 한 함수, 한 커밋에 켜면 시간과 토큰만 먼저 갑니다.

소비자용 제품이 오늘 같이 나왔다는 말도 만들지 않습니다. 웹·앱·X 안의 Grok은 나중에 올라간다고 적혀 있습니다. 오늘 쓸 수 있는 자리는 Cursor와 Grok Build, API와 파트너입니다. 그 밖을 추측해서 기본값을 바꾸지 않습니다. 새 제품을 기다리다 주간을 비우는 패턴이 여기에도 있습니다. 쓸 수 있는 자리는 이미 있습니다. 그 자리에 작업을 넣고 링크가 열릴 때까지 가는 쪽이 제출입니다. 배포가 제출입니다.

긴 작업에서 실제로 달라지는 자리

xAI가 강조한 장면은 벤치 표보다 구체적입니다. 넓은 제품 아이디어를 동작하는 첫 버전으로 밀어 가는 일. 낯선 도메인을 조사하고, 앱 구조를 잡고, 핵심 인터랙션을 구현하고, 피드백을 여러 바퀴 받으며 다듬는 일. 시각 언어를 한 패스에서 세우는 일. 데모 영고용으로 읽히기 쉽습니다. 빌더에게는 다른 질문입니다. 우리 세션은 어디서 끊깁니까. 조사에서입니까. 구현에서입니까. 수정에서 같은 파일을 다시 만집니까. 끝에서 테스트를 건너뜁니까.

에이전트가 죽는 이유는 대부분 몰라서가 아닙니다. 계획 다음 검색에서 길을 잃습니다. 작성 다음 검토를 건너뜁니다. 실행 다음 피드백을 자기 칭찬으로 닫습니다. 4.6이 그 연쇄를 더 이어 간다면, 잴 단위는 한 번에 맞는 답이 아닙니다. 몇 번째 도구 호출까지 목표를 유지하는가입니다. 짧은 질문으로 승부를 보면 이 업데이트의 핵심이 안 보입니다. 한 줄 퀴즈로 후훈련을 재는 실험은, 재는 단위가 틀린 실험입니다.

비교는 작아도 됩니다. 어제 4.5에서 끊긴 작업을 그대로 가져옵니다. 같은 저장소. 같은 이슈. 같은 도구. 모델만 4.6으로 바꿉니다. 그리고 세 지점을 적습니다. 처음 계획이 30분 뒤에도 남아 있는지. 중간 수정이 같은 파일을 다시 건드리는지. 끝에서 테스트를 실제로 돌리는지. 이 세 줄이 비면 벤치마크 61은 우리 팀과 상관없는 숫자입니다. 61은 공개된 지수입니다. 우리 저장소의 지수는 저 세 줄입니다.

이미 한 파일, 한 함수, 한 커밋으로 끝나는 일은 반대입니다. 4.5와 체감 차이가 작을 수 있습니다. 단가도 같습니다. 짧은 작업에서 모델을 갈아끼우는 비용은, 긴 작업에서 얻는 이득보다 먼저 느껴집니다. 교체 기준을 더 센 모델이 아니라, 끊기던 작업이 이어지는가로 옮깁니다. 기본값을 전 팀에 올리기 전에 긴 작업 두 개만 먼저 봅니다. 그 두 개가 이어지면 그때 기본값을 말합니다. 그 두 개가 이어지지 않으면 유행을 따른 것입니다.

시각 작업의 함정도 여기 있습니다. xAI가 말한 강한 첫 패스는 구조와 시각 언어가 한 번에 선다는 뜻입니다. 버튼이 보이는 것과 버튼이 동작하는 것은 다른 판정입니다. 첫 화면이 그럴듯하면 더 위험합니다. 4.5에서도 그 함정은 있었습니다. 4.6에서 첫 화면이 더 좋아지면, 동작하지 않는 화면을 통과시키기 더 쉬워집니다. 스크린샷만으로 통과시키지 않습니다. 클릭 한 번과 새로고침 한 번을 로그에 남깁니다. 화면이 예쁜 상태로 멈추면 그건 데모입니다. 돌아가는 링크가 제출입니다.

목표가 빠지는지 재는 방법

기록은 세 줄이면 됩니다. 목표. 지금 파일. 통과한 테스트. 이 세 줄을 세션 끝에 붙여 두면 다음 사람이 같은 에이전트를 이어받을 수 있습니다. 기록이 없으면 4.6이 버티든 4.5가 버티든 팀에는 남는 게 없습니다. 벤치 숫자를 채팅에 붙이는 일과, 세션 끝에 저 세 줄을 남기는 일은 다릅니다. 전자는 보도자료입니다. 후자가 인수인계입니다.

대시보드는 필요 없습니다. 세션 시작에 목표 한 문장을 적습니다. 30분마다 그 문장을 다시 읽습니다. 에이전트가 지금 만지는 파일이 그 문장과 맞는지 표시합니다. 맞으면 유지. 벗어나면 이탈. 이탈이 두 번이면 프롬프트를 탓하기 전에 컨텍스트에 쌓인 로그를 줄입니다. 이탈이 없는데도 테스트가 없으면 그건 다른 실패입니다. 목표를 붙잡고도 검증을 건너뛴 것입니다. 목표가 남아 있는 것과 끝난 것은 다른 판정입니다.

재는 시점도 미리 정합니다. 30분, 90분, 세 시간. 이 세 지점에서 같은 질문을 합니다. 목표가 남아 있습니까. 같은 파일을 다시 고칩니까. 테스트를 실제로 돌립니까. 한 시점에서만 버티고 다음 시점에서 끊기면, 4.6이 좋아졌다는 문장은 우리 팀과 상관없습니다. 버틴 시점만 남깁니다. 끊긴 시점도 남깁니다. 둘을 같이 적어야 다음 세션의 재료가 됩니다.

터미널 작업은 이 기록과 따로 봅니다. Terminal-Bench는 26퍼센트입니다. 4.5의 15.7보다 올랐습니다. 그래도 GPT-5.6 Sol Max의 34.6에는 못 미칩니다. 셸 중심 파이프라인에서 4.6을 기본값으로 올리면, 에디터에서 본 이득을 터미널에 옮긴 착각입니다. 실패 로그를 먼저 모읍니다. 로그가 쌓이기 전에 기본값을 올리는 일은 후훈련이 아닙니다. 성적표 한쪽만 읽는 일입니다.

오늘 DAKER 빌더가 할 일

팀 기본값을 바꾸는 회의는 금요일에 해도 됩니다. 수요일까지는 개인 실험입니다. 긴 작업 두 개. 짧은 작업 두 개. 이 네 기록이면 교체 여부를 정할 수 있습니다. 네 기록이 없이 기본값을 올리면 후훈련이 아니라 유행을 따르는 일입니다. 화면이 예쁜 상태로 멈추지 않습니다. 다른 사람이 링크를 열어 한 번 성공하는 지점까지 갑니다. 배포가 제출입니다. 모델 이름만 바꾼 채팅 로그는 제출이 아닙니다.

모델 카드를 더 읽는 것도 일입니다. 공식 발표와 xAI 개발자 문서만으로도 컨텍스트, 가격 구간, 추론 노력은 확인됩니다. 50만 토큰. 20만에서 단가가 두 배. 입력 2달러, 출력 6달러. xhigh. 그 밖에 떠도는 점수표는 오늘 필요 없습니다. 필요한 것은 한 개의 긴 작업입니다. 어제 끊기던 그 작업을 오늘 4.6에 다시 넣고, 어디서 살아남는지 봅니다.

해커톤 주간이면 이 구분이 더 선명합니다. 심사위원이 여는 것은 모델 목록이 아니라 URL입니다. 4.6을 켰다는 문장은 가산점이 아닙니다. 조사에서 구현으로, 구현에서 수정으로 이어져 배포까지 갔는지만 남습니다. 중간에 끊긴 세션은 로그가 있어도 제출이 아닙니다. 끊기지 않은 세션도 링크가 없으면 제출이 아닙니다. DAKER by DACON의 규칙은 그대로입니다. 만들어서 겨루고, 돌아가는 링크로 냅니다.

한 줄로 줄이면 이렇습니다. 4.6은 모델을 키운 업데이트가 아닙니다. 중간에 멈추지 않고 더 오래 일하게 만든 업데이트입니다. 중간에서 멈추는 버릇이 줄고, 같은 단가로 더 오래 일합니다. 그 변화가 우리 저장소에서 버티는지는 벤치가 말해 주지 않습니다. 오늘 한 세션이 말해 줍니다. 그 세션이 배포까지 가면 그때가 제출입니다.

원문: Introducing Grok 4.6 — xAI, 2026년 8월 12일