‘AI 3강 복귀’ 선언한 Grok 4.7, 실전은 달랐습니다: 코딩은 전진·디자인과 한국어는 숙제 | DAKER 커뮤니티
xAI가 Grok 4.7을 내놓으며 프런티어 AI 경쟁에 다시 긴장감이 돌고 있습니다. 회사는 “비교 가능한 모델보다 두 배 빠르고 가격은 절반”이라고 강조했습니다. 그러나 신제품의 진짜 위치는 발표 문구가 아니라 실제 작업에서 드러납니다.
코드팩토리가 Grok 4.7에 마인크래프트형 게임, GTA형 게임, 모델 소개 웹사이트, 한국어 단편소설을 맡긴 결과는 한 방향으로 정리되지 않았습니다. 코드로 작동하는 초안을 만드는 능력은 전 세대보다 분명히 나아졌지만, 디자인 감각과 한국어 문장 완성도에는 여전히 뚜렷한 약점이 남았습니다.
한 줄 결론
Grok 4.7은 모든 분야의 최강 모델이라기보다, 가격과 속도를 중시하는 코딩·자동화 작업에서 다시 선택지에 들어온 모델입니다. 완성품 제작보다 반복 작업과 에이전트 오케스트레이션에 배치할 때 강점이 선명해집니다.
1. 공식 수치는 ‘압승’이 아니라 ‘경쟁권 진입’을 말합니다
xAI 공식 발표에 따르면 Grok 4.7은 더 큰 기반 모델과 장시간 작업 비중을 높인 강화학습을 적용했습니다. 긴 작업을 이어가고, 결과를 스스로 점검하며, 긴 맥락을 관리하는 능력을 개선했다는 설명입니다.
주요 사양은 다음과 같습니다.
• 컨텍스트 창: 50만 토큰
• 입력 형식: 텍스트와 이미지
• 추론 단계: low·medium·high·xhigh
• 20만 토큰 이하 기본 가격: 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러
• 20만 토큰을 넘는 프롬프트: 입력 4달러, 출력 12달러로 상승
• Grok 4.7 Fast: 같은 모델을 더 빠른 인프라로 제공하며 토큰 요금은 두 배
공식 벤치마크도 분야별로 엇갈립니다. CursorBench 4.0에서는 Grok 4.7이 46.3%로 GPT-5.6 Sol의 41.7%를 앞섰지만 Fable 5.1의 51.8%에는 미치지 못했습니다. DeepSWE v1.1에서는 71.0%로 Fable 5.1의 70.0%와 비슷했고, Terminal-Bench 4.0에서는 38.0%로 Sol의 37.3%와 유사했지만 Fable 5.1의 57.9%와는 차이가 컸습니다.
따라서 “두 배 빠르고 절반 가격”은 특정 비교 조건에서 나온 회사의 메시지로 읽어야 합니다. 모든 작업에서 두 배 빠르거나 모든 경쟁 모델의 절반 비용이라는 뜻은 아닙니다. 공식 벤치마크 역시 xAI가 발표한 수치이므로, 실제 저장소와 업무 환경에서 다시 측정해야 합니다.
2. 마인크래프트형 게임: 초안은 만들었지만 제품은 아니었습니다
영상에서 Grok 4.7은 한 번의 지시로 블록 지형, 나무, 물, 해변, 아이템 선택 기능이 있는 게임을 만들었습니다. 아이디어를 실행 가능한 화면으로 옮기는 능력은 확인됐습니다.
다만 블록이 한 번의 조작으로 파괴되고, 인벤토리가 완성되지 않았으며, 세부 규칙은 빠져 있었습니다. 이 결과가 보여주는 것은 ‘게임을 완성했다’가 아니라 ‘후속 개발이 가능한 프로토타입을 빠르게 만들었다’는 수준입니다.
3. GTA형 게임: 물리 감각은 있었고 핵심 규칙은 비었습니다
NPC와 차량이 등장하고, 자동차 탑승과 충돌, 가속에 따른 움직임까지 구현됐습니다. 장면의 인상을 코드로 옮기는 능력은 기대 이상이었습니다.
그러나 좌우 조작이 뒤집혀 있었고, 전투·미션·건물 진입 등 핵심 게임 규칙은 구현되지 않았습니다. 화면이 움직인다는 사실과 요구사항이 충족됐다는 판단을 구분해야 하는 사례입니다. 자율 코딩에서는 반드시 기능 목록과 완료 조건을 테스트로 고정해야 합니다.
4. 소개 웹사이트: 작동하는 코드와 좋은 디자인은 다른 문제였습니다
자신을 소개하는 창의적인 웹사이트를 만들어 달라는 요청에는 긴 원페이지 사이트가 생성됐습니다. 메뉴 이동과 등장 애니메이션은 작동했지만, 큰 빈 공간과 어색한 사이드바, 약한 시각적 위계 때문에 결과물의 설득력은 낮았습니다.
Grok 4.7을 UI 작업에 사용하려면 “창의적으로 만들어 달라”는 추상적 주문보다 참고 사이트, 레이아웃, 색상, 컴포넌트 규칙, 금지 요소를 함께 제공해야 합니다. 코드를 생성할 능력과 디자인 방향을 스스로 결정할 능력은 동일하지 않습니다.
5. 한국어 단편: 분위기는 잡았지만 문장이 흔들렸습니다
200~300자 분량의 한국어 소설은 기다림과 귀환이라는 분위기를 만들었지만, 일부 단어 선택과 문법이 어색해 매끄럽게 읽히지 않았습니다. 한 번의 결과만으로 모델 전체의 한국어 능력을 단정할 수는 없지만, 외부 공개용 카피나 기사문을 검수 없이 맡기기에는 위험하다는 신호입니다.
한국어 결과물은 맞춤법 검사만으로 충분하지 않습니다. 문맥상 부자연스러운 단어, 주어와 시점의 흔들림, 번역투를 사람이 직접 확인해야 합니다.
6. Grok 4.7의 자리는 ‘주전 교체’보다 ‘작업 배치’에 가깝습니다
영상 제작자는 Grok 4.7을 디자인이나 한국어 집필의 최우선 모델로 평가하지 않았습니다. 대신 다음과 같은 작업에 현실적인 가치가 있다고 봤습니다.
• 테스트 코드 작성과 반복 QA
• 오래 실행해도 되는 백그라운드 작업
• 작은 기능과 보조 코드 생성
• 상위 모델의 사용량을 아끼기 위한 작업 분산
• Grok Bot을 이용한 자동화와 오케스트레이션
이 판단은 Grok 4.7이 Grok Bot 하네스를 기본적으로 이해하도록 학습됐다는 xAI의 공식 설명과도 맞닿아 있습니다. Grok Bot은 지속형 컴퓨터에서 브라우저, 파일, 명령줄을 사용하고 여러 Bot이 병렬로 협업할 수 있습니다. 모델 한 번의 답변보다 작업을 배분하고 끝까지 이어가는 운영 계층에서 강점을 노리는 전략입니다.
7. 도입 전에 확인할 실무 체크리스트
□ 자사 저장소의 실제 이슈 10건으로 동일 조건 비교
□ 속도뿐 아니라 총 토큰과 수정 횟수까지 기록
□ UI 작업에는 화면 레퍼런스와 디자인 규칙 제공
□ 한국어 외부 문서는 사람의 편집 단계 의무화
□ 게임·앱 제작은 기능별 완료 조건과 테스트 명시
□ Grok Bot에는 개발·스테이징 권한부터 제공
□ 운영 배포와 결제·고객정보 접근은 사람 승인 유지
□ 회사 발표 벤치마크와 내부 평가 결과를 분리해 기록
기자의 판단
Grok 4.7은 AI 경쟁의 판도를 단번에 뒤집은 모델은 아닙니다. 대신 xAI가 코딩 모델 경쟁에서 더 이상 주변부에 머물지 않겠다는 신호는 분명합니다. 빠른 프로토타입과 비용 민감한 반복 작업에서는 매력적이고, 디자인과 한국어처럼 미세한 판단이 필요한 작업에서는 추가 지시와 검수가 필요합니다.
지금 필요한 질문은 “어느 모델이 무조건 최고인가”가 아닙니다. 어떤 작업을 Grok 4.7에 맡기고, 어떤 작업은 다른 모델이나 사람에게 남길 것인지 결정하는 일입니다. 이번 업데이트의 의미는 새로운 왕의 등장이 아니라, 모델을 업무별로 배치해야 하는 멀티모델 시대가 더 선명해졌다는 데 있습니다.
영상 주요 구간
• 00:00 Grok 4.7 출시와 평가 기준
• 01:04 공식 발표와 벤치마크 비교
• 03:40 사용자 평가가 엇갈리는 이유
• 04:49 마인크래프트형 게임 테스트
• 06:21 GTA형 게임 테스트
• 07:22 자기소개 웹사이트 테스트
• 09:06 한국어 단편소설 테스트
• 10:35 Grok Bot 자동화 활용법
• 11:13 최종 평가와 추천 대상
출처
1) 코드팩토리, “Grok 4.7 출시! 드디어 다시 3사 경쟁!”
https://www.youtube.com/watch?v=EpGz8j1hltQ
2) xAI 공식 발표, “Introducing Grok 4.7”
https://x.ai/news/grok-4-7
3) xAI 공식 개발 문서, Grok 4.7
https://docs.x.ai/developers/grok-4-7
4) xAI 공식 릴리스 노트
https://docs.x.ai/developers/release-notes
5) xAI 공식 발표, “Introducing Grok Bot”
https://x.ai/news/introducing-grok-bot
6) xAI 공식 문서, Grok Bot 컴퓨터와 앱
https://docs.x.ai/grok-bot/computer-and-apps