2026년 10월 프론티어 모델 비교: GPT-6.1 Sol·Claude Opus 5.5·Gemini 4 Argon·Mistral Large 4의 가격과 공개 범위를 한 표로 정리했습니다 | DAKER 커뮤니티

2026년 10월 9일 기준으로 실제로 쓸 수 있는 최상위 범용 모델은 OpenAI GPT-6 Astra와 GPT-6.1 Sol, Anthropic Claude Opus 5.5, 그리고 프리뷰로 열린 Mistral Large 4입니다. Google Gemini 4 Argon, Anthropic Claude Mythos 5.1, OpenAI의 미공개 내부 모델은 성능 발표는 나왔지만 일부 기관에만 열려 있습니다. WorldofAI 채널이 10월 7일 올린 약 25분짜리 AI 뉴스 영상 GPT-7 'Bel' First Preview, Mythos 5.1 Access, Mistral Large 4, Claude Code Update, & More!이 이번 주 소식을 한 번에 다룹니다. 이 글은 영상 자막에서 모델 관련 주장을 추리고, 숫자는 각 회사 공식 발표로 다시 확인해 정리했습니다. 영상이 다루지 않은 Gemini 4 Argon과 GPT-6.1 Sol도 함께 넣었습니다.

벤치마크 트랙을 나란히 달리는 네 대의 로봇과 가격표·막대그래프를 그린 만화풍 생성 이미지, 제목 10월 프론티어 모델 비교
설명용 생성 이미지입니다.

한눈에 보는 2026년 10월 프론티어 모델 비교표

아래 가격은 입력/출력 100만 토큰당 미국 달러 기준 공식 표준 가격입니다. 벤치마크는 각 회사가 직접 발표한 수치라서 측정 환경이 서로 다릅니다. 같은 이름의 벤치마크라도 회사끼리 직접 순위를 매기는 근거로 쓰기는 어렵습니다.

모델 (회사)공개 상태API 가격 (입력/출력, 100만 토큰)공식 발표의 대표 수치
GPT-6 Astra (OpenAI)일반 공개$10 / $50Terminal-Bench Science 0.1 68.1%, OpenAI가 시험한 모델 중 최고
GPT-6.1 Sol (OpenAI, 9월 29일)API·ChatGPT Work·Codex$2 / $10DeepSWE v1.1에서 Astra와 동급, OSWorld 2.0에서 Astra와 2.1%p 차이
Claude Opus 5.5 (Anthropic)일반 공개$4 / $20Terminal-Bench 4.0 66.4%, Opus 5보다 일반 작업 비용 약 40% 절감
Claude Fable 5.1 / Mythos 5.1 (Anthropic)Fable 일반 공개, Mythos는 검증 기관만$10 / $50 (Fable 5.1)두 모델은 같은 모델이고 안전장치 수준만 다름
Gemini 4 Argon (Google, 9월 30일)Fairwind 프로그램 참여 보안 기관만도입가 $2 / $10, 이후 $4 / $20DeepSWE v1.1 77.9%, AutomationBench 51.3%, 출력 한도 100만 토큰
Mistral Large 4 (Mistral, 10월 6일)프리뷰 API, 가중치는 10월 말 공개 예정할인가 $0.68 / $2.09 (정가 $1.36 / $4.18)전체 1조 파라미터·활성 520억, DeepSWE v1.1 61.7%, Cybench 93%

OpenAI: 미공개 내부 모델이 쓴 수학 논문 722편

영상이 가장 먼저 다룬 소식은 OpenAI가 10월 6일 공개한 수학 원고 모음입니다. OpenAI는 GitHub의 openai/math 저장소에 미공개 내부 프런티어 모델이 만든 원고 722편을 372개 결과 묶음으로 나눠 올렸습니다. 저장소 설명에 따르면 평가 기간 동안 이 모델에 약 4,000개 문제를 냈고, 결과 하나에 평균 ChatGPT Pro 사고 시간 약 3시간 분량의 연산을 썼습니다. 많은 원고에는 컴퓨터로 검증할 수 있는 Lean 증명이 붙어 있지만 전부는 아닙니다. OpenAI도 형식 검증이 없는 결과에는 문제가 있을 수 있다고 밝혔습니다.

영상 진행자는 이 모델을 GPT-6.5 또는 GPT-7, 코드명 Bel로 추정합니다. 이 이름은 OpenAI가 확인한 사실이 아니라 진행자의 추측입니다. 원고 722편이 곧 722개 난제 해결을 뜻하지도 않습니다. 한 묶음 안에 주 결과, 보조 논증, 다른 증명이 함께 들어가기 때문입니다.

같은 날 OpenAI는 28일 연속 출시 이벤트의 둘째 날 소식도 냈습니다. 영상이 소개한 내용은 에이전트 행동을 다른 에이전트가 검토하는 Auto-review의 사용량 차감 중단, API 유료 등급을 Build·Launch·Grow 세 단계로 단순화, ChatGPT 맥 앱 회의 기록 플러그인 베타, GPT-6 Luna 기반 Decisions API입니다.

Anthropic: Mythos 5.1은 검증된 보안팀에만 열립니다

Anthropic은 10월 6일 Cyber Verification Program(CVP)을 세 단계로 확대했습니다. 방어(Defense), 레드팀(Red Team), 특화(Specialized) 등급마다 Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1을 쓸 수 있습니다. Anthropic 공식 안내에 따르면 Mythos 5.1은 Fable 5.1과 같은 모델이고, 보안과 생명과학 연구용으로 안전장치를 더 느슨하게 둔 버전입니다. 영상도 일반 사용자는 기존 공개 모델을 그대로 쓰고, 보안 전문가는 신청 절차를 거쳐야 한다고 설명합니다.

일반 사용자가 지금 고를 Anthropic 모델은 Claude Opus 5.5입니다. Anthropic 발표 기준으로 입력·출력 가격은 100만 토큰당 $4/$20으로 Opus 5보다 20% 낮고, 캐시 읽기는 $0.20으로 60% 낮습니다. 같은 발표의 표에서 Terminal-Bench 4.0 점수는 Opus 5.5 66.4%, GPT-6 Astra 57.9%입니다. GPT-6 Astra 수치는 OpenAI 발표를 옮겨 온 값입니다. 영상은 이 밖에 Claude가 Google 문서·시트·슬라이드 안에서 직접 편집을 제안하는 기능, 그리고 Claude Code 2.1.292부터 서브에이전트마다 추론 노력 수준을 따로 정할 수 있게 된 업데이트도 소개합니다.

Mistral Large 4: 유럽산 오픈 웨이트 모델의 보안 특화 전략

Mistral은 10월 6일 Mistral Large 4 프리뷰를 공개했습니다. Mistral 공식 문서 기준으로 전체 약 1.05조 파라미터에 활성 파라미터 520억 개인 전문가 혼합(MoE) 구조이고, 이미지를 함께 이해하는 멀티모달 모델이며 컨텍스트는 100만 토큰입니다. 영상은 활성 파라미터를 490억 개로 말하지만, Mistral 공식 발표와 문서는 520억 개로 적고 있습니다. 가중치는 10월 말에 공개할 예정입니다.

Mistral이 내세운 강점은 사이버 보안입니다. Mistral 발표에 따르면 Cybench 40개 과제 중 93%를 풀었고, 실제 취약점을 재현하고 고치는 시험에서 82%로 모든 모델 중 가장 높았습니다. Mistral은 같은 시험에서 Claude Opus 5.5와 GPT-6 Astra가 과제 수행을 거절해 0점에 가까웠다고 설명합니다. 영상 진행자도 이 우위가 상당 부분 거절이 적은 데서 나온다고 짚습니다. 코딩 지표는 DeepSWE v1.1 61.7%, Terminal-Bench 4 28.3%입니다.

ML4 is one of the world's strongest AI models for cybersecurity. (Mistral 공식 발표)

영상 진행자의 평가는 신중합니다. 추론 기능이 기본으로 꺼져 있고 켜면 느려지며, 일상 코딩용 주력 모델로는 권하지 않는다고 말합니다. 영상이 인용한 한 개발자의 3D 장면 비교에서는 오픈 모델 중 Mistral이 에펠탑 장면 1위를 했지만 전체 1위는 GPT-6 Astra였습니다. 수족관 장면에서는 Opus 5.5가 가장 좋았습니다. 대신 세 장면 비용이 Mistral은 0.87달러, Opus는 13.83달러였다고 합니다. 이 비교는 개인 개발자의 실험이고 공식 벤치마크가 아닙니다.

Google: Gemini 4 Argon, Nano Banana 2.1, EmbeddingGemma 2

영상은 Google 소식으로 이미지 모델과 임베딩 모델을 다루지만, 현재 Google의 최상위 언어 모델은 9월 30일 발표된 Gemini 4 Argon입니다. Google 발표에 따르면 Argon은 DeepSWE v1.1에서 77.9%로 최고 기록을 세웠고, AutomationBench 51.3%로 1위입니다. 출력 한도는 기존 6.4만 토큰에서 100만 토큰으로 늘었습니다. 다만 지금은 Fairwind 프로그램의 보안 기관에만 열려 있고, 유료 API 고객과 Google AI Ultra 구독자 순서로 확대할 계획입니다.

10월 6일 공개된 Nano Banana 2.1은 마스크 기반 편집과 인물·사물 일관성을 개선한 이미지 모델입니다. 영상 진행자의 시험에서는 이미지 한 장에 약 4센트, 11초가 걸렸고, GPT Image 2.5는 약 7센트, 50초가 걸렸다고 합니다. 진행자는 화질은 GPT Image 2.5가 낫다고 봤습니다. 같은 날 나온 EmbeddingGemma 2는 7.4억 파라미터의 오픈 임베딩 모델입니다. 텍스트·코드·이미지·음성·영상을 한 공간에 담고 Apache 2.0 라이선스로 공개됐습니다.

어떤 모델을 고를까: 해커톤·대회 참가자 기준 정리

출처