GPT-5.6이 키로에서 비용을 깎습니다 | DAKER 커뮤니티

OpenAI가 8월 24일 자사 뉴스룸에 올린 소식은 한 줄로 정리됩니다. GPT-5.6 세 모델이 AWS의 개발 에이전트 Kiro 안에서 돌아가기 시작했고, 두 회사가 함께 돌린 테스트에서 성공한 작업의 비용이 약 82% 내려갔다는 이야기입니다.

GPT-5.6이 키로에서 비용을 깎습니다

나온 것

1. GPT-5.6 Sol·Terra·Luna 세 등급이 Kiro에 들어갔습니다. OpenAI는 2026년 8월 24일 Advancing price-performance for developers with GPT-5.6 in Kiro 글을 올렸습니다. Kiro는 AWS가 만든 소프트웨어 개발 에이전트이고, 요구사항과 설계 문서를 먼저 정리한 다음 그 문서를 근거로 코드를 쓰는 방식으로 움직입니다. 이번 공지로 Sol, Terra, Luna 세 모델이 Kiro의 IDE와 CLI, 웹에서 모두 선택 가능해졌습니다. Kiro 쪽 공지는 OpenAI 모델이 Kiro에 올라간 것이 이번이 처음이라고 밝혔습니다.

2. 82%는 비용 숫자이고, 조건이 붙어 있습니다. OpenAI 공지는 두 회사가 Kiro 환경과 OpenAI 모델을 함께 최적화했고, Terminal-Bench 2.1에서 GPT-5.6 Terra가 Kiro 안에서 성공적으로 끝낸 작업의 비용이 약 82% 줄어들었다고 적었습니다. 정확도가 82% 올랐다는 이야기가 아니고, 성공한 작업 한 건을 끝내는 데 드는 비용 쪽 숫자입니다. 모델은 Terra 하나이고, 벤치마크는 Terminal-Bench 2.1 하나이며, 테스트 주체는 OpenAI와 AWS입니다. OpenAI는 절감의 이유로 Kiro가 처음부터 요구사항과 설계, 작업 맥락을 모델에게 붙여 준다는 점을 들었습니다. 방향을 잘못 잡고 되돌아오는 왕복이 줄어들면서 답에 더 빨리 도달한다는 설명입니다.

3. 세 등급의 벤치마크 위치가 공개되었습니다. Kiro 공지에 숫자가 붙어 있습니다. Sol은 Coding Agent Index 80점과 Terminal-Bench 2.1 88.8%를 기록했고, Kiro는 이 두 지표 모두에서 Claude Fable 5보다 위라고 적었습니다. 같은 문단에서 Sol이 출력 토큰은 절반 이하, 걸린 시간도 절반 이하라고 밝혔습니다. Terra는 Coding Agent Index 77.4점으로 Claude Fable 5의 77.2점 바로 위에 있습니다. Luna는 74.6점으로 Claude Opus 4.8의 72.5점을 넘었고, 비용은 Sol의 약 4분의 1이라고 적혀 있습니다.

4. 컨텍스트는 세 등급 모두 272K입니다. Kiro 공지는 세 모델이 모두 272K 컨텍스트 창을 가진다고 밝혔습니다. 등급에 따라 창 크기가 달라지지 않습니다. 대신 Kiro 내부의 크레딧 배수가 등급을 나눕니다. 출시 시점의 배수는 Sol 2.4배, Terra 1.2배, Luna 0.6배였습니다.

5. 그 배수가 이미 한 번 내려갔습니다. Kiro는 후속 공지에서 OpenAI가 Terra와 Luna 가격을 내렸고 그 인하를 Kiro 고객에게 그대로 넘긴다고 밝혔습니다. Luna는 0.6배에서 0.1배로, Terra는 1.2배에서 1.0배로 내려갔고, Sol은 2.4배로 그대로입니다. 같은 작업을 Luna로 돌릴 때 소모되는 크레딧이 6분의 1 수준으로 줄었다는 뜻입니다.

6. 아직 실험 지원이고 리전도 두 곳입니다. Kiro 공지는 세 모델이 Kiro Pro, Pro+, Pro Max, Power 고객에게 실험 지원 상태로 점진 배포된다고 적었습니다. 리전은 AWS US-East-1(북버지니아)과 AWS Europe(프랑크푸르트)이며, 크로스 리전 추론을 지원합니다. 모델 목록에 새 항목이 보이지 않는 경우 IDE나 CLI를 다시 시작하고, 웹은 브라우저를 새로 고치라고 안내했습니다.

7. 추론 과정은 보이지 않습니다. Kiro는 GPT-5.6 계열이 감춰진 사고 사슬 방식을 쓴다고 못 박았습니다. 모델의 내부 추론 단계는 화면에 나오지 않고 최종 출력만 보이며, 이것은 예상된 동작이고 출력 품질과는 관계가 없다는 설명입니다. 중간 근거를 화면에서 읽으면서 감독하는 방식에 익숙한 팀이라면 이 대목을 먼저 확인해야 합니다.

8. 양쪽 임원 발언도 같은 방향을 가리킵니다. AWS의 Agentic AI 부문 부사장 Swami Sivasubramanian은 Kiro에서 복잡하고 오래 걸리는 개발 작업을 돌릴 선택지를 늘리는 일이라고 말했습니다. OpenAI의 전략 파트너십 부문 부사장 Colleen Kapase는 개발 단계별로 지능과 속도, 비용을 맞출 여지가 생긴다고 말했습니다. 두 발언 모두 새 모델을 내놓았다는 이야기가 아니라, 이미 있는 세 등급을 작업 성격에 맞춰 갈라 쓰라는 이야기입니다.

9. Kiro가 1년 된 시점에 맞춰 나온 공지입니다. Kiro 공지는 이 발표가 Kiro의 1주년과 겹친다고 적었습니다. 2025년 7월 14일 공개 프리뷰로 시작한 뒤 명세 기반 IDE에서 IDE와 CLI, 웹을 아우르는 개발 플랫폼으로 커졌다는 설명입니다. 모델 하나를 추가한 사건이 아니라 플랫폼이 다루는 모델 공급사가 둘로 늘어난 사건으로 읽어야 맞습니다.

10. OpenAI가 정리한 활용 목록도 구체적입니다. 공지에는 Kiro와 GPT-5.6을 함께 쓸 때 할 수 있는 일이 항목으로 적혀 있습니다. 제품 아이디어와 요구사항을 구조화된 구현 계획으로 바꾸는 일, 여러 단계로 이어지는 복잡한 코딩 작업을 더 일관되게 끝내는 일, 명세 기반 개발로 AI 코딩에 구조를 넣는 일, 저장소 전체와 팀 표준을 맥락으로 함께 쓰는 일, 변경이 실제로 적용되기 전 검토 지점에서 모델의 작업을 확인하고 다듬는 일, 그리고 속성 기반 테스트로 구현이 맞는지 확인하는 일입니다. 마지막 두 항목이 특히 중요합니다. 자동으로 오래 돌리는 대신 검토 지점과 테스트를 붙여 쓰라는 뜻이기 때문입니다.

본문 도표

아닌 것

ChatGPT 요금제 변화가 아닙니다. 이번 공지는 개발 도구 안에서 모델을 고르는 이야기입니다. ChatGPT 구독 등급이나 사용량 정책을 건드리는 내용은 두 공지 어디에도 없습니다.

Kiro는 OpenAI 제품이 아닙니다. Kiro는 AWS가 만들고 운영하는 개발 에이전트입니다. 크레딧 배수와 요금제 이름, 리전 조건은 모두 Kiro 쪽 규칙입니다. OpenAI는 모델을 공급하는 쪽입니다.

82%가 모든 작업에 적용되는 값이 아닙니다. Terra 한 등급, Terminal-Bench 2.1 한 벤치마크, 그리고 Kiro라는 특정 환경에서 나온 값입니다. 두 회사는 이 절감분 가운데 얼마가 도구의 구조에서 오고 얼마가 모델 자체의 토큰 효율에서 오는지 나누어 밝히지 않았습니다. 정확도가 어떻게 변했는지도 이 구성에 대해서는 공개하지 않았습니다.

정식 출시가 아닙니다. 세 모델은 실험 지원 상태이며 점진 배포 중입니다. 지금 계정에서 보이지 않아도 이상한 일이 아닙니다. 리전도 두 곳으로 제한되어 있습니다.

Claude 모델이 빠지는 것도 아닙니다. Kiro 공지는 Anthropic 모델 옆에 OpenAI 모델을 나란히 놓는다고 적었습니다. 선택지가 늘어난 것이고, 기존 모델이 사라진 것이 아닙니다.

Sol이 항상 정답도 아닙니다. Sol의 크레딧 배수는 2.4배로 유지되었고 Luna는 0.1배까지 내려갔습니다. 같은 크레딧으로 Luna를 스물네 번 돌릴 수 있다는 계산이 나옵니다. 반복 실행으로 답을 찾는 작업이라면 등급 선택 자체가 비용 설계입니다.

새 모델이 나온 것도 아닙니다. GPT-5.6 Sol과 Terra, Luna는 이미 있던 등급입니다. 이번 공지는 그 세 등급이 Kiro라는 환경 안에서 쓰이게 되었고, 그 환경에서 비용이 어떻게 달라졌는지를 밝힌 내용입니다. 모델 자체의 성능이 이번에 올라갔다는 주장은 어디에도 없습니다.

추론 과정을 숨기는 것이 품질 저하 신호도 아닙니다. Kiro는 감춰진 사고 사슬이 예상된 동작이며 출력 품질에 영향을 주지 않는다고 명시했습니다. 다만 화면에서 중간 근거를 읽어 판단하던 팀에게는 검토 방식 자체를 바꿔야 하는 변화입니다.

오늘 할 일

첫째, 두 원문을 직접 읽으십시오. OpenAI 공지는 왜 이 조합인지를 설명하고, Kiro 공지는 점수와 배수, 리전 같은 실무 조건을 담고 있습니다. 크레딧 배수는 후속 공지에서 이미 바뀌었으므로 두 번째 글까지 확인해야 현재 값이 맞습니다.

둘째, 자기 작업을 세 등급으로 나누어 보십시오. 여러 파일을 한 번에 고치는 리팩터링과 터미널 작업이 많은 일감은 Sol 쪽 설명에 맞고, 매일 반복되는 보통 작업은 Terra 설명에 맞습니다. 같은 작업을 여러 번 돌려서 결과를 비교하는 일감은 0.1배가 된 Luna 쪽이 유리합니다. 등급을 하나로 고정해 두면 이번 인하의 효과를 거의 못 받습니다.

셋째, 감독 방식을 미리 손보십시오. 감춰진 사고 사슬 때문에 중간 추론이 화면에 나오지 않습니다. 대신 Kiro가 만들어 주는 요구사항과 설계 문서, 그리고 작업 단위 체크포인트에서 결과를 확인하는 흐름으로 바꾸어야 합니다. OpenAI 공지도 변경이 반영되기 전 검토 지점에서 모델의 작업을 확인하고 다듬는 절차를 능력 목록에 넣어 두었습니다.

넷째, 숫자를 자기 저장소에서 다시 재십시오. 82%와 88.8%, 80점은 모두 두 회사가 자기 환경에서 낸 값입니다. 팀의 실제 저장소와 실제 이슈로 같은 작업을 두 등급 이상에 돌려 보고, 성공률과 소요 크레딧을 함께 적어 두는 편이 안전합니다. 리전이 두 곳뿐이라는 점도 데이터 위치 규정이 있는 팀에게는 먼저 확인할 항목입니다.

다섯째, 만든 결과는 링크로 남기십시오. DAKER에는 25만 빌더와 339+ 대회, 29억+ 규모의 기록이 쌓여 있습니다. 등급별 비용과 성공률을 비교한 짧은 노트 하나가 같은 고민을 하는 팀에게는 벤치마크 표보다 도움이 큽니다. 올린 링크가 곧 제출입니다.

출처: OpenAI — Advancing price-performance for developers with GPT-5.6 in Kiro (2026-08-24) · Kiro — GPT-5.6 is now available in Kiro · Kiro — GPT-5.6 update: lower credit multipliers for Terra and Luna · Kiro Docs — Available models