스탠퍼드 AI Index, IMO 금메달과 시계 읽기 50.1% — 배포 전 jagged frontier를 보십시오 | DAKER 커뮤니티

스탠퍼드 HAI 「2026 AI Index Report」에 따르면, Gemini Deep Think는 국제수학올림피아드(IMO) 금메달을 받았지만, 최고 모델의 아날로그 시계 읽기 정확도는 50.1%에 그칩니다. 같은 보고서는 이 불균형을 jagged frontier라고 부릅니다. 원문은 The 2026 AI Index Report입니다.

research infographic

비교 지표

1. 고난도 수학은 금메달, 일상 지각은 반토막입니다. 보고서는 IMO 금메달과 시계 읽기 50.1%를 같은 단락에 둡니다. 벤치마크 상한과 실무 신뢰 구간이 같다고 가정하면 안 됩니다.

2. 에이전트도 같은 패턴입니다. OSWorld(실제 컴퓨터 작업) 성공률은 12%에서 약 66%로 올랐지만, 구조화 벤치마크에서는 대략 세 번 중 한 번 실패한다고 적혀 있습니다. 「된다」와 「항상 된다」를 구분하십시오.

3. 코딩 벤치마크는 빠르게 포화합니다. SWE-bench Verified는 1년 만에 60%에서 거의 100%까지 올랐다고 합니다. 점수가 올라갈수록, 그 점수가 가리는 실패 모드를 따로 재야 합니다.

4. 도입은 넓고, 능력은 들쭉날쭉합니다. 조직 도입률은 88%, 2025년 notable frontier 모델의 90% 이상을 산업계가 만들었다고 합니다. 배포 결정은 「최고 점수」가 아니라 「가장 약한 구간」으로 하십시오.

실무 판단

배포 체크리스트에 jagged 항목을 넣으십시오. 데모에서 통과한 작업과 비슷한 난이도의 「쉬운 실패」(시간·단위·UI 상태·예외 입력)를 같은 평가 세트에 넣습니다.

에이전트 SLA는 성공률이 아니라 실패 처리로 잡으십시오. 약 1/3이 실패할 수 있다는 전제에서 재시도·사람 개입·롤백 경로를 먼저 설계합니다.

참고 · Stanford HAI AI Index 2026