독파모 2차 평가, 벤치마크 1위 모티프가 탈락한 이유 | DAKER 커뮤니티

공개 벤치마크 1위가 다음 단계에 오르지 못했습니다. 숫자만 보면 의외지만, 이번 발표를 따라가 보면 이유는 비교적 분명합니다. 정부가 본 것은 벤치마크 점수만이 아니라 실제 서비스에서 쓰이는지까지 포함한 종합 평가였기 때문입니다.

2026년 8월 18일 정부서울청사에서 발표된 독자 AI 파운데이션 모델 프로젝트, 이른바 독파모 2차 단계평가는 한국의 AI 선발 기준이 어디에 놓여 있는지를 드러냈습니다. 공개 순위표가 높다고 곧바로 통과하는 구조가 아니라는 점입니다.

벤치마크 1등이 탈락했다 — 독파모 2차

다음 단계로 가는 팀은 업스테이지, SK텔레콤, LG AI연구원입니다. 모티프테크놀로지스는 명단에 없었습니다. 관련 내용은 아시아경제 종합, 아시아경제 브리핑 기사, 지디넷코리아의 모티프 후속 기사에 남아 있습니다.

독파모 2차 평가는 무엇을 봤나

독파모는 과학기술정보통신부의 독자 AI 파운데이션 모델 프로젝트입니다. 이번 2차 단계평가 배점은 벤치마크 40점, 전문가 35점, 사용자 25점으로 구성됐습니다. 합계는 100점입니다.

벤치마크만으로 확보할 수 있는 점수는 40점이고, 나머지 60점은 전문가와 사용자가 실제 활용 가능성을 어떻게 봤는지에 달려 있었습니다.

이 구조만 봐도 이번 선발이 모델 성능만 겨루는 시험은 아니었다는 점을 알 수 있습니다. 정부는 성능과 함께 사용성, 전략, 실제 서비스 적용 가능성을 함께 평가했습니다.

항목별 순위는 공개되지 않았습니다. 류제명 차관은 네 팀의 격차가 근소해 1위를 발표할 실익이 크지 않다고 설명했습니다. 이날 공개된 것은 평균 점수와 1위·4위 간 격차입니다. 벤치마크 평균은 22.5점, 1위와 4위의 차이는 4.0점이었습니다. 전문가 평가는 평균 28.8점, 격차 2.4점이었고, 사용자 평가는 평균 17.6점, 격차 5.0점이었습니다.

눈에 띄는 대목은 사용자 평가입니다. 만점은 25점으로 벤치마크보다 작지만, 실제 팀 간 격차는 가장 크게 벌어졌습니다. 벤치마크 4.0점보다 사용자 평가 5.0점 차이가 더 컸다는 뜻입니다.

일반 국민 평가는 1400여 명이 지원했고 최종 185명이 참여했습니다. 다만 류 차관은 이 평가가 당락에 결정적이지 않았다고 밝혔습니다. 특정 한 항목이 승패를 갈랐다기보다 전문가 평가와 사용성 평가를 포함한 종합 결과로 보는 것이 맞습니다.

벤치마크 1위 모티프는 왜 탈락했나

공개된 글로벌 지수 AAII에서 모티프는 47점이었습니다. 솔라 오픈 2(업스테이지)는 37점, 에이닷엑스-K2(SK텔레콤)는 35점, K-엑사원 2.0(LG AI연구원)은 31점으로 전해졌습니다. 공개 벤치마크만 놓고 보면 모티프가 앞섰습니다.

이번 탈락은 벤치마크 점수가 낮아서가 아니라, 사용성이 상대적으로 낮게 평가됐기 때문이라는 설명에 가깝습니다.

정부는 모티프가 에이전트, 코딩 고난도 벤치에서 글로벌 빅테크와 대등한 수준의 성과를 냈다고 인정했습니다. 류 차관도 작은 R&D 조직이 뛰어난 결과를 냈다고 평가했습니다. 다만 탈락 이유로는 타사 대비 사용성이 상대적으로 낮았다는 점을 짚었습니다. 항목별 세부 점수는 공개되지 않았기 때문에, 그 이상을 추정해 순위를 다시 짜는 것은 어렵습니다.

모티프는 처음부터 참여하던 팀이 아니라 중간에 합류한 팀입니다. 약 5개월 만에 사전학습부터 후처리까지 자체 모델 모티프3를 완성해 벤치마크 1위를 만들었습니다. 임정환 대표는 작은 스타트업에도 기회가 주어졌기에 이런 성과가 가능했다고 밝혔고, 결과와 별개로 한국에서도 프론티어급 기술력이 가능하다는 점을 증명했다고 말했습니다. 같은 날 마감하는 모두의 AI에는 KT 컨소시엄으로 남아 있습니다. 이번 탈락을 회사나 모델의 종료로 읽기는 어렵습니다.

한편 벤치마크에 맞춰 점수만 끌어올렸다는 의혹에 대해서는 정부가 선을 그었습니다. 류 차관은 평가기관에 확인한 결과 체계적 암기나 과적합이 입증될 만한 답변은 찾지 못했고, 큰 문제가 없다는 답을 받았다고 설명했습니다.

정부는 탈락 이유를 부정행위가 아니라 사용성에서 찾았습니다.

통과한 세 팀은 무엇이 달랐나

전문가위원회가 긍정적으로 본 지점은 단순한 점수표가 아니었습니다. 업스테이지는 다음, 타임리와 연계해 국민이 체감할 수 있는 배포를 추진하고, 퓨리오사AI NPU와 협업해 외산 하드웨어 종속성을 줄이려는 점이 언급됐습니다. 평가용 데모가 아니라 실제 사용자가 접하는 서비스 화면에 들어갈 가능성이 중요하게 읽힌 셈입니다.

SK텔레콤은 수리 추론과 한국어 성능에서 강점을 보였고, 대규모 상용 서비스에 실제로 탑재돼 사용성·실용성에서 높은 평가를 받았습니다. 회사는 A.X K2가 IMO 2026 문제 평가에서 금메달 기준을 충족했고, MathArena AIME 2026에서 97.1%로 공동 최고점을 냈다고 공개한 바 있습니다. 다만 이번 발표에서 더 강조된 것은 그 숫자 자체보다 이미 서비스에 들어가 있다는 사실이었습니다.

LG AI연구원은 국제기구 등과의 협업 전략, 에이전틱 AI의 차별성, 안전 측면이 호평을 받았습니다. K-엑사원 2.0이 7500억 파라미터 규모라는 점은 배경 설명에 가깝고, 실제 선발 이유로 거론된 것은 협력 구조와 활용 전략, 안전성입니다.

정부는 또 NIA 벤치가 한국어, 한국 맥락, 안전성, 신뢰성까지 본다고 설명했습니다. 그래서 글로벌 공개 순위표와 국내 선발 결과가 다를 수 있습니다. AAII처럼 지식, 추론, 코딩 등 여러 벤치를 하나의 점수로 묶는 지표와, 국내 정책 목적에 맞춘 평가 기준은 애초에 보는 방향이 다르기 때문입니다.

이번 발표에서 함께 봐야 할 숫자들

2차 평가를 통과한 세 팀에는 GPU 지원이 늘어납니다. 당초 768장 수준이던 엔비디아 B200 지원은 1000장 수준으로 올라갑니다. 3차 평가는 올해 말에서 내년 초 예정대로 진행되며, 최종 2팀을 고르게 됩니다.

다만 여기서 곧바로 장기 지원이 확정됐다고 보기는 어렵습니다. 류 차관은 2027년 이후 두 팀에 대한 지원을 지금 형태 그대로 유지할지 전면 재검토 중이라고 밝혔습니다. 브리핑 뒤 기자들과의 자리에서는 최상위급 독자 모델이 필요하다는 인식 아래 새 지원체계를 관계 부처와 논의 중이라고도 설명했습니다. 기존 독파모와 범용AI 프로젝트의 연계와 재편 가능성도 언급됐습니다.

GPU 지원 확대는 다음 단계 평가를 위한 지원이지, 2027년 이후 지원 방식까지 확정됐다는 뜻은 아닙니다.

정리하면 세 가지를 함께 읽는 것이 좋습니다. GPU는 1000장 수준으로 늘어나고, 진출 팀은 세 팀으로 줄었으며, 2027년 이후 지원 규칙은 아직 정해지지 않았습니다.

이번 선발이 보여준 기준

이번 발표는 단순히 한 팀이 떨어지고 세 팀이 올라간 사건으로만 보기 어렵습니다. 정부가 어떤 기준으로 국내 AI 모델을 선발하는지 비교적 선명하게 드러낸 사례이기 때문입니다.

공개 순위표가 선발 그 자체는 아니며, 실제 서비스에 붙어 있는지가 더 큰 비중으로 평가됐습니다.

모티프의 사례는 벤치마크 성과가 얼마나 빠르게 올라갈 수 있는지를 보여줬습니다. 동시에 그 점수만으로는 다음 단계 진출이 보장되지 않는다는 점도 드러냈습니다. 반대로 통과한 세 팀은 각기 다른 방식이지만 공통적으로 서비스 적용, 협업 구조, 안전과 활용 전략을 설명할 수 있었습니다.

이번 독파모 2차 평가는 결국 한국의 AI 선발이 시험 점수 40점과 실제 사용 60점 사이에서 어디에 더 무게를 두는지 보여준 발표였습니다.

참고 자료

아시아경제 종합
아시아경제 브리핑
지디넷코리아 (2026-08-18)

이번 결과를 보면, AI 모델 평가에서 벤치마크와 실제 사용성 가운데 무엇이 더 중요하다고 보시는지 궁금합니다.