벤치마크 1등이 탈락했다 | DAKER 커뮤니티

오늘 과학기술정보통신부가 독자 AI 파운데이션 모델 프로젝트, 독파모 2차 단계평가 통과 명단을 발표했습니다. 공개 글로벌 벤치마크에서 1위였던 모티프테크놀로지스의 이름은 그 명단에 없었습니다. 벤치마크 점수가 낮아서가 아닙니다. 정부가 벤치마크 점수와, 실제로 쓰이는지를 다른 비중으로 봤기 때문입니다.

벤치마크 1등이 탈락했다 — 독파모 2차

날짜는 2026년 8월 18일입니다. 자리는 정부서울청사입니다. 다음 단계로 가는 팀은 업스테이지, SK텔레콤, LG AI연구원입니다. 모티프테크놀로지스는 탈락했습니다. 공개 순위표가 높다고 다음 단계에 가는 날이 아닙니다. 기록은 아시아경제 종합, 같은 날 브리핑 기사, 지디넷코리아의 모티프 후속에 남아 있습니다. 아래 점수는 그 기사들이 전한 공식 배점과 공개 AAII입니다. 썸네일 스코어보드의 숫자는 연출입니다. 본문에 쓰지 않습니다.

무엇이 나왔습니까

독파모는 과학기술정보통신부의 독자 AI 파운데이션 모델 프로젝트입니다. 2차 단계평가 배점은 세 항목입니다. 벤치마크 40. 전문가 35. 사용자 25. 합이 100입니다. 벤치마크만 잘해도 받을 수 있는 점수는 40점에서 끝납니다. 전문가와 사용자를 더한 60점이 사용성, 전략, 실제 서비스의 점수입니다. 정부가 모델 성능만 고르는 시험이 아닙니다. 그 모델이 실제 서비스에서 쓰이는지를 같이 보는 시험입니다. 벤치마크 40점은 시험 점수입니다. 전문가·사용자 60점은 실제로 쓰이는지를 보는 점수입니다. 해커톤에서 매일 보는 비율과 같습니다. 공개 순위표만 좋은 팀은 시연에서 자주 실패합니다. 시연이 잘 되는 팀은 공개 순위표가 평범할 때가 많습니다. 독파모는 그 차이를 국가 선발 배점 40 대 60으로 고정해 두었습니다.

항목별 순위는 공개되지 않았습니다. 류제명 차관은 네 팀의 격차가 근소해 1위를 발표할 실익이 크지 않다고 했습니다. 다른 기업에 미치는 영향도 종합했다고 했습니다. 오늘 나온 것은 평균과 1위·4위 간격입니다. 벤치마크 평균 22.5점, 1위와 4위의 차 4.0점. 네 팀 모두 30점을 넘지 못했습니다. 전문가 평균 28.8점, 간격 2.4점. 사용자 평균 17.6점, 간격 5.0점. 팀 사이 점수 차이가 가장 큰 항목은 사용자 평가입니다. 벤치마크의 4점보다 사용자 평가의 5점이 더 큽니다. 만점 40점인 벤치마크보다, 만점 25점인 사용자 평가에서 간격이 더 컸습니다. 만점이 큰 쪽이 아니라, 실제로 벌어진 폭이 큰 쪽입니다.

절대값도 같이 봅니다. 벤치 평균 22.5점은 40점 만점의 절반인 20점을 조금 넘습니다. 전문가 평균 28.8점은 35점 만점에서 상대적으로 높습니다. 사용자 평균 17.6점은 25점 만점에서 전문가 항목보다 비율이 낮습니다. 탈락이 근소했다는 말과, 사용성이 낮았다는 말이 한꺼번에 나온 이유가 여기 있습니다. 네 팀은 벤치마크에서는 점수 차가 작았습니다. 사용자 평가가 간격을 더 벌렸습니다. 이 숫자로 등수를 만들 수는 없습니다. 채점자가 어느 항목에서 팀 사이 차이를 더 크게 봤는지는 이 간격으로 보입니다.

일반 국민 평가는 1400여 명 지원, 최종 185명이 참여했습니다. 류 차관은 이 평가가 당락에 결정적이지 않았다고 했습니다. 일반 국민 평가 한 항목이 당락을 정한 것이 아닙니다. 전문가와 사용성을 포함한 종합입니다. 185명을 국민 심판으로 과장하면 브리핑을 반대로 읽은 것입니다. 사람이 많다고 그 항목이 당락의 전부는 아닙니다. 정부가 그렇게 말하지 않았습니다.

진출한 세 팀에 GPU가 늘어납니다. 당초 768장 수준이던 엔비디아 B200 지원을 1000장 수준으로 올립니다. 3차 평가는 올해 말에서 내년 초, 예정대로 진행해 최종 2팀을 고릅니다. 그 이후는 다릅니다. 류 차관은 2027년 이후 두 팀에 대한 지원을 지금 형태 그대로 갈지 전면 재검토 중이라고 했습니다. 브리핑 뒤 기자들과의 자리에서는 최상위급 독자 모델이 필요하다는 인식 아래 새 지원체계를 관계 부처와 논의 중이라고도 했습니다. 기존 독파모와 범용AI 프로젝트의 연계, 재편도 들여다본다고 전했습니다. 2차 통과가 다음 예산의 자동 연장은 아닙니다. GPU 지원은 1000장 수준으로 늘어납니다. 진출 팀은 세 팀으로 줄었습니다. 2027년 이후 지원 규칙은 아직 정해지지 않았습니다. 이 세 사실을 같이 읽어야 합니다. GPU가 늘어난다는 문장만 보면 통과한 팀이 이긴 것처럼 보입니다. 2027년 지원을 전면 재검토한다는 문장까지 보면, 이번 통과는 아직 잠정입니다.

벤치마크 1위가 탈락한 이유

공개된 글로벌 지수인 AAII에서 모티프는 47점입니다. 솔라 오픈 2(업스테이지) 37점, 에이닷엑스-K2(SK텔레콤) 35점, K-엑사원 2.0(LG AI연구원) 31점을 앞섰습니다. 지디넷은 한국 기업 1위, 글로벌 10위, 오픈웨이트 기준 글로벌 4위로 전했습니다. 벤치마크만 보면 모티프가 위입니다. 이 네 숫자만 본문에 남깁니다. 가상 스코어보드의 90점대는 사실이 아닙니다. 썸네일에 그려 둔 점수판을 실제 결과로 옮기면 틀립니다.

정부는 모티프가 에이전트, 코딩 고난도 벤치에서 글로벌 빅테크와 대등한 수준을 냈다고 인정했습니다. 류 차관은 작은 R&D 조직인데도 뛰어난 성과를 냈다고 했습니다. 탈락 이유로 짚은 것은 사용성이 타사보다 상대적으로 낮았다는 점입니다. 공개 순위표 1위가 전문가·사용자 60점 쪽에서 밀린 것으로 읽힙니다. 항목별 득점은 비공개입니다. 그 이상을 점수 계산으로 메우지 않습니다. 47점에서 몇 점을 뺐는지는 나와 있지 않습니다. 없는 뺄셈을 여기서 하지 않습니다.

모티프는 처음부터 있던 팀이 아닙니다. 중간에 합류했습니다. 약 5개월 만에 사전학습부터 후처리까지 자체 모델 모티프3를 올려 벤치마크 1위를 만들었습니다. 임정환 대표는 정부가 작은 스타트업에도 기회를 주지 않았다면 이 성과가 없었을 것이라고 했습니다. 결과에 상관없이 기술력만으로 한국에서도 프론티어급이 가능하다는 점을 증명했다고 했습니다. 같은 날 마감하는 모두의 AI에는 KT 컨소시엄으로 남습니다. 선발에서 내려와도 모델은 남습니다. 독파모 탈락을 회사의 종료로 읽으면 기사를 덜 읽은 것입니다. AAII 점수와 모델은 남았습니다. 사업도 남았습니다. 내려온 것은 2차 선발입니다.

벤치마크에 맞춰 점수를 올렸다는 의혹은 이번 발표에서 정부가 일축했습니다. 류 차관은 해당 평가기관에 물었고, 체계적 암기나 과적합이 입증될 답변을 찾지 못했으며 큰 문제가 없다는 답을 받았다고 했습니다. 탈락의 이유를 부정행위로 읽을 근거를 정부는 제시하지 않았습니다. 사용성이 낮았다는 설명과, 벤치 조작이 입증되지 않았다는 설명은 같이 갑니다. 스캔들로 읽지 않습니다. 이 글이 가져갈 것은 부정행위 의혹이 아니라 배점입니다.

올라간 세 팀을 점수표가 아니라 사용으로 본 이유

전문가위원회가 호평한 문장은 벤치마크 숫자가 아닙니다. 업스테이지는 다음, 타임리와 연계해 국민이 체감할 배포를 추진하고, 퓨리오사AI NPU와 협업해 외산 하드웨어 종속성을 줄인 점이 적혔습니다. 모델 점수보다, 사람들이 이미 쓰는 서비스에 붙는지와 국산 칩을 쓰는지의 이야기입니다. 포털과 뉴스 앱에 붙는다는 것은 평가용 데모가 아니라는 뜻입니다. 사람이 이미 여는 화면에 들어간다는 뜻입니다. 심사 직전에 켠 링크가 아닙니다. 이미 사람들이 매일 여는 화면입니다.

SKT는 수리 추론과 한국어에서 정상을 확보했습니다. 대규모 상용 서비스에 실제로 올라가 사용성, 실용성에서 높은 평가를 받았습니다. 회사는 A.X K2가 IMO 2026 문제 평가에서 금메달 기준을 충족했고, MathArena AIME 2026에서 97.1%로 공동 최고점을 냈다고 공개한 바 있습니다. 독파모 발표가 다시 짚은 것은 그 숫자 자체보다, 이미 서비스에 들어가 있다는 사실입니다. 수학 경진대회 금메달 기준을 충족한 것이 통과 이유가 아닙니다. 상용 서비스에 붙은 모델이 통과 사유에 가깝습니다. 공개 순위표가 좋은 것과, 사람이 이미 쓰는 서비스에 올라간 것은 다른 제출입니다.

LG AI연구원은 국제기구 등과 협업 전략, 에이전틱 AI의 차별성, 안전이 호평 문장에 있습니다. K-엑사원 2.0은 7500억 파라미터 규모로 공개된 모델입니다. 큰 모델이 통과 사유로 호명된 것이 아닙니다. 파급과 에이전트와 안전의 전략이 호명됐습니다. 모델 크기(7500억 파라미터)는 배경 설명입니다. 선발 이유에 적힌 문장은 실제로 어떻게 쓰이는지입니다. 누가 같이 쓰는지, 사고가 나면 어떤 절차가 있는지가 3차 평가 진출 이유에 붙어 있습니다.

AAII는 지식, 추론, 코딩 등 여러 벤치를 한 점수로 묶습니다. 무엇을 묶느냐에 따라 흔들립니다. 정부는 NIA 벤치가 한국어, 한국 맥락, 안전성, 신뢰성까지 본다고 설명했습니다. 글로벌 1위 표와 국내 선발 표가 다른 이유입니다. 공개 순위표 한 장만으로 국가 선발을 설명하면, 배점 100점 가운데 전문가·사용자 60점을 뺀 셈입니다. 공개 점수를 올리는 일과, 그 모델이 실제로 쓰이는 서비스를 만드는 일은 처음부터 다른 숙제입니다.

무엇이 아닙니까

모티프의 기술 사망 선고가 아닙니다. 벤치마크 점수는 남았고, 모델은 남았고, 다른 사업은 이어집니다. 2차 선발에서 내려온 것입니다. 5개월 만에 공개 점수를 만든 팀은, 점수 밖의 사용성을 다음 제품에 붙이면 다시 싸웁니다. AAII 47은 그대로입니다. 2차 선발에서 다음 단계로 가는 자격만 사라졌습니다.

항목별 1등이 공개된 날도 아닙니다. 누가 벤치 40점 만점에서 몇 점을 받았는지는 나와 있지 않습니다. 공개 AAII와 평균, 간격만으로 순위를 재구성하면 과잉입니다. 썸네일의 가상 점수판을 실제 결과로 인용하면 틀립니다. 근소가 공식 형용사이고, 1등 호명은 정부가 하지 않은 일입니다. 없는 순위를 지어내면 이 글은 끝입니다.

2027년 지원이 확정된 이야기도 아닙니다. 3차는 예정대로 2팀을 고릅니다. 그다음 지원 방식은 전면 재검토입니다. 이번 통과는 3차(최종 2팀 선발)로 가는 자격이지, 다음 예산이 확정된 것이 아닙니다. 1000장 수준의 GPU는 다음 단계 학습·평가를 위한 지원입니다. 최종 선정이 아닙니다. GPU는 늘고, 팀은 줄고, 다음 해 계약은 아직 없습니다. 이 세 사실을 한 문장으로 묶지 않습니다.

이번 주에 읽을 문장

공개 순위표가 선발이 아닙니다. 배점의 60점은 전문가와 사용자입니다. 배포되고, 쓰이고, 서비스에 붙어 있는 쪽이 그 60점을 가져갑니다. 벤치마크 1위가 탈락한 이유는 그 문장 하나에 들어 있습니다. 공개 점수를 올린 팀은 여럿이었습니다. 그 모델이 실제로 쓰이는 서비스가 있는지가 선발을 갈랐습니다.

한국에서 모델을 만드는 팀의 이번 주 숙제는 종합 지수를 한 점 더 올리는 일이 아닙니다. 다음, 타임리처럼 국민이 이미 쓰는 화면. 에이닷처럼 이미 돌아가는 상용 서비스. 국제 협력과 안전처럼 바깥에서 검증되는 사용성. 그 세 줄을 한 줄로 적는 일입니다. 팀 내부 벤치 점수가 실제 서비스에서 쓰이지 않으면, 배점 40점만 채우는 일입니다. 3차까지 남은 시간은 벤치마크 점수만 고치기 위한 시간이 아닙니다. 사람이 여는 화면을 만들기 위한 시간에 가깝습니다.

DAKER에서도 같은 문장을 씁니다. 배포가 제출입니다. 리더보드에 올라간 제출은 제출이 아닙니다. 다른 사람이 링크를 열어 한 번 성공하는 지점까지가 제출입니다. 오늘 독파모가 국가 단위로 그 문장을 읽었습니다. 해커톤이든 파운데이션이든, 점수표에 남는 것과 사람이 실제로 쓰는 것은 배점이 다릅니다. 시연 화면만 다듬은 채로 멈추지 않습니다. 링크가 열릴 때까지 갑니다. 심사위원이 여는 것은 벤치 스크린샷이 아니라 URL입니다. 점수를 올렸다는 문장은 가산점이 아닙니다. 그 점수가 사람이 만지는 화면까지 갔는지만 남습니다.

이번 선발이 만드는 팀에게 남기는 것

오늘 발표는 네 회사의 순위표가 아닙니다. 정부가 벤치마크 40점과 전문가·사용자 60점을 어떻게 더하는지를 공개한 날입니다. 벤치 평균이 22.5에 머물고 누구도 30을 못 넘긴 상태에서, 나머지 점수를 가른 것은 전문가와 사용자 평가입니다. 글로벌 AAII 47점이 국내 선발을 자동으로 열어 주지 않는다는 뜻입니다. 모티프3의 5개월은 공개 점수가 빠르게 올라갈 수 있음을 보였습니다. 동시에, 점수만으로는 다음 단계의 GPU 1000장에 못 오른다는 것도 보였습니다.

3차에 남은 세 팀의 숙제는 반대입니다. 벤치마크에서 4점을 더 벌리는 일이 핵심이 아닙니다. 이미 공개된 간격은 벤치 4.0, 전문가 2.4, 사용자 5.0입니다. 사람이 만지는 화면과 상용 경로, 안전과 협력의 설명을 더 분명하게 만드는 쪽이 60점에 가깝습니다. 업스테이지의 다음, 타임리, SKT의 상용 탑재, LG의 국제 협력과 에이전트가 호평 문장에 남은 이유입니다. 3차 배점의 새 숫자는 이날 고정되지 않았습니다. 그래도 2차가 물은 방향은 남습니다. 실제로 쓰이는지, 서비스에 붙어 있는지를 보는 방향입니다.

만드는 팀에게는 국가 사업이 아니어도 같은 배점이 있습니다. 내부 벤치 40, 실제 사용자 60. 데모 데이의 점수는 제출이 아닙니다. 링크가 열리고 한 명이 성공하는 지점이 제출입니다. 오늘 독파모는 그 비율을 국가 단위로 읽었습니다. 월요일에 벤치 숫자를 자랑하고 금요일에 시연을 붙이는 일정은 이 배점과 반대입니다. 사람이 같은 과제를 다시 돌린 로그가 먼저입니다. 시연은 그 로그의 요약이면 됩니다. 순서가 뒤집힌 팀이 시험 점수에서 앞서도 실제 사용에서 밀립니다. 순위는 없어도 그 순서는 이미 나왔습니다.

오늘 손으로 할 실험은 작아도 됩니다. 팀의 지난 제출물 하나를 엽니다. 벤치 숫자. 전문가에게 말할 활용 문장. 실제 사용자가 다시 연 흔적. 세 가지 중 어디가 비었는지 먼저 표시합니다. 빈곳이 사용이면 이번 주는 모델을 바꾸지 않습니다. 같은 링크를 다른 사람 한 명에게 맡깁니다. 그 사람이 막힌 지점만 적습니다. 그 한 페이지가 2차가 물은 25점에 가장 가까운 숙제입니다. GPU가 늘어나는 뉴스보다, 그 빈곳을 메우는 로그가 3차 평가 전까지 버틸 근거가 됩니다.

벤치마크에서 앞선 팀이 빠졌습니다. GPU는 1000장 수준이 됩니다. 2027년 규칙은 아직 없습니다. 세 문장이 하루 브리핑입니다. 만드는 팀이 가져갈 것은 배점입니다. 40점은 시험 점수입니다. 60점은 실제로 쓰이는지입니다. 2027년 지원 규칙이 다시 정해지기 전에, 시험 점수가 아니라 실제 사용을 제출에 넣습니다. 이번 국가 선발은 벤치마크 시험 점수만으로 뽑히지 않았습니다.

원문: 아시아경제 종합 · 아시아경제 브리핑 · 지디넷코리아 (2026-08-18)