3차 전에 규칙을 지운다 | DAKER 커뮤니티

3차 진출 명단에 그 팀이 없습니다. 벤치마크에서는 앞섰던 팀입니다. 정부는 GPU를 1000장으로 늘린다고 했습니다. 같은 브리핑에서 2027년 지원 방식은 전부 다시 검토하겠다고 했습니다.

날짜는 2026년 8월 18일입니다. 과기정통부와 NIPA가 브리핑을 열었습니다. 독자 AI 파운데이션 모델, 독파모 2차 단계평가입니다. 남은 팀은 업스테이지, SK텔레콤, LG AI연구원입니다. 빠진 팀은 모티프테크놀로지스입니다. 연합뉴스뉴시스가 그날 같이 전한 팩트입니다. 팀마다 종합 점수는 안 나왔습니다. 누가 몇 등인지도 안 나왔습니다. 나온 것은 배점과 평균입니다. 1위와 4위가 얼마나 벌어졌는지도 나왔습니다. 오늘은 1등 팀 이름을 묻지 않습니다. 3차가 시작되기 전에 지원 규칙을 다시 쓴다는 발표를 묻습니다. 그 발표가 우리가 제출물을 어떻게 준비해야 하는지를 바꿉니다.

순위표는 없고 배점만 나왔다

2차 평가는 세 항목입니다. 벤치마크 40. 전문가 35. 사용자 25. 합이 100입니다. 연합뉴스가 전한 평균을 그대로 읽습니다. 벤치마크는 평균 22.5, 1위와 4위 차이 4.0. 전문가는 평균 28.8, 차이 2.4. 사용자는 평균 17.6, 차이 5.0. 제일 크게 벌어진 쪽이 사용자입니다. 제일 좁은 쪽이 전문가입니다. 벤치마크는 그 사이입니다. 뉴시스가 옮긴 과기정통부 설명은 짧습니다. 격차가 크지 않습니다. 항목마다 줄곧 1등을 한 기업은 없었습니다.

이 숫자만으로는 벤치마크 1등 팀을 알 수 없습니다. 알 수 있는 것은 배점 비중입니다. 벤치마크 40점은 시험 점수입니다. 남은 전문가 35점과 사용자 25점은 실제 사용 평가입니다. 전문가와 사용자를 더하면 벤치마크보다 배점이 큽니다. 모티프 3은 아티피셜 애널리시스 AAII에서 47을 받았습니다. 글로벌 지표입니다. 뉴시스는 참여팀 사이에서 이 지표가 앞섰다고 썼습니다. 그런데 그 팀이 종합 평가에서 빠졌습니다. 순위표를 만들지 않아도 되는 결론이 있습니다. 벤치마크 점수만으로는 3차에 가지 못했습니다.

순위를 안 밝힌 것은 배려가 아닙니다. 항목마다 1등이 달랐다는 뜻입니다. 한 항목에서 높은 점수를 받아도 다음 항목에서 밀릴 수 있습니다. 해커톤에서 매일 보는 상황입니다. 벤치마크 순위가 좋은 팀은 시연에서 자주 실패합니다. 시연이 잘 되는 팀은 벤치마크 순위가 평범한 경우가 많습니다. 독파모는 그 차이를 국가 선발 배점 숫자로 고정해 두었습니다. 40 대 60. 시험 점수와 실제 사용 평가의 비율은 이미 공개된 상태입니다.

평균을 다시 봅니다. 벤치마크 22.5는 40점 만점에서 절반을 간신히 넘습니다. 전문가 28.8은 35점에 거의 붙어 있습니다. 사용자 17.6은 25점의 70퍼센트에도 못 미칩니다. 네 팀은 벤치마크에서 서로 점수가 비슷했습니다. 전문가 평가에서는 서로 후했습니다. 실제 사용자 평가에서 간격이 더 벌어졌습니다. 이건 등수가 아닙니다. 채점자가 어느 항목에서 차이를 냈는지입니다. 다음 라운드를 준비하는 일은 평균 점수를 비판하는 일이 아닙니다. 점수 차이가 가장 컸던 항목에 제출물을 맞추는 일입니다.

25점이 작아 보이지만

사용자 쪽 25점은 작아 보입니다. 차이 5.0은 세 항목 가운데 제일 큽니다. 그래도 합격과 탈락을 그 한 항목만으로 설명하는 말은 과합니다. 뉴시스가 전한 대로 항목마다 1등은 달랐습니다. 종합 순위는 없습니다. 배점이 보여 주는 사실은 분명합니다. 기술력 설명만 들고 통과한 팀은 없었습니다. 활용성 쪽이 더 비중이 컸다는 보도가 있습니다. 사용자 쪽 간격이 제일 컸다는 숫자가 있습니다. 두 보도는 같은 방향을 가리킵니다.

뉴시스가 모티프 탈락을 적은 문장은 이렇습니다. 글로벌 벤치마크 같은 기술력에서는 평가가 높았습니다. 배점이 더 큰 활용성에서는 다른 기업을 못 따라갔습니다. 활용성은 전문가 35와 사용자 25를 합친 항목입니다. 75점입니다. 벤치마크 40보다 배점이 큽니다. AAII 47은 그 40점 안에 들어 있는 지표 하나입니다. 참여팀 중 그 지표가 앞섰다는 보도가 있습니다. 종합 평가에서는 빠졌다는 결과도 있습니다. 두 줄을 같이 읽어야 합니다. 벤치마크 한 항목이 전문가와 사용자 두 항목을 이기지 못했습니다.

사용성 배점이 남긴 숙제는 둘입니다. 하나는 모델입니다. 사람이 실제로 물어봐야 합니다. 이어서 고칠 수 있어야 합니다. 다시 맡겨도 되어야 합니다. 다른 하나는 배포입니다. 포털에 붙어야 합니다. 상용 서비스에 들어가야 합니다. 제조나 세무 같은 현장에서 한 번은 돌아가야 합니다. 독파모가 물은 것은 벤치마크 순위 한 줄이 아니었습니다. 누가 쓰는지. 어디서 쓰는지. 다시 쓰는지. 해커톤이 배포 URL을 제출로 받는 이유와 같습니다. 점수가 있어도 링크가 안 열리면 그 점수는 제출이 아닙니다.

25점을 가볍게 본 팀이 빠지는 이유는 단순합니다. 40점 항목에서 4점을 벌리는 일보다, 25점 항목에서 5점을 벌리는 일이 합격과 탈락에 더 가깝습니다. 만점 대비 비율이 아닙니다. 실제로 벌어진 점수 폭입니다. 전문가 항목은 2.4점밖에 안 벌어졌습니다. 거기서 순서를 뒤집기는 어렵습니다. 사용자 항목은 다섯 점이 움직였습니다. 우리 제출로 옮기면 이렇습니다. 벤치마크 숫자를 조금 올리는 주보다, 실제 사용자가 한 번 더 쓰는 주가 점수 차이로 이어질 여지가 큽니다. 사용성 배점이 남긴 것은 감동 이야기가 아닙니다. 어디에 시간을 쓰라는 지시입니다.

이 지시를 잘못 읽으면 한 번만 보여주는 시연이 됩니다. 한 번 보여주고 꺼버리는 화면은 사용자 평가가 아닙니다. 다시 접속해 쓸 수 있는 화면이 사용자 평가입니다. 포털에 붙었다는 문장이 전문가 의견에 남았습니다. 상용에 올라갔다는 문장도 남았습니다. 제조와 세무에서 실증했다는 문장도 남았습니다. 이유가 같습니다. 한 번 보여 주는 시연이 아닙니다. 반복해서 쓸 수 있는 서비스 경로입니다. 심사 직전에 화면을 고치는 버릇이 여기서 걸립니다. 심사 전날 급하게 올린 링크는 사용성이 아닙니다. 일주일 사용 기록이 쌓인 링크가 사용성입니다.

남은 세 팀, 전문가 의견만 있다

과기정통부가 내놓은 것은 점수표가 아닙니다. 전문가위원회 평가 의견입니다. 뉴시스가 옮긴 문장만 적습니다. 업스테이지는 포털 다음과 타임리 연계입니다. 퓨리오사AI NPU 협업도 있습니다. 국민이 체감할 플랫폼에 붙였습니다. 국산 가속 칩 협업이 같이 적혀 있습니다. 벤치마크 문장이 아닙니다. 배포와 하드웨어 문장입니다. 모델이 실제로 돌아가는 자리가 평가에 들어갔습니다.

SK텔레콤은 수리 추론과 한국어입니다. 대규모 상용 서비스 탑재도 있습니다. 분야 특화 AX K1이 같이 적혀 있습니다. 제조 산업 특화 에이전트 실증도 있습니다. 세무 분야 적용 가능성도 있습니다. 뉴시스 문장을 더하면 다국어와 실제 응용 체계의 활용성입니다. 점수는 여기도 없습니다. 있는 것은 탑재와 실증입니다. 모델이 서비스 안에 들어가 있다는 사실. 그게 전문가 의견의 핵심입니다.

LG AI연구원은 국제기구 협업입니다. 에이전틱 AI입니다. 신뢰성 방법론입니다. 뉴시스는 개념 정의가 명확하다고 썼습니다. 신뢰할 수 있는 AI를 위한 활동이 충실하다고 썼습니다. 지속가능성까지 반영됐다고 썼습니다. 글로벌 파급과 위험 관리가 같이 묶여 있습니다. 벤치마크 항목이 아닙니다. 운영 항목입니다. 누가 같이 쓰는지. 사고가 나면 어떤 절차가 있는지. 그 질문이 3차 진출 평가에 들어가 있습니다.

세 팀 문장에서 같이 빠진 것이 있습니다. 벤치마크 순위 한 줄입니다. 같이 있는 것은 실제 사용처입니다. 포털, 상용, 제조, 세무, 국제기구, 에이전트, NPU. 모델 이름보다 붙는 서비스가 먼저 나옵니다. 이 목록을 보고도 벤치마크만 올리면 다음 라운드에서 같은 실수를 합니다. 3차가 물을 항목은 아직 확정되지 않았습니다. 2차가 물은 항목은 이미 나와 있습니다. 실제 사용입니다.

주말 해커톤 기준으로 바꾸면 세 가지면 됩니다. 첫째, 모델이 붙는 실제 화면. 로그인 없는 데모가 아닙니다. 누가 다시 들어오는가입니다. 둘째, 그 화면이 도는 자리. 로컬 노트북이 아닙니다. 배포 URL입니다. 되면 가속 환경까지. 셋째, 실패했을 때 멈추는 법. 에이전트가 도구를 잘못 부르면 거절하고 기록을 남기는지. 이 세 가지가 있으면 2차 전문가 의견과 같은 말로 말하기 시작합니다. 없으면 벤치마크 스크린샷만 내는 팀과 같습니다.

GPU는 늘고 다음 해 규칙은 아직 없습니다

3차는 예정대로 마지막 2팀을 고릅니다. 류제명 2차관이 브리핑에서 한 말입니다. 그다음 문장이 오늘 글이 주목하는 발표입니다. 2027년 그 2팀 지원 방식은 완전히 재검토 중입니다. 뉴시스가 전한 공감대는 이렇습니다. 지금 같은 경쟁 방식에서 벗어납시다. 프론티어 기업 모델에 버금가는 경쟁이 가능한 쪽으로 재편합시다. 3차가 열리기 전에, 그다음 해 지원 규칙이 먼저 바뀌기 시작합니다.

바로 움직이는 자원은 GPU입니다. 상반기 B200 768장 수준에서 하반기 1000장 규모로 늘립니다. 진출한 세 팀을 위한 지원입니다. 뉴시스는 총 1200억 원 규모라고 적었습니다. GPU 장수는 늘었습니다. 남은 팀은 줄었습니다. 2027년 지원 형태는 아직 정해지지 않았습니다. 이 세 줄은 같이 가야 합니다. GPU를 늘리는 문장만 보면 이긴 팀입니다. 지원 방식을 다시 검토한다는 문장까지 보면, 다음 해 지원은 아직 확정되지 않았습니다. 3차 진출이 다음 해 예산을 확정하지는 않습니다.

다시 보겠다는 이유는 점수표 밖에 있습니다. 글로벌 프론티어 모델이 너무 빨리 올라간다는 인식입니다. 한정된 예산을 여러 곳에 나눠 주는 방식이 있습니다. 그 방식이 최상위급 독자 모델을 만들기에 맞는지, 다시 묻겠다는 취지입니다. 분산이냐 집중이냐. 어떤 컨소시엄이 맞느냐. 류 차관이 브리핑에서 남겨 둔 질문입니다. 해커톤 팀에게는 낯선 질문이 아닙니다. 한 해커톤 상금을 세 팀으로 나눌지, 우승 한 팀에 몰아 줄지와 같습니다. 주최 측이 목표를 높이면 배분부터 다시 짭니다.

3차에서 마지막 2팀을 고른다는 일정은 그대로입니다. 그 항목의 새 숫자는 이날 브리핑에서 고정되지 않았습니다. 2차의 40·35·25를 3차에 그대로 옮긴다고 가정하지 않습니다. 그래도 2차가 물은 방향은 남습니다. 실제 사용과 현장 적용입니다. 배점 숫자가 바뀌어도 한 가지는 안 바뀝니다. 벤치마크만으로 통과한 팀이 없었습니다. 다음 라운드 준비의 기본값은 그 사실입니다.

지원을 다시 짠다는 말은 다음을 기다리라는 뜻이 아닙니다. 남은 세 팀에게는 숙제입니다. GPU는 1000장으로 늘었습니다. 다음 해 계약은 아직 없습니다. 이 간격에서 할 일은 벤치마크 한 줄을 더 올리는 것이 아닙니다. 2차가 이미 물은 실제 사용 기록을 더 남기는 일입니다. 포털 연계를 계획 문서가 아니라 사용 로그로 남깁니다. 상용 탑재를 한 번 시연이 아니라 반복 사용으로 남깁니다. 신뢰성 방법론을 슬라이드가 아니라 거절 조건으로 남깁니다. 규칙이 다시 쓰일 때 남는 제출이 있습니다. 새 배점을 기다린 제출이 아닙니다. 이미 쓰이고 있는 제출입니다.

빠진 팀에게도 같은 문장은 남습니다. AAII 47이라는 숫자는 그대로입니다. 3차 진출 자격만 사라졌습니다. 뉴시스가 전한 활용성 부족은, 다음 제품을 어디에 붙일지의 힌트입니다. 벤치마크를 버리라는 힌트가 아닙니다. 벤치마크 위에 실제 사용 경로를 올리라는 힌트입니다. 국가 선발 밖에서도 그 숙제는 같습니다. 벤치마크 순위에만 남는 모델과, 실제 서비스에 남는 모델은 준비 일정이 다릅니다. 3차가 열리기 전에 지원 규칙이 다시 쓰이는 지금이, 그 일정을 고치기 가장 비용이 적은 시기입니다.

아닌 것부터 짚는다

모티프가 실력이 없어서 떨어졌다는 글이 아닙니다. AAII 47은 참여팀 중 앞섰다고 보도된 숫자입니다. 빠진 자리는 기술력 문장이 아닙니다. 활용성 문장입니다. 반대로, 남은 세 팀이 벤치마크에서 졌다는 글도 아닙니다. 팀별 벤치마크 점수와 종합 순위는 공개되지 않았습니다. 없는 순위를 지어내면 이 글의 근거가 무너집니다.

사용성 25점이 합격과 탈락을 혼자 정했다는 글도 아닙니다. 간격이 가장 큰 항목일 뿐입니다. 종합은 세 항목의 합입니다. 항목마다 1등은 달랐습니다. 스캔들로 읽지 않습니다. 가져갈 것은 의혹이 아니라 배점입니다. 40·35·25는 이미 공개돼 있습니다. 그 배점 아래에서 벤치마크가 앞선 팀이 빠졌다는 보도가 있습니다. 그 두 줄이면 됩니다.

2027년 재검토를 3차가 없어진다고 읽는 것도 틀립니다. 3차는 엽니다. 2팀을 뽑습니다. GPU는 늘립니다. 다시 검토하는 것은 그다음 해의 지원 형태입니다. 지금 당장 국가 선발이 사라진다는 발표가 아닙니다. 국가 선발 방식을 다시 쓰겠다는 발표입니다. 뽑힌 뒤에 얼마나 지원을 몰아 줄지를 다시 쓰겠다는 발표입니다. 해커톤으로 옮기면 이렇습니다. 결선은 예정대로 치릅니다. 결선 이후 후속 지원금과 운영 주체는 다시 협의합니다. 결선에 남은 팀은 안심할 자리가 아닙니다. 다음 계약은 아직 없습니다.

벤치마크 1등만으로 국가 선발에 가지 못한다

DAKER에서 배포가 제출입니다. 독파모 2차가 남긴 말과 같습니다. 벤치마크에서 앞서는 일과 국가 선발에 남는 일은 다릅니다. 40점은 필요조건에 가깝습니다. 60점은 실제 사용 조건입니다. 해커톤 팀이 벤치마크만 보고 시연을 미루는 버릇이 있습니다. 그 버릇이 국가 선발에서도 같은 모양으로 나왔습니다. 차이는 규모입니다. 주말 해커톤은 상금이 걸립니다. 독파모는 GPU 1000장과 다음 해 지원 형태가 걸립니다.

오늘 준비에 넣을 단위는 모델 이름이 아닙니다. 누가 쓰는가. 어디서 도는가. 실패하면 누가 책임지는가. 업스테이지 문장은 다음, 타임리, NPU입니다. SKT 문장은 상용 탑재, AX K1, 제조, 세무입니다. LG 문장은 국제기구, 에이전트, 신뢰성입니다. 제출 저장소 기준으로 옮기면 이렇습니다. 실제 사용자 한 명. 실제 환경 한 곳. 실패 기록과 롤백 한 줄. 이 세 가지가 비면 벤치마크 숫자는 보도자료일 뿐입니다. 제출이 아닙니다.

3차 배점이 아직 없다는 사실이 준비 기준을 더 분명하게 합니다. 숫자를 기다리면 준비가 늦어집니다. 2차가 이미 물은 항목을 먼저 메웁니다. 데모 한 번이 아니라 반복 사용. 연구 노트가 아니라 서비스 경로. 모델 카드가 아니라 현장 사용 기록. 국가 선발이 여기를 물은 이유는 단순합니다. 프론티어를 따라가려면 시험 점수가 아니라 실제 사용 기록이 쌓여야 한다고 본 것입니다. 2027년 지원을 다시 검토하는 이유도 같습니다. 나눠 준 GPU로 벤치마크 점수를 조금 올리는 구조가 있습니다. 그 구조가 목표에 못 미칠 수 있다는 판단입니다.

해커톤 팀이 이 브리핑에서 가져갈 것은 응원이 아닙니다. 채점표입니다. 벤치마크를 버리라는 뜻이 아닙니다. 벤치마크만 들고 본선에 가지 말라는 뜻입니다. 40점이 있는 한 시험 점수는 필요합니다. 60점이 있는 한 시험 점수만으로는 부족합니다. 다음 주 해커톤 제출물에도 같은 비율을 대봅니다. 성능 숫자 40. 누가 쓰는가 35. 실제로 돌아가는가 25. 이 세 가지를 비워 두고 모델만 갈아끼우면, 독파모 2차와 같은 모양의 탈락을 팀 안에서 먼저 겪습니다.

그 비율은 팀 작업판에 붙여 두는 편이 낫습니다. 월요일에 벤치마크 숫자를 자랑하고 금요일에 시연을 붙이는 일정은 2차 배점과 반대입니다. 수요일에 사용자 한 명이 같은 과제를 두 번 돌리게 합니다. 목요일에 그 사용 기록을 제출 문구로 옮깁니다. 금요일 시연은 그 기록의 요약이면 됩니다. 국가 선발이 이 순서를 물은 이유가 있습니다. 순서가 뒤집힌 팀이 벤치마크에서 앞서도 실제 사용에서 밀렸기 때문입니다. 순위는 없어도 준비 순서는 이미 나왔습니다.

지원이 다시 짜이는 구간에서 팀이 놓치면 안 되는 것은 모델 가중치가 아닙니다. 누가 다시 쓰는 사용 기록입니다. GPU가 768장에서 1000장이 되어도, 그 GPU가 벤치마크만 돌리면 2027년 재검토의 이유와 같아집니다. GPU가 늘어난 만큼 실제 사용 기록을 더 남기지 못하면, 다음 규칙 초안에서 같은 팀이 다시 밀립니다. 3차 전에 지원 규칙을 다시 쓴다는 문장은 협박이 아닙니다. 제출의 단위를 점수에서 실제 사용 기록으로 옮기라는 예고입니다.

오늘 직접 할 점검은 작아도 괜찮습니다. 팀의 지난 제출물 하나를 엽니다. 벤치마크 숫자. 전문가에게 말할 활용 문장. 실제 사용자가 다시 연 흔적. 세 가지 중 어디가 비었는지 먼저 표시합니다. 빈곳이 사용이면 이번 주는 모델을 바꾸지 않습니다. 같은 링크를 다른 사람 한 명에게 맡깁니다. 그 사람이 막힌 지점만 적습니다. 그 한 페이지가 2차가 물은 25점에 가장 가까운 숙제입니다. GPU가 늘어나는 뉴스보다, 그 빈곳을 메우는 사용 기록이 3차 전 준비의 기준이 됩니다.

오늘 세션

벤치마크에서 앞선 팀이 빠졌습니다. GPU는 1000장이 됩니다. 2027년 규칙은 아직 없습니다. 세 문장이 하루 브리핑입니다. 해커톤 팀이 가져갈 것은 세 번째 문장입니다. 지원 규칙이 다시 쓰이기 전에, 벤치마크 점수가 아니라 실제 사용 기록을 제출에 넣으십시오. 국가 선발은 벤치마크만으로 뽑히지 않았습니다.

브리핑 출처: 연합뉴스 — 독파모 LG·SKT·업스테이지 3파전, 모티프 탈락 · 뉴시스 — 2차 평가 통과와 활용성 평가(종합2보) · 연합뉴스 종합2보