오픈웨이트를 이어 학습해 주권형 프론티어 모델을 만듭니다 | DAKER 커뮤니티
2026년 8월 27일 Shengzhuang Chen 연구팀이 오픈웨이트 모델을 이어 학습해 주권형 프론티어 모델을 만드는 방법을 Thomson으로 arXiv에 공개했습니다. 프론티어 모델 개발이 소수의 큰 예산 조직에만 가능한 일로 여겨지면서, 개발자와 다양한 사용자 사이에 정보·경제·권력 비대칭이 생깁니다. 최근 논의는 SovereignAI, 곧 조직이 AI를 독립적으로 구축·배포·거버넌스할 능력을 말하지만, 예산이 다른 환경에서 단기적으로 어떻게 달성할지에 대한 구체 조언은 적습니다. 이 논문은 공개 오픈웨이트 위에 지속 학습(Continual Learning)을 쓰면 더 많은 기관이 프론티어급 성능을 가질 수 있다고 주장합니다.
논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27147에서 확인할 수 있습니다. 저자는 Shengzhuang Chen, Jerrod Parker, Yejin Bang, Andrew M. Bean, Nabeel Seedat, Stefan Winzeck, Daniil Glazko, Jannik Zgraggen, Fangyi Yu, Scott Arnott, Dietrich Trautmann, Luca Ciuffreda 외 14명입니다. PDF는 같은 번호의 pdf입니다. 오픈웨이트 모델은 Hugging Face thomsonreuters/Thomson-1.0-Small에 공개되어 있습니다. 오늘 본문은 초록이 적은 범위만 옮깁니다. 초록에 없는 벤치 이름과 퍼센트는 쓰지 않습니다.
주권형 AI는 소유 가능한 스택입니다
SovereignAI는 조직이 모델을 독립적으로 만들고, 배포하고, 사용을 거버넌스하는 능력을 말합니다. 초록은 이 능력이 큰 예산 플레이어에게만 열려 있다는 인식을 문제로 둡니다. 그 인식이 남으면 정보와 경제와 권력의 비대칭이 커집니다. Thomson은 공개된 오픈웨이트를 출발점으로 두고, mid-training과 post-training 스택을 강화해 그 비대칭을 줄이려 합니다.
작은 규모 파인튜닝, 프롬프트 엔지니어링, 동결 모델에 도구만 붙이는 방법은 한계가 있습니다. 초록은 이런 제한된 접근과 달리, 파라미터에 대한 고영향 개입을 최소로 유지하면서도 가소성(plasticity)과 안정성(stability)을 단계마다 지키는 안전장치를 넣습니다. 목표는 여러 세대에 걸쳐 흔히 보이는 수준의 이득을, 흔히 생각되는 것보다 훨씬 낮은 계산·인력 예산으로 내는 것입니다.
DACON과 DAKER처럼 팀이 짧은 기간에 에이전트와 도구 스택을 소유해야 하는 자리에서는, “모델 전부 처음부터”가 아니라 “오픈웨이트를 이어 학습하고 도구·가치·데이터 프라이버시까지 소유한다”는 문장이 바로 운영 원칙이 됩니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 동결 모델에 프롬프트만 얹지 말고, 지속 학습 스택과 안전장치를 같이 설계하십시오.
지속 학습으로 프론티어급을 만듭니다
Thomson은 고위험 전문 업무에 초점을 둔 범용 프론티어 모델입니다. 초록은 에이전트 작업, 안전, 법률, 세금, 다국어, 대규모 Deep Research에서 최근 프론티어 모델과 경쟁력 있게 작동한다고 적습니다. 평가에서는 π 모양 패턴이 나타납니다. 명시적으로 겨냥하지 않은 능력을 포함해 넓은 범위에서 뚜렷한 향상이 있고, 좁은 도메인 적응에서 흔한 망각(forgetting) 문제는 거의 사라집니다.
π 모양은 “한 과제만 올리면 나머지가 무너진다”는 실패 모드를 피하는 신호입니다. 해커톤에서 한 벤치만 맞추고 제출하면, 다른 도구 호출과 안전 규칙이 깨지기 쉽습니다. Thomson이 보여주는 방향은 단계마다 가소성과 안정성을 같이 지키는 개입입니다. 없는 점수를 만들지 않습니다. 초록이 준 패턴 이름과 능력 범주만 옮깁니다.
빌더 팀에 옮기면 세 줄입니다. 첫째, 베이스로 쓸 오픈웨이트 체크포인트를 고르고 출처 URL을 남깁니다. 둘째, mid·post-training에서 바꿀 파라미터 구간과 바꾸지 않을 구간을 표로 적습니다. 셋째, 학습 전후 에이전트·안전·다국어 점검을 같은 표에 둡니다. 한 지표만 보면 π 패턴을 놓칩니다.
소유할 스택을 나눕니다
초록은 SovereignAI 스택의 많은 부분, 곧 모델·도구 인프라·가치·데이터 프라이버시를 더 많은 행위자가 소유할 수 있게 된다고 적습니다. 소유는 다운로드만으로 끝나지 않습니다. 도구 권한, 데이터 보관 위치, 가치 정렬 규칙을 조직이 직접 적고 배포해야 합니다. 동결 API에만 의존하면 거버넌스가 외부에 남습니다.
DAKER 해커톤에서는 팀이 제출 링크와 함께 어떤 체크포인트를 이었는지, 어떤 안전장치를 켰는지, 어떤 데이터를 내부만 썼는지를 한 페이지에 적어야 합니다. “모델 이름만” 적힌 README는 주권 스택이 아닙니다. Thomson-1.0-Small이 Hugging Face에 공개된 것처럼, 팀이 만든 이어 학습 결과도 주소가 있는 링크로 남겨야 재현됩니다.
가치와 데이터 프라이버시는 학습 목표와 같이 적습니다. 법률·세금처럼 고위험 영역에서는 프롬프트 한 줄로 끝내지 말고, 어떤 데이터를 학습에 넣었는지와 넣지 않았는지를 분리해 기록합니다. 초록이 강조한 전문 업무 초점은, 해커톤에서도 “일반 챗봇 데모”와 “고위험 업무 에이전트”를 같은 제출로 섞지 말라는 뜻으로 읽을 수 있습니다.
망각을 거의 없애는 개입을 고릅니다
좁은 도메인 적응의 흔한 실패는 망각입니다. 한 도메인을 올리면 다른 능력이 떨어집니다. Thomson 평가는 넓은 능력 향상과 함께 망각이 거의 사라지는 패턴을 보고합니다. 초록은 이를 π 모양으로 부릅니다. 팀이 따라갈 운영은 “한 과제 점수만 올리기”가 아니라 “개입 전후 능력 표를 같이 보기”입니다.
구체 숫자는 초록에 없습니다. 오늘 본문에도 퍼센트를 짓지 않습니다. 대신 점검 항목을 고정합니다. 에이전트 작업, 안전, 법률·세금, 다국어, Deep Research 성격의 긴 조사. 이 다섯을 학습 전후에 같은 프롬프트로 돌리고, 승패와 실패 유형만 적습니다. 없는 리더보드 순위를 붙이지 않습니다.
개입 횟수도 최소화합니다. 초록은 파라미터에 대한 고영향 개입을 최소로 유지한다고 적습니다. 모든 레이어를 매일 바꾸지 마십시오. 바꿀 구간을 정하고, 안전장치로 가소성과 안정성을 같이 확인한 뒤에만 다음 개입으로 넘어가십시오. 해커톤처럼 시간이 짧을수록 개입을 줄이는 편이 재현에 유리합니다.
공개 체크포인트로 재현을 시작합니다
Thomson-1.0-Small이 Hugging Face에 공개되어 있으므로, 팀은 오늘 그 카드와 초록을 같은 탭에 두고 이어 학습 계획을 쓸 수 있습니다. 계획에는 베이스 모델 URL, 바꿀 단계, 안전장치, 점검 표, 내부 데이터 경계가 들어가야 합니다. 채팅에만 남긴 계획은 다음 주 팀원이 실행하지 못합니다.
다른 팀의 SovereignAI 시도를 받을 때도 같은 규칙을 씁니다. 체크포인트 링크 없이 “주권형”이라고 적은 문장은 검증되지 않습니다. DAKER와 DACON 제출은 다른 사람이 열 수 있는 주소를 요구합니다. 이어 학습 로그와 점검 표를 저장소에 두고, 커밋 해시에 날짜를 남기십시오.
오늘 팀이 오픈웨이트를 받기만 하고 지속 학습 안전장치를 비우면, 내일 도메인 적응이 망각으로 끝납니다. 그 순환을 끊는 일이 이 글을 읽는 이유입니다. 오픈웨이트를 이어 학습할 때 가소성과 안정성을 같이 지키십시오.
주권 스택의 모델·도구·가치·데이터 경계를 오늘부터 표로 적으십시오.
고위험 전문 업무와 해커톤 제출을 나눕니다
Thomson은 고위험 전문 업무에 초점을 둔 범용 모델입니다. 법률·세금·안전·다국어·Deep Research는 데모용 한 줄 챗과 요구가 다릅니다. 해커톤에서도 같은 구분이 필요합니다. 관객에게 보여 줄 데모와, 실제 거버넌스가 필요한 에이전트를 한 README에 섞지 마십시오. 섞이면 안전장치와 데이터 경계가 데모 문장에 묻힙니다.
팀이 오늘 할 일은 제출 페이지에 “전문 업무 모드”와 “일반 데모 모드”를 표로 나누는 것입니다. 전문 업무 모드에는 내부 데이터 경계, 도구 권한, 사람 확인 규칙을 적습니다. 일반 데모 모드에는 공개 가능한 프롬프트만 적습니다. 초록이 말한 소유는 이 표가 공개 주소에 있을 때 성립합니다.
이어 학습 로그에도 같은 구분을 남깁니다. 어떤 단계가 전문 업무 능력을 겨냥했는지, 어떤 단계가 일반 능력을 유지하려 했는지을 한 줄씩 적습니다. π 패턴을 우리 표에서 확인하려면, 겨냥한 능력과 겨냥하지 않은 능력을 같은 날짜에 같이 측정해야 합니다. 측정 없이 “망각이 없다”고 적지 않습니다.
다른 팀 체크포인트를 받을 때도 전문 업무 경계를 먼저 읽습니다. 경계가 비어 있으면 SovereignAI 스택의 가치·데이터 칸이 비어 있는 것과 같습니다. DAKER 제출 리뷰에서는 그 칸이 비어 있는 링크를 통과시키지 않는 편이 안전합니다.
이 글이 아닌 것입니다
특정 벤치 점수표가 아닙니다. 초록은 에이전트·안전·법률·세금·다국어·Deep Research에서 경쟁력 있다고 적되, 벤치 이름과 퍼센트를 적지 않습니다. 오늘 본문에 없는 점수를 지어내지 않습니다.
작은 파인튜닝만 하면 된다는 처방이 아닙니다. 초록은 소규모 파인튜닝·프롬프트·동결 모델 도구 증강과 구분해, mid·post-training 스택과 안전장치를 말합니다. “LoRA 한 번”으로 바꾸어 쓰지 않습니다.
모든 기관이 같은 예산으로 성공한다는 보장이 아닙니다. 예산이 다양해도 소유가 더 넓어질 수 있다는 주장입니다. 우리 대회 예산과 같다고 바꾸어 쓰지 않습니다.
특정 회사 제품 출시 공지가 아닙니다. 연구 논문과 공개 체크포인트 안내입니다. Thomson Reuters 제품 로드맵 발표문이 아닙니다.
망각이 절대 없다는 수학 증명도 아닙니다. 평가에서 망각 문제가 거의 사라지는 π 패턴을 보고합니다. “무망각 보장”으로 과장하지 않습니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.27147와 pdf를 같은 탭에 둡니다. 요약 카드만 보고 SovereignAI를 정의하지 않습니다. 저자 목록과 제출일 2026-08-27을 메모 첫 줄에 적습니다.
둘째, 공개 체크포인트를 북마크하십시오. thomsonreuters/Thomson-1.0-Small 카드와 라이선스·모델 카드 문장을 저장합니다. 다운로드만 하고 출처 URL을 비우지 않습니다.
셋째, 우리 팀의 SovereignAI 스택 표를 한 페이지로 쓰십시오. 모델, 도구 인프라, 가치 규칙, 데이터 프라이버시 경계를 네 칸으로 나눕니다. DAKER 월간 해커톤이나 DACON 코드 제출 과제 가운데 하나에 맞춰 적습니다.
넷째, mid·post-training에서 바꿀 구간과 안전장치를 정하십시오. 가소성과 안정성을 같이 점검할 항목을 표로 남깁니다. 모든 레이어를 한꺼번에 건드리지 않습니다.
다섯째, 학습 전후 능력 점검표를 만드십시오. 에이전트 작업, 안전, 법률·세금, 다국어, 긴 조사 성격 과제를 같은 프롬프트로 돌립니다. 없는 퍼센트를 채우지 말고 승패와 실패 유형만 적습니다.
여섯째, 동결 모델과 프롬프트만 쓰는 베이스라인과 이어 학습 후보를 나란히 비교하십시오. 초록이 구분한 제한 접근과 혼동하지 않습니다. 차이만 한 줄로 남깁니다.
일곱째, 스택 표와 점검 결과를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.