가드레일을 뺀 오픈웨이트가 양자화와 미러로 계속 남습니다 | DAKER 커뮤니티

2026년 9월 4일 Uncensored Open-weight Models 논문이 arXiv에 공개되었습니다. 오픈웨이트 모델에서 내장 안전 가드레일을 제거하는 행위자 생태계가 빠르게 커지고 있다고 적습니다. 저자들은 주요 생산자, 하위 재배포, 떠오르는 응용을 프로파일합니다. 2024년 1월부터 2026년 3월까지 HuggingFace에서 original uncensored 모델 3,471개를 식별했고, 각각 평균 2.4회 리패키징되었다고 합니다. 압축 재배포 8,164건 중 세 행위자가 52%를 차지합니다. 양자화한 뒤 별도 계정·포맷·Ollama 같은 레지스트리로 미러되면, 업스트림에서 지워도 남고 아래로 배포하기 쉬워진다고 적습니다. uncensored LLM을 붙인 GitHub 애플리케이션 1,643개 중 25%를 명시적 악성으로 분류했다고 보고합니다. 초록에 코드 URL은 없습니다. 오늘 팀은 “원본 제거”와 “양자화·미러 잔존”을 같은 표의 서로 다른 열에 둡니다.

가드레일을 뺀 오픈웨이트가 양자화와 미러로 계속 남습니다

논문은 2026-09-04 arXiv에 올라왔습니다. 초록은 arXiv:2609.05241에서 확인할 수 있습니다. 영문 제목은 Uncensored Open-weight Models: Redistribution as the Persistence Layer입니다. 저자는 10a Labs의 Juliette Garcia, Hailey May, Bobby McKenzie, David Pham, Matthew Swain, Joshua Valdez, Corie Wieland, Zachary Yahn입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 초록에서 확인한 범위만 옮깁니다.

가드레일 제거 생태계를 숫자로 그립니다

오픈웨이트 모델에는 안전 가드레일이 들어 있는 경우가 많습니다. 이 가드레일을 제거한 뒤 다시 올리는 행위자들이 늘어난다고 적습니다. 논문은 생산자, 하위 재생산, 응용을 나눠 프로파일합니다. 관측 구간은 2024년 1월부터 2026년 3월까지입니다.

HuggingFace에서 original uncensored 모델 3,471개를 찾았고, 각각 평균 2.4번 리패키징되었다고 합니다. 압축 재배포는 모두 8,164건이며, 그 중 52%가 세 행위자에게 집중됩니다. 세부 계정 이름은 초록에 없으므로 쓰지 않습니다.

DACON·DAKER에서 오픈웨이트를 쓸 때도, “원본 체크포인트”와 “양자화·미러본”을 같은 이름으로 취급하지 말고 출처 열을 나눕니다.

재배포가 지속성 계층이 됩니다

모델을 양자화한 뒤 다른 계정, 다른 포맷, Ollama 같은 레지스트리로 미러하면, 업스트림에서 삭제해도 파일이 남는다고 적습니다. 이렇게 되면 아래로 배포하기도 쉬워집니다. 저자들은 이 재배포 층을 persistence layer로 부릅니다.

응용 쪽에서는 uncensored LLM을 통합한 GitHub 애플리케이션 1,643개를 식별했고, 그중 25%를 명시적 악성으로 분류했다고 보고합니다. 분류 기준의 세부 라벨 정의는 초록에 없으므로 추측해 채우지 마십시오.

해커톤 README·보안 점검표에는 “3,471 originals / 평균 2.4 리패키징 / 8,164 압축본 중 3행위자 52% / GitHub 앱 1,643 중 25% 명시적 악성”만 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 사용 중인 오픈웨이트의 출처가 원본인지 양자화 미러인지 표로 적는 것입니다. HuggingFace 경로, Ollama 태그, 커밋 해시를 같은 행에 둡니다. 가드레일 제거본을 쓰는지 여부를 보안 리뷰 체크리스트에 넣습니다.

모델 카드를 공개할 때는 업스트림 삭제 후에도 미러가 남는지 운영 정책을 한 줄로 적습니다. GitHub에 에이전트 앱을 올릴 때는 uncensored LLM 의존성 여부를 명시하고, 악성 분류 통계를 우리 앱 면책처럼 쓰지 마십시오.

Controller와 Worker를 나누면, 모델 출처 화이트리스트와 런타임 설정을 한 프롬프트에 섞지 않습니다. API 키와 토큰을 공개 저장소에 넣지 않습니다. 초록에 없는 다운로드 URL을 만들지 마십시오.

안전 논의를 할 때는 숫자만 크게 키우지 말고, 관측 구간(2024-01~2026-03)과 플랫폼(HuggingFace·Ollama·GitHub)을 같이 적습니다.

지속성 계층을 제출 문서로 옮기는 방법

이 논문이 강조하는 점은 가드레일 제거 자체만이 아니라, 양자화와 미러가 삭제를 무력화하는 층이 된다는 점입니다. 팀 문서에도 같은 구조를 둡니다. 원본 식별, 리패키징, 압축 재배포 집중도, 레지스트리 미러, 응용 악성 비율을 절로 나눕니다.

3,471과 2.4회, 8,164의 52%, 1,643의 25%를 인용할 때는 기간과 플랫폼을 붙입니다. “업스트림 삭제와 무관하게 남는다”는 문장은 양자화·미러 문맥과 함께 둡니다. 우리 서비스 차단 성공률을 이 숫자로 대체하지 마십시오.

데모나 보안 브리프에는 persistence layer 개념을 크게 두고, 바로 옆에 관측 구간을 둡니다. 없는 행위자 명단을 만들지 마십시오.

회고에는 “모델 출처 추적”과 “미러 잔존 대응”을 서로 다른 항목에 적습니다. 한 항목에 섞으면 대응이 어렵습니다.

모델 카드와 미러 정책을 같이 고칩니다

3,471개 originals와 평균 2.4회 리패키징, 8,164건 압축 재배포의 52% 집중은 HuggingFace 관측입니다. Ollama 등 다른 레지스트리로 넘어가면 추적 열이 하나 더 필요합니다. 팀 모델 카드에는 HF 경로와 레지스트리 태그를 모두 적습니다.

업스트림 삭제 요청이 들어와도 미러본이 남는지 점검하는 주기를 정합니다. GitHub 앱 1,643개 중 25% 명시적 악성 분류는 우리 앱을 자동으로 악성으로 단정하는 근거가 아닙니다. 다만 의존성 목록에 uncensored LLM이 있으면 보안 리뷰를 통과시키기 전에 표시합니다.

제출 전에 사내 화이트리스트와 공개 데모 모델 목록을 같은 표로 맞춥니다. 관측 구간 2024-01~2026-03을 인용 각주에 남깁니다. 없는 행위자 순위표를 만들지 마십시오.

이 글이 아닌 것입니다

모든 uncensored 모델이 악성이라는 뜻이 아닙니다. GitHub 앱 1,643개 중 25%를 명시적 악성으로 분류했다는 보고입니다.

특정 계정 차단만으로 생태계가 사라진다는 보증이 아닙니다. 재배포 지속성을 강조합니다.

코드·데이터셋 URL을 이 글이 확정한다는 뜻이 아닙니다. 초록에 URL이 없습니다.

DACON·DAKER 공식 보안 공지가 아닙니다. 빌더 점검 안내입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.05241pdf를 같은 탭에 둡니다.

둘째, 사용 모델 출처 표를 만드십시오. 원본·양자화·Ollama 미러를 구분합니다.

셋째, 가드레일 제거본 사용 여부를 보안 체크리스트에 넣으십시오. 리뷰 칸을 비우지 않습니다.

넷째, 3,471·2.4·8,164·52% 인용에 기간을 붙이십시오. 2024-01~2026-03입니다.

다섯째, GitHub 앱 의존성에 uncensored LLM이 있는지 표시하십시오. 1,643·25%를 우리 면책처럼 쓰지 않습니다.

여섯째, 업스트림 삭제 후에도 미러가 남는지 운영 정책을 적으십시오. persistence layer를 한 줄로 남깁니다.

일곱째, 점검표와 출처 표를 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.05241 — Uncensored Open-weight Models: Redistribution as the Persistence Layer (2026-09-04) · PDF