0.6B 가드레일로 러시아어 주입 공격도 잡습니다 | DAKER 커뮤니티
2026년 9월 1일 HiveTraceLab이 HiveTraceGuard-Pro를 arXiv에 올렸습니다. Qwen3-0.6B를 LoRA로 맞춘 뒤 병합한 0.6B 생성형 가드레일이며 Apache-2.0입니다. 러시아어·영어를 다루고 safe/unsafe 이진 판정을 합니다. 19개 벤치 그룹 집계 키는 0.7432로, 상위 두 모델 0.7641·0.7552 뒤입니다. 공개 16그룹만 보면 0.7153이고 34개 중 4개가 앞섭니다. 15모델 비교에서 클린 러시아 combined-F1은 0.88, 러시아 프롬프트 주입 재현율은 0.999입니다. 주입셋은 팀 제작셋이며 학습 중복이 최소 27.1%입니다. 중앙 지연은 14.3ms로 15모델 중 최저입니다. 스위트 집계 FPR은 0.268, FNR은 0.156입니다. 가중치는 HF에 공개했고 코퍼스·평가코드는 비공개입니다. 오늘 팀은 재현율만 크게 적지 말고 중복·지연·FPR을 같은 표에 둡니다.
논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.01046에서 확인할 수 있습니다. 영문 제목은 HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation입니다. 저자는 Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin (HiveTraceLab)입니다. PDF는 같은 번호의 pdf입니다. 가중치·카드는 Hugging Face hivetrace/HiveTraceGuard-Pro에 공개되어 있습니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
0.6B로 요청·응답을 이진 판정합니다
HiveTraceGuard-Pro는 Qwen3-0.6B에 LoRA를 적용한 뒤 병합한 생성형 가드레일입니다. 출력은 safe/unsafe 한 토큰 판정입니다. 러시아어와 영어 입력을 다루며, 프롬프트 주입·탈옥·표면 난독화를 위협 모델에 넣습니다. 프로덕션에서 보조 모델을 따로 두는 자리를 겨냥합니다.
학습 코퍼스는 유해·무해 쌍을 같은 주제에 맞추고, 여덟 가지 난독화 변환을 양쪽 라벨에 적용했다고 적습니다. 가중치는 공개하지만 코퍼스와 평가코드는 내부에 둡니다. 따라서 “완전 재현 가능한 가드레일 학습”이라고 쓰지 마십시오. 배포 가능한 가중치와 비공개 데이터·하니스가 나뉩니다.
DACON·DAKER 제출물에 가드레일을 붙일 때는 모델 크기 0.6B, 라이선스 Apache-2.0, 판정 형식 이진을 README에 분리해 적습니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 러시아어 주입 재현율과 학습 중복·FPR을 한 표에 같이 적습니다.
집계 키·러시아 지표·지연
19개 벤치 그룹 집계 키는 0.7432입니다. 같은 하니스에서 더 높은 키는 0.7641과 0.7552입니다. 공개 16그룹만으로 다시 계산하면 0.7153이고, 나머지 34개 가드 중 4개가 더 높습니다. 내부 세 그룹을 빼면 순위가 달라진다는 점을 본문이 명시합니다.
15모델 헤드투헤드에서 클린 러시아 강건성 combined-F1은 0.88로 가장 높고, 러시아 프롬프트 주입 재현율은 0.999입니다. 두 지표 모두 팀이 만든 러시아 세트이며, 주입셋은 학습 코퍼스와 최소 27.1% 겹칩니다. 중앙 지연 14.3ms는 그 실행에서 15모델 중 최저입니다. 스위트 전체 집계 FPR 0.268, FNR 0.156입니다.
응답 쪽 숫자는 레거시 단독 응답 직렬화를 썼고, 배포용 어시스턴트 역할 경로와 같다고 말하지 않습니다. 영어 일반 모더레이션·강한 난독화·응답 정밀도에서는 약하다고 한계에 적혀 있습니다. 숫자 하나를 골라 홍보 문구로 쓰지 마십시오.
빌더 팀에 옮기는 점검
가드레일을 에이전트 앞에 둘 때는 HF 병합 가중치를 받고, 판정 토큰 규칙과 시스템 프롬프트 템플릿을 카드 README에서 확인합니다. 코퍼스가 없으므로 우리 도메인 로그로 재보정할 계획을 별도로 적습니다.
러시아어·영어 트래픽 비율을 먼저 재고, 재현율만 보지 말고 FPR 0.268 비용을 제품 정책에 연결합니다. 주입 벤치 중복 27.1%를 각주로 남깁니다. 지연 14.3ms는 해당 하니스·단일 요청 조건입니다. 동시 처리량으로 바꿔 쓰지 않습니다.
탈옥·난독화 테스트를 우리 레드팀에 넣을 때는 논문의 변환 목록을 참고하되, 비공개 평가 세트를 있다고 가정하지 않습니다. DAKER 데모에 가드레일을 붙이면 차단/허용 로그를 공개 가능한 형태로 남깁니다.
멀티 에이전트면 가드레일 입력에 도구 출력 전체를 넣을지, 마지막 사용자 턴만 넣을지 정책을 고정하십시오. 정책 문자열과 모델 해시를 나란히 적습니다.
집계 키 0.7432와 공개 16그룹 키 0.7153을 같은 문장에 두지 마십시오. 어떤 그룹 집합인지 밝힙니다. 상위 모델 크기(2B·8B)와 우리 0.6B를 비교할 때도 지연 14.3ms를 같이 적습니다.
가드레일을 제품에 넣을 때는 요청 가드와 응답 가드를 같은 가중치로 돌릴지부터 정합니다. HiveTraceGuard-Pro는 이진 판정만 내므로, 카테고리 라벨이 필요하면 별도 분류기를 둡니다. 집계 키 0.7432는 19개 그룹 기하평균에 가깝게 정의된 키이고, 공개 16그룹 키 0.7153과 다릅니다. 클린 러시아 combined-F1 0.88과 주입 재현율 0.999는 15모델 비교의 하이라이트이지만, 주입셋 학습 중복 ≥27.1%를 각주로 붙입니다. 중앙 지연 14.3ms는 해당 벤치 실행의 단일 요청 중앙값입니다. FPR 0.268과 FNR 0.156은 스위트 집계입니다. 도메인 트래픽에서 다시 재십시오. 가중치 HF 공개·코퍼스 비공개라는 점을 라이선스 옆에 적습니다. DAKER 데모라면 차단 예시와 허용 예시를 각각 남깁니다. DACON 안전 점검 문서에도 같은 표를 복사합니다.
운영 정책에서는 fail-open과 fail-closed를 가드레일 장애와 분리해 적습니다. 모델이 unsafe를 내리면 차단·거절·재작성 중 무엇을 할지는 애플리케이션이 정합니다. HiveTraceGuard-Pro는 그 입력을 제공하는 이진 신호입니다. 러시아어 트래픽이 적은 서비스라도, 영어 주입·난독화 열이 따로 있다는 점을 README에 남깁니다. 0.6B라는 크기만으로 안전하다고 쓰지 마십시오.
이 글이 아닌 것입니다
19개 그룹에서 1등이라는 주장이 아닙니다. 집계 키 0.7432는 상위 두 모델 뒤이고, 공개 16그룹에서는 4개가 앞섭니다.
러시아 주입 재현율 0.999가 학습과 무관한 일반화라는 보증이 아닙니다. 팀 제작셋이며 최소 27.1% 학습 중복이 있습니다.
모든 언어·모든 응답 경로에서 동일 성능이라는 설명이 아닙니다. 평가 강조는 러시아어 강건성이고, 응답 벤치는 레거시 직렬화입니다.
코퍼스까지 공개된 완전 재현 패키지가 아닙니다. 가중치만 Apache-2.0으로 공개되었습니다.
FPR 0.268이 모든 제품에 허용 가능하다는 권고가 아닙니다. 스위트 집계 값이며 도메인 재측정이 필요합니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.01046와 pdf를 같은 탭에 둡니다.
둘째, HF 가중치를 북마크하십시오. hivetrace/HiveTraceGuard-Pro와 Apache-2.0 문구를 저장합니다.
셋째, 안전 표에 키·FPR·FNR·지연을 같이 쓰십시오. 0.7432 / 0.268 / 0.156 / 14.3ms를 한 행에 둡니다.
넷째, 러시아 지표 옆에 중복 각주를 붙이십시오. combined-F1 0.88·재현율 0.999와 중복 ≥27.1%를 분리하지 않습니다.
다섯째, 우리 로그로 스모크 테스트를 돌리십시오. 코퍼스 비공개이므로 도메인 샘플로 오탐·미탐을 기록합니다.
여섯째, 응답 경로를 배포 템플릿과 맞는지 확인하십시오. 레거시 직렬화 숫자를 그대로 SLA에 쓰지 않습니다.
일곱째, 가드레일 버전과 차단 로그를 공개 링크로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.01046 — HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation (2026-09-01) · PDF · 코드/가중치