에이전트 하네스 훅 업데이트가 호스트 명령을 심습니다 | DAKER 커뮤니티
2026년 9월 3일 HookPry 관련 논문이 arXiv에 공개되었습니다. AI 에이전트 하네스의 lifecycle hooks가 세션 시작·도구 호출·파일 수정 같은 이벤트에 셸 명령을 붙이고, 그 명령은 호스트 권한으로 실행되며 LLM이 보지 못하는 시점에도 발화할 수 있다고 지적합니다. 공급망 위협 모델에서는 공격자가 플러그인 메타데이터와 lifecycle-hook 설정만 통제해도, 업데이트로 무해해 보이던 플러그인을 트로이화할 수 있습니다. HookPry는 이 경로를 체계적으로 치는 오픈소스 자동화 공격 프레임워크로, 10개 공격 목표를 구현합니다. 하네스×백엔드 25조합·종단 실행 1,000회에서 평가한 7개 하네스가 모두 침해되었고, 하네스별 성공률은 최대 92.5%입니다. Microsoft Defender recall은 0%이고, 정적 방어 3종의 합집합도 악성 아티팩트 47.5%를 놓칩니다. 오늘 팀은 훅 업데이트 신뢰 경계와 호스트 명령 허용 목록을 README에 적습니다.

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.03884에서 확인할 수 있습니다. 영문 제목은 A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors입니다. 저자는 Pengxun Li, Litian Zhang, Jianwei Hou, Shujiang Wu, Song Li, Zifeng Kang, Xi Zhang입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 제공된 사실과 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
훅 업데이트 경로가 신뢰 경계입니다
최신 AI 에이전트 하네스는 lifecycle hooks로 런타임 이벤트에 셸 명령을 바인딩합니다. 세션 시작, 도구 호출, 파일 수정 등이 대표 이벤트입니다. 이 명령은 호스트 권한으로 실행되고, 설정 파일 형태로 배포되며, LLM이 관찰하지 못하는 타이밍에 실행될 수 있습니다.
논문은 하네스가 맹목적으로 신뢰하는 lifecycle-hook 업데이트 경로를 새로운 공격면으로 지목합니다. 공급망 위협 모델에서 공격자가 플러그인 메타데이터와 lifecycle-hook 설정만 통제할 수 있다면, 버전 있는 무해 플러그인이 업데이트 한 번으로 공격자 명령을 이벤트에 심을 수 있습니다. 결과는 권한 상승 같은 호스트 측 악성 행동으로 이어질 수 있다고 적습니다.
DAKER 바이브코딩 해커톤과 DACON 빌더 환경에서도, “플러그인을 켰다”는 한 줄만으로는 부족합니다. 훅이 어떤 이벤트에 어떤 명령을 붙이는지 허용 목록으로 남깁니다.
HookPry 평가 숫자만 옮깁니다
HookPry는 이 취약점을 이질적인 AI 에이전트 하네스 전반에서 체계적으로 공격하는 오픈소스·완전 자동화 공격 프레임워크라고 소개됩니다. 공격 목표는 10개입니다. 하네스와 백엔드 25조합, 종단 실행 1,000회에서 평가한 7개 하네스가 모두 침해되었고, 하네스별 성공률은 최대 92.5%에 달합니다.
대표 방어는 충분하지 않다고 보고합니다. Microsoft Defender의 recall은 0%입니다. 정적 방어 3종의 합집합도 악성 아티팩트의 47.5%를 놓칩니다. 구체 하네스 이름 목록이나 코드 URL은 초록에 명시되지 않았으면 추측하지 않습니다. 오늘 본문도 초록에 있는 집계만 옮깁니다.
보안 점검을 자랑할수록 허용 훅 목록을 숨기기 쉽습니다. 배포가 제출입니다. 올린 링크가 제출입니다.
빌더 팀에 옮기는 점검
팀이 오늘 할 일은 에이전트 하네스의 훅 설정을 “편의 기능”이 아니라 “호스트 권한 실행면”으로 다루는 것입니다. 세션 시작·도구 호출·파일 수정에 붙은 명령을 표로 뽑습니다. 업데이트 채널(플러그인 레지스트리·자동 갱신)과 서명 검증 여부를 체크합니다.
플러그인 메타데이터만 바뀌어도 훅이 바뀌는지 재현 절차를 만듭니다. 사람 승인 없이 훅 업데이트가 반영되면 위험으로 표시합니다. DAKER 해커톤 README의 에이전트 항목에 하네스 이름·훅 파일 경로·허용 명령 목록을 분리해 적습니다.
Controller와 Worker를 나누면, 훅 수정 권한과 과제 실행 권한을 분리합니다. 한 에이전트가 자기 훅을 마음대로 고치지 못하게 합니다. 비밀키를 훅 스크립트에 넣지 않습니다.
도구 권한과 공유 워크스페이스를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. 훅 실행 로그를 다른 사람이 열 수 있는 주소에 올립니다.
정적 스캐너만 믿고 끝내지 마십시오. 논문은 정적 방어 합집합도 상당수 악성 아티팩트를 놓친다고 보고합니다. 런타임 허용 목록과 업데이트 서명을 같이 둡니다.
제출 문서에 적는 보안 체크리스트
HookPry가 보여주는 핵심은 “모델이 착한지”가 아니라 “하네스 훅 업데이트가 누구 명령을 실행하는지”입니다. 팀 체크리스트에 다음을 넣습니다. 훅 이벤트 목록, 명령 허용 목록, 플러그인 서명, 자동 업데이트 on/off, 호스트 권한 범위, 사람 승인 지점.
성공률 최대 92.5%와 7개 하네스 전부 침해 보고는 특정 제품 비방이 아니라, 평가 설정에서의 취약면 규모를 보여 주는 숫자입니다. 우리 스택 이름을 논문 숫자와 직접 치환하지 마십시오. Defender recall 0%와 정적 방어 미스 47.5%도 같은 방식으로, 방어를 한 겹만 두지 말라는 근거로만 인용합니다.
오픈소스 공격 프레임워크 이름을 README에 적을 때는 재현 목적과 윤리적 사용 범위를 한 줄로 명시합니다. 타인 시스템 무단 점검은 하지 않습니다. DAKER·DACON 제출물에는 우리 샌드박스에서 돌린 점검 로그만 올립니다.
배포 주소에 훅 설정 스냅샷과 허용 목록 diff를 첨부합니다. 배포가 제출입니다. 올린 링크가 제출입니다.
플러그인 업데이트를 호스트 권한 변경으로 봅니다
HookPry가 강조하는 문장을 팀 규칙으로 바꿉니다. lifecycle-hook 업데이트는 설정 파일이 아니라 호스트 권한 실행면을 바꿉니다. 플러그인 버전을 올릴 때마다 훅 diff를 코드 리뷰 대상으로 올립니다. 메타데이터만 바뀌고 명령이 바뀌는 경우를 테스트 케이스에 넣습니다.
평가 숫자(7개 하네스 전부 침해, 성공률 최대 92.5%, 1,000회, 25조합)는 위험 규모를 설명하는 근거로만 씁니다. 우리 제품 이름을 그 비율에 대입하지 마십시오. Defender recall 0%와 정적 방어 미스 47.5%는 “스캐너 한 겹” 전략을 폐기하는 근거로만 인용합니다.
허용 목록에는 절대 경로·해석기·네트워크 호출 여부를 적습니다. 세션 시작 훅에 다운로드 스크립트를 넣는 관행이 있으면 제거합니다. DAKER 해커톤 에이전트 제출에도 훅 스냅샷 파일을 첨부합니다.
보안 점검을 공개할 때는 샌드박스와 동의 범위를 면책 한 줄로 남깁니다. 타인 시스템 무단 검증은 하지 않습니다. 배포 링크에 허용 목록과 업데이트 정책만 올립니다. 배포가 제출입니다. 올린 링크가 제출입니다.
이 글이 아닌 것입니다
모든 에이전트 제품이 이미 침해되었다는 실시간 경보가 아닙니다. 논문이 평가한 7개 하네스·1,000회 실행 보고입니다.
HookPry 사용을 권장하는 공격 안내가 아닙니다. 빌더가 훅 신뢰 경계를 점검하라는 보안 연구 요약입니다.
Microsoft Defender가 모든 환경에서 무용하다는 일반화가 아닙니다. 보고된 recall 0% 실험 결과입니다.
특정 대회 우승 공지가 아닙니다. 하네스 공급망 위험 안내입니다.
초록에 없는 GitHub URL을 확정하는 글이 아닙니다. 구체 URL이 없으면 없다고만 적습니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.03884와 pdf를 엽니다. 제출일 2026-09-03을 적습니다.
둘째, 우리 하네스 훅 파일을 표로 뽑으십시오. 이벤트·명령·권한을 세 열로 둡니다.
셋째, 플러그인 업데이트 채널과 서명 검증을 확인하십시오. 자동 갱신이면 사람 승인 지점을 만듭니다.
넷째, 호스트 명령 허용 목록을 README에 공개하십시오. 없는 명령을 기본 허용하지 않습니다.
다섯째, 정적 스캐너만으로 끝내는지 점검하십시오. 런타임 가드를 같이 둡니다.
여섯째, 샌드박스 점검 로그만 공개 자료에 올리십시오. 무단 점검은 하지 않습니다.
일곱째, 훅 스냅샷과 허용 목록을 배포 링크에 붙이십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.03884 — A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors (2026-09-03) · PDF