압축된 컨텍스트로 에이전트를 학습하면 어긋납니다 | DAKER 커뮤니티
2026년 9월 1일 Token Foundry·Alibaba Group이 MemoryWalker를 arXiv에 공개했습니다. Claude Code·Qwen-Agent 같은 프로덕션 하네스의 컨텍스트 압축이 학습 조건을 트리로 만든다고 지적합니다. Naive-Compressed는 time-travel leakage를, Naive-Full은 train-inference mismatch를 만듭니다. LogitTree와 4D attention mask로 조건을 맞추고, SDCC는 단일 backward로 forward KL을 맞춥니다. Pinsker로 TV 갭은 O(sqrt(ε_KL))입니다. Qwen3-4B와 TC-RAG·AgentFold·MemexRL, Claude Code·OpenCode에서 검증했습니다. 무압축 logdiff 바닥은 0.014이고, AgentFold에서 Naive-Compressed는 0.366(약 26배)입니다. WideSearch(Claude Code, Qwen3.7-Air)에서 LogitTree 15스텝 후 Pass@4는 7.0에서 10.0으로 올랐습니다. 오늘 팀은 압축 스트림으로만 학습했는지, 롤아웃 시점 컨텍스트와 학습 접두가 같은지 README에 적습니다.
논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.00865에서 확인할 수 있습니다. 영문 제목은 MemoryWalker: Stop Training Agents on Contexts They Never Saw입니다. 저자는 Zinco J, Xunjie Zhu, Shen Huang, Zhenyi Wang, Pengjun Xie, Jieping Ye (Token Foundry, Alibaba Group)입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
압축이 학습 조건을 트리로 만듭니다
긴 에이전트 궤적은 컨텍스트를 압축해 유지합니다. Claude Code와 Qwen-Agent는 제거된 접두를 요약으로 바꿉니다. TC-RAG·AgentFold·MemexRL은 모델이 언제·무엇을 압축할지 고르기도 합니다. 추론에는 도움이 되지만, 학습에서 토큰 로그확률을 다시 계산할 때 원래 생성 시점의 컨텍스트가 사라집니다.
매 축출마다 히스토리가 갈라져 조건 트리가 됩니다. Naive-Compressed는 최종 압축 경로만 따라가 과거 토큰을 나중에 만든 요약 아래서 다시 평가합니다. 이를 time-travel leakage라고 부릅니다. Naive-Full은 전체 DFS 궤적을 다시 넣어, 배포 때 없는 내용을 학습에 노출합니다. 이를 train-inference mismatch라고 부릅니다.
DACON·DAKER에서 에이전트를 학습하거나 파인튜닝할 때, “압축 로그를 그대로 SFT했다”만 적지 마십시오. 오늘 팀이 가져갈 한 줄은 이것입니다. 각 토큰의 학습 접두가 롤아웃 시점 live view와 같은지 표로 적습니다.
LogitTree·4D mask·SDCC
LogitTree는 로짓 트리를 구간별 K-forward로 걷습니다. 4D attention mask는 같은 분기 구조를 한 번의 forward에 넣습니다. 둘은 gradient equivalent라고 적혀 있습니다. LogitTree는 K+1 backward가 필요하고, 4D는 커스텀 마스크 커널과 축출 기록이 필요합니다.
SDCC(Self-Distillation for Conditioning Consistency)는 단일 backward로 forward KL을 맞춥니다. 각 축출 지점에서 압축 학생과 stop-gradient 교사(축출 전 접두)의 KL을 줄입니다. Pinsker 부등식으로 잔여 KL ε_KL이 있으면 TV 갭은 O(sqrt(ε_KL))입니다. 블랙박스 하네스에도 수정 없이 적용할 수 있다고 적습니다.
실험은 Qwen3-4B를 중심으로 TC-RAG·AgentFold·MemexRL과 Claude Code·OpenCode에서 이뤄졌습니다. 무압축 logdiff 바닥은 0.014입니다. AgentFold에서 Naive-Compressed logdiff는 0.366으로 약 26배입니다. LogitTree·SDCC는 EM·보상에서 Naive보다 높다고 표에 있습니다.
WideSearch 숫자만 옮깁니다
WideSearch를 Claude Code 하네스와 Qwen3.7-Air로 돌린 결과, LogitTree를 15스텝 학습한 뒤 Pass@4는 7.0에서 10.0으로 올랐습니다. Pass@1도 함께 올랐다고 본문에 있으나, 오늘 본문은 key_facts에 적힌 Pass@4 구간만 강조합니다. 없는 순위를 붙이지 않습니다.
해커톤 문서에는 “우리 에이전트가 WideSearch 10.0”이라고 쓰지 마십시오. 같은 하네스·같은 스텝·같은 지표 이름만 복제합니다. 배포가 제출입니다. 올린 링크가 제출입니다.
빌더 팀에 옮기는 점검
압축 훅이 있는 하네스로 RL·SFT를 돌리면, 축출 시점과 살아 있는 컨텍스트 스냅샷을 로그에 남깁니다. Naive-Compressed만 쓰는지, LogitTree·SDCC를 쓰는지 한 줄로 밝힙니다.
logdiff 0.014와 0.366을 우리 실측처럼 쓰지 말고, 출처와 모델(Qwen3-4B)·에디터(AgentFold)를 병기합니다. Claude Code·OpenCode처럼 블랙박스면 SDCC 적용 여부를 별도 칸에 둡니다.
Controller·Worker를 나누는 팀이면, Worker 롤아웃 로그의 압축 전후 접두를 재구성할 수 있는지부터 확인하십시오. 재구성이 안 되면 SDCC 교사 다리를 만들 수 없습니다.
DAKER 월간 해커톤에서 장시간 에이전트를 제출할 때는 컨텍스트 편집 정책을 README에 적습니다. 요약 교체인지, 스택 pop인지, 외부 스토어 offload인지 용어를 통일합니다.
학습 로그에 축출 지점 J와 제거 구간 E를 남기지 않으면 LogitTree와 4D mask를 재현하기 어렵습니다. 블랙박스 하네스에서는 HTTPS로 관측한 렌더 접두로 분기 뷰를 복원하는 방식을 논문이 씁니다. SDCC는 압축 학생 한 번의 backward만 쓰고, 교사 다리는 stop-gradient입니다. 잔여 KL이 남으면 Pinsker로 TV 갭이 O(sqrt(ε_KL))로 묶입니다. Qwen3-4B 실험에서 무압축 logdiff 바닥 0.014는 수치 노이즈에 가깝고, AgentFold Naive-Compressed 0.366은 약 26배입니다. WideSearch에서 LogitTree 15스텝 뒤 Pass@4 7.0→10.0은 Claude Code·Qwen3.7-Air 조건입니다. 우리 해커톤 리더보드 숫자로 바꿔 쓰지 마십시오. EM·보상이 Naive보다 높다는 문장도 표 숫자를 직접 확인한 뒤에만 인용합니다. DAKER 장시간 에이전트 제출에는 압축 정책 이름과 학습 재계산 방식을 한 줄로 적습니다.
이 글이 아닌 것입니다
압축을 끄면 항상 더 좋다는 주장이 아닙니다. 문제는 압축 자체보다 학습·추론 조건 불일치입니다.
LogitTree가 모든 블랙박스 API에서 공짜라는 설명이 아닙니다. 정확한 방법은 비용·커널·화이트박스 요구가 있고, SDCC가 완화입니다.
Pass@4 7.0→10.0이 모든 벤치의 보장 상승이라는 확장이 아닙니다. WideSearch·Claude Code·Qwen3.7-Air·15스텝 조건입니다.
특정 대회 우승 공지가 아닙니다. 조건 일치 학습 방법과 공개 실험 안내입니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.00865와 pdf를 같은 탭에 둡니다.
둘째, 우리 하네스의 압축 훅을 목록으로 쓰십시오. Claude Code·Qwen-Agent·자체 요약 중 무엇을 쓰는지 적습니다.
셋째, 학습 파이프라인이 Naive-Compressed인지 점검하십시오. time-travel leakage 가능성을 README에 남깁니다.
넷째, logdiff 바닥 0.014와 AgentFold 0.366을 인용 형식으로만 복제하십시오. 우리 실측과 섞지 않습니다.
다섯째, SDCC 또는 LogitTree 도입 여부를 결정하십시오. 블랙박스면 SDCC부터 검토합니다.
여섯째, WideSearch Pass@4 숫자를 조건과 함께 적으십시오. 7.0→10.0 옆에 하네스·모델·스텝을 둡니다.
일곱째, 압축 정책과 학습 로그를 공개 링크로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.00865 — MemoryWalker: Stop Training Agents on Contexts They Never Saw (2026-09-01) · PDF