코드 셀프플레이로 197단어 최적화 하네스를 증류합니다 | DAKER 커뮤니티

2026년 9월 10일 Building the Harness Automatically 논문이 arXiv에 공개되었습니다. 영문 제목은 Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization이며 arXiv 번호는 2609.09468입니다. 초록은 에이전트가 실행 가능한 연습으로 수치 탐색 전략을 배운 뒤, 그 전략을 텍스트로 옮길 수 있는지 묻습니다. 저예산 블랙박스 최적화에서 도움 없는 언어모델은 강한 고전 최적화기보다 한참 아래에 남는다고 적습니다. 개발 단계에서 에이전트는 최적화 프로그램을 반복해 작성·평가하고, 그 결과 프로그램과 연습 기록을 한 번 증류해 197단어의 기본 Harness A로 만든 뒤 평가 전에 동결한다고 합니다. Harness A는 독립 N=30 연구에서 Gemini Flash 후회(regret)를 48% 줄였고(p<.001), 연습 패밀리에서 GP-BO 성능 구간에 들어가며, 세 개의 held-out BBOB 랜드스케이프에서 평균 후회를 낮춘다고 적습니다. 오늘 팀은 코드 셀프플레이와 동결된 텍스트 하네스를 같은 프롬프트에 섞지 말고, 단계를 README에 분리해 적습니다.
저자는 Wu, Yi, Ren, Zheng, Hu, Zhiyu, Wang, Haochen, Chang, Daryl, Wei, Li, Wang, Ting, Li, Zhen, Gupta, Pooja, Jindal, Nitin, Heldt, Lukasz입니다. 오늘 본문은 제공된 초록과 정리된 사실 범위만 옮깁니다. 초록에 없는 점수·연구소 순위·외부 저장소 주소는 쓰지 않습니다. 본문 공개 링크는 DAKER 커뮤니티와 DACON만 둡니다. 논문 영문 제목과 arXiv 2609.09468은 일반 텍스트로만 적습니다.
왜 텍스트 하네스 증류가 필요한가
초록은 저예산 블랙박스 최적화에서 도움 없는 언어모델이 강한 고전 최적화기보다 한참 아래에 남는다고 적습니다. 질문은 에이전트가 실행 가능한 연습으로 수치 탐색 전략을 배우고, 그 전략을 텍스트로 이전할 수 있는지입니다. 개발 중 에이전트는 최적화 프로그램을 반복 작성·평가한 뒤, 프로그램과 연습 기록을 한 번 증류해 197단어 기본 Harness A로 만들고 평가 전에 동결합니다.
해커톤에서 「최적화 코드를 짠다」와 「텍스트 하네스를 붙인다」를 한 문장으로 합치지 마십시오. DACON 알고리즘 대회와 DAKER 바이브코딩 해커톤 모두, 연습 단계와 동결 배포 단계를 문서에서 분리하는 습관이 필요합니다.
초록에 없는 벤치 전체 순위표나 추가 데이터셋을 붙이지 않습니다. 197단어, N=30, 48%, p<.001, BBOB 세 랜드스케이프라는 문장만 옮깁니다.
에이전트에게 블랙박스만 최적화하라만 시키면 실패 원인을 나누기 어렵습니다. 오늘은 코드 셀프플레이 단계와 동결 텍스트 하네스 단계를 체크리스트에서 분리합니다.
Harness A·B와 이전 결과가 덮는 범위
Harness A는 독립 N=30 연구에서 Gemini Flash 후회를 48% 줄였고(p<.001), 연습 패밀리에서 GP-BO 성능 구간에 들어가며, 세 held-out BBOB 랜드스케이프에서 평균 후회를 낮춘다고 적습니다. 같은 텍스트가 시험한 모든 Gemini 실행기를 개선하고, Claude Sonnet으로도 이전되어 후회를 43%·49% 줄였다고 적습니다(p≤.005). 독립 end-to-end 복제로 Harness B가 나오며, 다른 프로그램·텍스트이지만 같은 성능 티어라고 합니다. 같은 프레임워크가 봉인된 YouTube 보상 튜닝 프로덕션 벤치에서도 최저 후회를 달성한다고 적습니다.
팀이 오늘 가져갈 표 헤더는 단순합니다. 코드 셀프플레이, 동결 Harness A, 복제 Harness B, 크로스모델 이전을 서로 다른 행에 둡니다. 한 데모가 모든 행을 동시에 충족한다고 쓰지 마십시오.
제출 문서에는 어떤 단계(연습·증류·동결·이전)인지 한 줄씩 적습니다. 없는 저장소 주소를 만들지 않습니다. 공개 안내는 DAKER 커뮤니티와 DACON만 사용합니다.
48%와 43%·49%를 한 평균으로 합치지 마십시오. 초록이 Gemini Flash와 Claude Sonnet을 구분해 적기 때문입니다. YouTube 프로덕션 벤치 결과는 「최저 후회」라는 초록 표현만 옮기고, 구체 점수를 만들지 않습니다.
실험이 남기는 메시지
초록은 실행 가능한 연습이 탐색 정책을 발견하는 유효한 길이며, 언어가 그 정책을 배포하는 휴대 매체라고 정리합니다. 숫자 중 초록에 있는 것만 본문에 둡니다. 없는 벤치 이름이나 추가 p-value를 만들지 않습니다.
텍스트 하네스면 모든 최적화가 끝난다는 문장은 쓰지 마십시오. 초록이 말하는 것은 저예산 블랙박스 설정에서의 후회 감소와 이전입니다. DAKER 월간 해커톤 README에는 완료 선언 대신 동결 시점과 평가 분리를 나란히 둡니다.
DAKER 해커톤에서 최적화·에이전트 관련 과제를 고를 때도, 평가 스크립트가 셀프플레이인지 동결 하네스인지 먼저 적습니다. 랭킹 가이드 기준으로 활동을 쌓을 때도, 하네스 이름과 평가 구간을 같은 설명에 섞지 않습니다.
학습 자료가 필요하면 학습 트랙에서 최적화·에이전트 항목을 복습하고, 팀 내부 용어표를 Harness A·B 문구에 맞춥니다. 용어가 바뀌면 실험 비교가 무너집니다.
빌더 팀에 옮기는 점검
에이전트 프롬프트에 최적화하라만 넣지 말고, 셀프플레이 허용 횟수·동결 시점·평가 분리를 파일로 고정합니다. 연습 단계와 배포 하네스의 성공 기준을 서로 다른 체크리스트로 둡니다. 실행 로그에는 어떤 단계인지 태그를 붙입니다.
DACON 코드 제출 과제라면 재현 명령과 환경 고정 파일을 분리합니다. DAKER 바이브코딩 해커톤이라면 배포 주소와 함께 하네스 단어 수·동결 여부를 상단에 둡니다. 배포가 제출입니다. 올린 링크가 제출입니다.
초록에 없는 추가 후회 수치나 벤치 순위를 만들지 않습니다. 비교표를 만들 때는 N=30, 48%, 43%, 49%, p<.001, p≤.005 문구만 열로 복제합니다.
팀 회고에서는 Harness A와 Harness B가 다른 프로그램·텍스트라는 점을 숨기지 않습니다. 같은 성능 티어라는 초록 표현을 동일 문서 복제로 바꾸지 않습니다.
이 글이 아닌 것입니다
언어모델이 고전 최적화기를 이겼다는 전면 선언이 아닙니다. 초록은 도움 없는 LM이 아래에 남는다고 전제하고, 하네스로 후회를 줄인다고 적습니다.
197단어면 모든 블랙박스 문제가 풀린다는 보증이 아닙니다. 기본 Harness A의 보고 범위입니다.
YouTube 벤치 점수를 공개한다는 약속이 아닙니다. 최저 후회라는 초록 문장만 옮깁니다.
DACON·DAKER 공식 최적화 공지가 아닙니다. arXiv 2609.09468 초록 안내입니다.
Harness A와 B가 동일 텍스트라는 주장이 아닙니다. 다른 프로그램·텍스트·같은 티어라고 적습니다.
셀프플레이와 동결을 문서로 고정하는 법
초록이 강조하는 핵심은 연습으로 정책을 찾고 텍스트로 배포하는 분리입니다. 코드를 계속 고쳐도 동결하지 않으면 평가가 흔들립니다. 텍스트만 붙여도 연습 기록이 없으면 재현이 어렵습니다.
팀 실무에서는 과제 카드를 세 장으로 나눕니다. 첫 장은 코드 셀프플레이입니다. 둘째 장은 197단어 증류·동결입니다. 셋째 장은 크로스모델 이전 평가입니다. 세 장을 한 성공 문장으로 합치지 마십시오.
공개 안내는 DAKER 커뮤니티와 DACON처럼 허용된 주소만 링크합니다. 봉인된 프로덕션 벤치를 우리가 열었다는 식으로 쓰지 않습니다.
에이전트 로그를 남길 때는 단계 태그를 필수 필드로 둡니다. practice, distill, frozen-eval, transfer 중 하나를 고릅니다.
오늘 할 일
첫째, 영문 제목과 arXiv 2609.09468을 메모 첫 줄에 적으십시오. 요약 카드만 보고 Harness A를 정의하지 않습니다.
둘째, 팀 평가표를 세 행으로 나누십시오. 셀프플레이, 동결 증류, 이전 평가입니다.
셋째, 프롬프트에 동결 시점과 평가 분리를 명시하십시오. 연습 중 텍스트를 계속 고치지 않습니다.
넷째, 실패 로그에 단계 태그를 붙이십시오. 48%와 43%·49%를 한 숫자로 합치지 않습니다.
다섯째, 공개 산출물을 DAKER·DACON 링크로만 올리십시오. 커뮤니티에 점검표를 공유하고, 알고리즘 연습은 DACON에서 이어 갑니다.
여섯째, 자동 최적화 완료라는 말을 README에 쓰기 전에 근거 문장을 두십시오. 초록은 후회 감소와 이전을 보고합니다.
일곱째, Harness B 복제 문장을 홍보와 분리하십시오. 다른 프로그램·같은 티어입니다.
여덟째, 연습·증류·이전 카드 세 장을 저장소에 커밋하십시오. 카드가 없으면 평가 범위를 다시 논쟁하게 됩니다.