여러 코딩 하네스 보상을 한데 묶어도 이식성은 거의 안 오릅니다 | DAKER 커뮤니티

2026년 9월 3일 Multi-Harness RL 논문이 arXiv에 공개되었습니다. 에이전트 강화학습이 전체 실행 하네스를 타고 돌 때, “여러 하네스에 정책을 노출하는 것”과 “보상을 한 relative-advantage 그룹에서 비교하는 것”을 섞어 부르는 멀티 하네스 레시피를 분리합니다. 저장소 수준 코딩에서 두 번째 선택(그룹핑 규칙)만 떼어 실험합니다. Qwen3-8B 지도 학습 워밍 스타트 하나에서 Aider·OpenHands·Qwen Code·SWE-agent의 같은 frozen task-harness 기록을 동일 업데이트 수로 재플레이합니다. GRPO 규칙 두 가지를 둡니다. Within은 task-harness 쌍마다 한 그룹이고, Cross는 한 과제 안에서 하네스 보상을 풀링합니다. 봉인된 SWE-bench Verified 오라클로 네 소스 하네스와 학습에 쓰지 않은 minimal harness를 평가합니다. 평가 하네스가 지배 변수라고 보고합니다. 봉인 평가 24,000회에서 평균 solve rate가 2.14%에서 9.27%로 움직여 4.3배 차이가 나고, 학습 레시피는 1.16만 움직입니다. held-out 하네스에서 Cross에서 Within을 뺀 값은 +0.25pp이고 95% 신뢰구간은 [-0.48, +1.02]입니다. 초록에 코드 URL은 없습니다. 오늘 팀은 “평가 하네스”와 “그룹핑 규칙”을 표의 서로 다른 열에 둡니다.

여러 코딩 하네스 보상을 한데 묶어도 이식성은 거의 안 오릅니다

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.04518에서 확인할 수 있습니다. 영문 제목은 What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents입니다. 저자는 Chenqian Le, Jiayi Cheng, Qijia He, Runhao Li, Yinghao Li, Xupeng Chen입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

멀티 하네스 레시피를 두 선택으로 나눕니다

저자들은 에이전트 RL이 전체 실행 하네스를 통해 돈다고 적습니다. 멀티 하네스 레시피에는 선택이 두 개 섞여 있습니다. 하나는 정책을 여러 하네스에 노출하는 것이고, 다른 하나는 보상을 한 relative-advantage 그룹 안에서 비교하는 것입니다. 이 논문은 저장소 수준 코딩에서 두 번째 선택만 분리합니다.

실험은 Qwen3-8B의 지도 학습 워밍 스타트 하나에서 시작합니다. Aider, OpenHands, Qwen Code, SWE-agent에서 나온 같은 frozen task-harness 기록을 동일 업데이트 수로 재플레이합니다. 그룹 상대 정책 최적화(GRPO) 규칙은 Within과 Cross 두 가지입니다. Within은 task-harness 쌍마다 한 그룹을 두고, Cross는 한 과제 안에서 하네스 보상을 풀링합니다.

DACON 알고리즘 대회와 DAKER 바이브코딩 해커톤에서 코딩 에이전트를 학습할 때도, “멀티 하네스”라는 한 줄로 묶지 말고 노출 범위와 그룹핑 경계를 표로 나눕니다.

평가 하네스가 점수를 좌우합니다

평가는 봉인된 SWE-bench Verified 오라클로 합니다. 네 소스 하네스와 학습에 넣지 않은 minimal harness를 함께 점수합니다. 초록은 평가 하네스가 지배 변수라고 적습니다. 봉인 평가 24,000회에서 평균 solve rate가 2.14%에서 9.27%로 움직여 4.3배 차이가 납니다. 학습 레시피가 움직이는 폭은 1.16입니다.

held-out 하네스에서 Cross에서 Within을 뺀 값은 과제당 시도 8회 기준 +0.25pp이고, 95% 신뢰구간은 [-0.48, +1.02]입니다. 학습 시드 3개를 풀링하면 +0.16이고 구간은 [-0.41, +0.72]이며, 개별 시드 추정치의 부호가 바뀐다고 적습니다. 각 규칙의 시드 범위는 0.42pp에서 0.45pp로, 규칙 간 차이보다 큽니다.

해커톤 README에 숫자를 옮길 때는 “평가 하네스 효과 4.3배”, “그룹핑 차이 +0.25pp와 신뢰구간”, “시드 범위가 규칙 간 차이보다 큼”만 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.

Cross는 설정 적응을 남기고 이식성은 Within과 같습니다

두 규칙 모두 가장 큰 이득을 같은 소스 하네스에 둡니다. 풀링된 advantage가 하네스를 실어 나릅니다. out-of-fold 분류기는 Cross의 advantage에서 생성 하네스를 shuffled-label 기준선보다 +4.48pp 높게 회복하고, Within의 advantage에서는 회복하지 못한다고 적습니다. 그래도 두 규칙은 held-out 점수와 하네스 안 행동 분포에서 같은 수준에 도달합니다.

학습 데이터의 절반을 on-policy로 다시 모아도 이 결론은 바뀌지 않는다고 적습니다. Cross-harness credit는 설정 적응을 주고, Within-harness credit보다 이식 가능한 능력을 더 주지는 않는다고 정리합니다. 멀티 하네스 RL 보고는 그룹핑 경계를 명시하고, 학습에 안 쓴 하네스에서도 시험해야 한다고 권합니다.

팀이 오늘 할 일은 벤치 표를 “학습 하네스 / 평가 하네스 / 그룹핑 규칙 / held-out 점수”로 나누는 것입니다. Cross를 켰다고 이식성이 올랐다고 쓰지 마십시오. 분류기로 하네스가 복구되는지와 held-out 점수를 같이 적습니다.

빌더 팀에 옮기는 점검

코딩 에이전트 학습 로그에 Aider·OpenHands·Qwen Code·SWE-agent 중 어떤 기록이 들어갔는지 파일 해시를 남깁니다. GRPO 그룹 경계를 Within인지 Cross인지 설정 파일에 고정합니다. SWE-bench Verified 오라클을 봉인해 두었는지, 평가 하네스 이름을 결과 CSV 첫 열에 두는지 확인합니다.

시드를 세 번 이상 돌리고, 규칙 간 차이보다 시드 범위가 큰지 먼저 봅니다. held-out minimal harness 점수를 학습 하네스 점수와 나란히 둡니다. Cross advantage로 하네스 분류가 되는지 내부 스모크 테스트를 만듭니다.

Controller와 Worker를 나누는 팀이면, 그룹핑 규칙과 평가 하네스 이름을 한 프롬프트에 섞지 마십시오. 공유 GPU를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. API 키를 프롬프트나 공개 저장소에 넣지 않습니다.

DAKER 월간 해커톤 데모라면 배포 주소와 함께 “평가 하네스 이름”과 “그룹핑 규칙”을 README 상단에 둡니다. 초록에 없는 GitHub 주소를 만들지 마십시오.

이 글이 아닌 것입니다

Cross가 Within보다 항상 낫다는 보증이 아닙니다. held-out 차이의 신뢰구간은 0을 포함합니다.

모든 코딩 에이전트·모든 벤치에서 평가 하네스가 4.3배 차이를 낸다는 뜻이 아닙니다. 보고된 봉인 평가 범위만 옮깁니다.

코드 저장소를 이 글이 확정한다는 뜻이 아닙니다. 초록에 URL이 없습니다.

DACON·DAKER 공식 우승 공지가 아닙니다. 빌더가 옮길 수 있는 방법과 숫자 안내입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.04518pdf를 같은 탭에 둡니다. 제출일 2026-09-03을 메모 첫 줄에 적습니다.

둘째, 학습 로그에 하네스 이름을 열로 추가하십시오. Aider·OpenHands·Qwen Code·SWE-agent와 held-out minimal을 구분합니다.

셋째, GRPO 그룹핑을 Within/Cross로 표기하십시오. 설정 파일에 경계를 고정합니다.

넷째, 평가 하네스 효과를 학습 레시피 효과와 나란히 적으십시오. 2.14%→9.27%와 1.16을 섞지 않습니다.

다섯째, held-out 차이와 신뢰구간을 같이 인용하십시오. +0.25pp와 [-0.48, +1.02]를 한 셀에 둡니다.

여섯째, Cross advantage로 하네스 복구 여부를 점검하십시오. Within과 비교표를 만듭니다.

일곱째, 데모와 설정 파일을 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.04518 — What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents (2026-09-03) · PDF