성공한 코딩 궤적 10%만 골라도 점수가 오릅니다 | DAKER 커뮤니티
2026년 8월 27일 Dewu Zheng 연구팀이 성공한 코딩 에이전트 궤적 가운데 일부만 골라 지도 미세조정하는 SWE-Prime을 arXiv에 공개했습니다. 이전 연구는 성공한 궤적 전체를 학습 데이터로 썼습니다. 성공과 품질은 같지 않습니다. 효과가 없거나 중복이거나 위험한 단계가 성공 궤적 안에도 남아 있습니다. SWE-Prime은 궤적과 구간을 두 단계로 걸러, 고른 10%로 전체 해결 집합보다 높은 점수를 냈습니다.

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27449에서 확인할 수 있습니다. 저자는 Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng입니다. 분량은 9쪽, 그림은 5장입니다. 오늘 본문은 초록이 적은 숫자만 씁니다. 절대 해결률은 초록에 없으므로 쓰지 않습니다.

성공한 궤적 전부가 좋은 학습 데이터가 아닙니다
실제 소프트웨어 이슈를 푸는 능력을 키우려고, 이전 연구는 대규모 에이전트 궤적 집합을 만들고 성공한 궤적에 지도 미세조정을 적용했습니다. 과제를 끝낸 궤적은 겉보기에는 정답 경로입니다. 그러나 성공은 품질을 보증하지 않습니다. 효과가 없는 단계, 같은 검사를 반복하는 단계, 위험한 단계가 성공 궤적 안에 섞여 있습니다. 그런 궤적을 그대로 학습에 넣으면 시끄러운 감독이 들어가고, 모델은 바람직하지 않은 문제 해결 행동을 따라 배웁니다.
해커톤과 사내 코딩 에이전트 로그에서도 같은 일이 보입니다. 테스트가 통과한 세션을 전부 학습 데이터로 모으면, 파일을 필요 없이 넓게 읽거나 같은 명령을 여러 번 반복한 습관이 같이 들어갑니다. 제출은 성공인데 과정은 나쁩니다. 다음 모델은 그 나쁜 과정을 정답처럼 배웁니다. SWE-Prime이 겨냥한 지점이 여기입니다. 성공 여부만 보는 필터는 부족합니다. 과정 품질과 결과 품질과 대표성을 같이 봐야 합니다.
초록이 제안하는 해법은 데이터를 더 모으는 쪽이 아닙니다. 이미 있는 성공 집합에서 일부를 고르는 쪽입니다. 고른 10%가 전체 해결 집합보다 점수가 높았습니다. 데이터가 부족해서가 아니라, 잘못된 성공을 너무 많이 넣어서 점수가 눌렸다는 뜻입니다. 오늘 팀이 받을 운영 규칙은 한 줄입니다. 성공 로그를 전부 학습에 넣지 마십시오. 과정과 결과와 대표성을 먼저 가리십시오.
궤적을 고르고, 그다음 구간을 고릅니다
SWE-Prime은 두 단계 지도 미세조정 데이터 선택입니다. 첫째 단계는 궤적 필터입니다. 과정 품질, 결과 품질, 대표성을 보고 성공 궤적 가운데 품질이 높고 대표성이 있는 부분집합을 남깁니다. 과정 품질은 단계가 쓸모 있는지, 중복인지, 위험한지를 봅니다. 결과 품질은 최종 패치가 이슈를 실제로 해결하는지에 가깝습니다. 대표성은 같은 유형의 성공만 남는 편향을 줄입니다. 세 기준을 한 점수로 뭉개지 마십시오. 과정만 보면 결과가 약한 궤적이 남고, 결과만 보면 과정이 나쁜 궤적이 남습니다.
둘째 단계는 구간 필터입니다. 연속한 단계를 묶어 의미 구간을 만들고, 각 구간을 기여, 학습 가능성, 위험으로 채점합니다. 기여는 그 구간이 최종 해에 얼마나 필요한지입니다. 학습 가능성은 모델이 그 구간에서 배울 여지가 있는지입니다. 위험은 그 구간이 나쁜 습관을 심는지입니다. 연속 단계를 묶는 이유는, 한 줄 명령만 보면 맥락이 빠지기 때문입니다. 파일을 연 뒤 테스트를 돌리는 연속 동작은 한 구간으로 보는 편이 맞습니다.
DACON 코드 제출이나 사내 에이전트 평가에서는 이 두 단계를 체크리스트로 옮길 수 있습니다. 먼저 성공 세션만 모읍니다. 그다음 과정·결과·대표성으로 세션을 줄입니다. 남은 세션 안에서 연속 단계를 구간으로 자르고, 기여·학습·위험을 표시합니다. 자동 채점이 어려우면 사람 두 명이 같은 구간을 읽고 불일치만 남기십시오. 불일치가 많은 구간은 학습에서 빼는 편이 안전합니다.
문맥에는 남기고, 손실에는 고른 구간만 넣습니다
지도 미세조정 동안 모든 구간은 시퀀스에 남아 문맥을 지킵니다. 손실 계산에 들어가는 구간만 고른 구간입니다. 이 설계가 핵심입니다. 나쁜 구간을 시퀀스에서 지우면, 좋은 구간이 무엇을 보고 결정했는지가 끊깁니다. 반대로 나쁜 구간까지 손실에 넣으면 모델이 그 구간을 따라 배웁니다. 문맥으로 보여 주되 따라 배우지 않게 하는 분리가 이 논문의 학습 규칙입니다.
구현을 팀에 번역할 때는 마스크로 생각하면 됩니다. 전체 궤적을 그대로 넣고, 고른 구간의 토큰만 손실에 참여시킵니다. 고르지 않은 구간은 읽기만 합니다. 에이전트 학습 코드를 이미 가진 팀이면, 손실 마스크 한 줄을 추가하는 실험이 이 논문과 가장 가깝습니다. 데이터를 물리적으로 잘라 이어 붙이는 방식은, 문맥을 지키라는 규칙과 어긋납니다.
해커톤에서 파인튜닝을 직접 돌리지 않더라도 이 규칙은 쓸 수 있습니다. 데모용 궤적을 고를 때, 실패한 탐색은 설명용 문맥으로만 남기고, 평가 점수를 매기는 구간은 기여가 큰 구간만 쓰십시오. 심사자가 보는 녹화에 중복 명령이 길면, 모델이 그 습관을 정답으로 읽습니다. 사람 데모에도 같은 필터를 적용하십시오.
10%가 전체 해결 집합을 이깁니다
실험은 SWE-Bench Pro와 SWE-Bench Verified에서 이루어졌습니다. SWE-Prime이 고른 궤적 10% 부분집합으로 학습한 결과가, 전체 해결 집합으로 학습한 결과보다 앞섰습니다. 상대 이득은 Pro에서 최대 12.2%, Verified에서 최대 24.2%입니다. 절대 해결률은 초록에 없습니다. 오늘 본문에도 넣지 않습니다. “몇 퍼센트를 해결했다”는 문장을 이 글에서 읽었다고 쓰지 마십시오.
숫자가 가리키는 운영 함의는 분명합니다. 성공 데이터를 전부 넣는 습관이 점수를 올릴 것이라는 가정을 이 실험이 흔듭니다. 품질과 대표성을 가린 작은 집합이 더 나은 감독이 될 수 있습니다. 상대 이득의 상한만 적혀 있으므로, 모든 설정에서 같은 비율이 나온다고 단정하지 않습니다. 우리 과제에서 같은 비율이 나온다고 약속하지도 않습니다. 재현 실험의 목표는 절대 해결률을 맞히는 일이 아닙니다. 전체 집합 대비 고른 부분집합이 앞서는지를 같은 프로토콜로 확인하는 일입니다.
DAKER 빌더가 에이전트 궤적을 공개할 때도 이 숫자를 제목처럼 쓰지 마십시오. 10%와 12.2%, 24.2%는 이 논문의 두 벤치에서 나온 상대 이득입니다. 우리 로그의 비율이 아닙니다. 우리 실험 기록에는 고른 비율, 필터 기준, 비교 대상만 적습니다. 없는 절대 해결률을 채워 순위를 만들지 않습니다.
필터 기준을 다음 팀이 다시 쓰게 적습니다
10%가 전체를 이긴 실험은, 그 10%를 고른 기준이 재현될 때만 팀에 남습니다. 과정 품질, 결과 품질, 대표성, 기여, 학습 가능성, 위험은 초록이 이름을 붙인 여섯 축입니다. 이름을 목록에만 두고 정의를 비우면, 다음 주 팀은 다른 10%를 고릅니다. 해커톤 저장소에는 각 축을 한 문장으로 적으십시오. 과정 품질은 효과가 없거나 중복이거나 위험한 단계를 가린다, 처럼 초록의 단어를 그대로 쓰는 편이 안전합니다. 없는 점수 척도를 만들지 않습니다.
사람 두 명이 같은 구간을 읽을 때는 불일치 목록이 자산입니다. 불일치는 필터가 모호하다는 신호입니다. 그 구간을 학습에 넣지 말고, 정의를 고친 뒤에 다시 표시하십시오. 한 사람이 혼자 고른 10%는 대표성을 해칠 수 있습니다. 대표성 축이 있는 이유가 여기 있습니다. 같은 유형의 성공만 남기면, 모델은 그 유형만 배웁니다. DACON 과제처럼 이슈 유형이 갈라지는 자리에서는 이 축을 빼지 마십시오.
공개 기록에는 고른 궤적 식별자와 빠진 이유를 같이 올립니다. 성공했는데 빠진 궤적이 있어야 필터가 일합니다. 전부 남기면 이 논문이 피할 시끄러운 감독이 다시 들어갑니다. 전부 빼면 학습 데이터가 사라집니다. 문맥에는 남기고 손실에는 고른 구간만 넣는 규칙을, 리뷰 메모 첫 줄에 반복하십시오. 그 한 줄이 구현자와 리뷰자를 같은 설계에 붙입니다.
상대 이득 12.2%와 24.2%는 상한입니다. 모든 설정에서 같은 비율이 나온다고 팀에 알리지 마십시오. 재현의 성공은 우리 숫자가 그 상한과 같아지는 일이 아닙니다. 전체 해결 집합보다 고른 부분집합이 앞서는지를 같은 평가로 확인하는 일입니다. 앞설 때도 있고 아닐 때도 있습니다. 그 결과를 숨기지 말고 표에 남기십시오. 숨기면 다음 팀이 다시 전체를 넣습니다.
과정 품질을 표시할 때는 효과가 없는 단계, 중복 단계, 위험한 단계를 따로 표시하십시오. 세 가지를 한 점수로 합치면, 위험한 단계가 평균에 묻깁니다. 위험 단계는 성공 궤적 안에도 있습니다. 테스트를 지우는 명령, 비밀을 출력하는 명령, 범위를 필요 없이 넓히는 편집이 그런 예입니다. 성공했다는 이유만으로 그 단계를 학습에 넣지 마십시오. 모델은 성공 표시를 보고 그 단계를 정답으로 배웁니다.
결과 품질은 테스트가 통과했다는 사실과 같지 않을 수 있습니다. 이슈와 무관한 테스트를 만져 통과한 궤적은 결과 품질이 낮습니다. 대표성은 그런 궤적이 집합을 지배하지 않게 막습니다. 쉬운 이슈의 성공만 남기면 어려운 이슈의 과정이 학습에서 빠집니다. 해커톤 로그를 고를 때도 쉬운 성공만 모아 데모로 쓰지 마십시오. 심사자가 그 데모를 정답 과정으로 읽습니다.
손실 마스크를 쓰는 구현이 어렵다면, 우선 리뷰 메모에 마스크 계획을 적으십시오. 어느 구간이 문맥이고 어느 구간이 학습인지를 사람이 합의한 뒤에 코드를 고칩니다. 합의 없이 코드를 먼저 고치면, 필터 기준이 코드 속에 숨습니다. 숨은 기준은 다음 팀이 10%를 다시 고르지 못합니다. 기준이 문장으로 남아 있어야 이 논문의 두 단계가 재현됩니다.
오늘 고른 부분집합이 전체를 이기지 못해도 실험은 유효합니다. 유효한 실험은 기준과 결과가 같이 남은 실험입니다. 기준 없이 이겼다고만 적으면 다음 팀이 같은 필터를 재현하지 못합니다. 재현되지 않는 이김은 운영에 쓸 수 없습니다. 기준을 문장으로 남기는 일이 점수보다 먼저입니다.
고른 이유와 빠진 이유를 같은 표에 남겨 다음 팀이 같은 필터를 다시 적용할 수 있게 하십시오. 이유 없는 목록은 필터가 아닙니다.
필터를 문장으로 남기는 일을 오늘 커밋에 포함하십시오.
빠진 이유도 오늘 표에 한 줄로 남기십시오.
이 글이 아닌 것입니다
절대 해결률을 공개한 글이 아닙니다. 초록이 준 숫자는 고른 비율 10%, Pro 상대 이득 최대 12.2%, Verified 상대 이득 최대 24.2%뿐입니다. 없는 해결률을 표에 넣지 않습니다.
실패한 궤적까지 학습에 넣으라는 처방이 아닙니다. 출발점은 성공한 궤적입니다. 그 안에서 품질과 대표성과 구간을 가릅니다. 실패 궤적을 보상 학습에 쓰는 다른 논문과 한 제목에 묶지 않습니다.
데이터를 물리적으로 잘라 이어 붙이는 방법도 아닙니다. 모든 구간은 문맥에 남고, 고른 구간만 손실에 들어갑니다. 구간을 삭제하고 붙이면 이 설계와 다릅니다.
9쪽 짧은 논문이므로 하이퍼파라미터 전체를 준 글도 아닙니다. 분량은 9쪽, 그림은 5장입니다. 없는 학습률과 없는 배치 크기를 이 초록에서 읽었다고 쓰지 않습니다.
우리 대회 리더보드 점수와 같은 글이 아닙니다. SWE-Bench Pro와 SWE-Bench Verified의 상대 비교입니다. DACON 점수로 바꾸어 말하지 않습니다.
오늘 할 일
첫째, 초록을 읽고 숫자 세 개만 메모에 고정하십시오. arXiv:2608.27449에서 10%, 12.2%, 24.2%와 벤치 두 이름만 옮깁니다. 절대 해결률을 추정해 적지 않습니다. 저자 열 이름과 9쪽·5그림을 같은 줄에 둡니다.
둘째, 성공한 에이전트 세션을 모아 과정·결과·대표성 표를 만드십시오. DACON 코드 제출 로그나 사내 코딩 에이전트 로그를 씁니다. 성공만 남긴 뒤, 중복 단계와 위험 단계를 표시합니다. 세 기준을 한 점수로 합치지 않습니다.
셋째, 남은 세션을 연속 단계 구간으로 자르고 기여·학습·위험을 표시하십시오. 한 줄 명령만 보지 않습니다. 파일을 열고 테스트를 돌리는 연속 동작을 한 구간으로 둡니다. 사람 두 명이 같은 구간을 읽고 불일치를 남깁니다.
넷째, 학습을 돌린다면 손실 마스크로 고른 구간만 넣으십시오. 전체 궤적은 시퀀스에 남깁니다. 데이터를 잘라 이어 붙이지 않습니다. 파인튜닝을 하지 않는 팀도 데모 녹화에 같은 규칙을 적용합니다.
다섯째, 고른 10%와 전체 성공 집합을 같은 평가로 비교하십시오. 우리 과제에서 전체가 이기는지, 고른 집합이 이기는지를 한 표에 남깁니다. 논문의 12.2%와 24.2%를 우리 숫자처럼 쓰지 않습니다.
여섯째, 필터 기준을 저장소에 문장으로 남기십시오. 과정 품질, 결과 품질, 대표성, 기여, 학습 가능성, 위험의 정의가 없으면 다음 주 팀이 같은 10%를 고를 수 없습니다.
일곱째, 비교 표와 고른 궤적 목록을 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.