동적 루브릭 이점을 스텝별로 나눠 긴 에이전트를 학습합니다 | DAKER 커뮤니티
2026년 9월 4일 DRACO 논문이 arXiv에 공개되었습니다. 검증기가 있는 과제에는 RLVR이 잘 맞지만, 긴 구간 에이전트 도메인에는 프로그램 검사기가 없는 경우가 많습니다. 정답 성공 신호가 없는 outcome-blind 설정을 다룹니다. 다기준 루브릭을 궤적 끝에 한 번만 점수화하면 수십 스텝에 신호가 빈약합니다. DRACO는 학습 중 정책 능력에 맞춰 루브릭을 동적으로 만들고, 완료 궤적에 한 번 점수를 매긴 뒤, 주석된 루브릭을 담당한 스텝으로 닫힌 형식 재분배해 GRPO의 스텝별 advantage를 만듭니다. 학습된 attribution 모듈은 두지 않습니다. AppWorld에서 기반 모델 대비 15.9포인트, 희소 정답 보상 GRPO 대비 5.3포인트 올렸고, 검증기 자체는 쓰지 않았다고 적습니다. 도메인 밖 Tau-Bench에서는 프론티어 judge 없이도 기반 대비 5.3포인트 올렸으며, 정답 보상 학습과 다른 루브릭 설정보다 앞선다고 보고합니다. 코드는 IBM GitHub에 있습니다. 오늘 팀은 “궤적 점수”와 “스텝 재분배”를 README에 나눕니다.

논문은 2026-09-04 arXiv에 올라왔습니다. 초록은 arXiv:2609.04094에서 확인할 수 있습니다. 영문 제목은 DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training입니다. 저자는 Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk입니다. PDF는 같은 번호의 pdf입니다. 코드는 github.com/IBM/draco입니다. 오늘 본문은 제공된 사실과 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
루브릭 점수를 스텝으로 나눕니다
프로그램 검사기가 있으면 검증 가능 보상으로 학습하기 쉽습니다. 긴 구간 에이전트 과제에는 검사기가 없는 경우가 많습니다. DRACO는 정답 성공 신호가 없는 outcome-blind 설정을 전제로 합니다. 다기준 루브릭은 흔히 쓰이지만, 궤적당 스칼라 하나로는 수십 스텝에 신호가 약합니다.
DRACO는 학습 중 정책 능력 변화에 맞춰 루브릭을 동적으로 생성합니다. 완료된 궤적에 한 번 점수를 매기고, 주석된 루브릭을 담당한 스텝으로 닫힌 형식 재분배해 GRPO용 스텝별 advantage를 만듭니다. 별도의 학습된 attribution 모듈은 도입하지 않는다고 적습니다.
DACON·DAKER에서 에이전트 RL을 돌릴 때도, 궤적 끝 점수만 남기지 말고 스텝별 재분배 로그를 보관합니다.
보고된 벤치 상승
AppWorld에서 기반 모델 대비 15.9포인트, 희소 정답 보상으로 학습한 GRPO 대비 5.3포인트 향상을 보고합니다. 검증기 자체를 쓰지 않았다고 명시합니다. 절대 점수와 시드 수는 초록에 없으므로 쓰지 않습니다.
도메인 밖 Tau-Bench에서는 프론티어 judge 없이도 기반 모델 대비 5.3포인트 올렸고, 정답 보상 학습과 다른 루브릭 기반 학습 설정보다 앞선다고 적습니다. 세부 설정 이름과 표는 초록에 없으므로 채우지 않습니다.
해커톤 README에 점수를 옮길 때는 AppWorld +15.9 / GRPO-GT 대비 +5.3, Tau-Bench +5.3만 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.
빌더 팀에 옮기는 점검
팀이 오늘 할 일은 보상 파이프라인을 “궤적 스칼라”가 아니라 “동적 루브릭 생성 → 궤적 점수 → 스텝 재분배 → GRPO”로 나누는 것입니다. outcome-blind인지 verifier가 있는지 문서 상단에 표시합니다.
루브릭이 학습 중 어떻게 바뀌는지 버전을 남깁니다. 재분배가 닫힌 형식임을 체크리스트에 둡니다. attribution 네트워크를 새로 붙이지 않는 이유를 한 줄로 적습니다.
코드를 받을 때는 라이선스와 실행 명령을 README에 먼저 적습니다. 출처 arXiv 번호와 GitHub URL을 상단에 둡니다. DAKER 월간 해커톤 데모라면 배포 주소와 AppWorld/Tau-Bench 인용 조건을 같이 올립니다.
Controller와 Worker를 나누는 팀이면, 루브릭 생성 프롬프트와 GRPO 설정 파일을 한 메시지에 섞지 마십시오. 루브릭 버전 해시와 학습 로그 해시를 나란히 둡니다.
공유 GPU를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. API 키를 프롬프트나 공개 저장소에 넣지 않습니다.
크레딧 할당을 제출 문서로 옮기는 방법
DRACO가 강조하는 점은 루브릭을 쓰되, 궤적 끝 점수만으로 끝내지 않고 스텝 책임으로 나눈다는 것입니다. 팀 문서에도 같은 구조를 둡니다. 동적 루브릭, 닫힌 형식 재분배, AppWorld·Tau-Bench 결과를 절로 나눕니다.
+15.9와 +5.3 숫자는 초록에 나온 비교 축만 옮깁니다. 다른 벤치 점수를 만들어 붙이지 마십시오.
데모 페이지에는 “스텝별 루브릭 이점” 문장을 크게 두고, 바로 옆에 AppWorld·Tau-Bench 상승 폭을 둡니다. 없는 미러 URL을 만들지 마십시오.
팀 회고에는 “루브릭 품질”과 “재분배 후 학습 안정성”을 서로 다른 항목에 적습니다. 한 항목에 섞으면 원인 추적이 어렵습니다.
제출 전에 로컬에서 짧은 궤적으로 재분배 수치를 한 번 검산합니다. 결과는 로그만 남기고 과장 문구를 붙이지 않습니다.
outcome-blind 학습 체크리스트를 둡니다
DRACO는 정답 성공 신호가 없는 설정을 전제로 합니다. 팀 실험 카드 첫 줄에 outcome-blind 여부를 표시합니다. 검증기가 있는 과제와 없는 과제를 섞어 학습하지 않습니다. 섞어야 한다면 데이터셋 태그를 나눕니다.
동적 루브릭 버전을 매 업데이트마다 저장합니다. 궤적 점수를 스텝으로 재분배한 벡터를 로그에 남겨, GRPO advantage가 어떻게 달라졌는지 나중에 검산할 수 있게 합니다. 학습된 attribution 모듈을 추가하지 않는 설계임을 체크합니다.
AppWorld +15.9, GRPO-GT 대비 +5.3, Tau-Bench +5.3은 비교 축을 빠뜨리지 않고 적습니다. 프론티어 judge 없이 Tau-Bench 상승을 냈다는 문장은 인용으로만 둡니다.
GitHub 코드를 받을 때는 예제 설정과 라이선스를 먼저 읽고, 우리 환경 변수 파일을 커밋하지 않습니다. 공개 데모에는 짧은 궤적 재분배 예시만 올립니다.
이 글이 아닌 것입니다
모든 에이전트 벤치에서 같은 상승 폭이라는 보증이 아닙니다. AppWorld와 Tau-Bench 보고입니다.
세부 하이퍼파라미터를 이 글이 확정한다는 뜻이 아닙니다. 초록에 없는 항목은 쓰지 않습니다.
검증기가 있는 과제에서 RLVR을 버리라는 주장이 아닙니다. outcome-blind 설정 안내입니다.
DACON·DAKER 공식 우승 공지가 아닙니다. 빌더가 옮길 수 있는 방법과 숫자 안내입니다.
프론티어 judge가 필요하다는 뜻이 아닙니다. Tau-Bench에서는 없이도 +5.3을 보고합니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.04094와 pdf를 같은 탭에 둡니다. 제출일 2026-09-04를 메모 첫 줄에 적습니다.
둘째, 코드를 확인하십시오. github.com/IBM/draco에서 실행 경로를 추적합니다.
셋째, 우리 보상 파이프라인을 재분배 단계 표로 옮기십시오. 동적 루브릭·궤적 점수·스텝 advantage 열을 만듭니다.
넷째, AppWorld·Tau-Bench 숫자는 조건과 같이 인용하십시오. 우리 실측과 섞지 않습니다.
다섯째, outcome-blind 여부를 문서 상단에 표시하십시오. verifier 유무를 체크합니다.
여섯째, 루브릭 버전 해시를 재현 노트에 적으십시오. GRPO 로그와 나란히 둡니다.
일곱째, 데모와 설정 파일을 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.04094 — DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training (2026-09-04) · PDF · GitHub