코딩 에이전트에게 고객지원 에이전트를 맡기면 통과율은 23.9%입니다 | DAKER 커뮤니티
2026년 9월 4일 τ^τ-bench(hyper-tau-bench) 논문이 arXiv에 공개되었습니다. LLM 에이전트가 고객지원·분쟁·내부 시스템에 올라가고, 그 구축 일도 코딩 에이전트에 맡기는 흐름에서, 기존 벤치는 실제 고객 프로젝트 조건에서 AI가 에이전트를 납품할 수 있는지 거의 말하지 않는다고 적습니다. τ^τ-bench는 에이전트 구축 자체를 과제로 둡니다. 개발자 에이전트에게 실제 비즈니스 기록, 요구사항을 쥔 클라이언트, 운영 API, 상속할 코드베이스, 서빙 비용·모델 제한을 주고, 완전한 고객지원 에이전트를 납품한 뒤 보류 시뮬 사용자에 배포해 채점합니다. 도메인 4개에 걸친 과제 53개에서, 최강 설정 Claude Opus 5 + Claude Code의 평가 시뮬 통과율은 23.9%입니다. 전문가 작성 참고 상한은 82.2%입니다. 실패 양상은 기록을 깊게 읽지 않고 얕은 질의, 소통 부족 등 사람 개발자가 보는 것과 비슷하다고 적습니다.

논문은 2026-09-04 arXiv에 올라왔습니다. 초록은 arXiv:2609.04611에서 확인할 수 있습니다. 영문 제목은 τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction입니다. 저자는 Quan Shi, Keshav Dhandhania, Karthik Narasimhan, Victor Barres입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
에이전트 구축을 과제로 두는 이유
초록은 LLM 에이전트가 고객지원, 분쟁 판정, 내부 시스템 운영에 배포되고 있다고 적습니다. 그 구축 일도 점점 코딩 에이전트에 맡겨진다고 적습니다. 그런데 기존 벤치는 실제 고객 프로젝트 조건에서 AI 시스템이 에이전트를 납품할 수 있는지 거의 말하지 않는다고 적습니다. τ^τ-bench는 그 빈칸을 “구축” 과제로 채웁니다.
개발자 에이전트에게 주는 시작점은 실제 비즈니스가 남긴 기록, 요구사항을 쥔 클라이언트, 운영이 반드시 통과해야 하는 프로덕션 API, 상속할 코드베이스, 서빙 비용과 모델 제한입니다. 이 조건에서 완전한 고객지원 에이전트를 납품해야 합니다. 채점은 그 에이전트를 보류(held-out) 시뮬 사용자에 배포해 이뤄집니다.
DACON·DAKER에서 에이전트 데모를 낼 때도, “코딩 에이전트가 README를 썼다”와 “고객지원 시뮬을 통과했다”를 같은 줄에 두지 마십시오. 통과율은 배포 후 시뮬로만 적습니다.
통과율 23.9%와 참고 상한 82.2%
평가 범위는 도메인 4개에 걸친 과제 53개입니다. 최강 설정은 Claude Opus 5를 Claude Code 아래에서 돌린 구성이며, 평가 시뮬 통과율은 23.9%입니다. 전문가 작성 참고 상한은 82.2%입니다. 이 두 숫자만 초록에서 옮깁니다.
실패 양상으로 초록이 적는 것은 기록을 깊게 이해하지 않고 얕은 질의를 내는 것, 클라이언트에게 거의 소통하지 않는 것, 에이전트 아키텍처와 서빙 지출을 충분히 실험하지 않고 돌아가는 첫 설계를 바로 내는 것입니다. 사람 에이전트 개발자가 보는 실패와 비슷하다고 적습니다.
해커톤 README에 숫자를 옮길 때는 “도메인 4 / 과제 53”, “Claude Opus 5 + Claude Code 통과율 23.9%”, “전문가 참고 상한 82.2%”만 한 줄에 고정합니다. 다른 모델 점수를 만들지 않습니다.
빌더 팀에 옮기는 점검
고객지원 에이전트 과제에 비즈니스 기록 스냅샷 해시, 클라이언트 요구사항 문서 버전, 프로덕션 API 스펙, 상속 코드베이스 커밋을 남깁니다. 서빙 비용 상한과 허용 모델 목록을 설정 파일에 고칩니다.
채점용 시뮬 사용자를 학습·개발 대화와 분리합니다. 보류 세트를 먼저 봉인합니다. 첫 동작하는 설계를 바로 제출하지 말고, 아키텍처와 서빙 지출을 최소 한 번 이상 바꿔 본 기록을 남깁니다. API 키를 프롬프트나 공개 저장소에 넣지 않습니다.
DAKER 월간 해커톤 데모라면 배포 주소와 함께 “통과율 측정 방식(보류 시뮬)”과 “비용·모델 제한”을 README 상단에 둡니다. 초록에 없는 GitHub 주소를 만들지 마십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
실제 고객 프로젝트와 같은 시작점
초록은 개발자 에이전트에게 실제 비즈니스가 남긴 기록, 요구사항을 쥔 클라이언트, 운영이 반드시 통과해야 하는 프로덕션 API, 상속할 코드베이스, 서빙 비용과 모델 제한을 준다고 적습니다. 이 다섯 가지는 실제 고객 프로젝트가 주는 시작점과 같다고 적습니다. 팀 표에는 다섯 칸을 서로 다른 열로 둡니다.
납품물은 완전한 고객지원 에이전트입니다. 채점은 그 에이전트를 보류 시뮬 사용자에 배포해 이뤄집니다. 개발 중 대화 점수와 보류 시뮬 점수를 섞지 마십시오. 보류 세트를 먼저 봉인합니다.
도메인 4개에 걸친 과제 53개가 평가 범위입니다. 최강 설정 Claude Opus 5 + Claude Code의 평가 시뮬 통과율은 23.9%입니다. 전문가 작성 참고 상한은 82.2%입니다. 두 숫자를 같은 표에 두고, 다른 모델 점수를 만들지 않습니다.
실패 양상으로 초록이 적는 것은 기록을 깊게 이해하지 않고 얕은 질의를 내는 것, 클라이언트에게 거의 소통하지 않는 것, 에이전트 아키텍처와 서빙 지출을 충분히 실험하지 않고 돌아가는 첫 설계를 바로 내는 것입니다. 사람 에이전트 개발자가 보는 실패와 비슷하다고 적습니다.
코딩 에이전트에게 구축을 맡길 때도, “첫 동작”과 “시뮬 통과”를 같은 줄에 두지 마십시오. 아키텍처와 서빙 지출을 최소 한 번 이상 바꿔 본 기록을 남깁니다. 비용 상한과 허용 모델 목록을 설정 파일에 고칩니다.
이 글이 아닌 것입니다
모든 코딩 에이전트가 고객지원 에이전트를 23.9%만 통과한다는 뜻이 아닙니다. Claude Opus 5 + Claude Code 설정과 과제 53개 범위만 옮깁니다.
전문가 상한 82.2%가 사람 평균이라는 뜻이 아닙니다. 전문가 작성 참고 상한이라는 초록 표현만 씁니다.
고객지원 외 모든 도메인으로 일반화한다는 뜻이 아닙니다. 보고된 도메인 4개 과제만 둡니다.
DACON·DAKER 공식 우승 공지가 아닙니다. 빌더가 옮길 수 있는 벤치 숫자 안내입니다.
숫자만 다시 고정합니다
오늘 본문은 초록 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다. 위 절에 적은 계정·과제·통과율·개선폭·벤치 이름만 표에 남깁니다. DACON 알고리즘 대회와 DAKER 바이브코딩 해커톤 README에 옮길 때도 같은 표 형식을 씁니다. 배포가 제출입니다. 올린 링크가 제출입니다. 초록에 없는 GitHub 주소를 만들지 마십시오. API 키를 프롬프트나 공개 저장소에 넣지 않습니다. 평가 설정 파일과 결과 CSV 첫 열에 벤치 이름과 분할 이름을 고정합니다. 거절·통과·편집 크기·닫힌 루프 점수를 한 줄에 섞지 마십시오. 팀 회의 메모 첫 줄에 arXiv 번호와 제출일을 적습니다.
빌더가 오늘 점검할 공통 항목은 다음과 같습니다. 초록과 PDF를 같은 탭에 둡니다. 출처 링크는 abs와 pdf만 둡니다. 합니다체로 내부 메모를 쓰고, 없는 성능을 만들지 않습니다. 선택 배치와 전수 배치, 학습 하네스와 평가 하네스, 인식과 행동처럼 초록이 나눈 축을 표에서 합치지 않습니다. 데모 주소와 설정 파일을 함께 올립니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.04611와 pdf를 같은 탭에 둡니다. 제출일 2026-09-04을 메모 첫 줄에 적습니다.
둘째, 시작 조건을 다섯 칸으로 나누십시오. 기록·클라이언트·API·코드베이스·비용/모델 제한을 표로 둡니다.
셋째, 채점을 보류 시뮬 배포로만 적으십시오. 개발 대화 점수를 섞지 않습니다.
넷째, 23.9%와 82.2%를 같은 표에 두십시오. 모델 이름을 Claude Opus 5 + Claude Code로 고정합니다.
다섯째, 실패 양상 세 가지를 체크리스트로 만드십시오. 얕은 질의·소통 부족·첫 설계 고정을 점검합니다.
여섯째, 아키텍처와 서빙 지출 실험 로그를 남기십시오. 한 번만 돌리고 끝내지 않습니다.
일곱째, 데모와 제한 설정을 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.04611 — τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction (2026-09-04) · PDF