에이전트 군집을 지휘하는 능력을 따로 잽니다 | DAKER 커뮤니티

2026년 8월 31일 Jinshan Gao·Zhuoran Jin 연구팀이 SwarmBench를 arXiv에 공개했습니다. EMNLP 2026 Findings입니다. 질문은 대형언어모델이 에이전트 군집의 오케스트레이터로 얼마나 잘하는가입니다. 과제 8개, 샘플 400개(각 50개)이며, 분해·위임·집계 세 범주입니다. 메인 에이전트는 도구를 직접 호출하거나 혼자 답하지 못하고, 맥락 일부가 가려집니다. 서브에이전트는 모델 풀에서 고릅니다. 오늘은 “한 모델 점수”와 “군집 지휘 점수”를 한 표에 두지 말라는 글입니다.

에이전트 군집을 지휘하는 능력을 따로 잽니다

논문은 2026년 8월 31일 arXiv에 올라왔습니다. 초록은 arXiv:2608.30661에서 확인할 수 있습니다. 영문 제목은 SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?입니다. 저자는 Jinshan Gao, Zhuoran Jin(corresponding), Tianyi Men, Kang Liu, Jun Zhao이며 CASIA / UCAS입니다. PDF는 같은 번호의 pdf입니다. 코드는 GitHub ying1973/SwarmBench에 공개되어 있습니다. 오늘 본문은 제공된 사실 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

에이전트 군집을 지휘하는 능력을 따로 잽니다 본문

분해·위임·집계로 나눕니다

세 범주는 다음과 같습니다. 분해는 Batch Download, Multi-Text Understanding, MATH입니다. 위임은 MPA, RCA, Treasure Hunt입니다. 집계는 Long-Text Generation, Wide Search입니다. 메인 에이전트는 도구 호출과 단독 답변이 막혀 있고, 맥락 일부가 숨겨집니다. 서브에이전트 모델은 풀에서 고릅니다. 이 한 줄이 벤치의 핵심입니다.

AVG는 GPT-5.4가 50.49로 8과제 중 6개에서 최고입니다. Claude-Sonnet-4-6은 43.51, Qwen3.5-397b-a17b 40.62, Deepseek-v3.2 40.38, GLM-5.1 40.30, Kimi-k2.5 32.81입니다. 단일 에이전트 GPT-5-mini는 24.41입니다. 군집 설정과 단일 에이전트 점수를 같은 순위로 섞지 마십시오.

DACON과 DAKER처럼 팀이 서브에이전트를 나누어 돌리는 자리에서는, 오케스트레이터 프롬프트와 Worker 모델 풀을 표에서 분리해야 합니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 메인에게 도구를 주지 않은 채 지휘만 시키는지, 메인이 전부 하는지부터 README에 적습니다.

과제별 점수와 비용 경고

GPT-5.4는 MATH 82.97, Batch Download(BD) 87.84, MPA 77.17, Wide Search(WS) 38.67입니다. RCA는 여전히 낮아 10.00이고, Treasure Hunt(TH)는 10.33입니다. 높은 과제만 골라 “오케스트레이션 완성”이라고 쓰지 마십시오.

초록은 비용이 성능과 선형이 아니라고 적습니다. 병렬화율과 병렬화 이득도 같지 않습니다. 집계가 자주 가장 어렵습니다. 해커톤에서 서브에이전트 수를 늘리기만 하고 집계 규칙을 비우면 SwarmBench가 가리키는 실패와 같은 자리에 섭니다.

Treasure Hunt는 9×9 지도에서 구리·은·금 상자가 각각 100·200·300입니다. 메인 에이전트는 고정되어 있고, 정찰과 운반 서브에이전트를 생성합니다. Batch Download는 샘플당 평균 파일 11.44개이며 download F1로 평가합니다. 우리 미니게임·파일 파이프라인 데모에 같은 분리(지휘/정찰/운반)를 표로 옮길 수 있습니다.

SwarmExp로 궤적을 재사용합니다

SwarmExp는 궤적에서 스킬·트릭·모델 카드를 뽑아 재생합니다. Agent Swarm 대비 Multi-Text Understanding(MTU) 49.07(+0.25), RCA 16.42(+6.42), Long-Text Generation(LTG) 54.65(+6.46), WS 41.59(+2.92)입니다. 제거 실험에서 모델 카드를 빼면 평균 하락이 가장 커 -2.49입니다. 서브에이전트 선택 근거를 남기지 않으면 재생이 약해집니다.

DAKER 월간 해커톤 제출에는 오케스트레이터 지시, 서브에이전트 풀, 모델 카드 URL을 세 항목으로 둡니다. 배포가 제출입니다. 올린 링크가 제출입니다. 코드 저장소가 있으므로 오늘 클론과 초록을 같은 탭에 둘 수 있습니다.

단일 에이전트 24.41과 군집 최고 50.49를 나란히 적어, “모델만 바꿈”과 “지휘를 바꿈”을 구분합니다. 없는 리더보드 순위를 붙이지 않습니다. 초록이 준 모델 이름과 AVG만 옮깁니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 메인 에이전트에게 도구를 막은 채 위임만 시키는 스모크 테스트를 한 페이지로 쓰는 것입니다. 맥락 일부를 가린 설정도 같이 적습니다. SwarmBench 8과제 이름을 우리 내부 과제 매핑표에만 참고합니다.

비용·병렬화율·병렬화 이득을 세 항목으로 나누십시오. 초록이 선형이 아니라고 했으므로, 우리 표에도 성능만 올리지 않습니다. 집계 과제(Long-Text Generation·Wide Search)를 일정 후반에만 몰아넣지 말고 매주 한 번씩 돌립니다.

RCA 10.00·TH 10.33처럼 낮은 축을 실패 태그로 고정합니다. 위임 실패와 집계 실패를 Worker 코드 버그와 섞지 않습니다. SwarmExp식 모델 카드 보존을 의무 항목으로 둡니다. -2.49 하락을 우리 실측처럼 쓰지 말고, “카드 제거 실험” 형식만 복제합니다.

Treasure Hunt의 점수 100·200·300과 정지 메인·정찰·운반 구조를 미니 해커톤 규칙으로 옮겨 볼 수 있습니다. Batch Download의 평균 11.44 파일·download F1을 파일 파이프라인 평가 항목에 참고합니다. 없는 통과율을 만들지 않습니다.

GPT-5.4가 6/8에서 최고여도 WS·RCA·TH가 낮습니다. “평균 50.49”만 카드에 크게 쓰지 마십시오. 과제별 열을 공개 문서에 남깁니다. Qwen·Deepseek·GLM·Kimi AVG도 같은 표에 두어 비교군을 가리지 않습니다.

오케스트레이터 평가를 사내에 옮길 때는 메인에게 도구를 막고 맥락 일부를 가린 스모크부터 둡니다. GPT-5.4 AVG 50.49와 단일 에이전트 GPT-5-mini 24.41을 같은 주에 적어, 군집 이득이 실제로 붙는지 확인합니다. Claude·Qwen·Deepseek·GLM·Kimi AVG도 비교군으로 남겨 한 모델만 돋보이지 않게 합니다.

분해 과제(Batch Download·Multi-Text Understanding·MATH)와 위임(MPA·RCA·Treasure Hunt)·집계(Long-Text Generation·Wide Search)를 스프린트 보드의 세 열로 나눕니다. 집계가 자주 가장 어렵다는 경고를 열 상단 주석에 둡니다. Wide Search 38.67·RCA 10.00·Treasure Hunt 10.33을 실패 태그 예시로 고정합니다.

SwarmExp의 MTU·RCA·LTG·WS 이득과 모델 카드 제거 −2.49를 궤적 저장 규칙 회의에 올립니다. 스킬·트릭·모델 카드를 저장소에 남기지 않은 제출은 리뷰에서 되돌려 보냅니다. Treasure Hunt의 9×9·점수 100/200/300·정지 메인·정찰·운반 규칙을 미니 해커톤 설명문에 참고용으로만 옮깁니다.

이 글이 아닌 것입니다

단일 에이전트 코딩 리더보드가 아닙니다. 메인은 도구·단독 답이 막힌 오케스트레이터 평가입니다. GPT-5-mini 24.41은 단일 에이전트 참고선입니다.

서브에이전트를 늘리면 점수가 선형으로 오른다는 처방이 아닙니다. 비용과 성능은 선형이 아니고, 병렬화율과 이득도 같지 않습니다.

모든 과제에서 50점대라는 주장이 아닙니다. GPT-5.4도 RCA 10.00·TH 10.33처럼 낮은 지표가 있습니다.

모델 카드가 없어도 궤적 재생이 충분하다는 뜻이 아닙니다. 제거 시 평균 -2.49로 가장 큰 하락입니다.

특정 제품 출시 공지가 아닙니다. 벤치마크·공개 코드·오케스트레이션 평가 안내입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.30661pdf를 같은 탭에 둡니다. 요약 카드만 보고 SwarmBench를 정의하지 않습니다. 저자·CASIA/UCAS·제출일 2026-08-31·EMNLP Findings를 메모 첫 줄에 적습니다.

둘째, 공개 코드를 북마크하십시오. ying1973/SwarmBench와 라이선스·README를 저장합니다. 클론만 하고 출처 URL을 비우지 않습니다.

셋째, 오케스트레이터·서브에이전트 풀·모델 카드 표를 한 페이지로 쓰십시오. 메인 도구 차단 여부와 숨긴 맥락 범위를 명시합니다. DAKER 월간 해커톤이나 DACON 에이전트 과제에 맞춥니다.

넷째, 8과제를 분해·위임·집계로 매핑하십시오. 우리 내부 스모크에 각 범주 하나 이상을 둡니다. AVG만 보지 않습니다.

다섯째, 비용·병렬화율·병렬화 이득 항목을 만드십시오. 초록의 비선형 경고를 표 주석에 옮깁니다. 없는 달러·토큰 총량을 만들지 않습니다.

여섯째, SwarmExp식 궤적 보존을 의무화하십시오. 스킬·트릭·모델 카드를 저장소에 남기고, 카드 제거 A/B만 형식으로 복제합니다.

일곱째, 지휘 표와 평가 로그를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.30661 — SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators? (2026-08-31) · PDF · Code