54만 파라미터 정책으로 LIBERO 평균 95.1%를 냅니다 | DAKER 커뮤니티

2026년 9월 3일 MINERVA 논문이 arXiv에 공개되었습니다. LIBERO 조작 벤치에서 실제로 필요한 용량 하한을 재기 위해, 의도적으로 작은 visuomotor 정책 패밀리를 둡니다. 0.54M(54만) 파라미터 정책이 표준 LIBERO 4 suites 2,000 롤아웃에서 평균 성공률 95.1%를 냅니다. 보고된 LeRobot π0.5 결과보다 2.4점 낮지만 파라미터는 약 7,700배 적습니다. 성능은 약 1M에서 포화하고 0.25M 아래에서 붕괴합니다. 광범위 스윕에서 action-chunk 길이와 vision capacity만 ±1점 시드 밴드를 일관되게 넘습니다. flow matching은 3시드에서 direct L1 regression 대비 이점이 없고, regression은 GPU에서 최대 3.8배 빠릅니다. 같은 레시피로 LIBERO-90 89과제 94.6%를 보고하고, LIBERO-Plus 섭동에서는 46–56%, 광도 변화에는 거의 0에 가까운 강건성을 보입니다. 0.54M 정책은 노트북 CPU에서 청크당 5–9ms로 재계획하며 SmolVLA 대비 113배, π0.5 대비 1,400배 빠르다고 적습니다(GPU 없이). 오늘 팀은 “거대 VLA 점수”와 “용량·지연”을 제출 표에 나눕니다.

54만 파라미터 정책으로 LIBERO 평균 95.1%를 냅니다

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.03715에서 확인할 수 있습니다. 영문 제목은 MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?입니다. 저자는 Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 제공된 사실과 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

작은 정책으로 LIBERO 용량 하한을 잽니다

수십억 파라미터 VLA가 LIBERO를 지배하는 것처럼 보이지만, 벤치가 실제로 요구하는 용량은 불명확합니다. MINERVA(MINimal Efficient Robotic Vision-Action policy)는 이 과제 특화 용량 하한을 재려고 설계한 초소형 visuomotor 정책 패밀리입니다.

0.54M 파라미터 정책이 표준 LIBERO 네 스위트에서 2,000 롤아웃 평균 성공 95.1%를 냅니다. 보고된 LeRobot π0.5보다 2.4점 낮고, 파라미터는 약 7,700배 적습니다. 성능은 약 1M 근처에서 포화하고, 0.25M 아래에서는 붕괴합니다.

DAKER·DACON 로봇·시뮬 과제에서도 “모델이 크다”만 쓰지 말고, 파라미터 수·재계획 지연·성공률을 한 표에 둡니다.

스윕·프로브·강건성 숫자

아키텍처·학습·추론을 넓게 훑었을 때, ±1점 학습 시드 밴드를 일관되게 넘는 요인은 action-chunk 길이와 vision capacity뿐입니다. flow matching은 세 시드에서 direct L1 regression 대비 이점이 없고, regression은 GPU에서 최대 3.8배 빠릅니다.

task-ID 순열 프로브는 표준 LIBERO 지시 조건이 암기된 과제 선택에 가깝다는 신호를 줍니다. task-ID 매핑만 바꾸면 성공률이 거의 우연 수준으로 떨어집니다. 같은 레시피는 LIBERO-90 89과제에서 94.6%를 냅니다. LIBERO-Plus 섭동에서는 46–56%로 떨어지고, 광도(photometric) 변화에는 거의 0 강건성을 보입니다.

0.54M 정책은 노트북 CPU에서 제어 스텝마다 청크당 5–9ms로 재계획합니다. SmolVLA 대비 113배, π0.5 대비 1,400배 빠르며 GPU가 필요 없다고 적습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 LIBERO 점수를 “대형 VLA 승리”로만 읽지 않는 것입니다. 용량 곡선(0.25M 붕괴·0.54M 95.1%·1M 포화)을 우리 실험 노트에 복제할 축으로 둡니다. action-chunk와 vision capacity를 먼저 스윕합니다.

지시문만 바꿔도 되는 과제인지, task-ID 암기에 가까운지 프로브 실험을 한 줄로 계획합니다. LIBERO-Plus·광도 섭동을 최종 점수의 일부로 넣을지 미리 정합니다. DAKER 해커톤 README에 파라미터 수·CPU 지연·스위트별 성공률을 분리해 적습니다.

flow matching을 기본값으로 두지 말고, L1 regression과 벽시계를 같이 측정합니다. 시드 3개 이상을 권장 형식에 맞춥니다.

Controller·Worker를 나누면, 정책 가중치 경로와 평가 스크립트를 분리합니다. 비밀키를 설정에 넣지 않습니다.

시뮬 데모만 올릴 때는 실기 미사용을 명시합니다. 시드·카메라·과제 ID 목록을 공개합니다.

용량·지연을 제출 표로 만듭니다

MINERVA의 메시지는 “작아도 LIBERO 표준 스위트에서는 높게 나온다”와 “섭동·광도에서는 무너질 수 있다”를 같이 보라는 것입니다. README 표에 표준 4 suites 95.1%, LIBERO-90 94.6%, LIBERO-Plus 46–56%, 광도 거의 0을 네 줄로 나눕니다. 한 평균으로 합치지 마십시오.

7,700배 적은 파라미터와 CPU 5–9ms는 배포 효율 축입니다. 해커톤 심사 자료에 GPU 없이 도는지, 청크 길이는 얼마인지를 적습니다. π0.5·SmolVLA 배수(1,400×·113×)는 논문 보고 비교로만 인용하고 우리 실측처럼 쓰지 않습니다.

task-ID 순열로 무너지는 현상은 “지시 따르기” 자랑을 점검하는 도구입니다. 지시문을 셔플한 평가 열을 하나 더 둡니다. DAKER 바이브코딩·로봇 데모에서도 배포 링크에 평가 표를 붙입니다.

코드 URL은 초록에 없으면 “초록에 구체 URL이 없다”고만 적습니다. 추측 GitHub을 만들지 않습니다.

표준 점수와 섭동 점수를 같은 표에 둡니다

MINERVA를 읽는 팀은 LIBERO 95.1%만 헤드라인으로 쓰지 마십시오. 같은 표에 LIBERO-90 94.6%, LIBERO-Plus 46–56%, 광도 거의 0을 나란히 둡니다. 표준 스위트에서 작은 정책이 잘 나와도, 섭동에서 무너질 수 있다는 것이 논문이 같이 주는 메시지입니다.

용량 곡선은 실험 체크리스트가 됩니다. 0.25M 아래 붕괴, 0.54M 95.1%, 약 1M 포화를 우리 스윕의 기준점으로 복제합니다. action-chunk 길이와 vision capacity만 ±1점 시드 밴드를 넘는다는 보고에 맞춰, 다른 하이퍼파라미터 스윕을 과하게 늘리지 않습니다.

CPU 5–9ms와 SmolVLA·π0.5 대비 배수(113×·1,400×)는 배포 효율 절에만 인용합니다. GPU 없는 재계획을 팀 데모 조건으로 쓸지 미리 정합니다. task-ID 순열 프로브는 “지시 따르기” 자랑을 검증하는 열로 추가합니다.

DAKER 로봇·시뮬 과제나 DACON 빌더 노트에도 파라미터 수·지연·스위트별 성공률을 분리해 올립니다. 코드 URL이 없으면 없다고만 적습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

이 글이 아닌 것입니다

모든 로봇 벤치에서 95%라는 주장이 아닙니다. 표준 LIBERO는 높고, Plus·광도에서는 크게 떨어집니다.

대형 VLA가 불필요하다는 선언이 아닙니다. LIBERO 과제 특화 용량 하한의 경험적 추정입니다.

flow matching이 항상 쓸모없다는 일반화가 아닙니다. 3시드·이 설정에서 L1 대비 이점이 없었다는 보고입니다.

특정 대회 우승 공지가 아닙니다. 용량 인식 설계·증류 동기 안내입니다.

95.1%가 실기 성능을 보증한다는 뜻이 아닙니다. 보고된 시뮬 롤아웃 집계입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.03715pdf를 엽니다.

둘째, 용량 곡선 표를 만드십시오. 0.25M·0.54M·1M 구간에 우리 측정열을 비워 둡니다.

셋째, action-chunk와 vision capacity만 먼저 스윕하십시오.

넷째, L1 regression과 flow matching 벽시계를 같이 재십시오.

다섯째, task-ID 순열 프로브를 평가 열에 추가하십시오.

여섯째, LIBERO-Plus·광도 결과를 표준 점수와 분리하십시오.

일곱째, 파라미터·CPU 지연·표를 배포 링크에 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.03715 — MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO? (2026-09-03) · PDF