스킬 실행 전후를 검증하는 VLA 에이전트 틀을 둡니다 | DAKER 커뮤니티

2026년 9월 1일 EmbodiedSkills 논문이 arXiv에 공개되었습니다. 비전–언어–행동(VLA)이 행동을 예측하는 것만으로는 긴 horizon 과제에 부족하다고 보고, 스킬 결정을 실행 제안으로 취급합니다. 런타임이 사전조건을 검사한 뒤 실행하고, 실행 후 결과를 검증합니다. Qwen3-VL과 OpenPI/π0.5로 인스턴스화했을 때, 과제 적응 저수준 VLA는 RoboTwin 2.0 50과제 평균 성공률 86.20%, LIBERO 네 스위트 평균 97.40%를 보고합니다. 메모리 의존 RMBench 네 과제에서는 평균 12.5%입니다. 오늘 팀은 “정책 점수”와 “실행 전후 검증 로그”를 제출 문서에 나눕니다.

스킬 실행 전후를 검증하는 VLA 에이전트 틀을 둡니다

논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.01281에서 확인할 수 있습니다. 영문 제목은 EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents입니다. 저자는 Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin 외입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

스킬을 실행 제안으로 다룹니다

VLA는 시각 관찰과 언어 지시를 로봇 행동으로 바로 매핑합니다. 긴 horizon 과제에서는 인식·계획·실행·진행 검증·복구를 물리 상태가 바뀔 때마다 조율해야 합니다. 행동 예측이나 모델이 고른 스킬만으로는, 지금 상태에서 그 연산이 유효한지·결과가 검증되는지 보장되지 않습니다.

EmbodiedSkills는 각 스킬 결정을 실행 제안으로 봅니다. 런타임이 실행 전 사전조건을 확인하고, 실행 후 결과를 검증합니다. 공유 executable-skill 인터페이스가 고수준 스킬 선택, 범위 한정 저수준 VLA 실행, 사후 검증을 한 에이전트 루프에 연결합니다. 인터페이스가 고정되어 있으면 저수준 VLA를 바꿔도 에이전트 루프는 유지됩니다.

계획·실행·검증·복구 사건을 구조화 궤적으로 남겨 부품별 감독과, 상호작용 피드백이 있을 때 선택적 온라인 적응에도 쓸 수 있다고 적습니다.

보고된 성공률만 옮깁니다

인스턴스는 Qwen3-VL 기반 에이전트 구성 요소와 OpenPI/π0.5 저수준 VLA입니다. 과제 적응 저수준 VLA 정책은 RoboTwin 2.0 50과제에서 평균 성공률 86.20%로, LingBot-VA가 보고한 π0.5 참고 82.74%를 웃돈다고 적습니다. LIBERO-Spatial·Object·Goal·Long 네 스위트 평균은 97.40%이고, 공식 OpenPI 참고 96.85%와 비교합니다.

이 숫자는 EmbodiedSkills에 쓰인 과제 적응 저수준 실행 성능을 확정하는 보고입니다. 메모리에 의존하는 RMBench 네 과제에서는 같은 과제 적응 실행 접근이 평균 12.5% 성공에 그칩니다. 장기 기억·조건부 서브태스크가 필요한 구간은 아직 어렵다는 신호로 읽습니다.

로봇 데모 영만 올리고 검증 로그를 비우지 마십시오. DAKER·DACON 제출에도 사전조건 통과/실패와 사후 검증 결과를 표로 둡니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 VLA 체크포인트를 “만능 컨트롤러”로 쓰지 않고, 스킬 단위 사전·사후 검증을 코드로 남기는 것입니다. 스킬 스키마, 필요 아티팩트, 허용 전이, 실패 시 복구 스킬을 YAML이나 동등한 선언으로 적습니다.

저수준 정책을 교체할 계획이 있으면, 에이전트 루프와 정책 가중치 경로를 분리합니다. 루프를 다시 짜지 않고 정책만 바꿀 수 있는지 확인합니다. 구조화 궤적 로그를 다른 사람이 열 수 있는 주소에 올립니다.

성공률을 README에 쓸 때는 RoboTwin·LIBERO·RMBench를 한 평균으로 섞지 않습니다. 벤치별로 줄을 나눕니다. 배포가 제출입니다. 올린 링크가 제출입니다.

시뮬레이션과 실기를 섞는 팀이면, 어느 숫자가 시뮬인지 명시합니다. 카메라·캘리브레이션·랜덤 시드를 같이 적습니다.

도구 권한과 공유 상태를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. 프롬프트에 장비 자격 증명을 넣지 않습니다.

검증 로그를 성공률과 같이 남깁니다

EmbodiedSkills의 핵심 문장은 “스킬 결정은 실행 제안”입니다. 빌더 팀은 스킬 JSON에 사전조건, 필요 아티팩트, 허용 상태 전이, 사후 검증 함수, 실패 시 복구 스킬을 필수로 둡니다. 고수준 모델이 스킬 이름을 말해도, 런타임이 거절할 수 있어야 합니다.

RoboTwin 2.0 평균 86.20%와 LIBERO 평균 97.40%는 과제 적응 저수준 VLA 실행 성능을 보여 주는 숫자입니다. RMBench 메모리 의존 과제 12.5%는 같은 접근이 기억·조건부 서브태스크에서 아직 약하다는 신호입니다. 세 숫자를 하나의 “로봇 성공률”로 합치지 마십시오. README에 벤치별 줄로 나눕니다.

저수준 정책을 OpenPI/π0.5에서 다른 체크포인트로 바꿀 계획이 있으면, AgentLoop 인터페이스가 그대로인지부터 확인합니다. 루프를 다시 짜지 않고 정책 경로만 바꾸는 것이 이 프레임워크의 설계 의도입니다. 구조화 궤적(계획·실행·검증·복구)을 파일로 내보내 재현 가능하게 합니다.

시뮬 데모만 올릴 때는 실기 미사용을 한 줄로 명시합니다. 카메라 위치, 랜덤 시드, 과제 ID 목록을 같이 적습니다. DAKER 해커톤에서 로봇·시뮬 과제를 넣을 때도 “배포가 제출입니다” 원칙을 지킵니다. 올린 링크가 제출입니다.

이 글이 아닌 것입니다

모든 로봇 벤치에서 90%대라는 주장이 아닙니다. RoboTwin·LIBERO는 높고, RMBench 메모리 과제는 12.5%입니다.

Qwen3-VL 가중치를 이 논문이 새로 공개한다는 뜻이 아닙니다. 프레임워크 인스턴스에 쓰였다는 보고입니다.

사전·사후 검증이 실기 안전을 보증한다는 약속이 아닙니다. 실행 제안 검사·결과 검증 설계 설명입니다.

특정 대회 우승 공지가 아닙니다. VLA 오케스트레이션 방법 안내입니다.

86.20%와 97.40%가 프레임워크 없이 나온 숫자와 직접 치환된다는 확장이 아닙니다. 과제 적응 저수준 정책 보고입니다.

Qwen3-VL과 OpenPI/π0.5 조합을 재현하지 않더라도, “고수준 선택 / 저수준 실행 / 사후 검증” 세 모듈 경계는 그대로 가져올 수 있습니다. 각 모듈의 입출력 스키마를 한 페이지로 적습니다. 사전조건 실패와 사후 검증 실패를 서로 다른 오류 코드로 남기면, 나중에 어느 층이 약한지 집계하기 쉽습니다.

RoboTwin 50과제·LIBERO 네 스위트·RMBench 네 과제를 우리 데모 과제 목록과 1:1로 대응시키지 마십시오. 벤치 이름은 출처 인용용이고, 우리 과제 ID는 별도 열입니다. DAKER 제출 페이지에는 궤적 로그 샘플 3개를 공개 링크로 올립니다. 배포가 제출입니다. 올린 링크가 제출입니다.

성공률 표를 그릴 때는 π0.5 참고 82.74%와 OpenPI 참고 96.85%를 우리 실측 열에 넣지 않습니다. 출처 열에만 두고, 우리 열은 비우거나 자체 측정만 적습니다. 에이전트 루프 버전과 저수준 정책 버전을 시맨틱 버전으로 고정하면, 나중에 어떤 조합이 86.20%·97.40% 구간에 가까웠는지 추적하기 쉽습니다. DAKER와 DACON 모두 재현 가능한 주소에 명세를 올립니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.01281pdf를 엽니다.

둘째, 스킬 스키마 초안을 만드십시오. 사전조건·사후검증·복구를 표로 적습니다.

셋째, 저수준 정책 경로와 에이전트 루프를 분리하십시오. 교체 가능한지 확인합니다.

넷째, RoboTwin·LIBERO·RMBench 숫자를 벤치별로 인용하십시오. 우리 실측과 섞지 않습니다.

다섯째, 구조화 궤적 로그 형식을 README에 남기십시오.

여섯째, 시뮬/실기·시드·카메라 설정을 명시하십시오.

일곱째, 명세와 로그를 공개 링크로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.01281 — EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents (2026-09-01) · PDF