한 정책으로 로봇과 휴머노이드와 손을 같이 다룹니다 | DAKER 커뮤니티

2026년 8월 26일 Xiaomi Embodied Intelligence Team과 University of Macau 연구진이 이종 신체 조작을 카메라 중심 공유 기하로 맞추는 UCAG-P를 arXiv에 공개했습니다. 범용 비전-언어-행동(VLA) 정책을 키울 때 병목은 신체화 데이터의 이질성입니다. 로봇 형태, 카메라 배치, 저수준 행동 공간이 서로 다릅니다. 기존에는 명시적 행동 리타깃팅, 인간-로봇 비디오 합성, 데이터셋별 적응 분기로 이 불일치를 다루어, 통합 정책의 공동 학습을 막았습니다. UCAG-P는 이종 데이터셋을 공유 기하 행동 공간으로 구조적으로 정렬합니다.

한 정책으로 로봇과 휴머노이드와 손을 같이 다룹니다

논문은 2026년 8월 26일 arXiv에 올라왔습니다. 초록은 arXiv:2608.26058에서 확인할 수 있습니다. 저자는 Xiaomi Embodied Intelligence Team, University of Macau, Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang 외 12명입니다. PDF는 같은 번호의 pdf입니다. 프로젝트 페이지는 https://public-bots.github.io/UCAG-P입니다. 오늘 본문은 초록이 적은 숫자와 범위만 옮깁니다.

한 정책으로 로봇과 휴머노이드와 손을 같이 다룹니다 장면

로봇별 명령이 아니라 카메라로 보이는 운동을 공유합니다

UCAG-P는 로봇 전용 명령을 공유 정책 타깃으로 두지 않습니다. 조작을 이미지·카메라 좌표계에서 관측 가능한 앵커 운동으로 표현합니다. 로봇 팔, 휴머노이드, 사람 손을 공통 행동 스키마의 다른 신체로 둡니다. 기하 조건 행동 변환기가 예측 운동과 목표 신체 기구학을 합쳐 실행 가능한 제어를 만듭니다.

분리된 구조 덕분에 공유 VLA 정책은 전이 가능한 조작 기하를 배우고, 신체별 제어 가능성은 변환기에 남습니다. 해커톤에서 팔·휴머노이드·핸드 데이터를 억지로 같은 조인트 명령으로 맞추면, 리타깃팅 오류가 정책 학습을 가립니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 공유 타깃을 카메라에서 보이는 운동으로 두고, 실행 변환은 신체별로 분리하십시오.

DACON·DAKER 빌더가 여러 시뮬레이터를 쓸 때도 같은 원칙이 필요합니다. 데이터셋별 적응 분기만 늘리면 통합 체크포인트가 사라집니다. UCAG-P는 그 분기를 줄이는 방향을 제시합니다.

학습 시간과 단일 체크포인트 숫자를 적습니다

UCAG-P는 로봇·시뮬레이션 데이터 4.03K시간과 인간 시연 2.34K시간으로 학습합니다. 단일 체크포인트가 벤치별 파인튜닝 없이 LIBERO 98.3%, RoboTwin Easy 88.7%, RoboTwin Hard 89.2%, LIBERO-Plus 제로샷 82.0%, RoboCasa GR-1 62.0%에 도달합니다. 이 숫자 외부를 짓지 않습니다.

README에는 초록 표와 우리 측정 표를 나눕니다. “단일 체크포인트”와 “벤치별 파인튜닝 없음”은 운영 문장으로 남길 가치가 있습니다. 해커톤에서 벤치마다 다른 가중치를 두면, 통합 정책인지 확인하기 어렵습니다. 오늘 실험 설계에 “파인튜닝 없이 평가” 행을 넣으십시오.

로봇·시뮬 4.03K시간과 인간 2.34K시간을 우리 데이터 규모와 같은 칸에 쓰지 않습니다. 우리 가용 시간을 다른 행에 적습니다. 없는 시간을 채우지 않습니다.

이질성을 구조로 정렬합니다

형태·카메라·저수준 행동이 다르면, 명시적 리타깃팅이나 합성 비디오, 데이터셋별 분기가 흔합니다. 초록은 이들이 통합 정책 공동 학습을 근본적으로 방해한다고 적습니다. UCAG-P의 카메라 중심 통일 행동 식은 그 방해를 구조적으로 줄입니다. 공유 공간은 기하이고, 실행은 변환기입니다.

빌더 팀에 옮기면 세 줄입니다. 첫째, 각 데이터셋의 카메라 좌표계와 앵커 정의를 표로 적습니다. 둘째, 공유 정책이 예측하는 운동 표현을 고정합니다. 셋째, 목표 신체 기구학을 넣는 변환기 입출력을 스키마로 남깁니다. 스키마 없이 “한 정책”이라고 적지 않습니다.

사람 손 시연을 넣을 때도 같은 스키마를 씁니다. 손을 로봇 조인트로 먼저 바꾸지 말고, 카메라에서 보이는 앵커 운동으로 맞춘 뒤 변환합니다. 순서를 바꾸면 다시 리타깃팅 병목이 납니다.

제로샷 행을 점검표에 둡니다

LIBERO-Plus 제로샷 82.0%는 “본 적 없는 변형에도 같은 체크포인트”를 점검하라는 신호입니다. 해커톤에서 학습 분포와 같은 장면만 보여 주고 성공을 말하면, 통합 기하 학습을 검증하지 못합니다. 오늘 체크리스트에 제로샷 또는 분포 외 장면 행을 추가하십시오.

RoboCasa GR-1 62.0%처럼 신체·과제가 다른 숫자도 같은 표에 두되, 평균 한 줄로 지우지 않습니다. 신체별로 칸을 나눕니다. 팔·휴머노이드·손을 한 문장으로 뭉개지 마십시오.

프로젝트 페이지 https://public-bots.github.io/UCAG-P 를 북마크하고, 우리 스키마와의 차이를 한 줄로 남깁니다. 차이만 적고 없는 점수를 붙이지 않습니다.

공유 기하 스키마를 공개합니다

통합 정책은 스키마가 공개되어 있을 때만 다른 팀이 재현합니다. 앵커 정의, 카메라 프레임 규약, 변환기 입출력을 저장소에 두십시오. 채팅에만 남긴 “카메라 중심”은 다음 제출자가 실행하지 못합니다.

다른 팀의 VLA를 받을 때도 리타깃팅·합성·분기·UCAG식 기하 정렬 중 어디에 해당하는지 분류합니다. 분류 없이 “한 정책”이라고 적지 않습니다.

오늘 팀이 데이터셋별 분기만 늘리면, 내일 단일 체크포인트 평가가 불가능합니다. 그 순환을 끊는 일이 이 글을 읽는 이유입니다. 공유 타깃을 카메라 관측 운동으로 두십시오.

벤치별 파인튜닝 없이 평가하는 행을 오늘 표에 추가하십시오.

형태·카메라·행동 공간을 표로 고정합니다

이질성의 세 축은 로봇 형태, 카메라 배치, 저수준 행동 공간입니다. 해커톤 데이터 카드에 이 세 축이 비어 있으면, UCAG-P가 푸는 문제를 우리 팀이 아직 정의하지 않은 것입니다. 오늘 각 데이터셋 행에 형태·카메라·행동 공간 칸을 채우십시오. 빈 칸이 있는 데이터는 통합 학습에 넣지 않습니다.

기하 조건 행동 변환기는 예측 운동과 목표 신체 기구학을 합칩니다. 변환기 없이 공유 정책 출력만 조인트에 직접 넣으면, 다시 로봇별 명령 공간으로 돌아갑니다. 스키마에 변환기 입출력을 의무 항목으로 두십시오. 입출력이 없는 PR은 머지하지 않습니다.

인간 시연 2.34K시간과 로봇·시뮬 4.03K시간을 한 평균으로 지우지 않습니다. 손 데이터를 넣을 때는 카메라 관측 앵커로 맞춘 뒤 변환하는 순서를 지킵니다. 조인트 리타깃팅을 먼저 하면 초록이 피하려는 병목이 돌아옵니다.

단일 체크포인트가 LIBERO 98.3%, RoboTwin Easy 88.7%, Hard 89.2%, LIBERO-Plus 제로샷 82.0%, RoboCasa GR-1 62.0%에 도달했다는 문장은 인용 표에만 둡니다. 벤치별 파인튜닝을 켠 우리 실험에 같은 숫자를 붙이지 않습니다. 파인튜닝을 켠 경우에는 그 사실을 표에 명시합니다.

프로젝트 페이지와 우리 저장소의 스키마 버전을 날짜로 맞춥니다. 버전이 다른데 “UCAG-P 따름”이라고만 적으면 리뷰가 멈춥니다. 차이 한 줄을 반드시 남기십시오.

통합 학습 전에 분기 목록을 줄입니다

데이터셋별 적응 분기가 이미 많다면, UCAG-P 실험을 시작하기 전에 분기 목록을 표로 공개하고 줄일 대상을 고릅니다. 분기를 숨긴 채 “한 정책”이라고 적으면 리뷰어가 재현하지 못합니다. 오늘 저장소에 adapters/ 또는 동등 경로가 있다면 파일 수를 세어 README에 남기십시오.

공유 기하 행동 공간으로 정렬한다는 문장은, 정렬 스크립트와 출력 스키마가 있을 때 검증됩니다. 스크립트 없이 개념만 옮긴 문장은 제출이 아닙니다. 정렬 전후 샘플을 각각 세 개 이상 공개 폴더에 두십시오. 샘플에는 카메라 프레임과 앵커가 보이게 합니다.

제로샷 LIBERO-Plus 82.0%를 인용할 때는 우리 평가가 제로샷인지 파인튜닝인지 한 단어를 같이 적습니다. 단어가 없으면 인용을 본문에서 빼십시오. 정확한 조건 없는 숫자 인용은 팀을 혼란스럽게 합니다.

오늘 팀이 형태·카메라·행동 공간 표를 비운 채 학습을 시작하면, 내일 단일 체크포인트 평가가 데이터셋 분기의 합으로 바뀝니다. 세 축 표를 먼저 채우고, 변환기 스키마를 공개한 뒤에 학습을 시작하십시오.

휴머노이드와 팔과 손을 한 정책으로 다룬다는 문장은, 공유 기하 스키마와 신체별 변환기가 모두 공개되어 있을 때만 검증됩니다. 한쪽만 있으면 통합이 아니라 분기입니다. 두 파일을 같은 릴리스 태그에 묶으십시오.

RoboTwin Easy 88.7%와 Hard 89.2%를 한 줄 평균으로 지우지 않습니다. Easy와 Hard를 칸으로 남기고, 우리 평가에도 난이도 칸을 두십시오.

LIBERO 98.3% 인용과 우리 LIBERO 실행을 같은 셀에 넣지 마십시오. 셀이 합쳐지면 파인튜닝 여부가 사라집니다. 인용 셀과 측정 셀을 나란히 두십시오.

이 글이 아닌 것입니다

조인트 리타깃팅 튜토리얼이 아닙니다. 초록은 명시적 리타깃팅·합성·분기와 구분해 카메라 중심 기하 정렬을 말합니다. “조인트만 맞추면 된다”로 바꾸어 쓰지 않습니다.

초록 밖 벤치 점수를 채운 글이 아닙니다. 4.03K·2.34K시간과 LIBERO·RoboTwin·LIBERO-Plus·RoboCasa GR-1 숫자만 옮깁니다.

모든 휴머노이드가 62%라는 일반화가 아닙니다. RoboCasa GR-1에서 보고한 수치입니다. 우리 실기 성공률과 같다고 쓰지 않습니다.

특정 회사 제품 출시 공지가 아닙니다. Technical Report와 프로젝트 페이지 안내입니다. 상용 로봇 OS 업데이트 공지가 아닙니다.

인간 시연만으로 로봇이 완성된다는 처방이 아닙니다. 로봇·시뮬 4.03K시간과 인간 2.34K시간을 같이 씁니다. 한쪽만으로 단정하지 않습니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.26058pdf를 같은 탭에 둡니다. 제출일 2026-08-26과 저자·팀 이름을 메모 첫 줄에 적습니다.

둘째, 프로젝트 페이지를 북마크하십시오. https://public-bots.github.io/UCAG-P와 우리 스키마 차이를 한 줄로 남깁니다.

셋째, 카메라 앵커·프레임 규약을 한 페이지로 쓰십시오. DAKER 또는 DACON에서 쓸 팔·휴머노이드·핸드 데이터에 맞춰 칸을 나눕니다.

넷째, 공유 정책 출력과 신체별 변환기 입출력을 스키마로 고정하십시오. 데이터셋별 적응 분기를 기본값에서 뺍니다.

다섯째, 초록 숫자 표와 우리 측정 표를 분리해 두십시오. 단일 체크포인트·파인튜닝 없음 조건을 우리 평가에도 표시합니다.

여섯째, 제로샷 또는 분포 외 장면 행을 점검표에 추가하십시오. 학습 장면만으로 성공을 단정하지 않습니다.

일곱째, 스키마·평가 표·차이를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.26058 — UCAG-P (2026-08-26) · PDF · Project