로봇 표현을 먼저 키운 뒤 VLA를 이어 학습합니다 | DAKER 커뮤니티

2026년 8월 27일 Senqiao Yang 연구팀이 과제별 파인튜닝 전에 다중 신체 로봇 데이터로 표현 중심 이어 사전학습을 하는 VLAct를 arXiv에 공개했습니다. 범용 Vision-Language-Action(VLA)에는 로봇 데이터 확장이 중요하지만, 로봇 궤적은 웹 규모 이미지·텍스트보다 모으기 어렵고 물리 세계를 듬성듬성 덮습니다. 고정된 로봇 데이터 예산에서는 이어 사전학습이 행동을 맞추는 데 그치지 않고 전이 가능한 시각·행동 지식으로 바꿔야 합니다. VLAct는 넓은 VLM 사전을 지키면서 다중 헤드 연속 행동 공동 감독과 부분 통합 교차 신체 행동 배치로 공유 행동 의미를 키웁니다.

로봇 표현을 먼저 키운 뒤 VLA를 이어 학습합니다

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27550에서 확인할 수 있습니다. 저자는 Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia입니다. PDF는 같은 번호의 pdf입니다. 모델과 학습 파이프라인은 https://starvla.github.io/VLAct에 공개되어 있습니다. 오늘 본문은 초록이 적은 범위만 옮깁니다.

로봇 표현을 먼저 키운 뒤 VLA를 이어 학습합니다 장면

데이터 확장만으로 충분하지 않습니다

로봇 데이터 확장은 범용 VLA에 중요합니다. 로봇 궤적은 웹 규모 이미지·텍스트보다 수집 비용이 크고 물리 세계를 듬성듬성 덮습니다. 고정 예산에서는 표현 품질이 병목이 됩니다. 이어 사전학습은 제한된 궤적을 전이 가능한 시각·행동 지식으로 바꿔야 하며, 행동에만 맞추면 부족합니다.

VLAct는 과제별 파인튜닝 전에 넓고 이질적인 다중 신체 로봇 데이터로 학습한 VLA 지향 VLM 백본입니다. VLM 사전 보존, 다중 헤드 연속 행동 공동 감독, 부분 통합 교차 신체 행동 배치로 신체 간 공유 행동 의미를 키우고, 파인튜닝 단계에서는 과제별 행동 헤드를 허용합니다. 시뮬레이션·실세계·미본 신체 전이에서 고정 파인튜닝 프로토콜 아래 하류 성능이 일관되게 오른다고 보고합니다.

DACON과 DAKER처럼 팀이 제한된 데모로 로봇·에이전트 스택을 올리는 자리에서는, “데이터만 더 모으기”와 “표현 중심 이어 사전학습”을 같은 칸에 두지 말아야 합니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 파인튜닝 전에 표현 예산을 따로 잡으십시오.

보고된 성공률을 그대로 옮깁니다

LIBERO-Plus에서 성공률 82.6%, RoboTwin 2.0에서 92.5%를 달성하며 ABot-M0와 LingBot-VLA를 포함한 산업 VLA 시스템을 앞선다고 적습니다. RoboDojo에서는 성공률 기준 전체 정책 중 6위이며, 명시적으로 지정된 월드-행동 모델(WAM) 항목을 두 지표 모두에서 앞선다고 합니다. 가장 눈에 띄는 결과는 미본 휴머노이드 설정 RoboCasa-GR1에서, 하류 궤적의 20%만으로 전체 데이터 GR00T-N1.6 베이스라인을 이긴다는 보고입니다.

이 결과는 완전 오픈소스 데이터와 16-GPU 학습 설정에서 나왔다고 적습니다. 표현 중심 이어 사전학습이 modest한 계산에서도 경쟁력 있는 성능을 낼 수 있고, 데이터 확장과 별개인 VLA 진전 축이라는 주장입니다. 없는 순위를 추가하지 않습니다. 초록 숫자만 옮깁니다.

빌더 팀에 옮기면 세 줄입니다. 첫째, 파인튜닝 프로토콜을 고정한 뒤 백본만 바꿉니다. 둘째, 교차 신체 데이터 구성과 행동 레이아웃을 표로 남깁니다. 셋째, 데이터 비율 실험(예: 20%)을 같은 표에 둡니다. 해커톤 README에 이 세 칸이 없으면 재현이 어렵습니다.

VLM 사전을 지키며 행동을 공동 감독합니다

VLAct는 넓은 VLM 사전을 보존한다고 적습니다. 로봇 데이터만으로 사전을 덮어쓰면 일반 시각·언어 지식이 무너질 수 있습니다. 다중 헤드 연속 행동 공동 감독과 부분 통합 교차 신체 행동 배치는 신체마다 다른 행동 공간을 어느 정도 공유 의미로 묶습니다. 파인튜닝에서는 과제별 헤드를 허용합니다.

DAKER 제출에서는 사전학습 데이터 출처, 보존 손실, 행동 헤드 구성을 한 페이지에 둡니다. “VLA 파인튜닝만” 적힌 문서는 표현 축을 비운 것과 같습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

16-GPU와 오픈소스 데이터라는 조건은, 대형 비공개 스택만 가능하다는 인식을 흔듭니다. 우리 팀 예산과 같다고 쓰지 않습니다. 대신 “표현 사전학습 예산”과 “하류 파인튜닝 예산”을 표에서 분리합니다.

미본 신체 전이를 따로 재십시오

RoboCasa-GR1 결과는 미본 휴머노이드에서 하류 데이터의 20%만으로 전체 데이터 베이스라인을 이긴다는 보고입니다. 팀이 오늘 설계하는 전이 실험에도 “신체 본 적 없음”과 “데이터 비율”을 칸으로 둡니다. 본 신체 성공률만 보고 전이를 선언하지 마십시오.

RoboDojo 6위와 WAM 항목 대비 우위는 성공률·지표 맥락에서만 옮깁니다. 전체 대회 우승으로 바꾸어 쓰지 않습니다. LIBERO-Plus 82.6%와 RoboTwin 2.0 92.5%도 초록 표기 그대로 둡니다.

팀이 오늘 할 일은 프로젝트 페이지와 초록을 같은 탭에 두고, 오픈 데이터·16-GPU·고정 파인튜닝 프로토콜을 체크리스트로 옮기는 것입니다. 체크리스트가 공개 주소에 있을 때 재현이 성립합니다.

데이터 확장과 표현 중심 이어 사전학습을 둘 다 적습니다. 하나만 고르는 문장은 초록의 “independent axis” 주장을 한쪽만 남겨 자릅니다. 두 축을 표의 두 열로 두십시오.

표현 중심 이어 사전학습 체크리스트에는 다중 신체 데이터 비율, 보존 손실 가중치, 행동 헤드 수, 부분 통합 레이아웃 설명을 넣습니다. 파인튜닝 체크리스트에는 과제 이름, 데이터 비율, 학습률, 평가 프로토콜을 넣습니다. 두 체크리스트를 한 README에 섞지 마십시오.

LIBERO-Plus 82.6%와 RoboTwin 2.0 92.5%를 인용할 때는 항상 arXiv:2608.27550을 같이 적습니다. 우리 실측처럼 보이면 안 됩니다. ABot-M0·LingBot-VLA를 앞섰다는 문장도 초록 범위에서만 씁니다.

RoboDojo 6위는 성공률 기준 전체 정책 중 순위입니다. WAM으로 지정된 항목 대비 우위와 혼동하지 마십시오. 제출 문서에 “6위=우승”으로 바꾸어 쓰지 않습니다.

20% 데이터로 GR00T-N1.6 전체 데이터를 이긴 결과는 미본 휴머노이드 RoboCasa-GR1 설정입니다. 다른 신체·다른 베이스라인에 일반화한다고 적지 않습니다. 우리 실험 계획에도 신체·비율·베이스라인을 세 칸으로 고정합니다.

16-GPU와 오픈소스 데이터 조건을 팀 예산 표에 옮길 때는 GPU 종류와 데이터 라이선스를 명시합니다. “16-GPU”만 적고 기종을 비우면 재현이 실패합니다. 프로젝트 페이지의 공개 범위를 먼저 확인하십시오.

교차 신체 전이 표를 만들 때 학습에 본 신체와 평가 신체를 행·열로 둡니다. 대각선만 보고 범용이라고 적지 않습니다. 초록의 미본 휴머노이드 결과는 그 표의 비대각 칸에 해당합니다. 우리 표에도 비대각 칸을 비우지 말고 실험 계획을 적습니다.

이 글이 아닌 것입니다

데이터만 늘리면 된다는 처방이 아닙니다. 고정 예산에서 표현 품질 병목과 이어 사전학습 축을 말합니다.

모든 벤치에서 1등이라는 주장이 아닙니다. RoboDojo는 성공률 기준 6위입니다. 순위를 과장하지 않습니다.

비공개 대량 GPU가 필수라는 주장도 아닙니다. 오픈소스 데이터와 16-GPU 설정을 강조합니다.

특정 회사 제품 출시 공지가 아닙니다. 연구 논문과 공개 프로젝트 안내입니다.

20% 데이터가 항상 충분하다는 보편 법칙도 아닙니다. RoboCasa-GR1 미본 휴머노이드 설정에서의 보고입니다. 우리 로봇과 같다고 쓰지 않습니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.27550pdf를 같은 탭에 둡니다. 제출일 2026-08-27을 메모 첫 줄에 적습니다.

둘째, 프로젝트 페이지를 북마크하십시오. starvla.github.io/VLAct에서 모델·파이프라인 공개 범위를 확인합니다.

셋째, 표현 사전학습 예산과 파인튜닝 예산을 표로 나누십시오. DAKER 로봇·에이전트 해커톤이나 내부 데모에 맞춰 적습니다.

넷째, 고정 파인튜닝 프로토콜을 문서화하십시오. 백본만 바꿀 때 프로토콜이 흔들리지 않게 합니다.

다섯째, 교차 신체 데이터 구성과 행동 레이아웃을 적으십시오. VLM 사전 보존 손실이 있는지도 한 줄로 남깁니다.

여섯째, 미본 신체·데이터 비율 실험을 계획하십시오. 초록의 20% 보고를 우리 숫자로 바꾸지 말고 같은 형식의 칸만 복제합니다.

일곱째, 체크리스트와 학습 설정을 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.27550 — VLAct (2026-08-27) · PDF · Project