68만 파라미터로 언어 조건 로봇 조작을 돌립니다 | DAKER 커뮤니티
2026년 8월 27일 Hiroki Sawada, Shunichi Kasahara 연구팀이 68만 개의 학습 가능 파라미터로 언어 조건 로봇 조작을 수행하는 PredVLA를 arXiv에 공개했습니다. 큰 사전 학습 비전-언어-행동 모델이 현대 조작 벤치를 주도하지만, 강한 언어 조건 제어에 모델 규모가 얼마나 필요한지, 다른 제어 구조가 훨씬 작은 예산에서도 경쟁할 수 있는지는 여전히 열려 있습니다. PredVLA는 로봇 데이터 사전 학습 없이, 예측 코딩 기반 계층적 생성 순환 동역학으로 그 질문에 답합니다.
논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.26673에서 확인할 수 있습니다. 저자는 Hiroki Sawada, Shunichi Kasahara입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 초록이 적은 숫자만 옮깁니다. 초록에 없는 벤치 점수는 쓰지 않습니다.
작은 순환 정책으로 언어 조건 조작을 합니다
PredVLA는 언어 조건 예측 코딩 정책입니다. 학습 가능 네트워크 파라미터는 0.68백만 개이며, 로봇 데이터 사전 학습을 쓰지 않습니다. 계층적 생성 순환 동역학이 시각 특징과 고유수용 감각을 예측하고, 관측은 감각 예측 오차로부터의 온라인 추론을 통해서만 잠재 상태에 영향을 줍니다. 큰 모델을 Fine-tune하는 경로와 달리, 작은 순환 생성 정책의 구조를 전면에 둡니다.
해커톤 로봇 트랙에서 큰 VLA만 고집하면 학습·추론 비용이 먼저 한계에 닿습니다. 오늘 글이 팀에 남기는 한 줄은 이것입니다. 파라미터 예산을 먼저 적고, 같은 프론트엔드·데모·디코더 조건에서 작은 순환 정책을 비교하십시오.
DACON과 DAKER처럼 재현이 중요한 자리에서는, “크다”는 말이 곧 “낫다”는 말이 되지 않습니다. 규모를 주장하려면 통제된 비교가 필요합니다. PredVLA는 그 비교를 초록에 명시합니다.
LIBERO에서 보고된 성공률을 그대로 옮깁니다
LIBERO에서 PredVLA는 세 개의 단기 호라이즌 스위트 평균 성공률 86.9%를 기록했습니다. 장기 호라이즌 스위트를 포함하면 75.4%입니다. 이 두 숫자만 본문에 씁니다. 스위트 이름 목록이나 과제별 점수를 지어내지 않습니다. 팀이 받을 문장은 범위입니다. 단기만 보면 더 높고, 장기를 넣으면 낮아집니다. 평가 범위를 밝히지 않은 채 높은 숫자만 인용하지 마십시오.
빌더 보고서에 숫자를 옮길 때는 조건 문장을 같이 붙입니다. 0.68백만 파라미터, 로봇 데이터 사전 학습 없음, LIBERO, 단기 세 스위트 평균 86.9%, 장기 포함 75.4%. 조건이 빠지면 큰 모델 점수와 섞여 읽힙니다. 섞인 인용은 제출 설명에서 바로 문제가 됩니다.
장기 호라이즌에서 숫자가 내려가는 현상은 실패를 숨기지 말라는 신호이기도 합니다. 단기만 데모하고 장기를 빼는 보고는 초록의 두 숫자를 반만 쓰는 일입니다. 두 숫자를 나란히 두십시오.
같은 조건에서 Transformer·LSTM보다 앞섭니다
동결된 프론트엔드, 데모, 동작 디코더, 평가 절차를 맞춘 통제 비교에서 PredVLA는 파라미터 정합 Transformer 대비 평균 성공률 3.7배, 파라미터 정합 LSTM 대비 7.4배를 기록했습니다. 배수는 초록이 준 값입니다. 절대 점수를 추가로 만들지 않습니다. 팀이 받을 경고는 이것입니다. 같은 예산을 써도 구조가 다르면 결과가 크게 달라질 수 있습니다.
비교가 성립하려면 프론트엔드와 디코더를 같이 고정해야 합니다. 한쪽만 바꾸고 배수로 선전하면 초록의 통제 조건을 깬 요약이 됩니다. 해커톤 실험 일지에 “동결 모듈 목록”을 먼저 적으십시오. 목록이 없는 배수 인용은 쓰지 않습니다.
작은 모델이 이겼다고 해서 큰 VLA가 필요 없다는 결론으로 비약하지 않습니다. 초록의 질문은 규모가 얼마나 필요한지, 다른 구조가 작은 예산에서 경쟁할 수 있는지입니다. 우리 과제에서도 같은 질문을 표로 남기면 됩니다. 없는 벤치 점수를 채우지 않습니다.
예측 오차 추론이 관측 수정의 핵심입니다
예측 코딩 형식은 관측 기반 수정의 기여를 직접 측정하게 합니다. 관측이 잠재 상태에 영향을 주는 경로가 감각 예측 오차로부터의 온라인 추론뿐이기 때문입니다. 그 추론을 끄면 정확한 개방 루프 조건이 됩니다. 개방 루프와 닫힌 루프를 같은 정책에서 비교할 수 있다는 점이 이 구조의 실용 값입니다.
로봇 조작에서 개방 루프는 초기 계획만으로 동작을 밀어 붙이는 설정에 가깝습니다. 예측 오차 추론을 켜면 감각 불일치를 보며 상태를 고칩니다. 팀이 디버깅할 때 이 스위치를 남기면, 실패가 모델 용량 문제인지 온라인 수정 문제인지 가리기 쉽습니다. 스위치 없는 로그는 원인 분석을 막습니다.
백만 파라미터 미만의 순환 생성 정책이 현대 언어 조건 조작 벤치에서 강할 수 있다는 초록의 정리는, 구조 실험에 예산을 남기라는 뜻으로 읽힙니다. 큰 체크포인트만 받는 팀도, 작은 순환 기준선을 하나 두십시오. 기준선이 없으면 규모 논의가 구호로 끝납니다.
작은 정책 실험도 공개 기록으로 남깁니다
0.68백만 파라미터 정책이 가치가 있으려면 학습 설정과 평가 범위가 주소가 있는 문서여야 합니다. 채팅에만 남은 86.9%는 다음 주 팀이 재현하지 못합니다. 해커톤 기간이 짧을수록 이 습관이 빨리 무너집니다. 설정 문장은 짧게 쓰되, 파라미터 수와 사전 학습 여부와 평가 스위트 범위를 빠뜨리지 마십시오.
통제 비교 표에는 Transformer와 LSTM 파라미터 수도 같이 적습니다. “정합”이라고만 쓰고 숫자를 비우면 배수를 검증할 수 없습니다. 초록이 배수를 준 만큼, 우리 재현에서도 예산 정합을 증명할 자료를 남기십시오. 증명 없는 배수는 제출 설명에 쓰지 않습니다.
예측 오차 추론을 끌 때는 한 번의 실패를 일반 규칙으로 바로 올리지 마십시오. 같은 과제에서 한 번 더 확인하거나, 사람이 로그를 본 뒤에 개방 루프 기본값으로 올리십시오. 확인 없이 끈 추론은 정상 수정도 제거합니다. 해커톤처럼 시간이 짧은 자리일수록 이 절제가 필요합니다. 실험 표에 날짜와 확인자를 남기면, 나중에 그 설정을 되돌릴 수 있습니다.
큰 VLA 로그만 남기고 작은 정책 비교를 지우지 마십시오. 지으면 규모 논의의 기준선이 사라집니다. 이 논문이 통제 비교를 강조한 이유를 운영에서도 지키십시오. 공개 저장소에서는 동결 모듈 목록과 배수 표가 다음 기여자의 읽기 시작점입니다. 내부 채팅에만 남긴 숫자는 제출이 아닙니다.
다른 팀의 PredVLA 재현을 받을 때도 같은 절제를 유지하십시오. 가중치만 복사하고 평가 스위트 정의를 비우면, 86.9%와 75.4%를 다시 해석할 수 없습니다. 가중치와 평가 스크립트와 조건 표를 같이 받으십시오. 빈 조건 표 위의 가중치는 비교 가능한 정책이 아닙니다.
단기 성공률만 데모에 쓰지 마십시오. 장기 포함 75.4%를 옆에 두어야 범위가 보입니다. 범위 없는 데모는 초록을 반만 인용한 자료입니다. DAKER 커뮤니티에 올릴 때도 두 숫자를 같은 문단에 두십시오.
관측이 예측 오차 경로로만 상태를 고친다는 문장은 구현 체크리스트가 됩니다. 관측을 다른 우회 경로로 잠재 상태에 직접 넣고 있다면, 그 설정은 이 논문이 측정 가능하다고 한 조건을 깬 변형입니다. 변형을 쓸 때는 이름을 바꿔 적으십시오. 같은 이름에 다른 경로를 숨기지 않습니다.
오늘 팀이 큰 모델만 받고 작은 순환 기준선을 비우면, 내일 규모 논쟁에 숫자 근거가 없습니다. 그 순환을 끊는 일이 이 글을 읽는 이유입니다. 파라미터 정합 비교를 먼저 두십시오.
0.68백만 파라미터 기준선과 개방 루프 스위치를 오늘부터 적용하십시오.
파라미터 0.68백만은 “작다”는 인상만으로 다루지 마십시오. 학습 가능 파라미터가 어디에 쓰이는지, 동결 프론트엔드가 따로 있는지를 같이 적어야 예산 비교가 됩니다. 프론트엔드 용량을 숨긴 채 0.68백만만 강조하면 통제 비교를 흐립니다. 조건 표에 동결 모듈 용량을 별도 열로 두십시오.
언어 조건 조작에서는 지시 문장 분포가 성공률을 바꿉니다. 짧은 지시만으로 86.9%를 이야기하고, 긴 지시 실패를 빼면 범위가 왜곡됩니다. 우리 평가에도 지시 길이 구간을 한 열로 남기십시오. 초록 숫자를 인용할 때는 평가 프로토콜을 같이 읽습니다.
순환 동역학은 시간에 따른 상태 전달이 핵심입니다. 배치 학습에서만 잘 되고 온라인에서 붕괴하면 조작 현장에서는 쓸 수 없습니다. 학습 곡선과 온라인 롤아웃 실패를 같은 폴더에 두십시오. 학습 손실만으로 배포 결정을 내리지 않습니다.
3.7배와 7.4배는 평균 성공률 배수입니다. 분산이나 과제별 편차를 초록이 본문에 주지 않았다면 만들어 넣지 않습니다. 우리 재현에서 편차가 크면 그 사실만 적고, 초록 배수와 같다고 단정하지 마십시오. 단정은 제출 설명의 신뢰를 깎습니다.
로봇 데이터 사전 학습이 없다는 설정은 데이터 접근이 제한된 팀에 특히 중요합니다. 공개 데모만으로도 작은 정책이 경쟁할 수 있는지 묻는 실험이 됩니다. 사전 학습 가중치를 몰래 섞고 같은 이름을 쓰지 마십시오. 섞었다면 실험 이름을 바꾸어 적습니다.
데모 영상 썸네일에 86.9%만 크게 쓰지 마십시오. 75.4%와 파라미터 수, 사전 학습 없음을 같은 프레임에 넣어야 과장 인용을 줄입니다. DAKER 커뮤니티 이미지 규칙과도 맞습니다. 숫자 하나만 남은 썸네일은 오해를 만듭니다.
이 글이 아닌 것입니다
큰 VLA 폐기 선언이 아닙니다. 초록은 작은 예산에서도 다른 구조가 경쟁할 수 있는지 묻습니다. 모든 큰 모델을 끄라는 처방이 아닙니다.
과제별 점수표가 아닙니다. LIBERO 단기 평균 86.9%와 장기 포함 75.4%, 통제 비교 배수 3.7배·7.4배만 적습니다. 없는 과제 점수를 지어내지 않습니다.
로봇 데이터 사전 학습이 항상 해롭다는 글도 아닙니다. 이 모델이 사전 학습 없이 학습했다는 범위만 있습니다. 사전 학습을 금지하는 일반 규칙으로 바꾸지 않습니다.
특정 회사 제품 출시 공지가 아닙니다. 연구 논문입니다. 로봇 플랫폼이 오늘 이 기능을 켰다고 적힌 글이 아닙니다. 제품 로드맵에 이 제목을 그대로 옮기지 않습니다.
개방 루프만으로 충분하다는 이야기도 아닙니다. 예측 오차 추론을 끄면 개방 루프가 된다는 측정 설계입니다. 추론을 끄고 배포하라는 뜻이 아닙니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.26673와 pdf를 같은 탭에 둡니다. 요약 카드만 보고 배수를 인용하지 않습니다. 저자 두 이름과 제출일 2026-08-27을 메모 첫 줄에 적습니다.
둘째, 파라미터 예산과 동결 모듈 목록을 한 페이지에 적으십시오. 프론트엔드·데모·디코더·평가 절차를 맞춘 뒤에 비교를 시작합니다. 목록 없는 배수는 쓰지 않습니다.
셋째, 해커톤 조작 과제 하나를 골라 작은 순환 정책을 기준선으로 두십시오. DAKER 월간 해커톤이나 로봇 트랙 가운데 하나를 고릅니다. 성공 여부와 실패 유형만 적습니다. 없는 퍼센트를 채우지 않습니다.
넷째, LIBERO 숫자를 인용할 때 86.9%와 75.4%를 같이 적으십시오. 단기만 골라 쓰지 않습니다. 평가 범위 문장을 숫자 옆에 붙입니다.
다섯째, 예측 오차 추론 on/off 비교를 한 번 돌리십시오. 끈 설정이 개방 루프임을 로그에 명시합니다. 초록의 측정 설계를 우리 과제에 옮기는 최소 실험입니다.
여섯째, 파라미터 정합 Transformer·LSTM 기준선을 같은 조건으로 돌리십시오. 3.7배·7.4배는 초록 결과입니다. 우리 과제에서 같은 배수가 나온다고 단정하지 말고, 우리 표의 성공률만 적습니다.
일곱째, 만든 조건 표와 기준선 체크포인트를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.