계획은 VLM에 두고 동작은 월드모델 제어기에 맡깁니다 | DAKER 커뮤니티

2026년 8월 27일 Zineng Tang 연구팀이 계획은 VLM에 두고 동작은 월드모델 제어기에 맡기는 Instruct-to-Act를 arXiv에 공개했습니다. 사전 학습된 지시 튜닝 비전-언어 모델은 지시와 관측을 고수준 계획으로 잘 옮기지만, 낯선 환경에서 그 계획을 낮은 지연의 안정적인 동작 수열로 실현하는 데는 어려움을 겪습니다. 월드모델 제어기는 빠른 관측-동작 제어에 강하지만 열린 과제 안내가 부족합니다. Instruct-to-Act는 두 강점을 한 시스템으로 묶습니다.

계획은 VLM에 두고 동작은 월드모델 제어기에 맡깁니다

논문은 2026년 8월 27일 arXiv에 올라왔습니다. COLM 2026 학회 논문으로 실렸습니다. 초록은 arXiv:2608.26788에서 확인할 수 있습니다. 저자는 Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr입니다. PDF는 같은 번호의 pdf입니다. 프로젝트 페이지는 https://zinengtang.github.io/instruct-to-act/ 입니다. 오늘 본문은 초록이 적은 범위만 옮깁니다. 초록에 없는 벤치 이름과 퍼센트는 쓰지 않습니다.

계획은 VLM에 두고 동작은 월드모델 제어기에 맡깁니다 장면

계획과 제어를 나눕니다

Instruct-to-Act에서 VLM 플래너는 성긴 고수준 텍스트 지시를 만들고, 월드모델 제어기는 그 지시에 조건화된 채 높은 빈도로 스스로 동작합니다. 플래너는 지연이 더 크고 추상적인 문장을 내며, 제어기는 빠른 관측-동작 루프를 담당합니다. 한 모델이 계획과 저지연 동작을 동시에 떠안으면, 낯선 환경에서 둘 중 하나가 무너지기 쉽습니다. 역할을 나누면 각 모듈의 강점을 유지할 수 있습니다.

해커톤 로봇·에이전트 트랙에서도 같은 긴장이 있습니다. 큰 VLM에 모든 동작을 직접 생성하게 하면 반응이 늦고, 제어기만 돌리면 과제 목표가 흐려집니다. 오늘 글이 팀에 남기는 한 줄은 이것입니다. 계획 문장과 고빈도 제어기를 분리해 두고, 인터페이스를 텍스트 지시로 고정하십시오.

DACON과 DAKER처럼 재현 제출이 필요한 자리에서는, 분리 설계가 교체 실험으로 이어집니다. 플래너만 바꾸거나 제어기만 바꿀 수 있어야, 무엇이 성능을 바꿨는지 말할 수 있습니다. 한 덩어리 파이프라인은 그 비교를 막습니다.

합성 지시로 제어기를 언어에 맞춥니다

언어로 지시 가능한 제어기를 학습하기 위해, 제어기 정책 롤아웃의 구간을 합성 지시로 다시 라벨합니다. 그다음 행동 복제(BC) 목표와 기존 보상 최대화 목표, 월드모델링 목표를 함께 최적화합니다. 세 목표를 같이 두는 이유는 명확합니다. BC만 있으면 보상 신호가 약해질 수 있고, 보상만 있으면 언어 조건이 헐거워질 수 있으며, 월드모델이 없으면 빠른 제어의 예측 기반이 약해질 수 있습니다.

합성 지시 재라벨은 사람 주석을 모든 구간에 붙이지 않고도 언어 조건을 넣는 방법입니다. 다만 합성 문장의 품질을 점검하지 않으면 제어기가 잘못된 지시-동작 쌍을 학습합니다. 팀은 재라벨 샘플을 일부 열어 사람이 읽고, 이상 구간을 표로 남기십시오. 없는 정확도를 만들지 않습니다.

빌더 운영으로 옮기면 폴더를 셋으로 나눕니다. 롤아웃 원시 구간, 합성 지시 라벨, 학습 설정. 세 폴더를 한 커밋에 올리되 서로 덮어쓰지 마십시오. 지시 문장이 바뀌면 어떤 체크포인트인지 해시에 남깁니다.

일곱 환경에서 분리 설계를 검증합니다

평가는 일곱 개의 체현 환경에서 이뤄졌습니다. 그중 세 개는 다중 에이전트 환경으로, VLM 플래너가 언어로 조율하고 학습된 제어기가 액추에이터 역할을 합니다. 관측·동작 공간을 맞춘 조건에서, 분리 접근은 제어기만 쓰는 설정과 VLM이 동작을 직접 생성하는 설정보다 일관되게 앞섰습니다. 빠른 제어를 유지하면서, 서로 다른 사전 학습 VLM 플래너를 미세 조정 없이 교체할 수 있었습니다. 강한 VLA 및 다중 에이전트 RL 기준선과도 일곱 과제 중 여섯에서 경쟁력 있는 결과를 보였습니다.

팀이 받을 문장은 숫자 과장 없는 방향입니다. 분리하면 제어 속도를 지키면서 플래너를 갈아 끼울 수 있습니다. 미세 조정 없이 플래너를 바꾼다는 점은 해커톤에서 비용과 직결됩니다. 큰 VLM을 과제마다 다시 학습할 여유가 없을 때, 제어기를 고정하고 플래너만 바꾸는 실험이 성립합니다.

다중 에이전트 환경의 핵심은 언어 조율입니다. 플래너가 서로 문장으로 역할을 나누고, 제어기가 그 문장을 동작으로 옮깁니다. 조율 문장을 로그에 남기지 않으면 실패 원인이 계획인지 제어인지 가려지지 않습니다. DAKER 팀 제출에서는 조율 대화와 제어기 동작을 같은 타임라인에 두십시오.

플래너 교체와 기준선 비교를 기록합니다

미세 조정 없이 사전 학습 VLM 플래너를 교체할 수 있다는 결과는, 인터페이스가 텍스트 지시로 안정돼 있다는 뜻입니다. 인터페이스가 텐서 전용으로 묶여 있으면 플래너 교체마다 제어기를 다시 학습해야 합니다. 텍스트 지시를 계약으로 두면 실험 비용이 줄어듭니다. 계약 문장을 저장소에 짧게 적으십시오. 어떤 필드가 필수인지, 빈 지시일 때 제어기가 무엇을 하는지를 한 페이지에 남깁니다.

일곱 과제 중 여섯에서 강한 기준선과 경쟁했다는 문장은, 전승을 뜻하지 않습니다. 한 과제에서는 뒤처질 수 있습니다. 우리 과제에서도 승패를 과제별로 적고, 실패한 과제의 관측·동작 차이를 한 줄로 남기십시오. 없는 F1이나 퍼센트를 채우지 않습니다. 초록이 준 범위 안에서만 말합니다.

제어기만, 직접 VLM 동작 생성, 분리 시스템을 같은 관측·동작 공간에서 비교하는 표가 필요합니다. 공간을 맞추지 않은 비교는 초록의 조건을 깬 비교입니다. DACON 제출 설명에 그 조건을 명시하십시오.

지시-제어 계약을 공개합니다

분리 시스템이 가치가 있으려면 지시 문장이 공개 기록이어야 합니다. 채팅에만 남은 계획은 다음 팀원이 제어기에 넣지 못합니다. 해커톤 기간이 짧을수록 이 습관이 빨리 무너집니다. 지시 문장은 짧게 쓰되, 목표와 제약과 중단 조건을 빠뜨리지 마십시오. 세 항목이 한 페이지에 보이면 다음 제어기 실행이 그 페이지를 밟을 수 있습니다.

프로젝트 페이지와 논문 PDF를 같이 북마크하십시오. 구현 세부는 초록만으로 부족할 수 있습니다. 오늘 본문은 초록 범위만 옮기므로, 학습 하이퍼파라미터를 짐작해 쓰지 않습니다. 팀이 재현할 때는 PDF와 프로젝트 페이지를 직접 확인한 뒤에 설정을 복사하십시오.

합성 지시를 올릴 때는 한 번의 성공 구간을 일반 규칙으로 바로 올리지 마십시오. 같은 패턴이 한 번 더 보이거나, 사람이 확인한 뒤에 학습 데이터로 올리십시오. 확인 없이 올린 지시는 제어기를 잘못된 방향으로 고정합니다. 해커톤처럼 시간이 짧은 자리일수록 이 절제가 필요합니다. 라벨 파일에 날짜와 확인자를 남기면, 나중에 그 구간을 되돌릴 수 있습니다.

플래너 로그와 제어기 로그를 한 파일에 섞지 마십시오. 섞이면 계획 실패와 제어 실패를 동시에 흐리게 만듭니다. 이 논문이 역할을 나눈 이유를 운영에서도 지키십시오. 공개 저장소에서는 두 로그의 경로가 다음 기여자의 읽기 시작점입니다. 내부 채팅에만 남긴 지시는 제출이 아닙니다.

다른 팀의 제어기를 받을 때도 같은 절제를 유지하십시오. 가중치만 복사하고 지시 계약을 비우면, 플래너 교체 실험이 다시 비게 됩니다. 가중치와 지시 스키마와 비교 표를 같이 받으십시오. 빈 계약 위의 제어기는 지시 가능 제어기가 아닙니다.

오늘 팀이 계획과 제어를 한 모델에만 맡기면, 내일 플래너를 바꿀 때마다 전체를 다시 학습하게 됩니다. 그 순환을 끊는 일이 이 글을 읽는 이유입니다. 지시 계약을 먼저 고정하십시오.

VLM 플래너와 월드모델 제어기 분리를 오늘부터 적용하십시오.

체현 환경에서는 관측 지연과 동작 주파수가 계획 품질만큼 중요합니다. 플래너 문장이 좋아도 제어기가 늦게 반응하면 과제는 실패합니다. 분리 설계의 실용 값은 그 주파수를 지키면서 과제 안내를 유지하는 데 있습니다. 주파수 측정값을 한 줄로 남기십시오. 없는 벤치 점수를 대신 쓰지 않습니다.

다중 에이전트에서 언어 조율은 사람 팀의 역할 분담과 비슷합니다. 누가 무엇을 집고 누가 문을 여는지를 문장으로 남기지 않으면, 실패 후에 책임을 가릴 수 없습니다. 조율 문장을 타임스탬프와 함께 저장하십시오. 저장 없는 조율은 다음 라운드에 사라집니다.

VLA 기준선과 비교할 때는 관측·동작 공간을 맞춘 조건을 먼저 확인합니다. 공간을 맞추지 않은 채 이겼다고 쓰면 초록의 실험 조건을 깬 요약이 됩니다. 우리 표의 첫 열에 “공간 일치 여부”를 두십시오. 불일치면 그 행은 참고만 하고 본 비교에서 제외합니다.

월드모델링 목표는 제어기의 예측 품질을 받칩니다. 보상만 쫓고 월드모델을 끄면 빠른 제어가 불안정해질 수 있습니다. 반대로 월드모델만 키우고 언어 BC를 약하게 두면 지시 따르기가 헐거워질 수 있습니다. 세 목표의 가중치를 실험 일지에 남기십시오. 가중치 없는 재현은 재현이 아닙니다.

플래너를 교체할 때는 지시 문장 길이와 용어가 제어기 학습 분포와 맞는지도 봅니다. 너무 긴 계획이나 낯선 단어가 많으면 제어기가 지시를 무시하는처럼 보일 수 있습니다. 그 경우 제어기를 비난하기 전에 지시 분포를 먼저 점검하십시오. 점검 기록을 라벨 폴더에 붙입니다.

데모 영상을 올릴 때는 계획 문장 자막과 제어 주파수를 같이 넣으십시오. 영상만 있으면 분리 설계인지 단일 모델인지 시청자가 구분하지 못합니다. DAKER 커뮤니티 제출에서도 같은 자막 규칙이 읽기를 돕습니다. 자막 없는 데모는 재현 자료가 아닙니다.

이 글이 아닌 것입니다

특정 벤치 점수표가 아닙니다. 초록은 일곱 환경과 여섯 과제에서의 경쟁력을 적되, 과제별 퍼센트를 적지 않습니다. 오늘 본문에 없는 점수를 지어내지 않습니다. “우리 로봇 점수와 같다”고 바꾸어 쓰지 않습니다.

모든 과제에서 1등이라는 글도 아닙니다. 일곱 중 여섯에서 경쟁력 있다는 범위만 있습니다. 전승으로 요약하지 않습니다.

VLM을 버리라는 처방이 아닙니다. VLM은 플래너로 남습니다. VLM 없이 제어기만 쓰라는 운영은 이 논문의 주장이 아닙니다.

특정 회사 제품 출시 공지가 아닙니다. 연구 논문입니다. 로봇 플랫폼이 오늘 이 기능을 켰다고 적힌 글이 아닙니다. 제품 로드맵에 이 제목을 그대로 옮기지 않습니다.

사람 지시 없이 완전 자동만 하면 끝나는 이야기도 아닙니다. 합성 지시와 플래너 문장은 점검 대상입니다. 라벨을 열어보지 않으면 잘못된 조건이 고정됩니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.26788pdf를 같은 탭에 둡니다. 요약 카드만 보고 제어기를 나누지 않습니다. 저자 다섯 이름과 제출일 2026-08-27, COLM 2026을 메모 첫 줄에 적습니다.

둘째, 계획 모듈과 제어 모듈의 인터페이스를 텍스트 지시로 적으십시오. 필수 필드와 빈 지시 동작을 한 페이지에 남깁니다. 오늘 실행이 끝나면 지시 로그부터 저장하고, 그다음에 제어 로그를 저장합니다.

셋째, 해커톤 과제 하나를 골라 제어기만·VLM 직접 동작·분리 시스템을 같은 공간에서 비교하십시오. DAKER 월간 해커톤이나 체현 과제 가운데 하나를 고릅니다. 승패와 실패 유형만 적습니다. 없는 퍼센트를 채우지 않습니다.

넷째, 서로 다른 VLM 플래너 두 개를 미세 조정 없이 갈아 끼워 보십시오. 초록은 교체가 가능하다고 적습니다. 우리 과제에서 그런지 확인하는 표가 필요합니다.

다섯째, 합성 지시 재라벨 샘플을 사람이 일부 검수하십시오. BC·보상·월드모델 목표를 같이 쓰는 설정을 한 줄로 고정합니다. 검수자 이름을 라벨 파일에 남깁니다.

여섯째, 프로젝트 페이지를 북마크하십시오. https://zinengtang.github.io/instruct-to-act/ 와 우리 구현의 차이를 한 줄로 남깁니다. 차이만 적고 없는 점수를 붙이지 않습니다.

일곱째, 만든 지시 계약과 비교 표를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.26788 — Instruct-to-Act (2026-08-27) · PDF