교차 신체 영상 월드모델로 물리 시뮬레이터를 만듭니다 | DAKER 커뮤니티

2026년 8월 27일 Kechen Liu와 Ola Shorinwa가 교차 신체 행동 조건 영상 생성으로 물리 시뮬레이터를 만드는 CLAP를 arXiv에 공개했습니다. 최신 행동 조건 비디오 모델은 보통 한 로봇 신체에만 묶여, 일반화 가능한 물리를 배울 신호가 있는 이종 영상 코퍼스를 쓰기 어렵습니다. CLAP는 사람과 로봇 에이전트가 섞인 인터넷 규모 영상으로 학습할 수 있는 교차 신체 프레임워크입니다. 핵심 통찰은 시공간 역학을 지배하는 물리 법칙이 행위자와 무관하게 보편적이라는 점입니다.

교차 신체 영상 월드모델로 물리 시뮬레이터를 만듭니다

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27406에서 확인할 수 있습니다. 저자는 Kechen Liu, Ola Shorinwa입니다. PDF는 같은 번호의 pdf입니다. 프로젝트 웹사이트는 https://omni-clap.github.io입니다. 초록은 코드와 모델을 모두 오픈소스한다고 적습니다. 오늘 본문은 초록이 적은 범위만 옮깁니다. 초록에 없는 퍼센트는 쓰지 않습니다.

교차 신체 영상 월드모델로 물리 시뮬레이터를 만듭니다 장면

한 신체에 묶인 비디오 모델을 넘깁니다

행동 조건 비디오 모델이 한 로봇에만 묶이면, 사람 영상과 다른 로봇 영상에 있는 물리 신호를 버리게 됩니다. CLAP는 그 간극을 교차 신체 학습으로 메우려 합니다. 다만 행동 표현이 플랫폼마다 크게 다르고, 사람 영상에는 행동이 없는 경우가 많습니다. 초록은 이 어려움을 정면으로 적습니다.

CLAP는 서로 다른 행동 공간을 end-effector 포즈, 언어 지시, latent action으로 맞춥니다. 각각만 쓰면 한계가 있으므로, 커리큘럼형 교차 신체 학습을 둡니다. 먼저 라벨 없는 영상에서 latent action으로 기초 물리 prior를 배우고, 이후 end-effector 행동 공간에 정착시켜 실기 과제에 제로샷으로 붙입니다.

DACON·DAKER처럼 시뮬과 실기 데이터가 섞인 자리에서는, “우리 로봇 조인트만” 쓰는 비디오 모델과 “교차 신체 prior를 먼저” 쌓는 경로를 README에서 구분하십시오. 오늘 팀이 가져갈 한 줄은 이것입니다. 한 신체 전용 모델만 키우지 말고, latent에서 end-effector로 이어지는 커리큘럼을 표로 남기십시오.

행동 공간을 세 갈래로 맞춥니다

end-effector 포즈는 실기 제어에 가깝지만, 사람 영상에는 자주 없습니다. 언어 지시는 넓지만 물리 궤적이 약할 수 있습니다. latent action은 라벨 없는 영상에서 prior를 배우기 쉽습니다. CLAP는 세 갈래를 커리큘럼으로 잇습니다. 순서를 바꾸어 end-effector만으로 인터넷 영상을 강제하면, 교차 신체 학습이 다시 막힙니다.

빌더 팀에 옮기면 세 줄입니다. 첫째, 보유 데이터에 어떤 행동 라벨이 있는지 표로 적습니다. 둘째, latent prior 단계와 grounding 단계를 날짜로 나눕니다. 셋째, 제로샷 실기 평가 행을 커리큘럼 끝에 둡니다. 단계 없이 “교차 신체”라고만 적지 않습니다.

Few-shot 적응으로 이점이 더해진다고 초록은 적습니다. 없는 퍼센트를 만들지 않습니다. 우리 과제에서는 few-shot 샘플 수와 승패만 적습니다.

단일 신체 SOTA에 근접·상회하는 방향

초록은 CLAP가 DROID처럼 어려운 환경에서 최신 단일 신체 비디오 모델에 근접하거나 상회한다고 적습니다. 구체 퍼센트는 없습니다. 오늘 본문에도 퍼센트를 짓지 않습니다. 대신 평가 환경을 이름 그대로 적고, 우리 측정은 별도 표에 둡니다.

CLAP가 남기는 스위트는 end-effector·언어·latent 조건과, 교차 신체·DROID·Bridge·양팔 YAM·G1 휴머노이드를 아우릅니다. 해커톤 README에 이 목록을 인용할 때는 “지원 범위 인용”과 “우리 실험 범위”를 칸으로 나눕니다. 목록에 있다고 우리 팀이 전부 돌렸다고 쓰지 않습니다.

단일 신체 비디오 월드모델을 학습하는 새 패러다임으로, 교차 신체 prior 위에 few-shot 적응을 얹는 경로를 제시합니다. 팀이 따라갈 운영은 prior 체크포인트와 적응 체크포인트를 이름만 같게 두지 말고, 단계 태그를 붙이는 것입니다.

제로샷 물리 시뮬레이터로 씁니다

제목이 말하는 zero-shot physical simulator는, 교차 신체 prior를 실기 행동 공간에 정착시킨 뒤 바로 과제에 붙인다는 방향입니다. 시뮬레이터를 별도 엔진으로만 두지 않고, 행동 조건 영상 월드모델로 물리 예측을 본다는 뜻으로 읽습니다. 없는 물리 엔진 벤치 점수를 붙이지 않습니다.

운영 규칙으로 옮기면 네 줄입니다. latent prior 학습 로그를 남깁니다. end-effector grounding 구간을 표시합니다. 제로샷 실기 실패를 행동 공간별로 분류합니다. few-shot 적응 전후를 같은 표에 둡니다.

사람 리뷰도 같은 표를 봅니다. 예쁜 생성 영상만 보고 머지하지 마십시오. 행동 조건이 end-effector인지 언어인지 latent인지 칸에 적혀 있어야 합니다.

오픈소스와 프로젝트 링크로 재현합니다

프로젝트 사이트 https://omni-clap.github.io 와 오픈소스 코드·모델을 오늘 북마크하십시오. 우리 커리큘럼 표와의 차이를 한 줄로 남깁니다. 초록에 없는 점수를 차이 설명에 붙이지 않습니다.

다른 팀의 비디오 월드모델을 받을 때도 단일 신체인지 교차 신체인지, 행동 조건이 세 갈래 중 무엇인지 분류합니다. 분류 없이 “CLAP급”이라고 적지 않습니다.

오늘 팀이 한 로봇 조인트 영상만으로 월드모델을 키우면, 내일 사람·다른 로봇 영상의 물리 신호를 버리지 됩니다. 그 순환을 끊는 일이 이 글을 읽는 이유입니다. latent prior에서 end-effector grounding으로 이어지는 표를 먼저 쓰십시오.

DROID·Bridge·YAM·G1 인용과 우리 실험 범위를 같은 칸에 섞지 마십시오.

커리큘럼 실패를 행동 공간별로 나눕니다

교차 신체 학습이 실패하면, 원인을 latent prior·언어 조건·end-effector grounding 중 어디에 둘지부터 가립니다. 한 줄로 “생성 품질이 낮다”고만 적으면 다음 단계가 없습니다. 오늘 실패 로그에 행동 공간 칸을 의무로 두십시오. 칸이 비어 있는 실패는 주간 리뷰에 올리지 않습니다.

인터넷 규모 영상을 쓴다는 초록 서술과, 우리 팀이 실제로 모은 클립 수를 같은 칸에 쓰지 않습니다. 우리 행에는 출처·라이선스·행동 라벨 유무만 적습니다. 라벨이 없으면 latent 단계 후보로 표시하고, 있는 end-effector는 grounding 단계 후보로 표시합니다.

DROID에서 단일 신체 SOTA에 근접·상회한다는 문장은 퍼센트 없이 인용합니다. 우리 DROID 실험을 아직 안 돌렸다면 “미실행”이라고 적습니다. Bridge·양팔 YAM·G1 휴머노이드도 스위트 인용과 실험 완료를 분리합니다.

Few-shot 적응으로 이점이 쌓인다는 초록 문장을 운영으로 옮기면, 적응 전 제로샷 표와 적응 후 표를 날짜로 나란히 두는 일입니다. 적응 샘플 수를 숨기고 성공만 보여 주지 마십시오. 샘플 수와 승패를 같이 남깁니다.

오픈소스 코드·모델이 공개된다는 초록 문장을 확인한 뒤에는, 우리 포크에 커리큘럼 설정 파일을 추가합니다. 설정 파일 없는 포크는 재현 제출이 아닙니다. 프로젝트 사이트 링크와 커밋 해시를 README 첫 줄에 두십시오.

물리 prior와 제어 grounding을 날짜로 나눕니다

기초 물리 prior를 latent action으로 배우는 구간과, end-effector에 정착시키는 구간을 같은 커밋에 섞지 마십시오. 날짜와 태그가 같으면 few-shot 적응의 이득이 어디에서 났는지 읽을 수 없습니다. 오늘부터 학습 실행 이름에 prior 또는 ground 접두를 붙이십시오.

언어 지시 조건은 세 갈래 중 하나로 남기되, 언어만으로 실기 성공을 단정하지 않습니다. 언어 조건 실패와 end-effector 조건 실패를 같은 “생성 실패”로 합치지 마십시오. 합치면 커리큘럼 다음 단계가 사라집니다.

제로샷 배포가 목표라면, grounding이 끝난 체크포인트 해시만 배포 후보로 올립니다. prior 전용 체크포인트를 실기 데모에 올리면, 초록이 말한 정착 단계가 빠집니다. 배포 후보 목록에 단계 태그를 의무로 두십시오.

오늘 팀이 한 로봇 영상만으로 월드모델을 키우면, 내일 교차 신체 prior를 붙여도 grounding 데이터가 부족합니다. latent·언어·end-effector 표를 먼저 채우고, 오픈소스 링크와 함께 공개하십시오.

행동 조건 영상 월드모델을 물리 시뮬레이터로 쓴다는 주장은, 행동 조건 종류가 로그에 남아 있을 때 토론할 수 있습니다. 조건 칸이 비어 있는 생성 영상은 시뮬레이터 증거가 아닙니다. 조건 칸을 채운 뒤에만 공개 데모에 올리십시오.

코드와 모델을 모두 오픈소스한다는 초록 문장을 확인한 뒤에도, 우리 제출에는 사용한 커밋 해시가 있어야 합니다. 해시 없는 “오픈소스 사용” 문장은 재현 기록이 아닙니다.

이 글이 아닌 것입니다

퍼센트 점수표가 아닙니다. 초록은 DROID 등에서 단일 신체 SOTA에 근접·상회한다고 적되 퍼센트를 적지 않습니다. 없는 숫자를 짓지 않습니다.

사람 영상만 있으면 로봇 제어가 된다는 처방이 아닙니다. latent prior 뒤 end-effector grounding과 제로샷·few-shot 경로가 있습니다. 한 단계만으로 단정하지 않습니다.

언어 조건만으로 물리가 완성된다는 주장이 아닙니다. end-effector·언어·latent를 같이 다루고 커리큘럼으로 잇습니다.

특정 회사 제품 출시 공지가 아닙니다. 연구 논문과 프로젝트·오픈소스 안내입니다.

모든 휴머노이드·양팔 로봇에서 검증이 끝났다는 선언도 아닙니다. 스위트에 포함된다는 서술과 우리 실기 성공을 같은 문장으로 쓰지 않습니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.27406pdf를 같은 탭에 둡니다. 저자 두 이름과 제출일 2026-08-27을 메모 첫 줄에 적습니다.

둘째, 프로젝트 사이트를 북마크하십시오. https://omni-clap.github.io에서 코드·모델 공개 위치를 확인하고 우리 저장소에 링크를 남깁니다.

셋째, 보유 데이터의 행동 라벨을 end-effector·언어·latent·없음으로 분류하십시오. DAKER 또는 DACON 과제에 맞춰 표를 채웁니다.

넷째, latent prior 단계와 end-effector grounding 단계를 날짜로 나눈 커리큘럼을 쓰십시오. 단계 없이 교차 신체라고 쓰지 않습니다.

다섯째, 제로샷 실기 평가 행과 few-shot 적응 행을 같은 표에 두십시오. 없는 퍼센트를 채우지 말고 승패와 실패 유형만 적습니다.

여섯째, 지원 범위 인용(DROID·Bridge·YAM·G1 등)과 우리 실험 범위를 칸으로 분리하십시오. 목록 인용을 실험 완료로 바꾸지 않습니다.

일곱째, 커리큘럼 표·평가 표·오픈소스 링크를 공개 주소로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.27406 — CLAP (2026-08-27) · PDF · Project