정책과 월드 시뮬레이션을 한 모델에 넣습니다 | DAKER 커뮤니티

2026년 8월 27일 Haofeng Sun 연구팀이 정책 실행과 행동 조건 월드 시뮬레이션을 한 모델에 넣은 Riemann-1.0을 arXiv에 공개했습니다. Riemann-1.0은 완전 인과 오토리그레시브 World Action Model입니다. 다중 시점 시각 관측, 로봇 상태, 신체별 행동을 하나의 인과 시퀀스로 같이 모델링합니다. 로봇 행동과 월드 진화를 인과적 상태 전이로 표현합니다. 기존 WAM의 결합 생성, 비디오 우선 예측, 분리 모델링과 달리, 온라인 로봇 정책과 행동 조건 월드 시뮬레이터를 단일 모델로 통합합니다.

정책과 월드 시뮬레이션을 한 모델에 넣습니다

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27033에서 확인할 수 있습니다. 저자는 Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao 외 4명입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 초록이 적은 숫자와 범위만 옮깁니다.

정책과 월드 시뮬레이션을 한 모델에 넣습니다 장면

정책과 월드 시뮬레이터를 한 모델로 둡니다

Riemann-1.0은 실행 가능한 로봇 정책이면서, 다중 신체 시각 월드 시뮬레이터이기도 합니다. 두 역할을 따로 학습한 뒤 붙이는 구조가 아닙니다. 하나의 인과 오토리그레시브 시퀀스 안에서 관측·상태·행동이 이어집니다. 초록은 결합 생성, 비디오 우선 예측, 분리 모델링 패러다임과 이 통합을 구분합니다.

해커톤에서 정책 모델과 시뮬레이터를 따로 두면, 시뮬레이터에서 잘 나온 궤적이 실기 정책에서 깨지기 쉽습니다. 한 모델에 두면 같은 표현으로 온라인 실행과 행동 조건 예측을 봅니다. 오늘 팀이 가져갈 한 줄은 이것입니다. 정책 체크포인트와 월드 예측 체크포인트를 이름만 같게 두지 말고, 학습 목표부터 공유하십시오.

DACON·DAKER처럼 짧은 기간에 조작 데모를 만드는 자리에서는, “비디오만 생성하는 모델”과 “명령을 실행하는 정책”을 README에서 분리해 적되, Riemann이 제안한 통합 방향을 실험할 때는 둘을 한 시퀀스 목표로 묶는 초안을 남기십시오.

점진적 신체화 사전학습으로 경험을 옮깁니다

이종 데이터에서 신체화 경험을 키우기 위해, 초록은 progressive embodied pretraining 프레임워크를 둡니다. 1인칭 인간 비디오, 핸드헬드 그리퍼 시연, 이종 로봇 궤적을 공유 World Action Modeling 목표 아래에서 같이 학습합니다. 상호작용 데이터는 200K시간 이상입니다. 이 규모에서 대규모 신체화 경험을 실행 가능한 조작 능력으로 점진 전이합니다.

빌더 팀에 옮기면 데이터 출처를 세 칸으로 나누는 일입니다. 인간 에고 비디오, 그리퍼 시연, 로봇 궤적. 각 칸의 시간·라이선스·전처리 규칙을 표로 적습니다. 한 칸만 있고 나머지를 “나중에”로 비우면, 점진 전이의 앞 단계가 빠집니다. 없는 시간 수를 만들지 않습니다. 초록의 200K시간 이상만 인용하고, 우리 데이터는 우리 행에 적습니다.

공유 목표가 없으면 세 출처가 서로 다른 손실로 흩어집니다. World Action Modeling 목표를 한 문장으로 README에 고정하십시오. 문장이 바뀌면 전이 실험의 비교가 끊깁니다.

시뮬·실기 숫자를 초록 그대로 둡니다

초록이 보고한 숫자는 다음과 같습니다. RoboTwin2.0에서 성공률 94.3%, LIBERO에서 99.0%, 장기·조합 벤치 RoboCasa-365에서 62.6%이며, 이전 최고 대비 8.4%포인트 우위입니다. 장기 실기 조작에서는 Success Rate(SR) 85.0%, Progress Success Rate(PSR) 94.4%이며, 가장 강한 오픈소스 베이스라인 대비 SR이 15%포인트 높습니다. 이 숫자 외의 벤치 점수나 순위를 짓지 않습니다.

해커톤 README에 옮길 때는 초록 표와 우리 측정 표를 행으로 분리합니다. “Riemann이 94.3%이므로 우리도 같다”고 쓰지 않습니다. 우리 과제에서 돌린 성공·실패만 적습니다. 시뮬 벤치와 실기 SR·PSR도 같은 칸에 섞지 않습니다.

장기·조합 과제에서 62.6%와 실기 SR 85.0%는 과제가 다르다는 신호입니다. 데모 영상만 보고 실기 성공을 단정하지 마십시오. 오늘 점검표에는 시뮬 항목과 실기 항목을 나란히 두십시오.

인과 상태 전이로 행동을 읽습니다

로봇 행동과 월드 진화를 인과적 상태 전이로 두면, “다음에 무엇을 할지”와 “그 행동이 관측을 어떻게 바꿀지”가 같은 시퀀스에 있습니다. 분리 모델링에서는 이 두 질문이 다른 모듈에 있어 디버깅이 끊깁니다. 통합 모델에서는 실패 구간을 시퀀스 한 줄에서 추적할 수 있습니다.

운영 규칙으로 옮기면 네 줄입니다. 다중 시점 관측 로그를 남깁니다. 로봇 상태와 행동 토큰을 같은 타임라인에 둡니다. 실패 시 정책 출력과 월드 예측을 나란히 봅니다. 모듈을 탓하기 전에 시퀀스 정렬부터 확인합니다.

사람 리뷰도 같은 타임라인을 봅니다. 정책만 보고 머지하지 마십시오. 행동 조건 월드 예측이 같은 체크포인트에서 나오는지 확인합니다. DAKER 로봇·에이전트 트랙에서는 이 확인이 제출 리뷰 체크리스트에 들어가야 합니다.

통합 목표를 공개 링크로 고정합니다

초록에 별도 코드 URL은 없습니다. 따라서 팀이 남길 주소는 우리 실험 저장소입니다. World Action Modeling 목표 문장, 데이터 세 칸 표, 시뮬·실기 점검표를 한 저장소에 두고 공개합니다. 채팅에만 남긴 통합 목표는 다음 주 mid-training에서 사라집니다.

다른 팀의 WAM을 받을 때도 정책 전용인지, 비디오 우선인지, 통합인지 한 줄로 분류합니다. 분류 없이 “Riemann급”이라고 적지 않습니다. 초록이 구분한 패러다임 이름을 그대로 씁니다.

오늘 팀이 정책과 시뮬레이터를 다른 손실로만 돌리면, 내일 실기에서 궤적이 어긋납니다. 그 순환을 끊는 일이 이 글을 읽는 이유입니다. 관측·상태·행동을 한 인과 시퀀스 목표로 묶으십시오.

200K시간급 공개 서술과 우리 데이터 행을 섞지 말고, 우리 행부터 채우십시오.

다중 시점 관측을 제출 로그 규약으로 둡니다

Riemann-1.0은 다중 시점 시각 관측을 인과 시퀀스에 넣습니다. 해커톤 로그가 한 카메라만 남기면, 논문이 가정한 입력과 우리 디버깅이 어긋납니다. 오늘부터 실패 샘플에는 사용 가능한 시점 수와 각 시점 파일 경로를 같이 적으십시오. 경로가 없으면 시퀀스 정렬을 검증할 수 없습니다.

온라인 정책 실행과 행동 조건 월드 시뮬레이션이 한 모델이므로, 데모 영상만 저장하고 상태·행동 토큰을 버리면 재현이 끊깁니다. 저장 규약에 관측·상태·행동 세 칸을 의무로 두십시오. 세 칸이 채워진 샘플만 주간 리뷰에 올립니다.

점진 사전학습의 앞 단계인 인간 에고 비디오와 그리퍼 시연을 우리 파이프라인에 넣을 수 없다면, “미사용”이라고 명시합니다. 미사용을 숨기고 로봇 궤적만으로 Riemann과 같다고 쓰지 않습니다. 200K시간 이상이라는 초록 서술과 우리 가용 시간을 같은 문장에 넣지 않습니다.

실기 SR 85.0%와 PSR 94.4%는 장기 실기 조작에서 보고된 값입니다. 단기 집기 데모 성공률과 바꿔 쓰지 않습니다. 점검표에 장기 구간 정의를 한 줄로 적으십시오. 정의가 없으면 Progress Success를 측정했다고 말할 수 없습니다.

오픈소스 베이스라인 대비 SR +15%포인트라는 문장도 인용 블록에만 둡니다. 우리 베이스라인 이름을 지어내어 같은 숫자를 붙이지 않습니다.

실행 가능 정책인지 먼저 확인합니다

통합 모델이라는 이름만으로 제출을 끝내면, 실제로는 비디오 우선 예측만 돌린 실험이 섞일 수 있습니다. 오늘 수락 기준에 “동일 체크포인트로 온라인 명령을 실행할 수 있는가”를 넣으십시오. 실행 로그가 없으면 월드 시뮬레이터 데모로만 분류합니다. 분류가 있어야 초록이 구분한 패러다임과 우리 결과가 대응합니다.

RoboTwin2.0 94.3%, LIBERO 99.0%, RoboCasa-365 62.6%는 시뮬 벤치 숫자입니다. 실기 SR·PSR과 한 평균으로 합치지 마십시오. 합치면 장기 실기 난이도가 사라집니다. 표에는 시뮬 블록과 실기 블록을 위아래로 나눕니다.

이전 최고 대비 +8.4%포인트라는 문장도 시뮬 블록 인용에만 둡니다. 우리 리더보드 상승폭으로 바꾸어 쓰지 않습니다. DAKER 제출 본문에는 “초록 인용”과 “우리 측정” 소제목을 반드시 나눕니다.

오늘 팀이 정책과 월드 예측을 다른 저장소에만 두면, 내일 실기에서 어긋난 궤적의 원인을 한 시퀀스에서 읽지 못합니다. 통합 목표 문장과 세 칸 로그 규약을 같은 주소에 두십시오. 주소가 없는 통합은 제출이 아닙니다.

시뮬 벤치에서 높은 성공률이 나와도, 실기 PSR 정의가 없으면 Progress를 측정한 것이 아닙니다. 정의 문장을 점검표 상단에 고정하십시오. 고정 없는 PSR 숫자는 제출에서 빼십시오.

이 글이 아닌 것입니다

비디오만 생성하는 모델 소개가 아닙니다. 초록은 실행 가능 정책과 행동 조건 월드 시뮬레이터의 통합을 말합니다. “예쁜 롤아웃 영상”으로 바꾸어 쓰지 않습니다.

초록에 없는 벤치 점수를 채운 글이 아닙니다. RoboTwin2.0·LIBERO·RoboCasa-365·실기 SR·PSR만 옮깁니다. 다른 숫자를 짓지 않습니다.

인간 비디오만 있으면 로봇이 된다는 처방이 아닙니다. 에고 비디오·그리퍼 시연·로봇 궤적을 공유 목표로 점진 학습합니다. 한 출처만으로 단정하지 않습니다.

특정 회사 제품 출시 공지가 아닙니다. 연구 논문입니다. 오늘 상용 로봇에 탑재되었다는 발표문이 아닙니다.

모든 실기 과제가 85%라는 일반화가 아닙니다. 장기 실기 조작에서 보고한 SR·PSR입니다. 우리 과제 성공률과 같다고 쓰지 않습니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2608.27033pdf를 같은 탭에 둡니다. 저자 목록과 제출일 2026-08-27을 메모 첫 줄에 적습니다.

둘째, World Action Modeling 목표 문장을 한 줄로 고정하십시오. 정책 전용·비디오 우선·분리 모델링과 어떻게 다른지 옆에 적습니다.

셋째, 데이터 출처를 세 칸으로 나누십시오. 인간 에고 비디오, 핸드헬드 그리퍼 시연, 이종 로봇 궤적. DAKER 또는 DACON 로봇 과제에 맞춰 가용 여부를 표시합니다.

넷째, 초록 숫자 표를 우리 저장소에 인용 블록으로 두십시오. 94.3%·99.0%·62.6%·SR 85.0%·PSR 94.4%·+8.4%·+15%SR만 적고, 우리 측정은 다른 표에 둡니다.

다섯째, 실패 로그에 관측·상태·행동을 같은 타임라인으로 남기십시오. 정책 출력과 월드 예측을 나란히 비교합니다.

여섯째, 시뮬 점검과 실기 점검을 분리한 체크리스트를 만드십시오. 장기·조합 항목을 빠뜨리지 않습니다.

일곱째, 목표 문장·데이터 표·점검 결과를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.27033 — Riemann-1.0 (2026-08-27) · PDF