사람 주행 로그를 넘어 닫힌 루프 강화학습으로 주행을 배웁니다 | DAKER 커뮤니티

2026년 9월 5일 DriveZero 논문이 arXiv에 공개되었습니다. 대부분 종단간 자율주행은 사람 주행 로그 모방으로 배워 로그 품질·행동 범위에 묶인다고 적습니다. DriveZero는 사람 시연을 넘는 종단간 시스템으로, 인식 모델과 행동 모델로 분해해 각각에 맞는 방식으로 사전학습한 뒤 하나의 플래너로 결합합니다. 인식은 대규모·다양한 시각 데이터가 유리하고, 행동은 닫힌 루프 피드백이 필요하다고 적습니다. DriveRL은 혼합 에이전트 닫힌 루프 RL로, 실제 주행 로그를 상호작용 세계로 바꾸고 특권 교사 정책을 PPO로 닫힌 루프 롤아웃 학습합니다. DriveVFM은 DINOv3, SigLIP2, SAM, Depth Anything V2 등 여러 고정 비전 기반 모델을 원시 이미지만으로 하나의 백본으로 통합하며 과제별 주석이 불필요하다고 적습니다. 카메라만으로 두 모델을 하나의 플래너로 통일한다고 보고합니다. nuPlan에서 DriveRL이 value-guided test-time action search로 Val14·Test14-hard·Test14-random 커뮤니티 분할에서 non-reactive·reactive 모두 평균 점수 93.57을 내며 세 분할 모두 Log-Replay 전문가를 넘는다고 적습니다. DriveZero는 NAVSIMv1·NAVSIMv2·닫힌 루프 HUGSIM에서 사람 궤적 감독 없이 최신 성능을 낸다고 보고합니다.

사람 로그를 넘어 닫힌 루프로 주행을 배웁니다

논문은 2026-09-05 arXiv에 올라왔습니다. 초록은 arXiv:2609.06055에서 확인할 수 있습니다. 영문 제목은 DriveZero: End-to-End Driving Beyond Human Demonstrations입니다. 저자는 Hao He, Chengcheng Hu, Zirun Su, Heng Zhang, Haisong Liu, Jinke Li, Haochen Tian, Zhenwei Shen 외입니다. PDF는 같은 번호의 pdf입니다. 오늘 본문은 초록에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

사람 로그를 넘는 분해

초록은 대부분 종단간 자율주행이 사람 주행 로그를 모방한다고 적습니다. 그 결과 학습된 행동이 기록된 궤적의 품질과 행동 범위에 묶인다고 적습니다. DriveZero는 사람 시연을 넘는 종단간 시스템을 제시합니다. 인식 모델과 행동 모델로 분해하고, 각각에 맞는 학습 방식으로 사전학습한 뒤 하나의 종단간 플래너로 합칩니다.

인식은 세계를 이해해야 하므로 대규모·다양한 시각 데이터가 유리하다고 적습니다. 행동은 세계와 상호작용해야 하므로 닫힌 루프 피드백이 필요하다고 적습니다. 이 구분을 표의 서로 다른 열에 두십시오.

DACON·DAKER에서 주행·로봇 데모를 낼 때도, “로그 모방 정확도”와 “닫힌 루프 점수”를 같은 줄에 두지 마십시오. 사람 궤적 감독 없이 평가했는지 먼저 적습니다.

DriveRL·DriveVFM·통합 플래너

행동 쪽 DriveRL은 혼합 에이전트 닫힌 루프 강화학습 틀입니다. 실제 주행 로그를 상호작용 세계로 바꾸고, 특권 교사 정책을 PPO로 닫힌 루프 롤아웃으로 학습한다고 적습니다. 인식 쪽 DriveVFM은 DINOv3, SigLIP2, SAM, Depth Anything V2를 포함한 여러 고정 비전 기반 모델을 원시 이미지만으로 하나의 백본으로 통합하며, 과제별 주석이 불필요하다고 적습니다.

DriveZero는 둘을 카메라만으로 통일한 플래너로, 동결된 DriveRL 교사를 롤아웃 궤적으로 증류한다고 적습니다. 목표 조건 교사는 증강된 주행 의도로도 질의할 수 있어, 로그 데이터가 줄 수 없는 다양하고 목표 일관된 감독을 준다고 적습니다.

nuPlan에서 DriveRL이 value-guided test-time action search로 Val14, Test14-hard, Test14-random 커뮤니티 분할에서 non-reactive와 reactive 모드 모두 평균 점수 93.57을 내며, 세 분할 모두 Log-Replay 전문가를 넘는다고 적습니다. DriveZero는 NAVSIMv1, NAVSIMv2, 닫힌 루프 HUGSIM에서 사람 궤적 감독 없이 최신 성능을 낸다고 보고합니다. 해커톤 README에 숫자를 옮길 때는 “nuPlan 평균 93.57”, “Val14·Test14-hard·Test14-random”, “사람 궤적 감독 없음”만 한 줄에 고정합니다.

빌더 팀에 옮기는 점검

인식 사전학습 데이터와 행동 닫힌 루프 롤아웃 로그를 서로 다른 버킷에 둡니다. DriveVFM에 넣은 고정 비전 모델 이름을 설정 파일에 고칩니다. PPO 교사와 카메라 플래너 증류 단계를 실행 ID로 묶습니다.

nuPlan 분할 이름과 reactive/non-reactive 모드를 결과 CSV 첫 열에 둡니다. 사람 궤적 감독 사용 여부를 boolean으로 남깁니다. API 키와 차량 자격 증명을 공개 저장소에 넣지 않습니다.

DAKER 월간 해커톤 데모라면 배포 주소와 함께 “닫힌 루프 벤치 이름”과 “사람 로그 감독 여부”를 README 상단에 둡니다. 초록에 없는 GitHub 주소를 만들지 마십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

닫힌 루프와 비전 백본을 나누어 적습니다

대부분 종단간 자율주행은 사람 주행 로그 모방으로 배워 로그 품질·행동 범위에 묶인다고 적습니다. DriveZero는 인식과 행동을 분해합니다. 인식은 대규모·다양한 시각 데이터가 유리하고, 행동은 닫힌 루프 피드백이 필요하다고 적습니다.

DriveRL은 실제 주행 로그를 상호작용 세계로 바꾸고, 특권 교사 정책을 PPO로 닫힌 루프 롤아웃 학습합니다. DriveVFM은 DINOv3, SigLIP2, SAM, Depth Anything V2 등 여러 고정 비전 기반 모델을 원시 이미지만으로 하나의 백본으로 통합하며 과제별 주석이 불필요하다고 적습니다.

통합 플래너는 카메라만으로 동결된 DriveRL 교사를 롤아웃 궤적으로 증류한다고 적습니다. 목표 조건 교사는 증강된 주행 의도로도 질의할 수 있어, 로그 데이터가 줄 수 없는 다양하고 목표 일관된 감독을 준다고 적습니다.

nuPlan에서 DriveRL이 value-guided test-time action search로 Val14, Test14-hard, Test14-random에서 non-reactive·reactive 모두 평균 점수 93.57을 내며 세 분할 모두 Log-Replay 전문가를 넘는다고 적습니다. DriveZero는 NAVSIMv1, NAVSIMv2, 닫힌 루프 HUGSIM에서 사람 궤적 감독 없이 최신 성능을 낸다고 보고합니다.

팀 표에는 “사람 로그 모방”과 “닫힌 루프 RL”을 서로 다른 행에 둡니다. 사람 궤적 감독 사용 여부를 boolean으로 남깁니다. nuPlan 분할 이름과 reactive/non-reactive 모드를 결과 CSV 첫 열에 둡니다.

이 글이 아닌 것입니다

모든 자율주행 벤치에서 93.57이 나온다는 뜻이 아닙니다. nuPlan Val14·Test14-hard·Test14-random과 보고된 모드 범위만 옮깁니다.

사람 데모가 항상 불필요하다는 뜻이 아닙니다. DriveZero가 사람 궤적 감독 없이 특정 벤치에서 최신을 냈다는 초록 보고만 둡니다.

LiDAR·기타 센서를 쓰지 말라는 지침이 아닙니다. 카메라만으로 통일했다고 보고한 초록 문장만 옮깁니다.

DACON·DAKER 공식 주행 공지가 아닙니다. 빌더가 옮길 수 있는 방법과 숫자 안내입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.06055pdf를 같은 탭에 둡니다. 제출일 2026-09-05를 메모 첫 줄에 적습니다.

둘째, 인식과 행동을 표의 서로 다른 열에 두십시오. 시각 데이터와 닫힌 루프 피드백을 섞지 않습니다.

셋째, DriveRL·DriveVFM·통합 플래너 단계를 실행 ID로 묶으십시오. 교사 PPO와 증류를 구분합니다.

넷째, nuPlan 평균 93.57과 세 분할 이름을 한 셀에 두십시오. Log-Replay 대비를 같이 적습니다.

다섯째, NAVSIM·HUGSIM과 사람 궤적 감독 없음을 같이 인용하십시오. 없는 점수를 만들지 않습니다.

여섯째, DriveVFM에 넣은 비전 모델 목록을 설정 파일에 고정하십시오. DINOv3·SigLIP2·SAM·Depth Anything V2를 적습니다.

일곱째, 데모와 닫힌 루프 로그를 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.06055 — DriveZero: End-to-End Driving Beyond Human Demonstrations (2026-09-05) · PDF