Qwen이 주행용 비전언어 기반 모델을 공개합니다 | DAKER 커뮤니티

Qwen Team이 Qwen-Drive-1.0을 arXiv와 Hugging Face에 공개했습니다. 사전학습 비전언어 모델 Qwen3.5-4B 구조를 유지한 채, 3D 인식·시각 질의응답·모션 플래닝을 한 틀에 넣습니다. 외부 BEV 헤드가 3D 검출·의미 occupancy·BEV 맵 분할을 같이 수행해, 공유 표현에서 읽을 수 있는 3D 정보를 검사 가능한 인터페이스로 드러냅니다. nuScenes에서 43.95 mAP·맵 mIoU 60.99, OpenScene에서 43.45 mAP·맵 mIoU 71.27을 보고합니다. NAVSIM PDMS는 90.7, WOD-E2E Rater Feedback Score는 7.91입니다. 오늘 팀은 주행 VLM을 쓸 때 “일반 VQA 점수”와 “3D·플래닝 지표”를 분리해 적습니다.

Qwen이 주행용 비전언어 기반 모델을 공개합니다

논문은 2026-08-31 arXiv에 올라왔습니다. 초록은 arXiv:2609.00111에서 확인할 수 있습니다. 영문 제목은 Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving입니다. 저자는 Xin Zhou, Zongchuang Zhao, Zhibo Yang 외 (Qwen Team, HUST)입니다. PDF는 같은 번호의 pdf입니다. 코드는 GitHub QwenLM/Qwen-Drive-1.0에 공개되어 있습니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.

주행용 비전언어 기반 모델의 첫걸음

Qwen-Drive-1.0은 자율주행을 위한 비전언어 기반 모델로 가는 초기 단계라고 스스로를 정의합니다. 사전학습 VLM 아키텍처를 유지하고, 3D 인식·VQA·모션 플래닝을 통합합니다. 백본은 natively multimodal Qwen3.5-4B입니다.

외부 BEV 인식 헤드는 3D 객체 검출, 의미 occupancy 예측, BEV 맵 분할을 공동으로 수행합니다. 공유 표현에서 접근 가능한 3D 정보를 프로브하고, 장면 구조를 명시적으로 검사할 수 있는 인터페이스를 제공합니다. Planning Expert는 공유 VLM 표현을 조건으로 미래 ego 궤적을 생성합니다.

단계적 학습 레시피는 주행 감독과 일반 비전언어 데이터를 섞어, 주행 능력을 얻으면서 넓은 시각 이해와 지시 따르기를 유지하도록 돕습니다. 오픈루프·의사클로즈드루프·클로즈드루프 평가에서 경쟁력 있는 모션 플래닝을 보고합니다.

공개 가중치와 핵심 숫자

가중치는 Hugging Face Qwen/Qwen-Drive-1.0-4B와 ModelScope에 있고, 코드는 github.com/QwenLM/Qwen-Drive-1.0입니다.

3D 인식에서 nuScenes는 43.95 mAP와 맵 mIoU 60.99, OpenScene는 43.45 mAP와 맵 mIoU 71.27입니다. 모션 플래닝에서 NAVSIM Predictive Driver Model Score는 90.7, WOD-E2E Rater Feedback Score는 7.91입니다. 일반 비전언어 능력도 크게 유지했다고 적습니다.

해커톤이나 연구 노트에 숫자를 옮길 때는 데이터셋 이름과 지표를 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.

빌더 팀에 옮기는 점검

팀이 오늘 할 일은 주행 VLM을 “채팅 가능한 카메라 모델”로만 보지 않는 것입니다. BEV 헤드 출력(검출·occupancy·맵)과 Planning Expert 궤적을 각각 저장합니다. 일반 VQA 점수와 주행 지표를 한 평균으로 섞지 않습니다.

공개 4B 체크포인트를 쓸 때는 HF 카드·라이선스·입력 카메라 뷰 수를 확인합니다. nuScenes(6뷰)와 OpenScene(8뷰) 설정을 메모합니다. 재현 스크립트와 시드를 README에 남깁니다.

DACON·DAKER 제출에서 자율주행 데모를 넣을 경우, 오픈루프인지 클로즈드루프인지 명시합니다. 안전 관련 면책과 실차 미사용 여부를 한 줄로 적습니다.

Controller·Worker를 나누면, 인식 헤드와 플래닝 전문가의 입출력 스키마를 분리합니다. 한 프롬프트에 API 키를 넣지 않습니다.

데이터셋 경로와 공유 캐시를 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. 개인 영상 데이터를 공개 저장소에 올리지 않습니다.

인식 출력과 플래닝 출력을 분리합니다

Qwen-Drive-1.0은 채팅형 VLM에 주행 데이터를 조금 섞은 수준이 아니라, BEV 헤드와 Planning Expert를 명시한 통합 틀입니다. 팀 파이프라인에서도 검출 박스, occupancy, 맵 분할, ego 궤적을 서로 다른 아티팩트로 저장합니다. 한 PNG에 모두 그려 넣고 “결과”라고 부르지 마십시오.

nuScenes 43.95 mAP·맵 mIoU 60.99와 OpenScene 43.45 mAP·맵 mIoU 71.27은 3D 인식 축입니다. NAVSIM PDMS 90.7과 WOD-E2E Rater Feedback Score 7.91은 플래닝·선호 축입니다. 일반 VQA 점수와 이 숫자들을 평균 내지 않습니다. 표에서 열을 나눕니다.

공개 4B 체크포인트는 HF와 ModelScope, 코드는 GitHub에 있습니다. 카메라 뷰 수(nuScenes 6, OpenScene 8)와 학습 레시피(주행 감독+일반 VLM 데이터)를 재현 노트에 적습니다. 오픈루프·의사클로즈드루프·클로즈드루프 중 무엇을 돌렸는지 명시합니다.

실차 실험이 아니라면 “실차 미사용”을 면책 한 줄로 남깁니다. DAKER·DACON 공개 자료에 개인 식별 도로 영상을 올리지 않습니다. 배포 링크와 재현 명령을 같이 올립니다. 배포가 제출입니다.

이 글이 아닌 것입니다

실차 완전 자율 상용화 발표가 아닙니다. 연구용 비전언어 주행 모델과 벤치 보고입니다.

모든 주행 벤치 최고점 선언이 아닙니다. nuScenes·OpenScene·NAVSIM·WOD-E2E에서 보고한 숫자만 옮깁니다.

일반 VLM 능력이 전혀 줄지 않았다는 절대 보증이 아닙니다. 크게 유지했다는 실험 보고입니다.

특정 대회 우승 공지가 아닙니다. 오픈웨이트 공개 안내입니다.

4B가 대형 전용 주행 스택을 대체한다는 주장이 아닙니다. 통합 VLM 기반의 초기 단계 보고입니다.

HF 카드에 적힌 입력 형식과 우리 전처리가 다르면 인식 수치가 논문과 달라집니다. 전처리 스크립트 해시와 사용 체크포인트 해시를 README에 나란히 둡니다. PDMS 90.7과 RFS 7.91을 인용할 때는 평가 스플릿 이름을 같이 적습니다.

DAKER 해커톤에서 주행 데모를 넣을 경우, 시뮬레이션인지 로그 리플레이인지 명시합니다. 개인 정보가 있는 도로 영상은 올리지 않습니다. 배포 링크·재현 명령·면책 한 줄을 한 페이지에 모읍니다. 배포가 제출입니다. 올린 링크가 제출입니다.

Qwen3.5-4B 백본 이름과 Qwen-Drive-1.0-4B 체크포인트 이름을 혼동하지 마십시오. 일반 VLM 카드와 주행 파인튜닝 카드를 북마크에서 분리합니다. 43.95 mAP와 90.7 PDMS를 같은 “점수” 칸에 넣지 않습니다. 지표 정의를 README 각주에 한 줄씩 남깁니다. 배포가 제출입니다. 올린 링크가 제출입니다.

오늘 할 일

첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.00111pdf를 엽니다.

둘째, 가중치와 코드를 북마크하십시오. HFGitHub를 저장합니다.

셋째, BEV 출력과 궤적 로그 형식을 정하십시오. 검출·occupancy·맵·플랜을 나눕니다.

넷째, 일반 VQA와 주행 지표를 표에서 분리하십시오.

다섯째, 카메라 뷰 수·데이터셋 분할을 README에 남기십시오.

여섯째, 오픈루프/클로즈드루프와 실차 미사용을 명시하십시오.

일곱째, 재현 명령과 데모 링크를 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2609.00111 — Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving (2026-08-31) · PDF · 코드/자료