모바일·웹·데스크톱을 한 GUI 에이전트로 묶습니다 | DAKER 커뮤니티
Ant Group Venus Team이 UI-Venus-2 기술 보고서를 arXiv에 공개했습니다. 모바일·웹·데스크톱을 하나의 closed-loop 추론–행동 GUI 에이전트로 묶습니다. 실행 환경은 170개 넘는 다국어 모바일 앱과 네이티브 데스크톱 OS까지 넓히고, 기능에 정초한 지시 생성과 trace·sample 검증기·멀티모델 투표로 RL 신호를 안정화한다고 적습니다. 코드는 GitHub inclusionAI/UI-Venus, 가중치는 Hugging Face inclusionAI/ui-venus 컬렉션에 열려 있습니다. 그림 1 기준 UI-Venus-2-27B는 VenusBench-Mobile 48.7, WebVoyager 93.4, Odysseys 80.4를 보고합니다. 오늘 팀은 GUI 에이전트 데모에 환경 범위와 검증기 종류를 같이 적습니다.

논문은 2026-08-27 arXiv에 올라왔습니다. 초록은 arXiv:2609.00028에서 확인할 수 있습니다. 영문 제목은 UI-Venus-2 Technical Report입니다. 저자는 Venus Team (Ant Group)입니다. PDF는 같은 번호의 pdf입니다. 코드는 GitHub inclusionAI/UI-Venus에 공개되어 있습니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
실사용 GUI 에이전트를 겨냥합니다
멀티모달 GUI 에이전트는 디지털 과제 자동화의 유력한 형태입니다. 벤치 중심 모델에서 실서비스로 가려면 환경 커버리지, 과제 구성의 취약함, 보상 검증의 불안정이 걸림돌입니다. UI-Venus-2는 모바일·웹·데스크톱에서 동작하는 범용 기반 GUI 에이전트를 목표로, 통합 closed-loop 추론–행동 틀을 둡니다.
세 축을 같이 키웁니다. 환경은 170개 이상 다국어 모바일 앱과 네이티브 데스크톱 OS로 확장합니다. 과제는 deep-research 파이프라인으로 기능에 정초한 지시를 생성합니다. 검증은 visual keypoint와 멀티모델 투표를 쓰는 trace·sample 수준 평가기로 RL 신호를 만듭니다. 결과 중대한 행동에는 안전 인식 제어를 넣는다고 적습니다.
오픈소스 기반을 제공해 더 일반화·검증·자기 성찰 가능한 실세계 에이전트로 가겠다는 선언입니다. DAKER 바이브코딩 해커톤에서 GUI 자동화를 넣을 때도, “스크린샷 한 장”이 아니라 환경·과제·검증기를 나란히 적습니다.
공개 링크와 보고 점수
코드는 github.com/inclusionAI/UI-Venus, 모델은 Hugging Face inclusionAI/ui-venus, 프로젝트는 ui-venus.github.io/UI-Venus-2입니다.
논문 그림 1에 따르면 UI-Venus-2-27B는 VenusBench-Mobile 48.7, MobileWorld 관련 패널에서 82.1(비교열 Qwen-UI-Agent-27B), WebVoyager 93.4, Odysseys 80.4를 표시합니다. UI-Venus-2-9B는 VenusBench-Mobile 46.5, MobileWorld 76.1, WebVoyager 90.8, Odysseys 77.3입니다. 벤치마다 스텝 예산·스캐폴드·지표 정의가 다를 수 있으므로, 캡션의 조건 주를 함께 읽습니다.
해커톤 README에 점수를 옮길 때는 벤치 이름·모델 크기·지표를 한 줄에 고정합니다. 배포가 제출입니다. 올린 링크가 제출입니다.
빌더 팀에 옮기는 점검
팀이 오늘 할 일은 GUI 에이전트 범위를 “모바일만/웹만”으로 가정하지 않는 것입니다. 지원 OS·브라우저·앱 목록과, 위험 행동(결제·삭제·전송) 승인 지점을 체크리스트로 둡니다. 검증기가 화면 키포인트인지 텍스트 판정인지 명시합니다.
공개 가중치를 쓸 때는 HF 카드·라이선스·권장 입력 해상도를 저장합니다. 트레이스 로그를 다른 사람이 재생할 수 있는 형식으로 남깁니다. DACON 코드 제출과 DAKER 데모 모두, 실행 영상만 올리지 말고 재현 명령을 붙입니다.
RL 보상을 자체 제작할 때는 단일 LLM 판정만 쓰지 말고, 논문이 강조한 다중 검증 신호를 참고합니다. 다만 우리 스택에 없는 숫자를 초록에서 복사해 “우리 보상”이라고 쓰지 않습니다.
Controller·Worker를 나누면, GUI 액션 권한과 계획 모델 권한을 분리합니다. 한 프롬프트에 비밀키를 넣지 않습니다.
도구와 공유 세션을 쓰는 팀이면 전역 설정을 별도 파일로 둡니다. 세션 쿠키를 저장소에 커밋하지 않습니다.
환경·과제·검증기를 한 표에 적습니다
UI-Venus-2는 모델 크기만 키운 보고서가 아닙니다. 환경 커버리지, 기능 정초 과제 생성, 검증기 품질을 같이 키운다고 적습니다. 팀 문서에도 같은 세 칸을 만듭니다. 환경 칸에는 OS·브라우저·앱 목록, 과제 칸에는 기능 단위 지시 생성 방법, 검증 칸에는 trace/sample·키포인트·투표 여부를 적습니다.
그림 1의 VenusBench-Mobile·MobileWorld·WebVoyager·Odysseys 점수는 벤치마다 지표와 스텝 예산이 다릅니다. 27B와 9B를 한 줄에 섞지 말고, 모델 크기·벤치·점수를 세 열로 고정합니다. 캡션의 조건 주(스텝 수, GUI-only, refreshed split 등)를 같이 인용합니다.
오픈 코드와 HF 컬렉션을 쓰는 팀은 라이선스와 권장 입력 해상도를 먼저 저장합니다. 안전 인식 메커니즘이 있다고 해서 결제·삭제·전송 같은 중대 행동을 자동 승인하지 마십시오. Human 승인 노드를 체크리스트에 남깁니다.
GUI 에이전트 데모 영상만 올리면 재현이 어렵습니다. 트레이스 재생 명령, 초기 URL, 계정 없이 돌리는 샌드박스 여부를 README에 적습니다. DAKER 바이브코딩 제출에서도 배포 주소가 곧 제출입니다.
모바일·웹·데스크톱을 한 에이전트로 묶을 때는, 플랫폼별 액션 스키마가 같은지부터 확인합니다. 클릭·스크롤·텍스트 입력·앱 전환을 공통 타입으로 정의하고, 플랫폼 전용 액션은 확장 필드로 둡니다. 9B와 27B 중 무엇을 기본으로 쓸지, 지연·비용 기준으로 팀에 공지합니다.
벤치 점수를 홍보 문구로 쓸 때는 Claude·GPT·Kimi 등 비교열 이름을 우리 실측처럼 바꾸지 않습니다. 출처에 arXiv:2609.00028과 그림 번호를 남깁니다. 배포가 제출입니다. 올린 링크가 제출입니다.
이 글이 아닌 것입니다
모든 GUI 벤치 1등 선언이 아닙니다. 그림 1에 표시된 점수와 비교열만 옮깁니다.
170+ 앱이 모든 언어·모든 버전을 커버한다는 보증이 아닙니다. 환경 확장 보고입니다.
안전 메커니즘이 모든 위험 행동을 차단한다는 약속이 아닙니다. 중대 행동 제어를 통합했다는 설명입니다.
특정 대회 우승 공지가 아닙니다. 오픈 GUI 에이전트 기술 보고 안내입니다.
9B와 27B가 같은 점수라는 혼동이 아닙니다. 크기별 숫자를 구분합니다.
UI-Venus-2-27B의 WebVoyager 93.4와 Odysseys 80.4, VenusBench-Mobile 48.7을 한 문장 홍보로 합치지 마십시오. 벤치마다 한 줄입니다. 9B의 46.5·76.1·90.8·77.3도 같은 규칙입니다. 오픈소스 페이지와 HF 컬렉션 URL을 제출 README 상단에 고정하고, 로컬 수정 diff를 같이 올립니다. 배포가 제출입니다. 올린 링크가 제출입니다.
라이선스·모델 카드·재현 명령을 같은 폴더에 묶어 공개합니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.00028와 pdf를 엽니다.
둘째, 코드와 가중치를 북마크하십시오. GitHub와 HF 컬렉션을 저장합니다.
셋째, 우리 GUI 자동화 범위를 OS·앱·브라우저 표로 적으십시오.
넷째, 위험 행동 승인 지점을 체크리스트로 두십시오.
다섯째, 벤치 점수를 인용할 때 모델 크기와 지표를 고정하십시오.
여섯째, 트레이스 재생 방법을 README에 남기십시오.
일곱째, 데모 링크를 공개 주소로 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.00028 — UI-Venus-2 Technical Report (2026-08-27) · PDF · 코드/자료