Jev 대신 작은 오픈 모델로 스킬 고르기 — Laya 파인튜닝하니 상위 3개 적중률이 56%에서 71%로 | DAKER 커뮤니티

AI 에이전트가 메시지를 받을 때마다 122개 스킬 가운데 무엇을 불러올지 고르는 일을, 꼭 비싼 최상위 모델에게 맡겨야 할까요? Tonbi's AI Garage 채널이 2026년 9월 28일에 올린 영상 「Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing」(https://www.youtube.com/watch?v=iwdzdpCRlBs)은 이 질문을 직접 실험해 봅니다. 약 17분 길이이고, Jev 방식의 오픈 웨이트 결정 모델 Laya를 Jev와 나란히 놓고 비교한 뒤, 제작자의 실제 에이전트 기록으로 Laya를 파인튜닝해 성능이 얼마나 오르는지 보여 줍니다.

작은 결정 모델 Laya로 122개 스킬 중 후보를 추리는 과정과 파인튜닝 전후 상위 3개 적중률 56%, 71%를 정리한 생성 이미지
설명용 생성 이미지입니다.

먼저 알려 드릴 점이 있습니다. 이 글의 숫자는 모두 영상 제작자가 자기 에이전트 하나의 대화 기록으로 돌린 실험 결과이고, 따로 검증된 벤치마크가 아닙니다. 영상 앞부분 요약과 본 실험 화면의 숫자도 조금씩 다른데, 이 글에서는 각 실험 화면에 나온 숫자를 따랐습니다. 제작자도 이것이 에이전트의 최종 스킬 선택을 대신하는 방법이 아니라 후보 목록을 줄이는 실험이라고 설명합니다.

왜 스킬 고르기에 작은 모델인가

제작자는 Hermes Agent(https://github.com/NousResearch/hermes-agent)에 스킬을 122개 붙여 쓰고 있습니다. 지금은 대화를 이끄는 최상위 모델이 매번 이 목록 전체를 보고 스킬을 고릅니다. 제작자는 이 일이 그 정도 지능까지 필요한 작업은 아니라고 봅니다. 작고 빠른 결정 모델이 먼저 후보를 3개나 10개로 추려 주면, 큰 모델은 122개 대신 그 안에서만 고르면 됩니다.

Laya는 어떻게 동작하나

Laya는 Convai Innovations가 공개한 모델입니다. 소스와 문서는 GitHub(https://github.com/NandhaKishorM/laya)에, 모델 카드와 체크포인트는 Hugging Face(https://huggingface.co/convaiinnovations/laya)에 있습니다. Jev처럼 질문, 현재 상황, 여러 선택지를 받아 선택지마다 점수를 매기고, 글은 생성하지 않습니다. 예를 들어 “3월 요금이 두 번 청구됐다, 오늘 안 고치면 해지하겠다”는 문의를 넣으면 어느 부서로 보낼지, 얼마나 급한지, 해지 의사가 있는지를 각각 확률로 돌려줍니다. 로컬에서 돌아가니 데이터가 밖으로 나가지 않습니다.

영상의 설명을 정리하면 이렇습니다. 질문과 상황, 선택지를 한 줄로 이어 붙이고 선택지마다 마스크 토큰을 하나씩 둡니다. ModernBERT-large 기반 28개 층이 이 줄 전체를 읽은 뒤, 새로 학습한 2개 층이 선택지끼리 비교하고, 마스크 자리마다 점수 하나를 뽑아 확률로 바꿉니다. 모든 선택지가 192~256토큰 정도의 자리를 나눠 쓰기 때문에 선택지가 20개쯤을 넘으면 구분이 흐려진다고 합니다. 영상은 Jev가 선택지를 255개까지 받는다고 비교합니다. 체크포인트는 영어용 1억 2,100만 파라미터, 다국어용 3억 2,200만 파라미터, 그리고 파인튜닝 버전이 있습니다.

제작자가 가장 강조하는 점은 Laya가 받자마자 잘하는 모델이 아니라는 것입니다. Laya 쪽 자료에서도 학습 전 0.36이던 점수가 파인튜닝 후 0.77로 오른다고 소개하며, 제작자는 이를 “특정 작업에 맞춰 빠르게 특화시키는 출발점”이라고 부릅니다. Laya가 공개한 Jev 비교 수치도 Laya 측 숫자이고 검증되지 않았다고 짚습니다.

실험 1: 학습 없이 바로 써 보기

시험 데이터는 텔레그램으로 나눈 긴 대화 한 세션, 실제 메시지 364개입니다. 메시지마다 “이 스킬을 불러와야 하나”를 122개 스킬 전부에 대해 한 번에 물었고, 정답은 에이전트가 실제로 불러온 스킬입니다. 한 번 호출에 Jev는 API로 약 0.25초, Laya는 로컬에서 약 0.5초가 걸렸다고 합니다.

실험 2: 한 세션으로 파인튜닝

다음으로 같은 세션의 8월 메시지 221개로 Laya를 학습시키고, 한 번도 보지 않은 9월 메시지 143개로 평가했습니다.

실험 3: 전체 세션으로 더 크게 학습

마지막으로 이 에이전트의 모든 세션에서 학습 질문 12,144개를 만들고, 300개는 확신도 보정용으로 떼어 둔 채 다시 학습했습니다. DGX Spark에서 한 시간 넘게 걸렸다고 합니다.

정리하면

제작자의 결론은 바로 쓰기에는 Jev가 여전히 더 나은 스킬 라우터라는 것입니다. 대신 Laya는 자기 데이터로 파인튜닝하면 무료로, 로컬에서, 122개 스킬을 10개 안팎의 후보로 줄여 주는 도구가 될 수 있습니다. 에이전트를 운영하면서 “이 판단까지 큰 모델이 해야 하나” 싶은 지점이 있다면, 호출이 쌓일수록 비용이 커지는 부분부터 이런 작은 결정 모델로 후보를 먼저 추려 보는 실험을 해 볼 만합니다.

출처