Jev + Claude Code: 100ms 확률 판단으로 만드는 초저가 에이전트 코딩 루프 | DAKER 커뮤니티

한 줄 결론

Jev는 Claude Code를 대체하는 모델이 아닙니다. Claude Code가 깊게 생각하고 코드를 고치는 동안, Jev가 수백~수천 개의 작은 판단을 빠르고 싸게 처리하는 구조입니다. 쉽게 말해 Claude Code에 ‘반사신경’을 붙이는 모델입니다.

1. Jev는 무엇이 다른가

일반 LLM은 입력을 받은 뒤 문장을 토큰 단위로 생성합니다. 반면 Jev는 가능한 답을 미리 정의해 두고, 입력 상태를 보고 각 답의 확률을 한 번에 반환합니다.

예를 들어 “이 청구서는 사기인가?”라는 질문에 긴 설명을 쓰는 대신 다음처럼 소프트웨어가 바로 사용할 수 있는 판단을 돌려줍니다.

• 사기 88%

• 정상 10%

• 사람 검토 필요 2%

그래서 Jev는 ‘자연어를 이해하는 초고속 switch/if문’에 가깝습니다. TypeSafe 공식 발표 기준으로 입력 가격은 100만 토큰당 0.042달러, 출력 토큰은 별도 과금하지 않으며, 응답 시간은 약 70~500ms입니다. 영상의 데모에서는 주로 100~300ms가 언급됩니다. 단, 가격과 속도는 초기 서비스 및 특정 워크로드 기준이라는 점을 감안해야 합니다.

2. 세 가지 판단 프리미티브

• Noul: 조건이 참일 확률을 반환합니다. 영상에서는 Bool이라는 이름으로 소개됐지만 현재 공식 문서는 Noul로 설명합니다. “이 변경이 테스트를 약화했는가?”, “이 로그에 개인정보가 포함됐는가?”처럼 예/아니오 판단에 적합합니다.

• Choice: 미리 정의한 여러 선택지 중 무엇이 가장 적합한지 확률 분포를 반환합니다. 최대 255개 선택지를 다룰 수 있어 요청 라우팅, 스킬 선택, 작업 선택에 적합합니다.

• Score: 정의한 단계형 루브릭을 기준으로 정도를 평가합니다. “이 장애의 심각도는 0~3 중 어디인가?”, “이 영업 리드의 가치가 어느 수준인가?”처럼 순서가 있는 평가에 적합합니다. 영상 기준 최대 11개 단계로 구성할 수 있습니다.

선택법은 간단합니다. 예/아니오면 Noul, 연속적인 정도면 Score, 정해진 후보 중 하나를 고르면 Choice입니다.

3. Jev + Claude Code의 핵심 구조

이 조합은 System 1과 System 2의 역할 분담으로 이해하면 쉽습니다.

• Jev, System 1: 빠른 분류, 점수화, 라우팅, 이상 징후 탐지, 반복 검증

• Claude Code, System 2: 계획 수립, 원인 분석, 코드 수정, 기준 재설계

실전 루프는 다음과 같습니다.

1) Claude Code가 작업과 검증 기준을 설계한다.

2) Jev가 코드, diff, 로그, 브라우저 상태를 대량으로 검사한다.

3) 확률과 임계값으로 중요 항목만 추린다.

4) 통과 항목은 자동 처리하고, 애매하거나 위험한 항목만 Claude Code 또는 사람에게 보낸다.

5) Claude Code가 결과를 분석해 질문, 기준, 예시, 임계값을 개선한다.

6) 개선된 기준으로 Jev가 다시 빠르게 검증한다.

중요한 원칙은 ‘워크플로와 실행 권한은 코드가 통제하고, Jev는 경계가 정해진 의미 판단만 담당한다’는 것입니다. 구조화된 출력이 타입을 보장해도 판단 자체의 진실성을 자동 보장하는 것은 아닙니다.

4. 영상에서 소개한 실전 사례

A. Claude Code 스킬 자동 선택

에이전트에 스킬이 100~200개 설치되면 설명만으로도 컨텍스트가 크게 늘고 잘못된 스킬을 고를 가능성이 커집니다. TypeSafe Cookbook 실험에서는 182개 스킬을 대상으로 Haiku 4.5가 잘못된 스킬을 고른 비율이 16.8%였고, Jev의 추천을 앞단에 두자 7.3%로 감소했습니다. 아무 스킬도 필요하지 않은데 불필요하게 로드한 비율도 9.8%에서 4.0%로 줄었습니다. 영상 제작자는 자신의 환경에서 약 1만 토큰의 상시 컨텍스트를 줄일 가능성을 언급합니다.

B. 브라우저 기반 기능 검증

Jev 기반 브라우저 에이전트가 항공편을 약 7초, 0.4센트 수준에 찾는 데모가 소개됩니다. 이를 코딩 루프에 연결하면 Claude Code가 기능을 구현한 직후, 저렴한 브라우저 에이전트가 주요 사용자 흐름을 실행하고 실패 결과만 되돌려줄 수 있습니다.

C. 대규모 병렬 적대적 테스트

여러 브라우저를 병렬 실행해 매 릴리스를 깨뜨리려는 테스트도 가능합니다. 영상은 PR마다 수십~수천 개의 저비용 에이전트를 돌려 이상 동작을 찾고, 발견된 문제만 강한 모델이 수정하는 구조를 제안합니다. 규모가 커지면 토큰보다 샌드박스와 브라우저 컴퓨트 비용이 병목이 될 수 있습니다.

D. 코드 주석 품질 검사

단순히 코드 내용을 반복하는 주석, 오래돼 틀린 주석, 가치가 낮은 주석을 정성적으로 분류합니다. 영상 데모에서는 150개 주석을 9.3초, 약 1센트에 분석했고 전체 코드베이스 분석 예상 비용은 약 57센트였습니다.

E. 정성적 린터

기존 정적 린터가 찾기 어려운 의미적 규칙을 질문으로 만들 수 있습니다.

• 함수 이름이 실제 부작용까지 설명하는가?

• 로그에 비밀, 금융정보, 개인정보가 포함되는가?

• 주석이 정확하면서도 실제로 유용한가?

• 이 변경이 프로젝트의 설계 원칙을 어기는가?

영상의 코드 스멜 실험에서는 약 2,800만 입력 토큰 규모의 전체 패스를 1.19달러로 추산했습니다. 다만 중복 코드, 데드 코드, 타입 오류처럼 결정적으로 잡을 수 있는 문제는 기존 정적 분석 도구가 우선입니다. Jev는 기존 도구를 대체하기보다 의미적 판단을 추가하는 보완재에 가깝습니다.

F. 코드 리뷰 전처리

전체 diff를 비싼 모델이 처음부터 끝까지 읽는 대신 Jev가 정확성, 보안, 안정성, 호환성, 테스트 누락 등을 여러 각도에서 먼저 스크리닝합니다. 확률이 높은 몇 개의 증거와 코드 구간만 Claude Code에 넘기면 깊은 리뷰에 쓰는 입력량을 크게 줄일 수 있습니다. 영상에서는 코드 리뷰가 읽는 토큰을 최대 10분의 1 수준으로 줄일 가능성을 제시합니다.

G. 실시간 게임과 제어 루프

마인크래프트 데모에서는 강한 모델이 장기 전략과 중간 목표를 만들고, Jev가 현재 체력, 배고픔, 시간, 인벤토리, 최근 행동을 보고 다음 작업을 빠르게 선택합니다. Jev는 집 짓기, 도구 제작, 위험 회피 같은 즉시 판단을 맡고, 상위 모델은 일정 간격 또는 실패 시 전략을 수정합니다. 영상에서는 다이아몬드 곡괭이 제작 후 네더 진입까지 보여줍니다.

5. 왜 ‘가장 싼 에이전트 루프’라는 말이 나오는가

기존 에이전트는 작은 판단도 매번 강한 생성형 모델에 맡기는 경우가 많습니다. Jev 구조에서는 대다수의 반복 작업을 초저가 판단 모델이 처리하고, 정말 어려운 소수의 사례만 Claude Code로 올립니다.

비용 절감은 모델 단가 하나보다 다음 세 가지에서 발생합니다.

• 강한 모델이 읽어야 할 코드와 로그를 줄인다.

• 빠른 검증 루프를 더 자주 실행해 오류가 커지기 전에 잡는다.

• 확률과 임계값으로 자동 처리, 재검토, 사람 확인 경로를 명시한다.

즉 ‘한 번의 천재적인 답변’보다 ‘저렴한 판단을 수천 번 실행하고 중요한 것만 깊게 생각하는 시스템’에 초점이 있습니다.

6. 바로 적용한다면 추천하는 시작점

가장 현실적인 첫 프로젝트는 PR용 정성적 린터입니다.

1) 기존 ESLint, 타입 검사, 테스트는 그대로 유지합니다.

2) 팀이 자주 지적하는 의미적 규칙 5~10개를 고릅니다.

3) 각 규칙을 좁은 Noul 또는 Score 질문으로 만듭니다.

4) 처음에는 차단하지 말고 경고와 확률만 기록합니다.

5) 오탐과 누락을 수집해 기준과 예시를 수정합니다.

6) 충분히 검증된 규칙만 PR 게이트나 Claude Code 자동 수정 루프로 연결합니다.

추천 후보는 ‘민감정보 로깅’, ‘변경 목적과 무관한 diff’, ‘테스트 약화’, ‘에러를 삼키는 처리’, ‘이름과 실제 부작용 불일치’입니다.

7. 기대만큼 중요한 주의점

• 공식 수치와 영상 사례 상당수는 초기 접근 환경, 자체 평가, 데모 또는 외부 게시물에 기반합니다.

• 확률은 반복 실행 시 조금씩 달라질 수 있으므로 임계값 주변의 사례는 재검토 경로가 필요합니다.

• 구조화된 출력과 타입 안정성은 사실 정확성을 보장하지 않습니다.

• 정적 분석, 테스트, 컴파일러가 결정적으로 해결하는 문제에 굳이 AI를 쓰지 않는 것이 좋습니다.

• 게임과 브라우저 데모는 주변의 하드코딩된 제어 로직과 상태 표현에 성능이 크게 좌우됩니다.

• 실제 도입 전에는 팀의 데이터로 정확도, 비용, 지연시간, 오탐 비용을 별도로 측정해야 합니다.

결론

Jev의 가치는 더 똑똑한 챗봇이 아니라, 기존 소프트웨어 안에 의미 판단을 값싸게 심는 데 있습니다. Claude Code가 설계자이자 수리공이라면 Jev는 24시간 돌아가는 센서와 반사신경입니다. 둘을 잘 결합하면 코드 리뷰, 보안 검사, 브라우저 QA, 스킬 라우팅, 코드베이스 규칙 검사 같은 작업을 훨씬 촘촘하게 반복할 수 있습니다.

아직 초기 단계이므로 ‘Claude Code를 대체한다’보다 ‘Claude Code가 집중해야 할 문제를 줄여준다’고 이해하는 편이 정확합니다.

출처

1. 원본 영상, Ray Amjad: https://www.youtube.com/watch?v=ScvXFi4MUSc

2. TypeSafe 공식 Jev 발표: https://typesafe.ai/blog/introducing-system-one-models-and-jev

3. TypeSafe 공식 문서: https://docs.typesafe.ai/

4. 스킬 선택 Cookbook: https://docs.typesafe.ai/cookbooks/skill_suggestion

5. Claude/Codex용 TypeSafe 스킬: https://github.com/typesafe-ai/skills/blob/main/skills/typesafe-ai/SKILL.md

6. Jev 코드 리뷰 실험: https://github.com/devagrawal09/jev-review

이 글의 수치와 사례는 원본 영상 및 위 자료를 바탕으로 정리했으며, 일부는 공급사 자체 평가 또는 PoC 결과입니다.