「TypeSafe Jev 시리즈 2/10 — 텍스트가 아니라 교정된 확률」 | DAKER 커뮤니티

설명용 생성 이미지입니다.
AI Primer는 TypeSafe가 왜 생성 텍스트가 아니라 교정된(calibrated) 결정으로 결정 모델을 학습하는지 설명합니다.
1. Machine Native Intelligence
많은 AI 제품은 사람과의 대화를 중심으로 설계됩니다. TypeSafe는 대규모 자동화가 AI–AI·AI–소프트웨어 상호작용에 의해 좌우될 것이라는 가정에서 시작합니다. 그래서 채팅 UI보다 기계 인터페이스가 더 중요하다고 봅니다.
문서가 부르는 Machine Native Intelligence는 구조·신뢰성·관측 가능성·테스트 가능성·속도·일관성·낮은 비용 같은 소프트웨어적 속성을 가진 AI입니다.
2. 만능 신이 아니라 프로덕션용
TypeSafe는 모든 일을 하는 모델을 만들지 않습니다. 코드가 검사하고 행동할 수 있는 좁은 결정이 필요한 프로덕션 시스템을 겨냥합니다. 대규모 AI 자동화는 대략 기계 간 상호작용이 대부분이고 사람 상호작용은 소수일 것이라는 기대도 문서에 적혀 있습니다. 목표가 “읽기 좋은 답”에서 “소프트웨어 안에서 예측 가능하게 동작하는 출력”으로 이동합니다.
3. 세 가지 포스트트레이닝 경로
RLHF — 사람이 선호하는 응답을 학습해 챗봇으로 바꿉니다.
RLVR — 검증 가능한 보상으로 추론 모델을 키웁니다. 수학 등에 강하지만 더 느리고 비쌀 수 있습니다.
RLCD — TypeSafe 경로입니다. 생성 텍스트 대신 결정과 교정된 확률을 반환하도록 학습합니다.
참고로 문서는 RLHF가 InstructGPT·ChatGPT 학습에 쓰였고, TypeSafe 공동창업자 Diogo Almeida가 공동 발명했다고 적습니다.
4. 교정이란
RLCD의 출력 계약은 단순합니다. 모델은 텍스트를 생성하지 않고, 결정과 확률을 반환하며, 더 높은 확률은 답이 맞을 가능성이 더 크다는 뜻이어야 합니다.
잘 교정된 모델에서 여러 예측을 모아 보면, 확률 0.2로 표시한 결과는 약 20%, 0.8은 약 80%, 1.0은 100%에 가깝게 발생해야 합니다. 이는 단일 답에 대한 보장이 아니라 집단 통계입니다.
5. RLHF의 한계
RLHF는 사람이 선호하는 말을 하도록 가르치므로 챗봇에는 맞지만, 아첨(sycophancy)·자신감 있게 들리는 환각을 보상할 수 있습니다. 선호 최적화는 특정 스타일만 남기고 다른 출력 확률을 줄이는 mode dropping도 만듭니다. 사람에게 설득력 있는 출력과, 무인 자동화에 쓸 수 있을 만큼 신뢰할 수 있는 출력은 다른 최적화 목표입니다.
오늘 할 일
팀에서 “좋은 답”을 평가할 때 사람 선호(읽기 좋음)와 기계 신뢰(확률이 실제 정합과 맞음)를 구분하는 체크리스트 한 줄을 만듭니다.
출처
이전: 1/10 코드가 바로 쓰는 구조화 판단 · 다음: 3/10 빠른 구조화 결정 모델