LLM 파인튜닝 중급 ③ — 선호정렬 입문(DPO 감각) | DAKER 학습
중급 · 약 130분
선호 쌍 데이터와 DPO 감각으로 SFT 이후 '더 나은 답'을 정렬하는 입문을 한다.
커리큘럼
선호 쌍이란
DPO 감각
편향·노이즈
미니 랩: 선호 라벨링
퀴즈 — LLM 파인튜닝 중급 ③
플래시카드
실습 프롬프트