LLM 파인튜닝 중급 ③ — 선호정렬 입문(DPO 감각) | DAKER 학습

중급 · 약 130분

선호 쌍 데이터와 DPO 감각으로 SFT 이후 '더 나은 답'을 정렬하는 입문을 한다.

커리큘럼