작은 모델의 실패를 큰 모델의 힌트로 씁니다 | DAKER 커뮤니티
2026년 8월 27일 Yufan Wu 연구팀이 작은 모델의 실패 유형을 큰 모델의 문맥 힌트로 쓰는 CritICL을 arXiv에 공개했습니다. 추론 시간 스케일링은 대개 생성을 반복하거나 외부 검증을 붙입니다. CritICL은 같은 가족 안에서 규모를 건너 옮기는 구조화된 실패 유형을 씁니다. 약한 모델의 실패가 비평 문맥 예제가 됩니다. 표준 문맥 학습보다 앞섰고, 생성 횟수와 토큰 비용을 낮추면서 시험 시간 스케일링과 겨루거나 더 나았습니다.

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27455에서 확인할 수 있습니다. 저자는 Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu입니다. 코드는 github.com/umwyf/CRITICL입니다. 오늘 본문은 초록이 적은 범위만 옮깁니다. 정확도 퍼센트는 초록에 없으므로 쓰지 않습니다.

실패를 버리는 대신 힌트로 남깁니다
추론 시간 스케일링은 큰 언어모델의 추론을 끌어올리는 흔한 길입니다. 그 길은 대개 같은 문제를 여러 번 생성하거나, 외부 검증 모델을 붙입니다. 점수는 오를 수 있어도 호출과 토큰이 같이 늘어납니다. 해커톤에서 제출 직전 여러 답을 뽑아 투표하는 습관이 바로 그 길입니다. 시간이 부족하면 그 습관은 제출을 늦춥니다.
CritICL은 다른 신호를 씁니다. 같은 모델 가족 안에서 실패 유형이 규모를 건너 구조적으로 닮는다는 관찰입니다. 작은 모델이 틀린 방식이 큰 모델에도 남는다는 뜻입니다. 실패를 버릴 출력으로만 보지 않고, 옮길 수 있는 안내로 봅니다. 약한 모델의 실패를 모아 비평 문맥 예제로 넣으면, 큰 모델은 그 실패를 피하며 한 번 생성합니다. 생성을 반복해 늘리기 전에, 작은 모델이 이미 보여 준 실패를 읽는 쪽이 이 논문의 제안입니다.
DAKER와 DACON처럼 모델 크기를 섞어 쓰는 팀에게 이 관찰은 바로 쓰입니다. 작은 로컬 모델의 오답 로그는 버리는 파일이 아닙니다. 큰 API를 부르기 전에 그 오답의 유형을 문장으로 남기면, 큰 모델의 프롬프트가 짧아집니다. 정확도 숫자를 오늘 본문에서 만들지 않습니다. 팀이 받을 규칙은 실패 로그를 비평 예제로 바꾸라는 운영입니다.
동적 비평과 정적 비평을 나눕니다
CritICL에는 두 변형이 있습니다. CritICL-dynamic은 입력마다 실패를 예측하고, 그에 맞는 비평을 찾아 옵니다. CritICL-static은 전역 실패 윤곽을 쓰고, 입력과 무관하게 가족이 자주 하는 실패의 비평을 넣습니다. 동적은 문제마다 다른 위험을 겨냥합니다. 정적은 가족이 반복하는 실패를 안정적으로 보여 줍니다. 두 이름을 한 방법으로 뭉개지 마십시오.
동적 쪽은 호출이 한 번 더 필요합니다. 실패 유형을 예측한 뒤 비평을 찾아 최종 답을 생성합니다. 정적 쪽은 전역 윤곽이 이미 있으면 최종 생성만 합니다. 해커톤에서 시간이 빠듯하면 정적부터 붙이는 편이 구현이 짧습니다. 문제가 유형별로 갈라지는 과제라면 동적이 맞습니다. 어느 쪽이든 비평 예제는 사전에 작은 모델에서 모아 두어야 합니다. 시험 직전에 작은 모델을 새로 학습하라는 뜻이 아닙니다. 이미 있는 오답을 유형으로 묶는 일입니다.
비평 예제는 정답 예제와 다릅니다. 표준 문맥 학습은 맞은 풀이를 보여 줍니다. CritICL은 틀린 풀이와 그 비평을 보여 줍니다. “이렇게 하지 말 것”이 문맥에 들어갑니다. 맞은 풀이만 넣으면 모델은 같은 실패를 다시 밟을 수 있습니다. 실패 유형이 가족과 닮았다면, 작은 모델의 틀린 풀이가 큰 모델에게는 더 싼 힌트입니다.
생성을 늘리기 전에 실패 문맥을 넣습니다
초록은 CritICL이 표준 문맥 학습보다 앞섰고, 시험 시간 스케일링과 겨루거나 더 나았다고 적습니다. 그러면서 생성 횟수와 토큰 비용은 더 낮다고 적습니다. 정확도 퍼센트는 없습니다. 오늘 본문에 넣지 않습니다. 팀이 받아갈 비교는 방향입니다. 맞은 예제만 넣는 문맥보다, 실패 비평을 넣는 문맥이 이 실험에서 앞섰습니다. 답을 여러 번 뽑아 합치는 스케일링과 겨루면서도 호출은 더 적었습니다.
운영으로 옮기면 우선순위가 바뀝니다. 제출 전에 생성 횟수를 늘릴지부터 정하지 마십시오. 작은 모델 오답 유형이 정리되어 있는지를 먼저 보십시오. 유형이 있으면 정적 비평을 프롬프트에 넣고 한 번 생성합니다. 유형이 문제마다 갈리면 동적 예측을 한 뒤 비평을 찾아 한 번 더 생성합니다. 그 다음에야 투표용 반복 생성을 검토합니다. 순서를 바꾸면 토큰만 늘고 실패는 그대로입니다.
외부 검증 모델을 붙이는 길과도 비교됩니다. 검증은 강한 모델을 한 번 더 부르거나 별도 판정 모델을 둡니다. CritICL은 작은 모델의 지난 실패를 재사용합니다. 판정 모델을 새로 두지 않고, 이미 있는 오답 비평을 문맥에 넣습니다. 검증이 필요 없다고 단정하지는 않습니다. 검증 전에 실패 문맥을 넣으라는 순서입니다.
같은 가족의 실패를 모으는 일이 먼저입니다
옮길 수 있는 전제는 같은 가족입니다. 초록은 규모를 건너 옮기는 구조화된 실패 유형이 같은 가족 안에 있다고 적습니다. 다른 가족 모델의 오답을 그대로 큰 모델에 넣는 실험은 이 초록이 주장한 범위가 아닙니다. 팀에 남길 규칙은 분명합니다. 비평 은행을 만들 작은 모델과, 답을 낼 큰 모델을 같은 가족에서 고르십시오. 가족을 섞으면 실패 유형이 안 맞을 수 있습니다.
해커톤 저장소에서는 작은 모델 오답을 유형 태그로 남기는 일이 먼저입니다. 문제, 틀린 답, 실패 유형, 한 줄 비평을 한 행으로 둡니다. 그 행이 모여야 정적 윤곽과 동적 검색이 동작합니다. 오답만 쌓고 유형이 없으면 검색할 열쇠가 없습니다. 유형만 있고 비평 문장이 없으면 큰 모델이 읽을 힌트가 없습니다. 남길 항목은 넷입니다. 문제, 오답, 유형, 비평입니다.
코드가 공개되어 있으므로 재현은 저장소에서 시작하십시오. 오늘 본문은 구현 세부와 정확도 표를 만들지 않습니다. 초록이 준 것은 틀의 이름과 두 변형과 비교 방향입니다. 그 범위를 넘는 승패를 README 제목으로 쓰지 않습니다.
비평 은행을 하루 작업으로 시작합니다
큰 모델을 여러 번 부르기 전에, 작은 모델 오답을 유형으로 묶는 일이 먼저입니다. 해커톤 첫날에 큰 API 예산을 다 쓰지 마십시오. 같은 가족 작은 모델로 과제 일부를 풀고, 틀린 답만 모아 한 줄 비평을 붙입니다. 맞은 풀이 은행과 한 파일에 섞지 않습니다. 검색 열쇠는 유형입니다. 유형이 없으면 동적 예측이 찾아 올 대상이 없고, 정적 윤곽이 고를 대상도 없습니다.
정적과 동적을 같은 실험으로 기록하지 마십시오. 정적은 전역 실패 윤곽을 넣고 한 번 생성합니다. 동적은 입력마다 실패를 예측한 뒤 비평을 찾아 생성합니다. 호출 횟수가 다릅니다. 시간이 빠듯하면 정적을 먼저 붙이고, 문제 유형이 갈라지면 동적을 추가합니다. 표준 문맥 학습, 곧 맞은 예제만 넣은 호출을 같은 표의 기준선으로 두십시오. 승패와 실패 유형만 적습니다. 정확도 퍼센트는 만들지 않습니다.
반복 생성과 외부 검증은 그 다음입니다. 초록은 생성 횟수와 토큰 비용이 더 낮다고 적습니다. 우리 로그에도 호출 횟수와 토큰을 남기면, 실패 문맥이 호출을 줄였는지 확인할 수 있습니다. 숫자를 순위표로 바꾸지 마십시오. 코드 저장소가 열려 있으므로 구현은 그곳에서 맞추고, 오늘 제출물은 비평 은행과 비교 표의 공개 주소면 충분합니다. 주소가 없는 스크린샷은 제출이 아닙니다. 다른 팀이 지금 바로 열어 볼 수 있는 공개 주소를 남기십시오.
같은 가족 전제를 팀 슬랙에도 한 줄로 남기십시오. 작은 모델과 큰 모델의 이름을 나란히 적고, 가족이 같은지를 확인합니다. 다른 가족 오답을 큰 모델 프롬프트에 넣은 실험은 별도 실험입니다. 그 실험을 하더라도 오늘 논문의 주장으로 포장하지 마십시오. 초록이 말한 옮김은 같은 가족 안의 구조화된 실패 유형입니다.
비평 문장은 짧게 쓰되, 무엇이 틀렸고 다음에 무엇을 피해야 하는지를 넣으십시오. 정답을 그대로 적어 넣는 비평은 힌트가 아니라 정답 유출입니다. 평가 라벨이 숨겨진 대회에서는 특히 그렇습니다. 실패 유형과 피해야 할 단계만 남기고, 최종 답을 비평에 적지 마십시오. 그 절제가 문맥 힌트를 평가 규정 안에 남깁니다.
표준 문맥 학습보다 앞섰다는 문장은 방향입니다. 우리 과제에서 항상 이긴다고 약속하지 않습니다. 시험 시간 스케일링과 겨루거나 더 나았다는 문장도 방향입니다. 생성 횟수와 토큰이 줄었는지를 우리 로그로 확인하는 일이 재현입니다. 확인 없이 순위표를 만들지 마십시오.
실패 유형 이름을 팀이 같이 쓰려면 짧은 목록을 먼저 고정하십시오. 목록이 없으면 같은 실패에 다른 이름이 붙고, 검색이 실패합니다. 목록은 오늘 과제에서 자주 보는 실패만 넣습니다. 없는 분류 체계를 논문 이름으로 포장하지 마십시오. 초록은 구조화된 실패 유형이 같은 가족 안에서 옮긴다고 적었을 뿐, 유형 목록을 주지 않았습니다. 우리 목록은 우리 작업물입니다. 작업물에는 우리 이름과 날짜를 남깁니다.
비평 문장을 여러 사람이 쓸 때는 정답 유출 여부를 한 번 더 보십시오. 최종 숫자나 최종 패치를 비평에 넣으면 평가가 오염됩니다. 오염된 비평 은행은 큰 모델에게 정답을 힌트가 아니라 유출로 줍니다. 대회 규정이 정답 공개를 금지하면 그 은행은 쓸 수 없습니다. 유형과 피해야 할 단계만 남기는 절제가 규정을 지킵니다. 절제된 은행을 공개 주소로 올리면 다른 팀도 같은 절제를 배웁니다.
정적 윤곽을 만든 뒤에는 그 윤곽이 어떤 오답에서 나왔는지를 한 줄로 적으십시오. 출처 없는 윤곽은 전역처럼 보이지만 실제로는 한 주의 로그일 수 있습니다. 한 주의 로그를 전역으로 부르지 마십시오. 동적 예측을 추가할 때도 예측된 유형과 찾아 온 비평의 유형이 맞는지를 확인합니다. 유형이 어긋난 비평은 표준 문맥보다 나을 이유가 없습니다. 어긋난 호출을 성공으로 기록하지 마십시오.
오늘 큰 모델을 부르기 전에 작은 모델 오답이 한 줄이라도 있는지 확인하십시오. 오답이 없으면 정적 윤곽도 동적 검색도 시작되지 않습니다. 시작되지 않은 틀을 적용했다고 쓰지 마십시오. 오답을 모으는 일이 적용의 첫 줄입니다.
이 글이 아닌 것입니다
정확도 퍼센트를 공개한 글이 아닙니다. 초록은 표준 문맥 학습보다 앞섰고, 시험 시간 스케일링과 겨루거나 더 나았다고만 적습니다. 없는 점수를 표에 넣지 않습니다.
생성을 반복하면 안 된다는 금지도 아닙니다. 반복과 외부 검증의 비용을 지적하고, 실패 문맥으로 호출을 줄이는 대안을 제시합니다. 반복이 필요한 자리까지 없애라는 운영이 아닙니다.
다른 가족 모델의 실패를 그대로 옮기라는 주장도 아닙니다. 전제는 같은 가족 안의 구조화된 실패 유형입니다. 가족을 섞은 이전은 이 초록의 범위가 아닙니다.
작은 모델을 큰 모델로 학습하라는 사후학습 논문이 아닙니다. 추론 시간에 문맥 예제로 넣는 틀입니다. 가중치를 갱신한다고 적히지 않았습니다.
외부 검증이 필요 없다고 단정한 글도 아닙니다. 검증 전에 실패 비평을 넣으라는 순서입니다. 검증 모델을 오늘 버리라는 문장이 아닙니다.
오늘 할 일
첫째, 초록과 코드를 같이 여십시오. arXiv:2608.27455와 GitHub를 체크리스트에 올립니다. 정확도 숫자를 추정해 적지 않습니다. 저자 일곱 이름과 제출일 2026-08-27을 메모 첫 줄에 둡니다.
둘째, 같은 가족에서 작은 모델과 큰 모델을 한 쌍으로 고르십시오. 가족을 섞지 않습니다. 작은 모델로 해커톤 과제 일부를 풀어 오답만 남깁니다. 맞은 풀이 예제 은행과 섞어 한 파일로 두지 않습니다.
셋째, 오답마다 유형과 한 줄 비평을 붙이십시오. 행은 문제, 오답, 유형, 비평입니다. 유형이 없는 오답은 검색에 쓰지 않습니다. 오답이 조금 모여도 정적 윤곽을 시작할 수 있습니다. 개수를 논문 숫자처럼 쓰지 않습니다. 우리 작업량만 적습니다.
넷째, 정적 비평을 프롬프트에 넣고 큰 모델을 한 번 호출하십시오. 표준 문맥 학습, 곧 맞은 예제만 넣은 호출과 같은 문제로 비교합니다. 승패와 실패 유형만 적습니다. 없는 퍼센트를 채우지 않습니다.
다섯째, 문제가 갈라지면 동적 예측을 한 번 추가하십시오. 입력마다 실패 유형을 예측하고 비평을 찾아 최종 생성을 합니다. 정적과 동적을 한 방법으로 기록하지 않습니다. 호출 횟수를 로그에 남깁니다.
여섯째, 반복 생성 스케일링과 토큰 비용을 같은 표에 놓으십시오. 초록은 생성 횟수와 토큰 비용이 더 낮다고 적습니다. 우리 과제에서 호출이 줄었는지만 확인합니다. 정확도 숫자를 만들어 순위를 내지 않습니다.
일곱째, 비평 은행과 비교 표를 공개 링크로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 스크린샷만 채팅에 남기고 주소를 비우지 않습니다. 배포가 제출입니다. 올린 링크가 제출입니다.