모델 실험 결과를 검색 가능한 카탈로그로 모읍니다 | DAKER 커뮤니티
2026년 9월 1일 CredibleAI 등이 Modelpedia를 arXiv에 공개했습니다. 논문에서 모델에 대한 finding을 LLM 보조로 추출해 모델·데이터셋·방법·개념에 연결하고, 검색 가능한 공개 카탈로그로 모읍니다. ICLR 2024·2025 채택 논문에 프로토타입을 적용해 finding 1000개 이상을 추출했다고 보고합니다. 사이트는 https://credibleai.github.io/modelpedia 이고, 코드는 https://github.com/CredibleAI/modelpedia 입니다. 카탈로그 자체를 메타분석 대상으로 삼아 커뮤니티가 모델을 어떻게 조사하는지도 봅니다. 산재한 모델 행동·실패 보고를 검색 가능하게 만드는 것이 목표입니다. 오늘 팀은 “모델 카드”와 “제3자 finding”을 한 칸에 섞지 말고, 출처 논문과 증거 유형을 README에 나란히 적습니다.
논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.01090에서 확인할 수 있습니다. 영문 제목은 Modelpedia: A Catalog of Model Findings for the Meta-Science of AI입니다. 저자는 Franciszek Bernat, Dawid Płudowski 외 (CredibleAI)입니다. PDF는 같은 번호의 pdf입니다. 코드는 GitHub CredibleAI/modelpedia에 공개되어 있습니다. 오늘 본문은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다. 없는 숫자는 쓰지 않습니다.
모델 finding을 카탈로그로 모읍니다
모델 과학은 새 벤치 점수만 쌓지 않고, 이미 학습된 모델을 조사 대상으로 둡니다. 그런데 관찰은 논문·블로그·기술 보고에 흩어져 검색이 어렵습니다. Modelpedia는 LLM 보조 파이프라인으로 논문에서 모델에 대한 finding을 추출하고, 모델·데이터셋·방법·개념·출처에 연결합니다.
프로토타입은 ICLR 2024·2025 채택 논문에 적용해 finding 1000개 이상을 추출했다고 보고합니다. 웹 서비스와 소스 코드가 공개되어 있습니다. 카탈로그를 메타분석 대상으로 삼아, 커뮤니티가 어떤 모델·데이터셋에 조사를 집중하는지도 봅니다.
DACON·DAKER에서 모델 실패 모드를 문서화할 때, 오늘 팀이 가져갈 한 줄은 이것입니다. “우리 모델이 실패한다”만 쓰지 말고, finding을 모델·데이터셋·방법·개념·출처 다섯 칸으로 나눕니다.
구조와 추출 절차
각 finding은 최소한 모델 변형, 평가 데이터셋, 사용 방법, 개념(예: failure mode·shortcut), 원출처에 연결됩니다. 관련 연구 링크도 둘 수 있습니다. 본문은 증거 유형을 observational·interventional·correlational로 나눕니다.
OpenReview API로 논문을 모으고, 초록·리뷰 키워드로 관련성을 점수화한 뒤 상위 약 15%를 LLM 추출에 넣습니다. 추출은 인용 구를 강제해 환각을 줄이려 합니다. 엔티티는 기존 레지스트리와 매칭하고, 검증기는 별도 LLM으로 finding을 확인했다고 적습니다.
사이트에서 finding 페이지를 열고 요약·주의·키 지표를 읽을 수 있습니다. 코드 저장소에는 스크리닝·프롬프트·데이터 구조가 있습니다. 해커톤 문서에는 사이트 URL과 저장소 URL을 그대로 적습니다.
메타분석에서 본 쏠림
ICLR 2025 기준 메타분석은 언어·비전-언어 모델 조사가 많고, Llama·GPT·Mistral 계열에 관심이 모인다고 봅니다. 비전 평가는 ImageNet·COCO에 치우치고, 언어 벤치는 더 다양합니다. correlational 증거가 많고 observational·interventional은 상대적으로 적습니다. 개입은 가중치 접근이 필요해 오픈웨이트에 더 많습니다.
이 숫자들은 “우리 대회 리더보드”가 아닙니다. 카탈로그에 쌓인 finding의 분포입니다. 없는 순위를 붙이지 않습니다. 팀이 벤치를 고를 때 ImageNet만 반복하는지 점검하는 질문으로 씁니다.
빌더 팀에 옮기는 점검
모델 행동·실패를 이슈로만 남기지 말고, Modelpedia식 필드로 이슈 템플릿을 만듭니다. 모델·데이터셋·방법·개념·출처·증거 유형을 필수 칸으로 둡니다.
finding 1000개 이상을 우리 규모로 오해하지 마십시오. ICLR 2024·2025 프로토타입 추출량입니다. 사이트와 코드를 북마크한 뒤, 우리 도메인 논문 한 편으로 수동 finding을 먼저 적어 봅니다.
닫힌 가중치 모델만 쓰면 correlational에 머물 가능성이 큽니다. 오픈웨이트로 개입 실험을 할지 제품 정책에 적습니다. DAKER 제출 README에는 “벤치 점수”와 “finding 목록”을 분리합니다.
Controller·Worker를 나누는 팀이면, Worker 실패 로그를 finding 초안으로 자동 변환할지 검토하십시오. 자동 추출이면 인용 구 검증을 반드시 둡니다.
Modelpedia는 모델 카드·데이터시트와 다른 층입니다. 카드가 제작자 문서라면, finding은 제3자 논문이 남긴 관찰을 모읍니다. ICLR 2024·2025에서 1000개 이상 추출했다는 보고를 우리 내부 위키 규모와 비교해 과장하지 마십시오. 사이트 https://credibleai.github.io/modelpedia 에서 finding을 검색하고, 코드 https://github.com/CredibleAI/modelpedia 에서 추출 프롬프트를 확인합니다. 증거 유형 correlational이 많다는 메타분석은 “개입이 부족하다”는 팀 회고 문장으로만 옮깁니다. 비전 평가가 ImageNet·COCO에 쏠린다는 관찰도 벤치 선택 점검에 씁니다. 추출 finding의 진위는 카탈로그가 보증하지 않습니다. as-is로 모은다고 본문에 적혀 있습니다. DACON·DAKER 문서에는 벤치 표와 finding 표를 나누고, 각 finding에 출처 URL을 붙입니다. 배포가 제출입니다. 올린 링크가 제출입니다.
커뮤니티에 기여할 때는 새 venue finding을 추출해 카탈로그에 더하는 경로를 저장소에서 확인합니다. 우리 팀이 내부 모델 finding을 공개할 때도 같은 스키마를 쓰면 검색과 비교가 쉬워집니다. 1000개 이상이라는 숫자는 프로토타입 규모이며, 앞으로 학회를 늘린다고 본문이 적습니다. 오늘 할 일은 스키마를 우리 문서에 이식하는 것입니다.
이 글이 아닌 것입니다
모든 학회 finding을 이미 다 모았다는 주장이 아닙니다. ICLR 2024·2025 프로토타입과 1000개 이상 추출 보고입니다.
추출된 finding이 사실로 검증되었다는 보증이 아닙니다. 논문 주장을 as-is로 모으며, 진위 검증은 별도 과제라고 적습니다.
벤치마크 대체재라는 설명이 아닙니다. 모델 행동·실패 보고를 검색 가능하게 만드는 카탈로그입니다.
특정 대회 우승 공지가 아닙니다. 메타과학용 공개 카탈로그와 코드 안내입니다.
오늘 할 일
첫째, 초록과 PDF를 직접 여십시오. arXiv:2609.01090와 pdf를 같은 탭에 둡니다.
둘째, 사이트와 코드를 북마크하십시오. credibleai.github.io/modelpedia와 GitHub CredibleAI/modelpedia를 저장합니다.
셋째, finding 템플릿 다섯 칸을 만드십시오. 모델·데이터셋·방법·개념·출처를 이슈 양식에 넣습니다.
넷째, 증거 유형 칸을 추가하십시오. observational·interventional·correlational 중 하나를 고르게 합니다.
다섯째, 우리 모델 실패 로그 한 건을 finding으로 옮겨 보십시오. 1000개 규모와 섞어 말하지 않습니다.
여섯째, 벤치 선택 편향을 점검하십시오. ImageNet·COCO만 반복하는지 표로 봅니다.
일곱째, finding 목록과 출처 링크를 공개 주소에 올리십시오. 배포가 제출입니다. 올린 링크가 제출입니다.
출처: arXiv:2609.01090 — Modelpedia: A Catalog of Model Findings for the Meta-Science of AI (2026-09-01) · PDF · 코드/가중치