5090 한 장으로 2B 모델을 6,900달러 안에 학습했습니다 | DAKER 커뮤니티

2026년 8월 27일 Kairong Luo 연구팀이 소비자용 RTX 5090 GPU에서 처음부터 학습한 Puro-2B 모음과 그 레시피를 arXiv에 공개했습니다. Llama-3.2-3B 학습 비용은 150만 달러를 넘고, SmolLM3-3B를 재현하는 비용은 70만 달러를 넘습니다. Puro-2B 최고 모델의 계산 비용은 6,900달러 미만이고, 저자들의 평가 프로토콜에서 Qwen2.5-1.5B에 근접합니다. 데이터와 코드와 가중치는 Apache 2.0으로 공개되어 있습니다.

가정용 데스크톱과 그래픽카드가 보이는 작은 연구실

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27370에서 확인할 수 있습니다. 저자는 Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen입니다. 분량은 62쪽입니다. 가중치와 데이터, 코드 모음은 Hugging Face 컬렉션 thu-pacman/puro-2b에 있습니다. 오늘 본문은 초록이 적은 달러와 토큰 예산만 씁니다. 초당 토큰 수와 GPU 대수는 초록에 없으므로 쓰지 않습니다. 하드웨어는 RTX 5090 GPU로만 적습니다.

5090이 들어간 미니 랩

사전학습 비용을 소비자 GPU 예산으로 내립니다

언어모델 사전학습은 비용 때문에 많은 연구실과 오픈소스 팀이 손대기 어려운 일이었습니다. 열린 가중치와 열린 학습 레시피는 이미 있습니다. 그러나 비용이 낮고 하드웨어에 접근하기 쉬운 열린 사전학습 레시피는 오래 비어 있었습니다. 작은 규모에서도 Llama-3.2-3B를 학습하는 비용은 150만 달러를 넘고, SmolLM3-3B를 재현하는 비용은 70만 달러를 넘습니다. 가중치를 받을 수는 있어도, 같은 학습을 다시 돌릴 예산이 없는 자리가 많습니다.

Puro-2B는 그 장벽을 낮추려고 처음부터 학습한 2B 규모 모음입니다. 학습은 최대 1.4T 토큰, FP8, 소비자용 RTX 5090 GPU에서 이루어졌습니다. 모음 안 모델은 토큰 예산과 레시피 조합이 다릅니다. 최고 모델의 계산 비용은 6,900달러 미만입니다. 저자들의 평가 프로토콜에서 이 모델은 Qwen2.5-1.5B에 근접합니다. 오늘 본문은 그 프로토콜 밖 점수를 만들지 않습니다. “모든 벤치에서 이겼다”는 문장으로 바꾸지 않습니다.

해커톤 팀이 받을 첫 문장은 이것입니다. 사전학습을 클라우드 대형 가속기만의 일로 두지 마십시오. 이 논문은 소비자 GPU와 낮은 정밀도와 공개 레시피로 2B 규모를 다시 돌릴 수 있다고 적습니다. 다만 GPU 대수와 초당 토큰은 초록이 주지 않습니다. 견적서에 없는 대수를 넣지 마십시오. 하드웨어 이름은 RTX 5090 GPU로 고정합니다.

다섯 가지를 같이 맞춰 비용을 줄입니다

비용이 낮아진 이유로 초록이 이름을 붙인 방법은 다섯입니다. 하드웨어 선택, 낮은 정밀도, 하이퍼볼 최적화, 커리큘럼 모델 평균, 데이터 레시피입니다. 다섯을 한 문장으로 뭉개지 않습니다. 하드웨어만 바꾸면 정밀도 이득이 빠집니다. 정밀도만 낮추면 최적화와 데이터 순서가 빠집니다. 팀에 옮길 때는 다섯 이름을 체크리스트로 적으십시오.

하드웨어 선택은 소비자용 RTX 5090 GPU입니다. 낮은 정밀도는 FP8입니다. 하이퍼볼 최적화는 가중치 갱신을 고정 반지름 안으로 묶는 최적화로 소개됩니다. 커리큘럼 모델 평균은 데이터 순서와 후반 체크포인트 평균을 같이 설계하는 방법입니다. 데이터 레시피는 어떤 토큰을 어떤 예산으로 넣는지를 정합니다. 모음 안 모델이 토큰 예산과 레시피 조합으로 갈라지는 이유가 여기 있습니다. 같은 2B라도 예산과 순서가 다르면 다른 체크포인트가 됩니다.

DAKER 빌더가 작은 모델을 직접 돌릴 때, 이 다섯을 한 주에 다 재현할 필요는 없습니다. 오늘 할 일은 다섯 이름을 실험 일지에 적고, 우리 예산에서 손댈 항목을 고르는 일입니다. FP8만 켜고 데이터 순서를 그대로 두는 실험도 성립합니다. 커리큘럼만 바꾸고 정밀도를 그대로 두는 실험도 성립합니다. 없는 초당 토큰을 목표로 적지 않습니다. 초록이 준 달러와 토큰 예산만 비교 축으로 쓰십시오.

비용 스케일링 법칙이 4,400달러를 가리킵니다

저자들은 Puro Cost Scaling Law를 제시합니다. 학습 비용과 평균 성능을 잇는 관계입니다. 맞춘 법칙은 약 4,400달러, 곧 5,090달러보다 적은 금액으로 Qwen2-1.5B 성능에 도달하기에 충분하다고 말합니다. 최고 모델의 6,900달러 미만과 이 4,400달러는 다른 문장입니다. 전자는 모음 최고 모델이 Qwen2.5-1.5B에 근접한 계산 비용입니다. 후자는 Qwen2-1.5B 성능에 닿는 비용 추정입니다. 두 비교 대상을 한 줄에 섞지 마십시오.

숫자 읽는 규칙을 밝힙니다. 150만 달러와 70만 달러는 각각 Llama-3.2-3B 학습과 SmolLM3-3B 재현의 기존 비용입니다. 1.4T는 최대 토큰 예산입니다. 6,900달러 미만은 최고 모델 계산 비용입니다. 4,400달러와 5,090달러는 스케일링 법칙이 가리키는 Qwen2-1.5B 도달 비용입니다. 이 밖에 초당 토큰, GPU 대수, 벤치 점수 절대값은 초록에 없습니다. 없는 값을 표에 채우지 않습니다.

해커톤 견적에서 이 달러를 우리 청구서처럼 쓰지 마십시오. 계산 비용은 저자들의 회계 경계 안에서 나온 값입니다. 데이터 수집과 실패 실험과 인건비가 빠질 수 있습니다. 우리 클라우드 단가로 곱한 값이 같다고 약속하지 않습니다. 팀에 공유할 때는 “논문이 적은 계산 비용”이라고 라벨을 붙이십시오.

사전학습 커리큘럼이 사후학습을 바꿉니다

논문은 사전학습 커리큘럼이 사후학습 이후 성능을 어떻게 만드는지도 살핍니다. 가중치만 공개된 모델로는 이 비교가 어렵습니다. 전체 사전학습 파이프라인을 열어 두었기 때문에, 같은 사후학습을 다른 사전학습 순서 위에 올릴 수 있습니다. 해커톤에서 파인튜닝만 만지는 팀에게도 이 문장은 쓰입니다. 밑 모델의 데이터 순서가 다르면, 같은 지도 미세조정 뒤에도 결과가 달라질 수 있습니다.

따라서 “사후학습만 바꾸면 된다”는 운영은 이 논문과 어긋납니다. 사전학습 순서를 기록하지 않은 채 파인튜닝 결과만 비교하면, 차이를 사후학습 탓으로 오인합니다. 공개 레시피를 받아 재현할 때는 토큰 예산과 레시피 조합을 체크포인트 이름과 같이 적으십시오. 모음이 여러 개인 이유가 바로 그 조합입니다.

전체 레시피의 데이터와 코드와 가중치는 Apache 2.0으로 Hugging Face 컬렉션에 올라 있습니다. 라이선스가 열린 만큼, 해커톤 제출물에 출처를 밝히고 쓰는 길이 있습니다. 상위 데이터 일부는 원 라이선스가 다를 수 있으므로, 컬렉션 안내를 먼저 읽으십시오. 가중치만 받고 레시피를 무시하면, 이 논문이 연 비교를 닫는 셈입니다.

공개 레시피를 체크포인트 이름과 같이 읽습니다

모음이 여러 개인 이유는 토큰 예산과 레시피 조합이 다르기 때문입니다. 가중치 파일 하나만 받아 이름을 Puro-2B로 뭉개면, 4,400달러 문장과 6,900달러 문장을 구분할 수 없습니다. 컬렉션에서 체크포인트를 고를 때는 예산과 레시피 이름을 같이 적으십시오. 커리큘럼이 다른 체크포인트에 같은 사후학습을 올리는 비교는, 그 이름이 남아 있어야 성립합니다. 이름이 없으면 차이를 모델 탓으로 오인합니다.

Apache 2.0은 코드와 가중치와 레시피 데이터를 열어 두었다는 뜻입니다. 상위 데이터 일부는 원 라이선스가 다를 수 있습니다. 해커톤 제출물에 넣기 전에 컬렉션 안내를 읽고, 출처를 README에 남기십시오. 라이선스를 확인하지 않은 채 가중치만 압축해 올리면 제출이 막힐 수 있습니다. 오늘 본문은 라이선스 문구를 새로 만들지 않습니다. 공식 컬렉션이 적은 범위를 따르십시오.

소비자 GPU에서 작은 구간만 돌리는 실험은, 1.4T를 오늘 끝내라는 뜻이 아닙니다. 도는지와 어디서 멈추는지를 확인하는 실험입니다. 초당 토큰과 GPU 대수를 논문 숫자처럼 적지 마십시오. 초록이 준 하드웨어 이름은 RTX 5090 GPU입니다. 그 이상 장수를 견적서에 넣지 않습니다. 계산 비용 6,900달러 미만과 4,400달러를 우리 청구서 합계와 같다고 쓰지 마십시오. 라벨은 논문이 적은 계산 비용입니다.

기존 비용 숫자와 이 논문의 계산 비용을 한 표에 놓을 때는 라벨을 나누십시오. 백오십만 달러와 칠십만 달러는 다른 모델의 기존 학습·재현 비용입니다. 육천구백 달러 미만과 사천사백 달러는 이 모음의 계산 비용과 스케일링 추정입니다. 네 숫자를 한 순위처럼 나열하면 비교 대상이 섞입니다. 해커톤 발표 슬라이드에서 네 숫자를 한 막대로 그리지 마십시오. 막대는 같은 회계 경계를 전제합니다. 이 초록은 그 전제를 네 숫자에 같이 주지 않았습니다.

다섯 방법 가운데 오늘 손댈 항목을 고를 때는 우리 하드웨어부터 확인하십시오. 소비자 가속기가 없으면 정밀도 실험이 먼저 멈춥니다. 가속기가 있어도 데이터 레시피 없이 정밀도만 바꾸면 비교가 빈약합니다. 비교를 숨기지 말고, 손댄 항목과 그대로 둔 항목을 일지에 나누어 적으십시오. 그대로 둔 항목을 숨기면 다음 주 팀이 다섯을 다 바꿨다고 오인합니다.

사후학습 비교를 나중에 돌릴 계획이라면, 지금 체크포인트 파일 이름에 예산과 레시피를 넣으십시오. 나중에 이름을 추측해 붙이면 비교가 무너집니다. 공개 컬렉션을 받아 쓰는 팀도 같은 규칙을 적용합니다. 받은 파일의 안내를 우리 메모로 다시 쓰십시오. 안내를 읽지 않고 가중치만 호출하면, 커리큘럼이 사후학습을 바꾼다는 문장을 검증할 길이 없습니다. 검증 없는 호출은 재현이 아닙니다.

오늘 발표에서 이 논문을 인용할 때는 계산 비용이라는 말을 빼지 마십시오. 계산 비용을 총비용으로 바꾸면 청중이 청구서를 본 것처럼 듣습니다. 청구서는 이 초록에 없습니다. 소비자 가속기에서 처음부터 학습한 모음이 공개되었고, 최고 모델 계산 비용이 육천구백 달러 미만이며, 스케일링 법칙이 사천사백 달러로 이전 세대 소형 모델 성능에 닿는다고 적혀 있습니다. 그 세 문장을 유지하면 인용은 정확합니다. 장수를 보태거나 초당 처리량을 보태면 인용이 아닙니다.

해커톤에서 작은 모델을 로컬로 돌리는 일은 비용 이야기와 별개로 가치가 있습니다. 큰 원격 호출만 쓰면 실패 로그가 우리 손에 남지 않습니다. 로컬 호출은 로그가 남습니다. 남은 로그가 위키와 스킬과 비평 은행의 재료가 됩니다. 이 글은 그 재료를 만드는 쪽을 응원합니다. 응원은 숫자가 아니라 공개 주소로 증명하십시오.

공개 주소를 남길 때는 어떤 체크포인트를 받았는지, 어떤 항목을 손댔는지를 같이 적으십시오. 이름 없는 로그는 재현 기록이 아닙니다.

손댄 항목과 그대로 둔 항목을 오늘 일지 첫머리에 나누어 적으십시오.

체크포인트 이름을 오늘 로그 첫 줄에 그대로 옮기십시오.

라이선스 안내는 오늘 제출 README에도 한 줄로 옮기십시오.

이 글이 아닌 것입니다

GPU 한 장으로 끝났다고 대수까지 확정한 글이 아닙니다. 초록은 RTX 5090 GPU라고 복수로 적습니다. 대수는 주지 않습니다. 오늘 본문에서 장수를 지어내지 않습니다. 초당 토큰도 없습니다.

모든 벤치에서 Qwen2.5-1.5B를 이겼다는 글도 아닙니다. 최고 모델이 저자들의 평가 프로토콜에서 그 모델에 근접한다고 적혀 있습니다. 프로토콜 밖 승패를 만들지 않습니다.

4,400달러와 6,900달러를 같은 비교로 읽은 글도 아닙니다. 4,400달러는 Qwen2-1.5B 도달 추정입니다. 6,900달러 미만은 최고 모델이 Qwen2.5-1.5B에 근접한 계산 비용입니다.

총비용 청구서를 공개한 글이 아닙니다. 계산 비용입니다. 데이터 전처리와 실패 런과 인건부를 포함한다고 적히지 않았습니다. 우리 견적과 같다고 쓰지 않습니다.

상용 API 출시 공지가 아닙니다. 연구 레시피와 공개 가중치입니다. 특정 클라우드가 오늘 이 모델을 호스팅한다고 적힌 글이 아닙니다.

오늘 할 일

첫째, 초록과 컬렉션을 같이 여십시오. arXiv:2608.27370Hugging Face 컬렉션을 같은 체크리스트에 올립니다. Apache 2.0 범위와 상위 데이터 라이선스를 먼저 읽습니다. 62쪽 전부보다 초록의 달러와 토큰 예산을 먼저 고정합니다.

둘째, 비교 대상을 두 줄로 나누십시오. Qwen2-1.5B는 약 4,400달러 문장입니다. Qwen2.5-1.5B는 6,900달러 미만 최고 모델 문장입니다. 한 표에 섞지 않습니다. Llama-3.2-3B 150만 달러와 SmolLM3-3B 70만 달러는 기존 비용 참고로만 둡니다.

셋째, 다섯 방법 이름을 실험 일지에 적으십시오. 하드웨어 선택, 낮은 정밀도, 하이퍼볼 최적화, 커리큘럼 모델 평균, 데이터 레시피입니다. 우리 예산에서 손댈 항목 하나만 고릅니다. 없는 GPU 대수를 목표로 적지 않습니다.

넷째, 소비자 GPU에서 FP8 학습이 도는지 작은 구간만 확인하십시오. 1.4T 전체를 오늘 돌리지 않습니다. 도는지, 어디서 멈추는지를 로그로 남깁니다. 초당 토큰을 논문 숫자처럼 쓰지 않습니다. 초록에 그 숫자가 없습니다.

다섯째, 공개 체크포인트 하나를 받아 해커톤 과제에 붙이십시오. DAKER 월간 해커톤이나 DACON 코드 제출 과제에 로컬 2B를 한 번 호출합니다. 큰 API 기준선과 같은 입력으로 비교합니다. 승패만 적고 없는 벤치 점수를 채우지 않습니다.

여섯째, 사전학습 커리큘럼이 다른 체크포인트를 같은 사후학습으로 비교할 계획을 한 줄 적으십시오. 지금 돌리지 못해도, 어떤 두 체크포인트를 비교할지는 남겨 둡니다. 파인튜닝 차이로만 결과를 설명하지 않기 위한 메모입니다.

일곱째, 컬렉션 링크와 재현 로그를 공개 주소로 올리십시오. DAKER와 DACON에는 빌더와 대회 기록이 쌓여 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

출처: arXiv:2608.27370 — Puro-2B (2026-08-27) · Hugging Face 컬렉션