로컬에서 AI 모델을 돌려 보려고 마음먹으면 첫 벽이 늘 같아요. 내 그래픽카드에 뭐가 들어가지?
모델 이름 옆에 붙은 7B, 13B 같은 숫자를 보고 감으로 짐작하게 되는데, 실제 다운로드 용량은 양자화 방식에 따라 크게 달라져요. 그래서 전부 재 봤어요.
결론부터 적을게요. 올라마 공식 라이브러리 219개 모델의 다운로드 조합 7,004개를 전수로 쟀어요. 기본 태그 기준 중앙값은 4.80GB이고, 16GB 그래픽카드에 들어가는 것은 212개 중 160개예요. 8GB면 143개고요.
이 글이 재는 자리를 먼저 못박을게요. 공개 라이브러리 페이지에 적힌 다운로드 용량 값만 봐요. 실제로 내려받아 돌려 본 게 아니고, 속도나 품질을 잰 것도 아니에요. 잰 것은 표에 적힌 숫자까지예요.

어떻게 쟀는지 먼저 밝힐게요
| 항목 | 값 |
|---|
| 자료 | 올라마 공식 라이브러리 목록 페이지와 각 모델의 태그 페이지 |
| 인증 | 없음. 공개 경로 |
| 목록에서 찾은 모델 | 238개 |
| 태그 표를 읽어 낸 모델 | 219개 |
| 읽지 못한 모델 | 19개 |
| 모은 다운로드 조합 | 7,004개 |
| 기본 태그가 있는 모델 | 212개 |
| 조회 일시 | 2026년 8월 28일 (한국 시각) |
읽지 못한 19개를 먼저 밝혀 둘게요. 임베딩 전용 모델 몇 개와 아주 최근에 올라온 모델들이었어요. 태그 표의 생김새가 달라서 같은 방법으로 숫자를 뽑을 수 없었어요. 그래서 아래 숫자는 238개가 아니라 219개 기준이에요.
그래픽카드 메모리별로 몇 개가 들어가나요
기본 태그 용량을 그래픽카드 메모리의 85퍼센트와 견줘 세었어요.
| 그래픽카드 메모리 | 들어가는 모델 | 212개 중 비율 |
|---|
| 4GB | 43개 | 20.3% |
| 6GB | 122개 | 57.5% |
| 8GB | 143개 | 67.5% |
| 12GB | 157개 | 74.1% |
| 16GB | 160개 | 75.5% |
| 24GB | 180개 | 84.9% |
여기서 눈여겨보실 대목이 두 개예요.
첫째, 4GB와 6GB 사이가 절벽이에요. 43개에서 122개로 세 배 가까이 뜁니다. 흔한 소형 모델들이 이 구간에 몰려 있어요.
둘째, 8GB에서 16GB로 올려도 17개밖에 안 늘어나요. 143개에서 160개예요. 8GB를 넘어가는 모델들은 대체로 훨씬 커서, 중간 지점을 올리는 것보다 아예 큰 폭으로 올려야 개수가 늘어나요. 24GB로 가면 180개가 돼요.
왜 85%로 쟀는지도 적어 둘게요. 모델 파일 말고도 문맥을 담는 공간과 화면 출력용 메모리가 같이 들어가요. 파일 크기가 메모리와 딱 같으면 실제로는 안 올라가요. 85%는 여유를 두려고 이 글이 잡은 기준이고 법칙은 아니에요.
이 표를 뒤집어 읽으면 이렇게도 돼요. 16GB에 안 들어가는 모델이 52개 남아요. 212개 중 사분의 일이에요. 그러니까 그래픽카드를 아무리 좋게 맞춰도 개인용 장비로는 손이 닿지 않는 구간이 늘 남아 있다는 뜻이에요. 반대로 말하면 나머지 사분의 삼은 이미 손 안에 있어요. 로컬 모델을 시작하지 못하는 이유가 장비인 경우는 생각보다 드물어요.
카드를 새로 사실 생각이라면 이 표를 견적서 옆에 놓고 보시면 좋아요. 6GB에서 8GB로 가면 21개가 열리는데 8GB에서 12GB로 가면 14개, 12GB에서 16GB로 가면 3개예요. 돈을 더 쓸수록 열리는 개수는 줄어들어요. 개수 대신 그 구간에 있는 모델이 나에게 필요한 것인지를 보셔야 해요.

용량 분포는 이렇게 생겼어요
기본 태그 212개의 용량을 정리하면 이래요.
| 값 | 용량 |
|---|
| 최소 | 0.27GB |
| 중앙값 | 4.80GB |
| 상위 10퍼센트 경계 | 40.00GB |
| 최대 | 404.00GB |
최소와 최대가 1,500배 가까이 차이 나요.
가장 작은 쪽은 대체로 임베딩용이거나 아주 작은 대화 모델이에요. 0.27GB짜리 임베딩 모델을 빼면 0.29GB, 0.61GB, 0.62GB 순이에요. 0.62GB짜리는 이름에 tiny가 붙은 소형 대화 모델들이에요.
가장 큰 쪽은 404GB가 두 개, 133GB가 하나, 96GB, 87GB, 80GB 순으로 이어져요. 404GB는 개인용 그래픽카드로는 다룰 수 있는 크기가 아니에요. 이런 모델이 라이브러리에 있다는 건 서버용으로 쓰라는 뜻이에요.
한 가지 더요. 기본 태그가 아니라 그 모델의 가장 작은 태그를 기준으로 세면 숫자가 조금 달라져요. 8GB에 들어가는 모델이 219개 중 161개, 16GB에서는 168개가 돼요. 기본 태그 기준과 크게 다르지 않아요. 작은 태그를 고른다고 큰 모델이 갑자기 들어오지는 않는다는 뜻이에요.
태그가 왜 이렇게 많은가요
219개 모델에 다운로드 조합이 7,004개예요. 모델 하나에 평균 32개씩 붙어 있는 셈이에요.
| 모델 | 태그 수 |
|---|
| 가장 많은 모델 | 378개 |
| 두 번째 | 198개 |
| 세 번째 | 198개 |
| 네 번째 | 173개 |
태그가 늘어나는 이유는 매개변수 규모와 양자화 방식의 조합이 각각 하나씩 태그가 되기 때문이에요. 3B와 7B가 있고 양자화가 열여섯 가지면 그것만으로 서른두 개가 돼요.
양자화 표기를 세어 봤어요.
| 표기 | 태그 수 |
|---|
| q8_0 | 563개 |
| q4_K_M | 547개 |
| fp16 | 481개 |
| q4_0 | 400개 |
| q4_1 | 387개 |
| q5_0 | 387개 |
서로 다른 표기가 16가지였어요. 이 글은 어느 것이 낫다고 판단하지 않았어요. 다만 가장 흔한 두 가지가 q8_0과 q4_K_M이라는 건 세어 둘 만해요. 처음 고르실 때 이 둘 중 하나가 있을 확률이 높다는 뜻이니까요.
태그 개수가 많다는 사실 자체도 실용적인 뜻이 있어요. 목록에서 모델 이름만 보고 "이건 너무 크다"고 넘겨 버리기 쉬운데, 같은 모델 안에 훨씬 작은 태그가 함께 들어 있는 경우가 많아요. 태그가 378개인 모델이라면 그중 상당수는 소형 조합이에요. 그러니까 모델을 먼저 고르고 그 안에서 태그를 고르는 순서가, 처음부터 작은 모델만 찾아다니는 것보다 선택지가 넓어요.

문맥 창은 어떻게 나뉘어 있나요
태그에 표시된 문맥 창도 세어 봤어요.
| 문맥 창 | 태그 수 |
|---|
| 32K | 1,601개 |
| 4K | 1,487개 |
| 8K | 1,004개 |
| 128K | 926개 |
| 16K | 692개 |
| 2K | 607개 |
| 256K | 259개 |
| 1M | 58개 |
32K가 가장 흔하고, 4K도 여전히 많아요. 4K와 2K를 합치면 2,094개로 전체 7,004개의 29.9%예요. 세 개 중 하나 가까이가 아직 짧은 문맥이에요. 오래된 모델들이 이 구간에 남아 있어요.
여기서 조심할 게 있어요. 표시된 문맥 창은 최댓값이지 기본값이 아니에요. 그리고 문맥을 길게 잡을수록 메모리가 더 필요해요. 128K짜리 모델을 8GB 카드에 올렸다고 해서 128K를 다 쓸 수 있는 건 아니에요.
그래서 어떻게 고르면 되나요
- 먼저 내 그래픽카드 메모리를 확인하세요. 그 숫자의 85%가 실질 한도예요.
- 8GB라면 143개 안에서 고르시면 돼요. 선택지가 좁지 않아요. 전체의 3분의 2예요.
- 16GB로 올릴 계획이라면 17개가 더 열린다는 걸 알고 결정하세요. 개수만 보면 큰 차이가 아니에요. 다만 그 17개가 더 큰 모델이라 성능이 다를 수 있어요.
- 모델 이름 옆의 B 숫자만 보지 마세요. 같은 7B라도 양자화에 따라 파일 크기가 몇 배 차이 나요.
- 문맥을 길게 쓰실 거면 여유를 더 두세요. 85%도 빠듯할 수 있어요.
설치부터 처음 해 보시는 거라면 올라마와 오픈웹UI 설치 가이드를, 비용 없이 로컬 환경을 꾸리는 전체 흐름은 무료 로컬 LLM 구축 가이드에 정리해 뒀어요.
한 가지만 덧붙일게요. 여기서 잰 것은 내려받는 파일의 크기예요. 모델을 실제로 올려 돌릴 때 메모리를 얼마나 쓰는지는 문맥 길이와 실행 방식에 따라 또 달라져요. 그래서 이 표는 후보를 좁히는 자로 쓰시고, 최종 확인은 직접 한 번 올려 보시는 편이 확실해요.
확인하지 못한 것
정직하게 적어 둘게요.
- 19개 모델을 세지 못했어요. 태그 표의 형식이 달라 숫자를 뽑을 수 없었어요. 238개 중 219개 기준이라는 점을 표에 적어 뒀어요.
- 실제로 돌려 보지 않았어요. 속도, 품질, 안정성은 이 글이 잰 것이 아니에요.
- 메모리 실사용량을 재지 않았어요. 파일 크기와 실제 점유량은 다르고, 85%는 이 글이 잡은 여유값이에요.
- CPU와 통합 메모리로 돌리는 경우를 보지 않았어요. 그래픽카드 메모리 기준으로만 셌어요.
- 양자화 방식의 품질 차이를 판단하지 않았어요. 표기 개수만 셌어요.
- 다운로드 수나 인기 순위를 보지 않았어요. 페이지에서 받아 오지 않았어요.
정리
올라마 라이브러리는 생각보다 넓어요. 219개 모델에 다운로드 조합이 7,004개예요.
그리고 8GB 그래픽카드로도 143개가 돌아가요. 전체의 3분의 2예요. 16GB로 올리면 160개가 되지만 늘어나는 폭은 17개뿐이에요.
용량 중앙값이 4.80GB라는 것만 기억해 두셔도 충분해요. 절반은 그보다 작아요. 처음 시작하실 때 400GB짜리를 보고 겁먹지 않으셔도 돼요.