HowtoAI
ai-guide2026-09-04 5 min read

AI 모델 파일 형식을 세어 봤어요 — 많이 받는 1,000개 중 142개는 안전한 형식을 고를 수 없어요

🤖
HowtoAI 편집팀AI 전문 에디터

AI 기술을 누구나 쉽게 활용할 수 있도록 실전 가이드를 작성합니다. ChatGPT, Claude, AI 자동화, SEO 분야를 전문으로 다룹니다.

📅 2026-09-04⏱️ 5 min read🌐 how-toai.com
목차 보기

로컬에서 모델을 받다 보면 파일 확장자가 제각각인 걸 보게 돼요. 어떤 건 .safetensors이고 어떤 건 .bin이에요. 대충 같은 거라고 넘기기 쉬운데, 불러올 때 벌어지는 일이 다릅니다.

그래서 얼마나 갈려 있는지 세어 봤어요.

결론부터 적을게요. 상위 1,000개 중 safetensors를 가진 모델은 732개예요. 그런데 142개는 pickle 계열만 있어서, 받는 쪽에서 안전한 형식을 고를 수가 없어요.

이 글이 재는 자리를 먼저 못박을게요. 공개 API가 주는 리포 파일 목록의 확장자만 봐요. 어느 모델이 악성인지는 보지 않았고, 그럴 방법도 없어요. 잰 것은 어떤 형식이 올라와 있느냐까지예요.

어두운 흑연빛 바닥에 닫힌 금속 상자가 놓인 사진

어떻게 쟀는지 먼저 밝힐게요

항목
자료허깅페이스 공개 모델 API
인증없음
받은 모델1,000개 (다운로드 많은 순)
판정 기준리포 안 파일 확장자
조회 일시2026년 9월 4일 오전 (한국 시각)

판정 규칙은 단순해요. .safetensors가 하나라도 있으면 safetensors 있음, .bin·.pt·.pth·.ckpt가 하나라도 있으면 pickle 계열 있음으로 세었어요.

한 가지 덧붙일게요. 파일 목록을 받으려면 API에 full 옵션을 켜야 해요. 기본 응답에는 리포 안 파일이 안 들어 있어서, 그냥 부르면 형식을 셀 수 없어요.

1,000개가 네 칸으로 갈려요

구분모델 수비율
safetensors 만468개46.8%
둘 다 올려 둠264개26.4%
pickle 계열만142개14.2%
둘 다 없음126개12.6%

safetensors를 가진 것은 위 두 칸을 더한 732개73.2퍼센트예요. 넷 중 셋은 안전한 형식을 쓸 수 있다는 뜻이에요.

여기서 조심할 게 있어요. 「둘 다 없음」 126개를 위험군으로 읽으시면 안 돼요. GGUF나 ONNX, 코어ML 같은 다른 형식이거나, 가중치 없이 설정만 올린 리포예요. 이 글의 판정 기준 밖이라 따로 칸을 뒀어요.

실무에서 문제가 되는 자리는 pickle 계열만 있는 142개예요. 이 경우에는 받는 쪽이 형식을 선택할 수 없어요.

왜 형식이 문제가 되나요

허깅페이스 공식 문서가 직접 적어 둔 문장으로 옮길게요.

pickle은 머신러닝에서 널리 쓰이는 직렬화 형식이고, 파이토치 모델 가중치의 기본 형식이에요. 그런데 같은 문서가 이어서 이렇게 적어요.

pickle 파일을 불러올 때 임의 코드 실행 공격이 벌어질 수 있어요.

이유는 형식의 구조에 있어요. pickle은 데이터만 담는 게 아니라 역직렬화 시점에 파이썬 코드를 돌릴 수 있도록 설계돼 있어요. 그래서 "파일을 읽는다"가 "명령을 실행한다"와 겹쳐요.

반대로 safetensors는 구조가 달라요. 공식 저장소가 형식을 이렇게 규정해요. 앞 8바이트가 헤더 크기이고, 그다음 N바이트가 JSON 헤더예요. 헤더는 반드시 { 문자로 시작해야 하고요.

헤더가 코드가 아니라 데이터라는 게 핵심이에요. 읽는 것만으로 무언가가 실행될 여지가 구조적으로 없어요. 저장소 설명도 "pickle과 달리 안전하게, 그러면서도 빠르게" 저장하는 형식이라고 적어요.

회색 콘크리트 바닥에 위 덮개가 열린 종이 상자가 놓인 모습

많이 받는 모델이라고 안전한 형식은 아니에요

여기가 가장 뒤집히는 대목이에요. pickle 계열만 있는 142개를 다운로드순으로 세워 봤어요.

다운로드어떤 모델인가확장자
5,699만 회문장 이해용 인코더 (구글)bin
3,672만 회다국어 임베딩bin, pt
1,993만 회이미지·텍스트 매칭 (오픈AI)bin
1,288만 회일본어 음성 인식bin
1,129만 회음성 합성pt, pth
967만 회소형 언어 모델 (메타)bin
741만 회다국어 음성 합성pth

1위가 5,699만 회예요. "많이 쓰이니까 안전하겠지"라는 짐작이 형식에서는 통하지 않는다는 뜻이에요.

다시 말씀드리지만 이 목록이 위험한 모델 목록은 아니에요. 널리 쓰이고 잘 알려진 곳에서 올린 것들이에요. 확인된 것은 안전한 형식이 함께 올라와 있지 않다는 사실까지예요.

용도에 따라 스무 배 차이가 나요

파이프라인별로 갈라 보니 그림이 완전히 달라졌어요.

용도전체pickle 계열만비율
이미지와 글을 함께 받는 모델166개0개0.0%
문장 유사도55개1개1.8%
글 생성218개5개2.3%
이미지 분류24개1개4.2%
특징 추출46개9개19.6%
빈칸 채우기34개10개29.4%
텍스트 분류33개12개36.4%
음성 인식93개44개47.3%

글 생성이 2.3퍼센트인데 음성 인식은 47.3퍼센트예요. 같은 허브 안에서 스무 배 차이가 나요.

왜 이렇게 갈리는지는 이 글이 단정하지 않을게요. 모델별 최종 갱신 시점을 재지 않았거든요. 확인된 것은 용도에 따라 형식 사정이 전혀 다르다는 사실까지예요.

실무로 옮기면 이렇게 돼요. 글 생성 모델만 다루시면 형식 때문에 고민할 일이 거의 없어요. 반면 음성 인식이나 오래된 인코더 계열을 쓰시면 절반 가까이가 pickle 계열만 있어서 마주치게 돼요.

둘 다 올려 둔 264개가 알려 주는 것

네 칸 중에 조용하지만 중요한 칸이 하나 있어요. safetensors와 pickle 계열을 둘 다 올려 둔 264개예요. 전체의 26.4퍼센트고요.

같은 가중치를 두 형식으로 함께 올려 둔 자리예요. 왜 그렇게 두는지 이 글이 물어보지는 않았지만, 받는 쪽에는 분명한 뜻이 있어요. 예전 도구로도 열리고 새 형식으로도 열린다는 것이고, 무엇보다 고를 수 있다는 것이에요.

그래서 실무에서는 이 264개와 앞의 468개를 같은 칸으로 묶어 보시면 돼요. 합쳐서 732개, 안전한 형식을 선택할 수 있는 자리예요.

반대로 말하면 142개만 선택지가 없어요. 이 숫자가 이 글에서 유일하게 실무를 바꾸는 값이에요. 나머지는 "고르면 된다"로 끝나거든요.

한 가지 더 짚어 둘게요. 파일이 여러 개로 쪼개진 모델도 같은 규칙으로 셌어요. 큰 모델은 가중치를 조각으로 나눠 올리는데, 조각 중 하나라도 해당 확장자면 그 형식을 가진 것으로 판정했어요. 그래서 이 표는 「그 형식으로 받을 수 있느냐」를 세는 표이지 파일 개수를 세는 표가 아니에요.

확장자 넷을 한 칸으로 묶은 이유

pickle 계열로 묶은 확장자가 넷이에요. .bin·.pt·.pth·.ckpt고요. 이름은 달라도 불러올 때 파이썬 객체를 되살리는 같은 구조를 쓰기 때문에 한 칸으로 셌어요.

실제 분포도 그 묶음이 맞다는 쪽이었어요. 가장 흔한 것은 .bin이었고, 음성 합성 계열에서 .pt.pth가 함께 쓰였어요. 확장자가 다르다고 안전성이 갈리지는 않아요.

그래서 파일 목록을 보실 때 넷 중 무엇이 있느냐가 아니라 .safetensors가 있느냐를 보시는 편이 빨라요. 있으면 그걸 쓰시면 되고, 없으면 그때부터 올린 곳을 보시면 돼요.

확인할 수 있는 방법이 두 가지 있어요

형식을 고를 수 없을 때 쓸 수 있는 것도 공식 문서에 적혀 있어요.

첫째, 허브가 pickle 안의 import 목록을 보여 줘요. 문서는 이걸 "vetting"이라고 표현해요. 파일 안에서 무엇을 불러오려 하는지 화면에서 확인할 수 있어요.

둘째, pickletools로 코드를 실행하지 않고 읽을 수 있어요. 파이썬 표준 라이브러리이고, 문서가 "코드를 실행하지 않고" 명령어를 볼 수 있다는 점을 굵게 짚어 둬요.

문서가 권하는 것은 이래요. 신뢰하는 이용자나 조직의 모델을 쓰고, 서명된 커밋에 기대고, 다른 형식에서 자동 변환하는 경로를 쓰라는 것까지예요.

승인이 필요한 모델을 받을 때 걸리는 절차는 AI 모델 접근 요청이 뜨는 이유에, 상업적으로 써도 되는지는 상위 1,000개 모델의 라이선스 태그에 따로 정리해 뒀어요.

흰 배경에 가느다란 줄을 따라 무늬 없는 꼬리표가 걸려 있는 모습

확인하지 못한 것

정직하게 적어 둘게요.

  • 악성 모델을 세지 않았어요. 이 글은 형식 분포만 봤어요. pickle이라고 악성인 게 아니에요.
  • 허브의 pickle 스캔 결과를 받지 않았어요.
  • 모델별 최종 갱신일을 재지 않았어요. 그래서 "오래된 모델이라서"를 결론으로 쓰지 않았어요.
  • GGUF나 ONNX의 안전성을 비교하지 않았어요. 다른 축이에요.
  • 허브 전체를 세지 않았어요. 다운로드 상위 1,000개 안의 값이에요.

정리

세 줄로 줄이면 이래요.

첫째, 넷 중 셋은 safetensors를 쓸 수 있어요. 732개, 73.2%예요.

둘째, 142개는 고를 수가 없어요. pickle 계열만 올라와 있고, 그중에는 다운로드 5,699만 회짜리도 있어요.

셋째, 용도에 따라 스무 배 갈려요. 글 생성은 2.3%, 음성 인식은 47.3%예요.

받으실 때 파일 목록에서 .safetensors가 있는지 한 번 보는 것만으로 대부분 정리돼요. 없다면 그 모델을 올린 곳이 믿을 만한지를 한 번 더 생각해 보시면 되고요.

❓ 자주 묻는 질문 (FAQ)

safetensors가 뭐가 다른가요?

불러올 때 코드가 실행되지 않는 구조예요. 공식 저장소 설명을 보면 앞 8바이트가 헤더 크기이고 그다음이 JSON 헤더예요. 헤더가 코드가 아니라 데이터라서, 파일을 읽는 것만으로 무언가가 실행될 여지가 없어요. 반면 pickle은 불러오는 과정 자체가 명령을 실행하는 구조예요.

그러면 bin 파일은 위험한가요?

형식이 위험을 허용한다는 것과 그 파일이 악성이라는 것은 달라요. 허깅페이스 공식 문서는 pickle 파일을 불러올 때 임의 코드 실행 공격이 가능하다고 적고, 신뢰하는 이용자나 조직의 모델을 쓰라고 권해요. 이 글은 형식 분포만 셌고 어느 모델이 악성인지는 보지 않았어요.

상위 1,000개 중 얼마나 되나요?

safetensors를 가진 모델이 732개로 73.2%예요. 그중 safetensors만 있는 것이 468개, pickle 계열과 둘 다 올려 둔 것이 264개예요. pickle 계열만 있는 것이 142개고, 둘 다 없는 것이 126개예요.

둘 다 없는 126개는 뭔가요?

GGUF나 ONNX, CoreML 같은 다른 형식이거나 가중치 없이 설정만 올린 리포예요. 위험군이 아니라 이 글의 판정 기준 밖이라 따로 세었어요.

용도에 따라 다른가요?

많이 달라요. 글 생성 모델은 218개 중 5개로 2.3%만 pickle 계열만 있어요. 이미지와 글을 함께 받는 모델은 166개 중 0개예요. 반대로 음성 인식은 93개 중 44개로 47.3%예요. 같은 허브 안에서 스무 배 차이가 나요.

많이 쓰는 모델이면 안전하지 않나요?

그 통념이 성립하지 않아요. pickle 계열만 있는 모델 중 가장 많이 받는 것이 다운로드 5,699만 회였어요. 그 뒤로도 3,672만 회, 1,993만 회짜리가 이어져요. 인기와 파일 형식은 별개예요.

코드를 실행하지 않고 확인할 방법이 있나요?

공식 문서가 pickletools를 소개해요. 파이썬 표준 라이브러리이고 pickle 안의 명령어를 코드 실행 없이 읽을 수 있어요. 허깅페이스도 pickle 안의 import 목록을 허브 화면에 표시해 둬요.

📚 함께 읽으면 좋은 글 (Related Posts)

AI 사용법 가이드 더 보기 →
AI 모델 접근 요청이 뜨는 이유 — 많이 받는 1,000개 중 37개가 승인제이고 23개는 사람이 검토해요
ai-guide2026-09-03

AI 모델 접근 요청이 뜨는 이유 — 많이 받는 1,000개 중 37개가 승인제이고 23개는 사람이 검토해요

허깅페이스 다운로드 상위 1,000개 모델의 메타데이터를 받아 접근 승인 설정을 전수로 셌어요. 승인이 필요한 모델은 37개였고 자동 승인 14개, 수동 승인 23개로 갈렸어요. 상위 100위 안에만 8개가 있고 그중 5개가 한 조직 것이에요. 비로그인으로 파일을 요청해 보니 자동이든 수동이든 똑같이 401이 돌아왔어요. 조회 일시는 2026년 9월 3일 오후(한국 시각)예요.

올라마 모델 219개 용량을 전부 재 봤어요 — 16GB 그래픽카드에 들어가는 건 160개, 8GB면 143개예요
ai-guide2026-08-28

올라마 모델 219개 용량을 전부 재 봤어요 — 16GB 그래픽카드에 들어가는 건 160개, 8GB면 143개예요

올라마 공식 라이브러리에 올라온 모델 목록을 통째로 받아 다운로드 조합 7,004개의 용량을 전수로 쟀어요. 기본 태그 기준 중앙값은 4.80GB이고, 16GB 그래픽카드에 들어가는 건 212개 중 160개예요. 가장 큰 것은 404GB, 가장 작은 것은 0.27GB로 1,500배 차이가 나요. 조회 일시는 2026년 8월 28일(한국 시각)이에요.

가장 많이 내려받는 AI 모델 1,000개의 라이선스를 세어 봤어요 — 태그만 보고는 상업적으로 써도 되는지 알 수 없는 게 182개예요
ai-guide2026-08-25

가장 많이 내려받는 AI 모델 1,000개의 라이선스를 세어 봤어요 — 태그만 보고는 상업적으로 써도 되는지 알 수 없는 게 182개예요

허깅페이스 공개 목록에서 다운로드 상위 1,000개 모델을 받아 라이선스 태그를 전수로 셌어요. 아파치 2.0이 540개로 절반을 넘었지만, 태그가 아예 없는 모델이 89개, 값이 other나 unknown인 모델이 93개였어요. 합치면 182개가 태그만으로는 판단이 안 돼요. 비상업 조건이 명시된 것은 24개, 벤더 전용 라이선스가 39개였어요. 조회 일시는 2026년 8월 25일 오전 11시 35분(한국 시각)이에요.

npm에서 MCP 패키지 1,773개를 세어 봤어요 — 절반이 최근 30일에 올라왔고 258개는 1년째 멈춰 있어요
ai-tools2026-08-28

npm에서 MCP 패키지 1,773개를 세어 봤어요 — 절반이 최근 30일에 올라왔고 258개는 1년째 멈춰 있어요

자바스크립트 패키지 저장소 공개 검색 창구로 MCP 관련 패키지를 세 가지 질의로 훑어 1,773개를 모았어요. 마지막 배포일을 세니 890개가 최근 30일 안이고 258개는 1년 넘게 멈춰 있어요. 배포 계정 1,029개 중 529개가 자동화 계정 하나였고, 저장소 링크가 없는 패키지가 375개였어요. 조회 일시는 2026년 8월 28일(한국 시각)이에요.

AI 라이브러리 30개의 최소 파이썬 버전을 실측했어요 — 파이썬 3.9로는 24개가 안 깔리고 넘파이는 3.12부터예요
ai-tools2026-08-25

AI 라이브러리 30개의 최소 파이썬 버전을 실측했어요 — 파이썬 3.9로는 24개가 안 깔리고 넘파이는 3.12부터예요

파이썬 패키지 저장소 공개 API로 AI 개발에 흔히 쓰는 라이브러리 30개를 골라 최신판 메타데이터를 받고 최소 파이썬 버전을 하나씩 확인했어요. 24개가 3.10 이상을 요구하고 넘파이는 3.12 이상이에요. 상한을 건 패키지도 있어서 3.15가 나오면 두 개는 설치가 막혀요. 그리고 30개 중 7개는 지원 버전 분류값을 제대로 달아 두지 않았어요. 조회 일시는 2026년 8월 25일 오전 11시 35분(한국 시각)이에요.