# 검열 해제 오픈 모델 3,471개 — 재배포자 3곳이 52%

> 10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/uncensored-open-weight-model-ecosystem/)
- 발행: 2026-09-06
- 카테고리: 논문 한입 · 태그: 논문, 오픈소스, AI 보안, 안전성, Hugging Face

## 핵심 답변

10a Labs 연구진은 2024년 1월부터 2026년 3월까지 Hugging Face에서 안전장치를 제거한 원본 모델 3,471개와 압축 재배포 8,164건을 찾았고, 재배포의 52%를 세 계정이 만들었다고 보고했습니다. 이런 모델을 쓰는 GitHub 앱 1,643개 중 25%(411개)는 명백히 악성으로 분류됐습니다.

## 요약

- 원본 검열 해제 모델 3,471개는 평균 2.4회 재포장돼 8,164건의 압축 재배포(GGUF·AWQ·GPTQ 등)로 퍼졌습니다.
- 재배포의 52%는 mradermacher(2,905건)·Triangle104(936건)·RichardErkhov(364건) 세 계정 몫입니다.
- 2025년 11월 나온 Heretic CLI 이후 월간 원본 생산이 약 89개에서 약 338개로 뛰었고, 2026년 1분기 생산의 54%를 차지했습니다.
- GitHub 앱 1,643개 중 25%가 명백히 악성이고 43%는 Ollama를 참조합니다. 논문은 재배포 단계가 생태계의 '가장 좁은 지점'이라고 봅니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 조사 기간 | 2024-01 ~ 2026-03 (Hugging Face + 공개 GitHub) |
| 원본 검열 해제 모델 | 3,471개 (Hugging Face) |
| 압축 재배포 | 8,164건 (원본당 평균 2.4회) |
| 상위 3개 재배포 계정 비중 | 52% (mradermacher 36% · Triangle104 11% · RichardErkhov 4%) |
| 통합 GitHub 앱 | 1,643개 (25%(411개) 명백히 악성) |
| Heretic 전후 월 생산 | 약 89 → 약 338개 (2025-11 출시 전 22개월 / 후 4.5개월) |


## 무슨 일인가요

10a Labs 연구진이 9월 4일 arXiv에 올린 논문 "Uncensored Open-weight Models: Redistribution as the Persistence Layer"는 오픈웨이트 모델의 안전장치를 벗겨 내는 생태계를 통째로 측정했습니다.  2024년 1월부터 2026년 3월까지 Hugging Face에서 원본 검열 해제 모델 3,471개를 찾았고, 각 원본은 평균 2.4회 재포장돼 8,164건의 압축 재배포(GGUF·AWQ·GPTQ·EXL2·MLX)로 퍼졌습니다.  재배포의 52%는 세 계정이 만들었습니다. mradermacher 2,905건(36%), Triangle104 936건(11%), RichardErkhov 364건(4%)입니다. 



## 어떻게 쟀나요

연구진은 중국어·일본어 표현을 포함한 고신호 검색어 43개와 맥락 의존 검색어 12개로 Hugging Face 모델·데이터셋 저장소를 훑고, 다작 생산자 15곳의 저장소를 전수 크롤링해 후보 17,727개를 모았습니다. 이를 GPT-5 분류기가 원본·압축 재배포·병합·악성 데이터셋·오탐으로 나눠, 안전장치 제거와 연관된 저장소 12,360개를 얻었습니다.  GitHub 쪽은 후보 44,705개를 걸러 검열 해제 LLM을 통합한 앱 1,643개(별 11,600개 이상, 포크 1,800개 이상)를 확정했습니다. 



기법은 세 갈래입니다. 내부 표현에서 거부 방향을 억제하는 활성화 공간 어블리터레이션, 거부 응답을 걸러 낸 SFT·DPO·LoRA 미세조정, 그리고 검열 해제 모델을 다른 모델과 섞어 추론 능력 등을 보강하는 병합입니다.  2025년 11월 공개된 Heretic CLI는 이 작업을 터미널 명령 하나로 줄였는데, 출시 전 22개월간 월 약 89개이던 원본 생산이 출시 후 4.5개월간 월 약 338개로 늘었고 2026년 1분기 생산의 54%가 이 도구로 만들어졌습니다. 

## 어떤 모델이, 어디에 쓰이나요

| 항목 | 수치 |
| --- | --- |
| 서구 기반 모델 비중 | 57% (그중 Llama 52%, Gemma 17%, Mistral·Mixtral 15%) |
| 중국 기반 모델 비중 | 전체의 38% (그중 Qwen 80%) |
| 중국 기반 분기별 점유율 | 2024년 1분기 1% → 2025년 2분기 55%, 이후 43~51% |
| 앱 용도 | 범용 챗봇 37%, 사이버 보안 도구 16%, 문서 처리 16% |
| 앱 배포 경로 | Ollama 참조 43%, Hugging Face 직접 다운로드 14%, 텔레그램 봇 110개 |
| 명백히 악성인 앱 | 25% (411개), 전용 악성코드 생성기 9개 |

Dolphin 계열이 앱의 30%(499개)를 움직이고, huihui-ai 모델은 109개 앱에 그치지만 합산 별 4,264개로 가장 많은 관심을 받았습니다.  생산자 1,055곳과 재배포자 1,011곳은 24%만 겹칩니다. 논문은 생산자 단계의 삭제가 "가용성을 의미 있게 줄이지 못한다"고 결론짓습니다. Triangle104는 수집 뒤 프로필과 모델이 지워졌지만 936건의 재배포는 남아 있었습니다.  대신 세 계정이 52%를 만드는 재배포 단계가 "생태계의 가장 좁은 지점"이며, 배포 관측은 모델 메타데이터가 아니라 README·레지스트리 출처·기능 범주 같은 애플리케이션 층에서 해야 한다고 제안합니다. 


저자들이 밝힌 한계입니다. 범위가 Hugging Face와 공개 GitHub에 그쳐 ModelScope·Gitee·비공개 저장소·자체 호스팅은 빠졌습니다. 분류는 사람 검증 없이 LLM 한 번 통과로 이뤄졌고 후보의 30.3%가 오탐으로 분류됐으며 정밀도·재현율은 측정하지 않았습니다. 원본의 21%는 메타데이터에 기법 신호가 없고, 2026년 1분기는 2.3개월치라 다른 분기와 직접 비교가 어렵습니다. GitHub 검색 API가 쿼리당 1,000건으로 잘려 비영어권 앱은 과소집계됐을 수 있습니다. 



이 논문의 쓸모는 "검열 해제 모델이 많다"는 사실이 아니라 병목의 위치를 짚은 데 있습니다. 원본 제작자는 1,055곳이지만 압축 재배포의 절반은 세 계정에서 나오고, 앱의 43%는 Ollama를 거칩니다. 플랫폼이 손을 대려면 원본 삭제보다 재배포와 레지스트리 층이 지렛대라는 뜻입니다. 다만 같은 층이 취미 사용자와 상용 서비스를 함께 떠받치고 있어, 집행은 곧 오픈 생태계 전체의 마찰로 돌아옵니다. 



## 자주 묻는 질문

**Q. 검열 해제(uncensoring)란 무엇인가요?**

오픈웨이트 모델에 학습된 거부 행동을 의도적으로 걷어내는 기법을 뜻합니다. 내부 표현에서 거부 방향을 억제하는 활성화 공간 어블리터레이션, 거부 응답을 걸러 낸 SFT·DPO·LoRA 미세조정, 검열 해제 모델을 다른 모델과 섞는 병합이 있으며, 2025년 11월 나온 Heretic CLI는 이를 터미널 명령 하나로 줄였습니다.

**Q. 어느 기반 모델이 가장 많이 쓰이나요?**

서구 기반이 57%로, 그중 Llama 52%, Gemma 17%, Mistral·Mixtral 15%입니다. 중국 기반은 전체의 38%이며 그중 80%가 Qwen입니다. 중국 기반 비중은 2024년 1분기 1%에서 2025년 2분기 55%로 올랐고 이후 43~51% 사이를 오갑니다.

**Q. 원본을 삭제하면 해결되나요?**

논문은 생산자 단계의 삭제가 가용성을 의미 있게 줄이지 못한다고 봅니다. 원본은 평균 2.4회 재포장되고, Triangle104는 수집 뒤 프로필과 모델이 지워졌는데도 936건의 재배포가 남았습니다. 대신 세 계정이 52%를 만드는 재배포 단계와 Ollama 같은 레지스트리가 더 좁은 병목이라고 제안합니다.

## 출처

1. [Uncensored Open-weight Models: Redistribution as the Persistence Layer (arXiv:2609.05241, 초록)](https://arxiv.org/abs/2609.05241) (paper)
2. [같은 논문 HTML 전문 (arXiv)](https://arxiv.org/html/2609.05241) (paper)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._