본문으로 건너뛰기

검열 해제 오픈 모델 3,471개 — 재배포자 3곳이 52%

10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.

AI피셜 편집부· 3분 읽기원문 보기 ↗
데이터센터 안에 줄지어 선 컴퓨터 랙
사진: Wilweterings · Public domain

핵심 답변

10a Labs 연구진은 2024년 1월부터 2026년 3월까지 Hugging Face에서 안전장치를 제거한 원본 모델 3,471개와 압축 재배포 8,164건을 찾았고, 재배포의 52%를 세 계정이 만들었다고 보고했습니다. 이런 모델을 쓰는 GitHub 앱 1,643개 중 25%(411개)는 명백히 악성으로 분류됐습니다.

TL;DR세 줄 요약

  • 원본 검열 해제 모델 3,471개는 평균 2.4회 재포장돼 8,164건의 압축 재배포(GGUF·AWQ·GPTQ 등)로 퍼졌습니다.
  • 재배포의 52%는 mradermacher(2,905건)·Triangle104(936건)·RichardErkhov(364건) 세 계정 몫입니다.
  • 2025년 11월 나온 Heretic CLI 이후 월간 원본 생산이 약 89개에서 약 338개로 뛰었고, 2026년 1분기 생산의 54%를 차지했습니다.
  • GitHub 앱 1,643개 중 25%가 명백히 악성이고 43%는 Ollama를 참조합니다. 논문은 재배포 단계가 생태계의 '가장 좁은 지점'이라고 봅니다.

핵심 사실

조사 기간
2024-01 ~ 2026-03Hugging Face + 공개 GitHub
원본 검열 해제 모델
3,471개Hugging Face
압축 재배포
8,164건원본당 평균 2.4회
상위 3개 재배포 계정 비중
52%mradermacher 36% · Triangle104 11% · RichardErkhov 4%
통합 GitHub 앱
1,643개25%(411개) 명백히 악성
Heretic 전후 월 생산
약 89 → 약 338개2025-11 출시 전 22개월 / 후 4.5개월

무슨 일인가요

10a Labs 연구진이 9월 4일 arXiv에 올린 논문 "Uncensored Open-weight Models: Redistribution as the Persistence Layer"는 오픈웨이트 모델의 안전장치를 벗겨 내는 생태계를 통째로 측정했습니다. 논문 2024년 1월부터 2026년 3월까지 Hugging Face에서 원본 검열 해제 모델 3,471개를 찾았고, 각 원본은 평균 2.4회 재포장돼 8,164건의 압축 재배포(GGUF·AWQ·GPTQ·EXL2·MLX)로 퍼졌습니다. 논문 재배포의 52%는 세 계정이 만들었습니다. mradermacher 2,905건(36%), Triangle104 936건(11%), RichardErkhov 364건(4%)입니다. 논문

압축 재배포 상위 3개 계정 (전체 8,164건)
0건1,250건2,500건3,750건5,000건mradermacherTriangle104RichardErkhov2,905건936건364건
압축 재배포 상위 3개 계정 (전체 8,164건)
항목재배포 건수
mradermacher2,905건
Triangle104936건
RichardErkhov364건

출처: arXiv:2609.05241 (10a Labs, 2026-09-04)

어떻게 쟀나요

연구진은 중국어·일본어 표현을 포함한 고신호 검색어 43개와 맥락 의존 검색어 12개로 Hugging Face 모델·데이터셋 저장소를 훑고, 다작 생산자 15곳의 저장소를 전수 크롤링해 후보 17,727개를 모았습니다. 이를 GPT-5 분류기가 원본·압축 재배포·병합·악성 데이터셋·오탐으로 나눠, 안전장치 제거와 연관된 저장소 12,360개를 얻었습니다. 논문 GitHub 쪽은 후보 44,705개를 걸러 검열 해제 LLM을 통합한 앱 1,643개(별 11,600개 이상, 포크 1,800개 이상)를 확정했습니다. 논문

네트워크 장비 랙에 파란색 랜케이블이 어지럽게 엉켜 있는 배선실
논문은 원본 제작보다 재배포 단계가 이 생태계의 가장 좁은 지점이라고 봤습니다.· 사진: Wikimedia Commons · Public domain

기법은 세 갈래입니다. 내부 표현에서 거부 방향을 억제하는 활성화 공간 어블리터레이션, 거부 응답을 걸러 낸 SFT·DPO·LoRA 미세조정, 그리고 검열 해제 모델을 다른 모델과 섞어 추론 능력 등을 보강하는 병합입니다. 논문 2025년 11월 공개된 Heretic CLI는 이 작업을 터미널 명령 하나로 줄였는데, 출시 전 22개월간 월 약 89개이던 원본 생산이 출시 후 4.5개월간 월 약 338개로 늘었고 2026년 1분기 생산의 54%가 이 도구로 만들어졌습니다. 논문

어떤 모델이, 어디에 쓰이나요

항목수치
서구 기반 모델 비중57% (그중 Llama 52%, Gemma 17%, Mistral·Mixtral 15%)
중국 기반 모델 비중전체의 38% (그중 Qwen 80%)
중국 기반 분기별 점유율2024년 1분기 1% → 2025년 2분기 55%, 이후 43~51%
앱 용도범용 챗봇 37%, 사이버 보안 도구 16%, 문서 처리 16%
앱 배포 경로Ollama 참조 43%, Hugging Face 직접 다운로드 14%, 텔레그램 봇 110개
명백히 악성인 앱25% (411개), 전용 악성코드 생성기 9개

Dolphin 계열이 앱의 30%(499개)를 움직이고, huihui-ai 모델은 109개 앱에 그치지만 합산 별 4,264개로 가장 많은 관심을 받았습니다. 논문 생산자 1,055곳과 재배포자 1,011곳은 24%만 겹칩니다. 논문은 생산자 단계의 삭제가 "가용성을 의미 있게 줄이지 못한다"고 결론짓습니다. Triangle104는 수집 뒤 프로필과 모델이 지워졌지만 936건의 재배포는 남아 있었습니다. 논문 대신 세 계정이 52%를 만드는 재배포 단계가 "생태계의 가장 좁은 지점"이며, 배포 관측은 모델 메타데이터가 아니라 README·레지스트리 출처·기능 범주 같은 애플리케이션 층에서 해야 한다고 제안합니다. 논문

자주 묻는 질문

검열 해제(uncensoring)란 무엇인가요?
오픈웨이트 모델에 학습된 거부 행동을 의도적으로 걷어내는 기법을 뜻합니다. 내부 표현에서 거부 방향을 억제하는 활성화 공간 어블리터레이션, 거부 응답을 걸러 낸 SFT·DPO·LoRA 미세조정, 검열 해제 모델을 다른 모델과 섞는 병합이 있으며, 2025년 11월 나온 Heretic CLI는 이를 터미널 명령 하나로 줄였습니다.
어느 기반 모델이 가장 많이 쓰이나요?
서구 기반이 57%로, 그중 Llama 52%, Gemma 17%, Mistral·Mixtral 15%입니다. 중국 기반은 전체의 38%이며 그중 80%가 Qwen입니다. 중국 기반 비중은 2024년 1분기 1%에서 2025년 2분기 55%로 올랐고 이후 43~51% 사이를 오갑니다.
원본을 삭제하면 해결되나요?
논문은 생산자 단계의 삭제가 가용성을 의미 있게 줄이지 못한다고 봅니다. 원본은 평균 2.4회 재포장되고, Triangle104는 수집 뒤 프로필과 모델이 지워졌는데도 936건의 재배포가 남았습니다. 대신 세 계정이 52%를 만드는 재배포 단계와 Ollama 같은 레지스트리가 더 좁은 병목이라고 제안합니다.

출처 · 2

  1. 1Uncensored Open-weight Models: Redistribution as the Persistence Layer (arXiv:2609.05241, 초록)논문arxiv.org/abs/2609.05241
  2. 2같은 논문 HTML 전문 (arXiv)논문arxiv.org/html/2609.05241

이 글의 마크다운 원문: /posts/uncensored-open-weight-model-ecosystem/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

NeoMME — 2.6억 파라미터로 3.75B급 문서 검색

H Company가 9월 3일 공개한 NeoMME는 비전 타워 없이 하나의 Transformer로 텍스트와 이미지 패치를 처리합니다. ViDoRe v3 점수, 처리량, 255배 압축 결과를 정리했습니다.

  • #논문
  • #오픈 모델
  • #멀티모달