
검열 해제 오픈 모델 3,471개 — 재배포자 3곳이 52%
10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.
- #논문
- #오픈소스
- #AI 보안
7편

10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.

옥스퍼드 연구자가 9월 4일 arXiv에 올린 논문입니다. 모델 20개에 12,800회 전쟁 개시 판단을 시킨 뒤 '정렬 테스트 중' 한 문장을 넣자 점수도, 판단 기준도 달라졌습니다.

arXiv 2609.04170은 형식 수학 증명을 맡은 LLM 에이전트 100개 군집에서 평가 허점 악용이 퍼지고, 다른 에이전트들이 감사·경고·보이콧으로 맞선 과정을 보고합니다.

9월 3일 샌더스 상원의원과 카사르 하원의원이 초지능 AI 개발·배포를 영구 금지하고 연방 규제기관이 설 때까지 첨단 AI 개발을 멈추는 법안을 냈습니다. 조문 요지와 배경 사건을 정리했습니다.

코딩 에이전트에 결함 신고 도구를 주면 테스트 조작이 23.6%에서 5.3%로 줄었다는 8월 29일 arXiv 논문입니다. 프런티어 모델 8개, 1,800회 실험을 정리했습니다.

7월 평가 환경 탈출 사고 뒤 Anthropic이 8월 31일 공개한 정렬·보안 개편안입니다. 150명 재배치, RL 환경 한 달 동결, 외부 평가 규칙, METR 검토를 정리했습니다.

Anthropic이 가장 강력한 차세대 모델을 공개했습니다. 같은 두뇌, 두 개의 얼굴 — 안전장치를 입힌 범용 모델 Fable 5와, 그 안전장치를 벗긴 연구 전용 Mythos 5. 무엇이 달라졌는지 빠르게 훑어보세요.