무슨 일인가요
H Company의 Aurélien Lac과 Tony Wu는 9월 3일 Hugging Face 블로그에 NeoMME를 공개했습니다. 논문은 8월 31일 arXiv에 올라왔고, 모델은 Apache 2.0으로 배포됩니다. 논문 핵심은 구조입니다. 사전학습된 비전 타워와 텍스트 인코더를 따로 두지 않고, "하나의 양방향 Transformer가 텍스트 토큰과 원시 이미지 패치를 함께 처리"합니다. 논문 크기는 2.6억과 8억 파라미터 두 가지이고, 컨텍스트는 16,384 토큰으로 4K UHD 이미지 두 장까지 들어갑니다. 공식
학습 목표는 마스크드 이산 확산(masked discrete-diffusion) 디노이징이고, 멀티모달 예시에는 0.3부터 1 사이의 손상률을 적용했습니다. 논문 학습량은 약 5,240억 패킹 입력 토큰(텍스트 전용 2,900억 포함)이며 텍스트 55%, 멀티모달 45% 비율로 50만 스텝을 돌렸습니다. 논문 하드웨어는 AWS p5.48xlarge(H100 16~32장), 옵티마이저는 NorMuon이고, 토크나이저는 131k 어휘의 BPE를 다국어 텍스트·코드·수학·이미지 전사 데이터로 처음부터 학습했습니다. 논문
숫자로 보면
| 항목 | nDCG@10 |
|---|---|
| ColSmol 256M | 0.207 |
| ColModernVBERT 250M | 0.261 |
| NeoMME 260M | 0.523 |
| ColQwen2.5 3.75B | 0.524 |
| NeoMME 800M | 0.556 |
| Vultron Flash 850M | 0.565 |
출처: H Company 블로그·arXiv 2609.01657 (2026-09-03)
검색기로 미세조정한 NeoMME-260M은 ViDoRe v3에서 nDCG@10 0.523으로 8억 파라미터 미만 모델 중 가장 높고, 14배 큰 ColQwen2.5(37.5억, 0.524)와 사실상 같은 점수입니다. 논문 800M은 0.556으로 Vultron Flash 0.8B(0.565)에 0.009 차이입니다. 논문 속도는 NVIDIA L40S에서 2048×2048 페이지 기준 260M이 초당 51.3페이지로 ColModernVBERT(26.0)의 1.97배이고, 800M은 초당 21.2페이지입니다. 논문

| 압축 설정 | 페이지당 저장 | 압축률 | 성능 유지 |
|---|---|---|---|
| 압축 없음 | 1,536.7kB | 1배 | 100% |
| 풀링 10 + 쿼리·문서 int8 | 39.0kB | 39.4배 | 99.16% |
| 풀링 8 + 쿼리 int8·문서 이진 | 6.0kB | 255.5배 | 95.19% |
늦은 상호작용(late-interaction) 임베딩을 계층적 토큰 풀링과 비대칭 양자화로 줄이면, 페이지당 약 1.5MB가 6kB로 255배 작아지면서 기준 nDCG@10의 95% 이상을 유지합니다. 논문
무엇을 보면 되나요
- 문서 검색(비주얼 RAG) 구축자: 260M 모델이면 L40S 한 장으로 초당 50페이지를 색인하고, 이진 압축이면 100만 페이지가 약 6GB입니다. 추정
- 다국어 사용자: 목표 언어 14개 안에 들어가는지 확인하세요. 한국어 포함 여부는 논문과 블로그에서 확인되지 않았습니다.
- 지켜볼 것: Hugging Face 컬렉션의 체크포인트와 데모 스페이스, 후속 미세조정 레시피.



