# NeoMME — 2.6억 파라미터로 3.75B급 문서 검색

> H Company가 9월 3일 공개한 NeoMME는 비전 타워 없이 하나의 Transformer로 텍스트와 이미지 패치를 처리합니다. ViDoRe v3 점수, 처리량, 255배 압축 결과를 정리했습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/neomme-multimodal-native-encoder/)
- 발행: 2026-09-05
- 카테고리: 논문 한입 · 태그: 논문, 오픈 모델, 멀티모달, 검색, Hugging Face

## 핵심 답변

H Company는 2026년 9월 3일 멀티모달 네이티브 다국어 인코더 NeoMME(260M·800M)를 Apache 2.0으로 공개했습니다. 별도 비전 인코더 없이 단일 양방향 Transformer로 텍스트와 이미지 패치를 처리하며, 문서 검색 벤치마크 ViDoRe v3에서 260M 모델이 nDCG@10 0.523으로 14배 큰 ColQwen2.5(0.524)와 같은 수준을 냈습니다.

## 요약

- 구조: 사전학습된 비전 타워 없이 하나의 양방향 Transformer가 텍스트 토큰과 원시 이미지 패치를 함께 처리. 컨텍스트 16,384 토큰.
- 성능: ViDoRe v3 nDCG@10 260M 0.523, 800M 0.556. Vultron Flash 0.8B(0.565)에 0.009 차이.
- 속도: L40S에서 260M이 초당 51.3페이지로 ColModernVBERT(26.0)의 1.97배.
- 압축: 토큰 풀링과 이진 양자화로 페이지당 1,536.7kB를 6.0kB로(255.5배) 줄이면서 성능 95.19% 유지.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 공개일 | 2026-09-03 (Hugging Face 블로그. 논문은 8월 31일 arXiv) |
| 크기 | 260M · 800M (Apache 2.0) |
| ViDoRe v3 | 0.523 / 0.556 (nDCG@10, 260M / 800M) |
| 처리량 | 51.3 페이지/초 (260M, L40S, 2048×2048) |
| 학습량 | 약 5,240억 토큰 (텍스트 전용 2,900억 포함, 50만 스텝) |


## 무슨 일인가요

H Company의 Aurélien Lac과 Tony Wu는 9월 3일 Hugging Face 블로그에 NeoMME를 공개했습니다. 논문은 8월 31일 arXiv에 올라왔고, 모델은 Apache 2.0으로 배포됩니다.  핵심은 구조입니다. 사전학습된 비전 타워와 텍스트 인코더를 따로 두지 않고, "하나의 양방향 Transformer가 텍스트 토큰과 원시 이미지 패치를 함께 처리"합니다.  크기는 2.6억과 8억 파라미터 두 가지이고, 컨텍스트는 16,384 토큰으로 4K UHD 이미지 두 장까지 들어갑니다. 

학습 목표는 마스크드 이산 확산(masked discrete-diffusion) 디노이징이고, 멀티모달 예시에는 0.3부터 1 사이의 손상률을 적용했습니다.  학습량은 약 5,240억 패킹 입력 토큰(텍스트 전용 2,900억 포함)이며 텍스트 55%, 멀티모달 45% 비율로 50만 스텝을 돌렸습니다.  하드웨어는 AWS p5.48xlarge(H100 16~32장), 옵티마이저는 NorMuon이고, 토크나이저는 131k 어휘의 BPE를 다국어 텍스트·코드·수학·이미지 전사 데이터로 처음부터 학습했습니다. 

## 숫자로 보면



검색기로 미세조정한 NeoMME-260M은 ViDoRe v3에서 nDCG@10 0.523으로 8억 파라미터 미만 모델 중 가장 높고, 14배 큰 ColQwen2.5(37.5억, 0.524)와 사실상 같은 점수입니다.  800M은 0.556으로 Vultron Flash 0.8B(0.565)에 0.009 차이입니다.  속도는 NVIDIA L40S에서 2048×2048 페이지 기준 260M이 초당 51.3페이지로 ColModernVBERT(26.0)의 1.97배이고, 800M은 초당 21.2페이지입니다. 



| 압축 설정 | 페이지당 저장 | 압축률 | 성능 유지 |
| --- | --- | --- | --- |
| 압축 없음 | 1,536.7kB | 1배 | 100% |
| 풀링 10 + 쿼리·문서 int8 | 39.0kB | 39.4배 | 99.16% |
| 풀링 8 + 쿼리 int8·문서 이진 | 6.0kB | 255.5배 | 95.19% |

늦은 상호작용(late-interaction) 임베딩을 계층적 토큰 풀링과 비대칭 양자화로 줄이면, 페이지당 약 1.5MB가 6kB로 255배 작아지면서 기준 nDCG@10의 95% 이상을 유지합니다. 


토크나이저 커버리지는 원래 목표한 14개 언어 밖에서 약해지며, FLORES-200의 204개 언어 전체로 평가하면 이 점이 드러납니다.  유사도 맵 시각화는 정성적 진단일 뿐 완전한 설명이 아니고, 이진 커널 구현의 실제 검색 지연 시간은 측정하지 않았습니다. 


## 무엇을 보면 되나요

- **문서 검색(비주얼 RAG) 구축자**: 260M 모델이면 L40S 한 장으로 초당 50페이지를 색인하고, 이진 압축이면 100만 페이지가 약 6GB입니다. 
- **다국어 사용자**: 목표 언어 14개 안에 들어가는지 확인하세요. 한국어 포함 여부는 논문과 블로그에서 확인되지 않았습니다.
- **지켜볼 것**: Hugging Face 컬렉션의 체크포인트와 데모 스페이스, 후속 미세조정 레시피.


이 논문의 메시지는 "비전 인코더를 따로 붙이지 않아도 된다"입니다. 문서 검색에서는 지금까지 큰 VLM을 잘라 쓰는 것이 정석이었는데, 2.6억 파라미터짜리 단일 타워가 37.5억 모델과 같은 점수를 내면서 두 배 빠르다면 서빙 비용 계산이 달라집니다. 다만 비교가 문서 검색 벤치마크에 몰려 있어, 일반 이미지·텍스트 과제에서도 같은 효율이 나오는지는 별도 검증이 필요합니다. 



## 자주 묻는 질문

**Q. 기존 문서 검색 모델과 무엇이 다른가요?**

ColPali·ColQwen 계열은 큰 비전-언어 모델을 잘라 검색기로 씁니다. NeoMME는 처음부터 텍스트와 이미지 패치를 하나의 인코더로 학습해, 훨씬 작은 크기로 비슷한 검색 점수를 냅니다.

**Q. 어떤 언어를 지원하나요?**

131k 어휘 토크나이저를 다국어 텍스트·코드·수학 데이터로 처음부터 학습했습니다. 다만 저자들은 목표 언어 14개 밖에서는 토크나이저 커버리지가 약해진다고 밝혔고, 한국어 포함 여부는 확인되지 않았습니다.

**Q. 바로 쓸 수 있나요?**

모델은 Hugging Face 컬렉션에 Transformers 형식으로 올라와 있고 Apache 2.0입니다. 비주얼 RAG 데모 스페이스도 공개돼 있습니다.

## 출처

1. [NeoMME: an efficient Multimodal-native and Multilingual Encoder (H Company, Hugging Face 블로그)](https://huggingface.co/blog/Hcompany/neomme) (official)
2. [arXiv 2609.01657 — NeoMME 논문 초록](https://arxiv.org/abs/2609.01657) (paper)
3. [arXiv 2609.01657 — 논문 본문(HTML)](https://arxiv.org/html/2609.01657) (paper)
4. [NeoMME 모델 컬렉션 (Hugging Face)](https://huggingface.co/collections/Hcompany/neomme) (official)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._