본문으로 건너뛰기

NeoMME — 2.6억 파라미터로 3.75B급 문서 검색

H Company가 9월 3일 공개한 NeoMME는 비전 타워 없이 하나의 Transformer로 텍스트와 이미지 패치를 처리합니다. ViDoRe v3 점수, 처리량, 255배 압축 결과를 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
선전 도서관의 서가와 무인 대출·반납 기기
사진: FrENdwquymn · CC BY-SA 4.0

핵심 답변

H Company는 2026년 9월 3일 멀티모달 네이티브 다국어 인코더 NeoMME(260M·800M)를 Apache 2.0으로 공개했습니다. 별도 비전 인코더 없이 단일 양방향 Transformer로 텍스트와 이미지 패치를 처리하며, 문서 검색 벤치마크 ViDoRe v3에서 260M 모델이 nDCG@10 0.523으로 14배 큰 ColQwen2.5(0.524)와 같은 수준을 냈습니다.

TL;DR세 줄 요약

  • 구조: 사전학습된 비전 타워 없이 하나의 양방향 Transformer가 텍스트 토큰과 원시 이미지 패치를 함께 처리. 컨텍스트 16,384 토큰.
  • 성능: ViDoRe v3 nDCG@10 260M 0.523, 800M 0.556. Vultron Flash 0.8B(0.565)에 0.009 차이.
  • 속도: L40S에서 260M이 초당 51.3페이지로 ColModernVBERT(26.0)의 1.97배.
  • 압축: 토큰 풀링과 이진 양자화로 페이지당 1,536.7kB를 6.0kB로(255.5배) 줄이면서 성능 95.19% 유지.

핵심 사실

공개일
2026-09-03Hugging Face 블로그. 논문은 8월 31일 arXiv
크기
260M · 800MApache 2.0
ViDoRe v3
0.523 / 0.556nDCG@10, 260M / 800M
처리량
51.3 페이지/초260M, L40S, 2048×2048
학습량
약 5,240억 토큰텍스트 전용 2,900억 포함, 50만 스텝

무슨 일인가요

H Company의 Aurélien Lac과 Tony Wu는 9월 3일 Hugging Face 블로그에 NeoMME를 공개했습니다. 논문은 8월 31일 arXiv에 올라왔고, 모델은 Apache 2.0으로 배포됩니다. 논문 핵심은 구조입니다. 사전학습된 비전 타워와 텍스트 인코더를 따로 두지 않고, "하나의 양방향 Transformer가 텍스트 토큰과 원시 이미지 패치를 함께 처리"합니다. 논문 크기는 2.6억과 8억 파라미터 두 가지이고, 컨텍스트는 16,384 토큰으로 4K UHD 이미지 두 장까지 들어갑니다. 공식

학습 목표는 마스크드 이산 확산(masked discrete-diffusion) 디노이징이고, 멀티모달 예시에는 0.3부터 1 사이의 손상률을 적용했습니다. 논문 학습량은 약 5,240억 패킹 입력 토큰(텍스트 전용 2,900억 포함)이며 텍스트 55%, 멀티모달 45% 비율로 50만 스텝을 돌렸습니다. 논문 하드웨어는 AWS p5.48xlarge(H100 16~32장), 옵티마이저는 NorMuon이고, 토크나이저는 131k 어휘의 BPE를 다국어 텍스트·코드·수학·이미지 전사 데이터로 처음부터 학습했습니다. 논문

숫자로 보면

ViDoRe v3 문서 검색 (nDCG@10)
0.0000.2500.5000.7501.000ColSmol 256MColModernVBERT 250MNeoMME 260MColQwen2.5 3.75BNeoMME 800MVultron Flash 850M0.2070.2610.5230.5240.5560.565
ViDoRe v3 문서 검색 (nDCG@10)
항목nDCG@10
ColSmol 256M0.207
ColModernVBERT 250M0.261
NeoMME 260M0.523
ColQwen2.5 3.75B0.524
NeoMME 800M0.556
Vultron Flash 850M0.565

출처: H Company 블로그·arXiv 2609.01657 (2026-09-03)

검색기로 미세조정한 NeoMME-260M은 ViDoRe v3에서 nDCG@10 0.523으로 8억 파라미터 미만 모델 중 가장 높고, 14배 큰 ColQwen2.5(37.5억, 0.524)와 사실상 같은 점수입니다. 논문 800M은 0.556으로 Vultron Flash 0.8B(0.565)에 0.009 차이입니다. 논문 속도는 NVIDIA L40S에서 2048×2048 페이지 기준 260M이 초당 51.3페이지로 ColModernVBERT(26.0)의 1.97배이고, 800M은 초당 21.2페이지입니다. 논문

값싼 PC 본체를 층층이 쌓아 만든 구글의 초기 생산 서버 랙
작은 모델로 큰 모델의 검색 성능을 내면 색인에 필요한 하드웨어도 줄어듭니다. 사진은 1999년 구글의 초기 생산 서버입니다.· 사진: Steve Jurvetson · CC BY 2.0
압축 설정페이지당 저장압축률성능 유지
압축 없음1,536.7kB1배100%
풀링 10 + 쿼리·문서 int839.0kB39.4배99.16%
풀링 8 + 쿼리 int8·문서 이진6.0kB255.5배95.19%

늦은 상호작용(late-interaction) 임베딩을 계층적 토큰 풀링과 비대칭 양자화로 줄이면, 페이지당 약 1.5MB가 6kB로 255배 작아지면서 기준 nDCG@10의 95% 이상을 유지합니다. 논문

무엇을 보면 되나요

  • 문서 검색(비주얼 RAG) 구축자: 260M 모델이면 L40S 한 장으로 초당 50페이지를 색인하고, 이진 압축이면 100만 페이지가 약 6GB입니다. 추정
  • 다국어 사용자: 목표 언어 14개 안에 들어가는지 확인하세요. 한국어 포함 여부는 논문과 블로그에서 확인되지 않았습니다.
  • 지켜볼 것: Hugging Face 컬렉션의 체크포인트와 데모 스페이스, 후속 미세조정 레시피.

자주 묻는 질문

기존 문서 검색 모델과 무엇이 다른가요?
ColPali·ColQwen 계열은 큰 비전-언어 모델을 잘라 검색기로 씁니다. NeoMME는 처음부터 텍스트와 이미지 패치를 하나의 인코더로 학습해, 훨씬 작은 크기로 비슷한 검색 점수를 냅니다.
어떤 언어를 지원하나요?
131k 어휘 토크나이저를 다국어 텍스트·코드·수학 데이터로 처음부터 학습했습니다. 다만 저자들은 목표 언어 14개 밖에서는 토크나이저 커버리지가 약해진다고 밝혔고, 한국어 포함 여부는 확인되지 않았습니다.
바로 쓸 수 있나요?
모델은 Hugging Face 컬렉션에 Transformers 형식으로 올라와 있고 Apache 2.0입니다. 비주얼 RAG 데모 스페이스도 공개돼 있습니다.

출처 · 4

  1. 1NeoMME: an efficient Multimodal-native and Multilingual Encoder (H Company, Hugging Face 블로그)공식 발표huggingface.co/blog/Hcompany/neomme
  2. 2arXiv 2609.01657 — NeoMME 논문 초록논문arxiv.org/abs/2609.01657
  3. 3arXiv 2609.01657 — 논문 본문(HTML)논문arxiv.org/html/2609.01657
  4. 4NeoMME 모델 컬렉션 (Hugging Face)공식 발표huggingface.co/collections/Hcompany/neomme

이 글의 마크다운 원문: /posts/neomme-multimodal-native-encoder/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용
논문 한입· 3

검열 해제 오픈 모델 3,471개 — 재배포자 3곳이 52%

10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.

  • #논문
  • #오픈소스
  • #AI 보안