녹음을 보내지 않고, 휴대폰에서 바로 받아써요
30분 녹음을 아이폰에서 6초에 받아쓰고, 5분 녹음의 잡음을 1초에 다듬습니다. Desert Ant Labs가 공개한 자체 측정 결과입니다. 이 회사는 2026년 9월 8일 출범하면서 기기 안에서 작동하는 모델 18개를 함께 열었습니다. 정식 12개와 베타 6개이고, Swift·Kotlin·JavaScript 용 SDK 하나로 불러 씁니다. 회사는 스스로를 "기기 위에서 도는 지능을 만드는 유럽의 프런티어 AI 랩"이라고 소개했습니다. 공식
세운 사람은 Paul Veugen 입니다. 영상 앱 Detail 을 5년 동안 기기 우선으로 만들어 왔는데, 짧은 클립을 자동으로 뽑거나 소리를 다듬는 기능을 붙일 때마다 클라우드 API 로 되돌아가야 했고 앱이 커질수록 인프라 요금도 따라 커졌다고 적었습니다. 그래서 모델을 직접 학습시켰다는 것이 출범문의 설명입니다. 공식
2MB 가 무엇을 할 수 있나요
크기부터가 낯섭니다. 흔히 말하는 대형 모델이 수백 기가바이트를 차지하는 것과 달리, 여기 모델들은 메가바이트 단위입니다.
| 모델 | 크기 | 하는 일 |
|---|---|---|
| Tongue | 2MB | 84개 언어를 세 단어에서 가려냄 |
| Clear | 9MB | 잡음 섞인 녹음을 스튜디오 품질로 |
| Redact | 12MB | 이름·주소·카드번호를 27개 언어에서 가림 |
| Clips | 284MB | 10분 영상에서 짧은 클립 열두 개 |
| Voz | 467MB | 25개 유럽 언어 받아쓰기 |
2MB 짜리 Tongue 은 세 단어에서 언어를 가려내는 정확도가 0.933 으로, 293MB 짜리 판별기의 0.887 보다 높았습니다. Clear 는 5분짜리 녹음을 1초에 처리해 iPhone 16 Pro 에서 실시간의 302배, MacBook Pro(M5)에서 345배 속도를 냈습니다. 데이터
| 항목 | 배속 |
|---|---|
| Voz | 319배 |
| Apple SpeechAnalyzer | 78배 |
| Whisper large-v3-turbo | 50배 |
출처: Desert Ant Labs
작은 모델로 어디까지 할 수 있나요
받아쓰기 모델 Voz 의 단어 오류율은 공개 데이터셋 여섯 개 평균 7.40% 입니다. 같은 조건에서 Whisper large-v3-turbo 는 7.00% 였습니다. 회의실에서 녹음한 소리처럼 조건이 나쁜 쪽에서는 11.84% 대 13.87% 로 Voz 가 앞섰지만, 평균으로는 뒤집니다. 데이터
개인정보를 가리는 Redact 도 마찬가지입니다. 12MB 로 88.8% 를 잡아내는데, 2.3GB 짜리 GLiNER-PII 는 91.1% 를 잡습니다. 회사가 내세우는 것은 정확도 1위가 아니라 크기당 정확도입니다. 데이터
Voz는 NVIDIA의 공개 음성 모델 Parakeet TDT 0.6B v3를 바탕으로 기기용으로 다듬었습니다. 모델 페이지에 기반 모델과 CC BY 4.0 라이선스가 함께 안내돼 있습니다. 공식
왜 지금 이런 회사가 나왔나요
에이전트가 하는 일을 뜯어 보면 큰 모델이 필요 없는 호출이 많습니다. NVIDIA 연구진이 에이전트 시스템 세 개를 분해해 추정한 값을 보면, MetaGPT 는 호출의 약 60%, Open Operator 는 약 40%, Cradle 은 약 70% 를 작고 특화된 모델로 옮길 수 있었습니다. 논문

녹음에서 잡음을 걷고, 사진에 주제를 붙이고, 문장에서 날짜를 뽑고, 이름이 서버로 넘어가기 전에 가리는 일이 그런 쪽입니다. 하루에 십만 번씩 똑같이 반복되는 호출이라 요금만 쌓입니다. 추정
회사는 이 모델들을 소뇌에 빗댔습니다. 균형을 잡고 박자를 맞추는 일처럼 늘 돌아가지만 굳이 의식하지 않는 몫을 소뇌가 맡아 주듯, 작은 모델이 상시 업무를 받아 두면 큰 모델은 정말 생각이 필요한 일만 하면 된다는 것입니다. 다음 단계로는 어느 모델이 답할지 고르는 층을 올리겠다고 밝혔습니다. 공식





댓글
로그인 없이 닉네임과 비밀번호만으로도 남길 수 있어요.
로그인하면 비밀번호 없이 쓰고 지울 수 있어요.
댓글을 불러오는 중입니다…
댓글 남기기