본문으로 건너뛰기

30분 녹음을 6초에, 휴대폰 안에서 도는 AI

Desert Ant Labs가 작은 AI 모델 18개를 공개했습니다. 회사 측정에서 30분 녹음을 아이폰으로 6초에 받아썼고, 가장 작은 언어 판별 모델은 2MB입니다.

AI피셜 편집부· 6분 읽기원문 보기 ↗
책상 위 커피잔 옆에서 두 손으로 스마트폰을 들고 화면을 조작하고 있다
사진: www.Pixel.la Free Stock Photos · CC0

TL;DR요약

  • 유럽 온디바이스 AI 랩 Desert Ant Labs 가 9월 8일 출범하며 모델 18개(정식 12개, 베타 6개)를 그날 열었습니다.
  • Tongue 은 2MB 로 84개 언어를 세 단어에서 가려내고, Clear 는 9MB 로 5분 녹음을 1초에 다듬습니다.
  • Voz 는 30분 녹음을 iPhone 17 Pro 에서 6초에 받아씁니다. 대신 단어 오류율은 7.40% 로 Whisper large-v3-turbo 의 7.00% 보다 조금 높습니다.
  • 플랫폼당 월간 활성 기기 10만 대까지 무료입니다. 지금은 애플 기기용이고 안드로이드와 윈도우는 준비 중입니다.
Desert Ant Labs의 18개 기기 내 모델, 언어 식별, 소음 제거, 받아쓰기 성능과 무료 사용 조건을 설명하는 여섯 칸 만화.
클라우드로 보내던 작은 작업을 기기 안에서 처리합니다. 성능 수치는 회사 공개 자료입니다.· 그림: AI 생성 이미지 (OpenAI)

핵심 사실

출범일
2026-09-08
공개 모델
18개정식 12개 · 베타 6개
가장 작은 모델
2MBTongue, 84개 언어 식별
Voz 전사 속도
30분 녹음을 6초iPhone 17 Pro 기준
월 활성 기기 10만 대까지 무료플랫폼당, 사용자당 추론 무제한
SDK
Swift · Kotlin · JavaScript

녹음을 보내지 않고, 휴대폰에서 바로 받아써요

30분 녹음을 아이폰에서 6초에 받아쓰고, 5분 녹음의 잡음을 1초에 다듬습니다. Desert Ant Labs가 공개한 자체 측정 결과입니다. 이 회사는 2026년 9월 8일 출범하면서 기기 안에서 작동하는 모델 18개를 함께 열었습니다. 정식 12개와 베타 6개이고, Swift·Kotlin·JavaScript 용 SDK 하나로 불러 씁니다. 회사는 스스로를 "기기 위에서 도는 지능을 만드는 유럽의 프런티어 AI 랩"이라고 소개했습니다. 공식

세운 사람은 Paul Veugen 입니다. 영상 앱 Detail 을 5년 동안 기기 우선으로 만들어 왔는데, 짧은 클립을 자동으로 뽑거나 소리를 다듬는 기능을 붙일 때마다 클라우드 API 로 되돌아가야 했고 앱이 커질수록 인프라 요금도 따라 커졌다고 적었습니다. 그래서 모델을 직접 학습시켰다는 것이 출범문의 설명입니다. 공식

2MB 가 무엇을 할 수 있나요

크기부터가 낯섭니다. 흔히 말하는 대형 모델이 수백 기가바이트를 차지하는 것과 달리, 여기 모델들은 메가바이트 단위입니다.

모델크기하는 일
Tongue2MB84개 언어를 세 단어에서 가려냄
Clear9MB잡음 섞인 녹음을 스튜디오 품질로
Redact12MB이름·주소·카드번호를 27개 언어에서 가림
Clips284MB10분 영상에서 짧은 클립 열두 개
Voz467MB25개 유럽 언어 받아쓰기

2MB 짜리 Tongue 은 세 단어에서 언어를 가려내는 정확도가 0.933 으로, 293MB 짜리 판별기의 0.887 보다 높았습니다. Clear 는 5분짜리 녹음을 1초에 처리해 iPhone 16 Pro 에서 실시간의 302배, MacBook Pro(M5)에서 345배 속도를 냈습니다. 데이터

30분 녹음을 받아쓰는 속도 (M3 Ultra, 실시간 대비 배속)
0배125배250배375배500배VozApple SpeechAnalyzerWhisper large-v3-turbo319배78배50배
30분 녹음을 받아쓰는 속도 (M3 Ultra, 실시간 대비 배속)
항목배속
Voz319배
Apple SpeechAnalyzer78배
Whisper large-v3-turbo50배

출처: Desert Ant Labs

작은 모델로 어디까지 할 수 있나요

받아쓰기 모델 Voz 의 단어 오류율은 공개 데이터셋 여섯 개 평균 7.40% 입니다. 같은 조건에서 Whisper large-v3-turbo 는 7.00% 였습니다. 회의실에서 녹음한 소리처럼 조건이 나쁜 쪽에서는 11.84% 대 13.87% 로 Voz 가 앞섰지만, 평균으로는 뒤집니다. 데이터

개인정보를 가리는 Redact 도 마찬가지입니다. 12MB 로 88.8% 를 잡아내는데, 2.3GB 짜리 GLiNER-PII 는 91.1% 를 잡습니다. 회사가 내세우는 것은 정확도 1위가 아니라 크기당 정확도입니다. 데이터

Voz는 NVIDIA의 공개 음성 모델 Parakeet TDT 0.6B v3를 바탕으로 기기용으로 다듬었습니다. 모델 페이지에 기반 모델과 CC BY 4.0 라이선스가 함께 안내돼 있습니다. 공식

왜 지금 이런 회사가 나왔나요

에이전트가 하는 일을 뜯어 보면 큰 모델이 필요 없는 호출이 많습니다. NVIDIA 연구진이 에이전트 시스템 세 개를 분해해 추정한 값을 보면, MetaGPT 는 호출의 약 60%, Open Operator 는 약 40%, Cradle 은 약 70% 를 작고 특화된 모델로 옮길 수 있었습니다. 논문

사람 뇌를 반투명하게 그린 3차원 그림에서 뒤쪽 아래에 자리한 소뇌가 붉게 칠해져 있다
회사는 앞으로 낼 백 개의 모델을 소뇌(붉은 부분)에 비유했습니다. 균형과 타이밍처럼 늘 돌아가는 일을 맡아 두면 나머지가 생각할 여유를 갖는다는 뜻입니다.· 사진: RAZVAN V. MARINESCU · CC BY 4.0

녹음에서 잡음을 걷고, 사진에 주제를 붙이고, 문장에서 날짜를 뽑고, 이름이 서버로 넘어가기 전에 가리는 일이 그런 쪽입니다. 하루에 십만 번씩 똑같이 반복되는 호출이라 요금만 쌓입니다. 추정

회사는 이 모델들을 소뇌에 빗댔습니다. 균형을 잡고 박자를 맞추는 일처럼 늘 돌아가지만 굳이 의식하지 않는 몫을 소뇌가 맡아 주듯, 작은 모델이 상시 업무를 받아 두면 큰 모델은 정말 생각이 필요한 일만 하면 된다는 것입니다. 다음 단계로는 어느 모델이 답할지 고르는 층을 올리겠다고 밝혔습니다. 공식

자주 묻는 질문

클라우드 모델만큼 정확한가요?
항목마다 갈립니다. Voz 의 단어 오류율은 여섯 개 데이터셋 평균 7.40% 로 Whisper large-v3-turbo 의 7.00% 보다 높지만, 회의실 녹음에서는 11.84% 대 13.87% 로 앞섭니다. 개인정보를 가리는 Redact 는 88.8% 를 잡아내 2.3GB 짜리 GLiNER-PII 의 91.1% 에 조금 못 미칩니다.
정말 값을 안 내나요?
회사는 SDK 마다 월간 활성 기기 10만 대까지 무료이고 사용자당 추론 횟수에는 제한이 없다고 밝혔습니다. 기기 안에서 계산하므로 호출마다 붙는 요금이 없습니다. 10만 대를 넘길 때의 조건은 공개되지 않았습니다.
안드로이드 앱에도 넣을 수 있나요?
아직 아닙니다. 전사 모델 Voz 는 애플의 Core ML 로 빌드돼 iOS·iPadOS·macOS·tvOS·visionOS 에서 돌고, 안드로이드와 윈도우는 준비 중이라고 적혀 있습니다.

출처 · 3

  1. 1Desert Ant Labs 출범 발표공식 발표desertant.com/blog/introducing-desert-ant-labs/
  2. 2Voz 모델 사양과 벤치마크공식 발표desertant.com/models/voz/
  3. 3Small Language Models are the Future of Agentic AI (NVIDIA Research)논문arxiv.org/abs/2506.02153

이 글의 마크다운 원문: /posts/desert-ant-labs-on-device-models/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 추천해 주세요.

동료에게도 보내 주세요.

댓글

로그인 없이 닉네임과 비밀번호만으로도 남길 수 있어요.

로그인하면 비밀번호 없이 쓰고 지울 수 있어요.

댓글을 불러오는 중입니다…

댓글 남기기

나중에 이 댓글을 지울 때 씁니다.

1000자까지 쓸 수 있습니다. 서식 없이 평문으로 보입니다.

AI피셜 주간 하이라이트

한 주 동안 AI 소식에서 중요한 것만 골라 월요일 아침에 보내드릴게요

같은 태그·카테고리의 글을 골랐습니다.

캘리포니아 산타클라라에 있는 NVIDIA 본사 건물 외관
업계 동향· 6

NVIDIA, Hugging Face 129억 달러 인수 — 개방 유지

NVIDIA가 9월 3일 Hugging Face를 $12,930,300,000에 인수한다고 발표했습니다. 거래 배경(7월 침해 사건·거절했던 제안)과 '개방 플랫폼 유지' 약속을 정리했습니다.

  • #NVIDIA
  • #Hugging Face
  • #인수합병