# 8~29MB AI, 대화 대신 기기 명령을 만듭니다

> Cactus의 Needle 3는 작은 기기에서 도구 호출을 만드는 모델입니다. 가중치 크기와 실제 메모리, 형식 정확성과 의미 정확성을 구분합니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/needle3-tiny-tool-model/)
- 발행: 2026-09-19
- 카테고리: AI 모델 · 태그: 온디바이스 AI, 소형 모델, 도구 호출, 오픈소스

## 핵심 답변

Cactus는 가중치를 2비트로 압축한 8~29MB급 Needle 3를 공개했습니다. 작은 기기의 명령 처리와 정보 추출에 초점을 맞췄습니다. 모델이 만드는 것은 대화문이 아니라 앱이 읽는 도구 호출입니다. 필요한 파일을 받은 뒤에는 로컬 추론이 가능합니다.

## 한 장 요약(만화)

![초록 후드의 AI 마스코트가 네 컷에서 문장을 도구 호출로 바꾸는 과정, 2비트 압축, 기기 내 추론과 앱의 실행 통제를 설명합니다.](https://aifficial.net/images/posts/needle3-tiny-tool-model/comic-v1.0.0.webp)

## 요약

- Cactus는 가중치를 2비트로 압축한 8~29MB급 Needle 3를 공개했습니다. 작은 기기의 명령 처리와 정보 추출에 초점을 맞췄습니다.
- 모델이 만드는 것은 대화문이 아니라 앱이 읽는 도구 호출입니다. 필요한 파일을 받은 뒤에는 로컬 추론이 가능합니다.
- 개발사가 제시한 성능 비교는 지정된 작업과 미세조정 조건의 결과입니다. 명령 형식이 맞아도 실제 뜻과 실행 권한은 앱에서 확인해야 합니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 공개 모델 크기 | 8~29MB (개발사 표제의 가중치 용량이며 실행 중 RAM 사용량과 다릅니다.) |
| 모델 규모 | 2,900만~1억2,100만 매개변수 (개발사 공개 구조의 하위 네트워크 범위입니다.) |
| 추론 방식 | 로컬 도구 호출 (엔진과 가중치를 먼저 확보해야 합니다.) |


## 기기가 알아야 할 말은 생각보다 좁습니다

방의 조명을 낮추고 싶을 때 기기에 필요한 것은 긴 설명보다 방 이름과 밝기 값입니다. Cactus가 공개한 Needle 3는 이런 요청을 읽어 도구 호출(tool calling)로 바꾸는 모델입니다. 도구 호출은 앱이 실행할 함수와 그 함수에 넣을 값을 정해진 형식으로 전달하는 일입니다. 전구를 직접 움직이는 주체는 그 명령을 받은 앱입니다. 

Cactus는 가중치를 2비트로 압축해 8~29MB 모델을 제시했습니다. 가중치는 모델이 학습한 수치들이고, 양자화(quantization)는 그 수치를 더 적은 비트로 표현하는 방법입니다. 여행 짐의 물건을 간단한 표기로 압축해 적는 것에 비유할 수 있습니다. 파일을 줄이는 과정에서 정밀도가 달라지므로 크기만으로 정확도를 판단할 수는 없습니다. 

## 한 모델에서 필요한 깊이를 골라 씁니다

공개 구조는 층을 달리 사용하는 Laddered Simple Attention Networks입니다. 개발사는 2,900만~1억2,100만 매개변수의 하위 네트워크를 제시합니다. 여기서 매개변수 수는 모델 구조의 크기이고 MB는 저장 형식까지 반영한 파일 용량입니다. 둘 다 실제 실행 중 필요한 메모리와는 구별해야 합니다. 



발표의 미세조정 비교는 DroidCall 등 특정 도구 호출 과제를 사용합니다. 기본 모델과 조정 모델에 강제 호출 조건을 적용한 결과이므로, 범용 챗봇 전체 성능의 순위로 옮길 수 없습니다. 독자에게 더 실용적인 질문은 자신의 기기에서 자주 쓰는 요청을 얼마나 정확하게 처리하는가입니다. 

## 잘 생긴 명령과 올바른 행동은 구분합니다

공식 Python 문서는 JSON 스키마(schema)에 맞춰 출력을 제한한다고 설명합니다. 스키마는 방 이름은 문자열, 밝기는 정해진 범위의 숫자처럼 입력 칸의 규칙을 정한 것입니다. 서류 칸을 빠짐없이 채웠다고 서류의 내용까지 맞는 것은 아니듯, 형식 검증과 의미 검증은 각각 필요합니다. 

필요한 파일을 받은 기기는 인터넷 없이도 추론할 수 있습니다. 또한 앱은 한 번의 호출만 반환받아 직접 실행 여부를 정할 수 있습니다. 형식에 맞는 명령도 뜻을 확인합니다. 실제 실행은 앱이 통제합니다. 예를 들어 밝기를 바꾸는 요청과 출입문을 여는 요청은 같은 수준의 확인으로 취급하기 어렵습니다. 


저는 이 모델의 작은 용량보다 맡길 일을 좁혔다는 점이 흥미롭습니다. 모든 질문에 답하는 능력을 기기마다 넣으려 하면 비용과 지연시간을 함께 떠안게 됩니다. 반대로 조명, 알람, 일정처럼 경계가 분명한 일에는 작은 모델을 시험할 공간이 생기는 것 같습니다.

그 시험의 출발점은 멋진 데모보다 자주 틀릴 법한 문장일 듯합니다. 방 이름이 빠진 요청, 실행 취소가 들어간 문장, 서로 충돌하는 조건을 모으면 제품에 필요한 확인 절차도 드러날 수 있습니다. 독자님이 쓰는 기기에서 AI에게 맡기고 싶은 좁은 일은 무엇이며, 어떤 순간에는 사람의 확인을 남기고 싶으십니까? 



## 자주 묻는 질문

**Q. 일반 챗봇처럼 질문에 답합니까?**

Needle 3는 선언된 도구를 선택하고 인자를 채우는 데 초점을 맞춥니다. 공식 Python 문서는 자유로운 문장 응답 대신 도구 결과를 반환한다고 설명합니다.

**Q. 작은 파일이면 모든 기기에서 잘 작동합니까?**

가중치 파일 외에 실행 엔진과 작업 메모리가 필요합니다. 기기 지원 여부, 실제 지연시간, 내 명령의 정확도를 따로 확인해야 합니다.

## 출처

1. [Cactus — Needle 3 공개 자료](https://cactuscompute.com/needle) (official)
2. [Needle Python 공식 문서](https://cactuscompute.com/blog/needle-python-docs) (official)
3. [Cactus Needle 공개 저장소](https://github.com/cactus-compute/needle) (official)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._