본문으로 건너뛰기

8~29MB AI, 대화 대신 기기 명령을 만듭니다

Cactus의 Needle 3는 작은 기기에서 도구 호출을 만드는 모델입니다. 가중치 크기와 실제 메모리, 형식 정확성과 의미 정확성을 구분합니다.

AI피셜 편집부· 5분 읽기원문 보기 ↗
검은 배경의 Cactus Needle 3 공식 화면에 작은 기기용 자동화 모델이라는 제목과 조명 제어 데모가 보입니다.
작은 기기의 명령 처리를 앞세운 Needle 3 공식 소개입니다. 성능 문구는 개발사 자체 평가이며, 아래 데모는 스마트홈 제어를 예로 듭니다.· 사진: Cactus 공식 발표 화면 · 제품 소개 목적 인용

TL;DR요약

  • Cactus는 가중치를 2비트로 압축한 8~29MB급 Needle 3를 공개했습니다. 작은 기기의 명령 처리와 정보 추출에 초점을 맞췄습니다.
  • 모델이 만드는 것은 대화문이 아니라 앱이 읽는 도구 호출입니다. 필요한 파일을 받은 뒤에는 로컬 추론이 가능합니다.
  • 개발사가 제시한 성능 비교는 지정된 작업과 미세조정 조건의 결과입니다. 명령 형식이 맞아도 실제 뜻과 실행 권한은 앱에서 확인해야 합니다.
초록 후드의 AI 마스코트가 네 컷에서 문장을 도구 호출로 바꾸는 과정, 2비트 압축, 기기 내 추론과 앱의 실행 통제를 설명합니다.
모델 용량과 실행 방식, 형식에 맞는 명령의 뜻을 확인하는 절차를 연결했습니다.· 그림: AI 생성 이미지 (ChatGPT Images 6 Pro)

핵심 사실

공개 모델 크기
8~29MB개발사 표제의 가중치 용량이며 실행 중 RAM 사용량과 다릅니다.
모델 규모
2,900만~1억2,100만 매개변수개발사 공개 구조의 하위 네트워크 범위입니다.
추론 방식
로컬 도구 호출엔진과 가중치를 먼저 확보해야 합니다.

기기가 알아야 할 말은 생각보다 좁습니다

방의 조명을 낮추고 싶을 때 기기에 필요한 것은 긴 설명보다 방 이름과 밝기 값입니다. Cactus가 공개한 Needle 3는 이런 요청을 읽어 도구 호출(tool calling)로 바꾸는 모델입니다. 도구 호출은 앱이 실행할 함수와 그 함수에 넣을 값을 정해진 형식으로 전달하는 일입니다. 전구를 직접 움직이는 주체는 그 명령을 받은 앱입니다. 공식

Cactus는 가중치를 2비트로 압축해 8~29MB 모델을 제시했습니다. 가중치는 모델이 학습한 수치들이고, 양자화(quantization)는 그 수치를 더 적은 비트로 표현하는 방법입니다. 여행 짐의 물건을 간단한 표기로 압축해 적는 것에 비유할 수 있습니다. 파일을 줄이는 과정에서 정밀도가 달라지므로 크기만으로 정확도를 판단할 수는 없습니다. 공식

한 모델에서 필요한 깊이를 골라 씁니다

공개 구조는 층을 달리 사용하는 Laddered Simple Attention Networks입니다. 개발사는 2,900만~1억2,100만 매개변수의 하위 네트워크를 제시합니다. 여기서 매개변수 수는 모델 구조의 크기이고 MB는 저장 형식까지 반영한 파일 용량입니다. 둘 다 실제 실행 중 필요한 메모리와는 구별해야 합니다. 공식

Cactus 공식 Needle 3 발표의 도구 호출 벤치마크 화면입니다. 가로축은 매개변수 수의 로그 눈금, 세로축은 도구 호출 평균 점수이며 Needle 계열과 비교 모델이 표시됩니다.
개발사의 성능 비교입니다. 선택한 작업과 평가 방식에 따라 결과가 달라지므로, 작은 모델이 모든 대화 작업에서 큰 모델을 대신한다는 뜻으로 읽어서는 안 됩니다.· 사진: Cactus 공식 발표 화면 · 제품 분석을 위한 인용

발표의 미세조정 비교는 DroidCall 등 특정 도구 호출 과제를 사용합니다. 기본 모델과 조정 모델에 강제 호출 조건을 적용한 결과이므로, 범용 챗봇 전체 성능의 순위로 옮길 수 없습니다. 독자에게 더 실용적인 질문은 자신의 기기에서 자주 쓰는 요청을 얼마나 정확하게 처리하는가입니다. 데이터

잘 생긴 명령과 올바른 행동은 구분합니다

공식 Python 문서는 JSON 스키마(schema)에 맞춰 출력을 제한한다고 설명합니다. 스키마는 방 이름은 문자열, 밝기는 정해진 범위의 숫자처럼 입력 칸의 규칙을 정한 것입니다. 서류 칸을 빠짐없이 채웠다고 서류의 내용까지 맞는 것은 아니듯, 형식 검증과 의미 검증은 각각 필요합니다. 공식

필요한 파일을 받은 기기는 인터넷 없이도 추론할 수 있습니다. 또한 앱은 한 번의 호출만 반환받아 직접 실행 여부를 정할 수 있습니다. 형식에 맞는 명령도 뜻을 확인합니다. 실제 실행은 앱이 통제합니다. 예를 들어 밝기를 바꾸는 요청과 출입문을 여는 요청은 같은 수준의 확인으로 취급하기 어렵습니다. 공식

자주 묻는 질문

일반 챗봇처럼 질문에 답합니까?
Needle 3는 선언된 도구를 선택하고 인자를 채우는 데 초점을 맞춥니다. 공식 Python 문서는 자유로운 문장 응답 대신 도구 결과를 반환한다고 설명합니다.
작은 파일이면 모든 기기에서 잘 작동합니까?
가중치 파일 외에 실행 엔진과 작업 메모리가 필요합니다. 기기 지원 여부, 실제 지연시간, 내 명령의 정확도를 따로 확인해야 합니다.

출처 · 3

  1. 1Cactus — Needle 3 공개 자료공식 발표cactuscompute.com/needle
  2. 2Needle Python 공식 문서공식 발표cactuscompute.com/blog/needle-python-docs
  3. 3Cactus Needle 공개 저장소공식 발표github.com/cactus-compute/needle

이 글의 마크다운 원문: /posts/needle3-tiny-tool-model/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

도움이 됐다면

공유

더보기

다음으로 읽을 글

같은 태그·카테고리에서 세 편을 골랐습니다.

SemIf 공식 데모 상단의 브라우저 로컬 결정 모델 소개와 기본 모델 안내가 보입니다.
AI 도구· 5

답을 쓰기 전에 고릅니다, 브라우저 AI 실험

SemIf는 같은 로컬 모델이 선택지 확률을 바로 읽는 방식과 JSON으로 쓰는 방식을 비교합니다. 빠르기와 판단의 정확도를 따로 봅니다.

  • #온디바이스 AI
  • #추론
  • #오픈소스
AI피셜 마스코트 AI가 Rust 코드 카드에서 GPU 칩으로 이어지는 두 갈래 길, 스레드 격자와 타일 블록을 가리키는 가로형 썸네일
AI 인프라· 8

NVIDIA, GPU 커널까지 Rust로 쓰게 합니다

NVIDIA가 Rust로 GPU 커널을 직접 작성하는 CUDA Rust의 두 방식, cuda-oxide와 cutile-rs를 공개했습니다. 컴파일러가 막는 실수와 아직 초기인 단계를 함께 살핍니다.

  • #NVIDIA
  • #CUDA
  • #Rust

AI피셜 주간 하이라이트

한 주 동안 AI 소식에서 중요한 것만 골라 월요일 아침에 보내드릴게요