기기가 알아야 할 말은 생각보다 좁습니다
방의 조명을 낮추고 싶을 때 기기에 필요한 것은 긴 설명보다 방 이름과 밝기 값입니다. Cactus가 공개한 Needle 3는 이런 요청을 읽어 도구 호출(tool calling)로 바꾸는 모델입니다. 도구 호출은 앱이 실행할 함수와 그 함수에 넣을 값을 정해진 형식으로 전달하는 일입니다. 전구를 직접 움직이는 주체는 그 명령을 받은 앱입니다. 공식
Cactus는 가중치를 2비트로 압축해 8~29MB 모델을 제시했습니다. 가중치는 모델이 학습한 수치들이고, 양자화(quantization)는 그 수치를 더 적은 비트로 표현하는 방법입니다. 여행 짐의 물건을 간단한 표기로 압축해 적는 것에 비유할 수 있습니다. 파일을 줄이는 과정에서 정밀도가 달라지므로 크기만으로 정확도를 판단할 수는 없습니다. 공식
한 모델에서 필요한 깊이를 골라 씁니다
공개 구조는 층을 달리 사용하는 Laddered Simple Attention Networks입니다. 개발사는 2,900만~1억2,100만 매개변수의 하위 네트워크를 제시합니다. 여기서 매개변수 수는 모델 구조의 크기이고 MB는 저장 형식까지 반영한 파일 용량입니다. 둘 다 실제 실행 중 필요한 메모리와는 구별해야 합니다. 공식

발표의 미세조정 비교는 DroidCall 등 특정 도구 호출 과제를 사용합니다. 기본 모델과 조정 모델에 강제 호출 조건을 적용한 결과이므로, 범용 챗봇 전체 성능의 순위로 옮길 수 없습니다. 독자에게 더 실용적인 질문은 자신의 기기에서 자주 쓰는 요청을 얼마나 정확하게 처리하는가입니다. 데이터
잘 생긴 명령과 올바른 행동은 구분합니다
공식 Python 문서는 JSON 스키마(schema)에 맞춰 출력을 제한한다고 설명합니다. 스키마는 방 이름은 문자열, 밝기는 정해진 범위의 숫자처럼 입력 칸의 규칙을 정한 것입니다. 서류 칸을 빠짐없이 채웠다고 서류의 내용까지 맞는 것은 아니듯, 형식 검증과 의미 검증은 각각 필요합니다. 공식
필요한 파일을 받은 기기는 인터넷 없이도 추론할 수 있습니다. 또한 앱은 한 번의 호출만 반환받아 직접 실행 여부를 정할 수 있습니다. 형식에 맞는 명령도 뜻을 확인합니다. 실제 실행은 앱이 통제합니다. 예를 들어 밝기를 바꾸는 요청과 출입문을 여는 요청은 같은 수준의 확인으로 취급하기 어렵습니다. 공식




