
논문 한입· 2분
τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%
Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.
- #논문
- #코딩 에이전트
- #벤치마크
2편

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

9월 3일 공개된 Grok Bot for Enterprise는 업무를 통째로 위임받는 'AI 팀원'입니다. 봇마다 전용 클라우드 컴퓨터, 루틴, 접근·네트워크·감사 제어를 공식 문서 기준으로 정리했습니다.