# AI 챗봇에게 재테크 물었더니, 57%가 틀린 답 냈다

> 영국 핀테크 새턴(Saturn)이 18개 주류 AI 모델을 대상으로 1만 건의 금융 조언을 검증한 결과, 복잡한 질문에서 오류율이 88~99%까지 치솟았습니다.

- 출처 사이트: 머니피셜 (https://aifficial.net/money/posts/saturn-ai-financial-advice-error-rate/)
- 발행: 2026-09-21
- 카테고리: 성장 지표 · 태그: AI챗봇, 금융조언, 환각현상, 핀테크, 소비자보호

## 핵심 답변

영국 핀테크 리서치 기업 새턴(Saturn)이 2026년 9월 발표한 '인공적 권위(Artificial Authority)' 보고서에 따르면, 챗GPT·클로드·제미나이·코파일럿 등 18개 주요 AI 모델을 대상으로 121개 금융 질문을 5회 반복 검증(총 1만 건 이상 분석)한 결과 평균 57%의 답변이 오답이거나 부적절한 것으로 나타났습니다. 특히 여러 단계의 계산이나 규정 해석이 필요한 복잡한 금융 질문에서는 오류율이 평균 88%에 달했으며, 일부 모델은 99% 오답을 기록했습니다.

## 한 장 요약(만화)

![머니피셜 마스코트가 챗봇 재테크 질문, 1만 건 테스트와 57% 오답률, 연금 세금 폭탄 사례, 면책 없는 무규제 위험을 4컷으로 설명합니다.](https://aifficial.net/images/posts/saturn-ai-financial-advice-error-rate/comic-v1.0.0.webp)

## 요약

- 새턴이 18개 AI 모델을 대상으로 1만 건 이상의 금융 질문을 테스트한 결과 평균 57%가 오답이었습니다.
- 복잡한 세금 및 대출 연산 질문에서는 오류율이 88%까지 치솟았으며 일부 모델은 99% 실패했습니다.
- 유료 모델의 평균 오류율(49%)이 무료 모델(63%)보다 낮았으나 여전히 절반에 가까운 오답을 냈습니다.
- 가장 우수한 성적을 낸 모델은 클로드 오퍼스 5(추론 모드)였으나 역시 39%의 오류율을 보였습니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 조사 기관 | Saturn (영국 핀테크) (보고서 명: 'Artificial Authority: Should you trust AI to deliver financial advice?') |
| 테스트 규모 | 18개 모델 · 10,000건 이상 (121개 고유 재정 질문을 모델당 5회씩 반복 질의) |
| 전체 평균 오류율 | 57% (무료 모델 평균 63% vs 유료 모델 평균 49%) |
| 복잡 질문 실패율 | 88% ~ 99% (연금 세금, 주택담보대출 유예, 학자금 대출 상환 등 다단계 계산) |


## 챗봇에게 물어본 연금, 돌아온 건 3천만 원 세금 폭탄

"집을 사려는데 주택담보대출 상환 유예를 신청하면 신용등급에 영향이 없나요?" 구글 제미나이는 "영향이 없다"고 답했습니다. 사실과 다릅니다. "해외로 이주하면 학자금 대출 상환을 합법적으로 멈출 수 있나요?" 앤트로픽 클로드는 아예 존재하지도 않는 가짜 규정을 지어내 답변했습니다. 영국의 금융기술 기업 새턴(Saturn)이 실시한 대규모 실증 테스트에서 포착된 실제 환각 사례들입니다. 

새턴은 2026년 9월 14일 '인공적 권위(Artificial Authority)'라는 제목의 연구 보고서를 공개했습니다. 챗GPT, 클로드, 코파일럿, 제미나이, 그록 등 전 세계에서 가장 널리 쓰이는 18개 상용 AI 모델을 대상으로 주택대출, 연금, 세금, 저축, 학자금 등 121개 실전 금융 질문을 던졌습니다. 일관성을 검증하기 위해 질문당 5번씩 질의하여 총 10,000건 이상의 답변을 수집해 정밀 채점했습니다. 

결과는 충격적이었습니다. AI 모델들은 전체 금융 질문의 57%에서 오답을 내놓았습니다. 정확한 조언을 내놓은 비율은 43%에 불과했습니다. 

## 복잡한 계산이 들어가면 100건 중 99건 실패

질문의 난도가 올라갈수록 AI는 급격히 무너졌습니다. 두 단계 이상의 계산이나 상충되는 조세 규정 해석이 필요한 복잡한 시나리오에서 AI 모델들의 평균 실패율은 88%로 치솟았습니다. 일부 모델의 경우 고난도 질문에서 실패율이 무려 99%에 달했습니다. 



무료 모델과 유료 구독 모델 사이의 격차도 뚜렷했습니다. 무료 AI 모델의 평균 오류율은 63%였고 유료 모델은 49%였습니다. 하지만 가장 우수한 성적을 거둔 최고급 추론 모델 '클로드 오퍼스 5(Claude Opus 5 Reasoning)'조차 39%의 오류율을 기록했습니다. 가장 비싼 AI를 쓰더라도 10번 중 4번은 엉터리 재정 조언을 해준다는 뜻입니다. 

| AI 모델 및 등급 | 전체 오답률 | 복잡 질의 실패율 | 비고 |
| --- | --- | --- | --- |
| 클로드 하이쿠 4.5 | 82% | 99% | 테스트 모델 중 최하위 |
| 구글 제미나이 3.1 프로 | 73% | 90% 이상 | 규정 누락 다수 |
| 챗GPT 5.6 루나 | 58% | 85% 이상 | 복합 세금 연산 오류 |
| 클로드 오퍼스 5 (추론 모드) | 39% | 65% | 테스트 모델 중 최우수 (그러나 40% 결함) |

## 면책 조항 뒤에 숨은 무규제의 위험

아말 졸리(Amal Jolly) 새턴 최고경영자는 "수백만 명의 소비자가 돈 문제를 AI에 의존하기 시작했지만, 이들이 얻는 답변의 절반 이상은 실제 손실을 초래할 수 있는 오답"이라고 경고했습니다. 실제로 한 테스트에서는 연금 인출 규정에 대한 잘못된 조언을 그대로 따랐을 경우 영국 국세청(HMRC)으로부터 17,500파운드(약 3,100만 원)의 추징 세금을 부과받을 수 있는 심각한 결함이 발견됐습니다. 

더 큰 문제는 법적 보호 장치가 전혀 없다는 점입니다. 공인 재무설계사(IFA)의 조언을 듣고 손해가 발생하면 금융감독 당국을 통해 분쟁 조정이나 배상을 받을 수 있지만, AI 챗봇의 하단에는 "AI는 실수를 할 수 있으니 확인하라"는 면책 한 줄만 적혀 있을 뿐입니다. 규제 당국의 조속한 가이드라인 제정이 시급하다는 목소리가 커지고 있습니다. 


AI가 코딩이나 문장 교정에서는 놀라운 생산성을 보여주지만, 세법이나 이자 계산처럼 단 1원이나 하루 차이로도 패널티가 갈리는 금융 영역에서는 여전히 매우 위험한 도구라는 점을 1만 건의 데이터가 증명합니다. 특히 '확신에 찬 어조로 존재하지 않는 금융 법률을 지어내는 환각'은 금융 지식이 부족한 일반인에게 치명적입니다. AI를 재테크 아이디어 브레인스토밍에 쓸 수는 있어도, 실제 송금 버튼을 누르기 전 최종 검증은 반드시 공인된 기관의 원문 규정을 직접 대조해야 합니다. 독자님께서는 챗봇에게 세금이나 대출 관련 질문을 던져보신 적이 있으신지요? 



## 자주 묻는 질문

**Q. 어떤 종류의 치명적인 오류들이 발견됐습니까?**

주택담보대출 상환 유예가 신용점수에 영향이 없다고 잘못 안내하거나, 연금 인출 세금 규정을 틀리게 답변해 최대 17,500파운드(약 3,100만 원)의 세금 폭탄을 맞을 수 있는 조언, 우선순위 공과금보다 고금리 부채를 먼저 갚으라는 잘못된 채무 조정 조언 등이 확인됐습니다.

**Q. 유료 AI를 쓰면 믿을 만합니까?**

유료 모델 역시 평균 49%가 오답이었으며, 가장 성능이 좋았던 클로드 오퍼스 5(추론 모드)조차 10건 중 4건(39%)에서 오답을 냈습니다. 유료 서비스라고 해서 맹신할 수 없습니다.

**Q. 규제 당국의 입장은 무엇입니까?**

현재 AI의 비공식 금융 조언은 금융감독청(FCA) 등 금융 규제의 사각지대에 놓여 있어, 잘못된 조언으로 손실이 발생해도 법적 보상이나 분쟁 조정이 불가능합니다.

## 출처

1. [Saturn 공식 보고서 페이지](https://www.saturnos.com/report/artificial-authority) (official)
2. [파이낸셜 타임스(FT) 보도](https://www.ft.com/content/c0cd359d-df84-4208-a789-ffa864b43666) (report)
3. [IBS Intelligence 상세 분석](https://ibsintelligence.com/ibsi-news/ai-chatbots-give-incorrect-financial-advice-57-of-the-time-study-finds/) (report)

_이 문서는 머니피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._