Claude 한계 테스트 — 실제로 못하는 것 5가지 2026

Claude를 석 달 넘게 매일 썼다. Claude 한계가 정확히 어디까지인지 궁금해져서, 이번엔 일부러 못하는 지점을 찾아보기로 했다. 다섯 가지를 직접 찔러봤고, 결과를 있는 그대로 옮긴다.

1. 일부러 약점을 찾아보기로 한 이유

Claude 한계가 뭔지 정확히 모르고 쓰면 두 가지 실수를 한다. 못하는 일을 시켜놓고 실망하거나, 반대로 알아서 걸러줄 거라 믿고 결과를 그대로 믿어버린다. 둘 다 겪어봤다. 그래서 이번엔 잘하는 척하지 않고, 어디서 막히는지부터 확인해보기로 했다.

방법은 단순했다. 평소라면 안 물어볼 애매한 질문, 함정이 있는 질문, 일부러 헷갈리게 만든 질문을 던졌다. 결과가 나쁘면 나쁜 대로, 의외로 괜찮으면 괜찮은 대로 그대로 적었다.

2. 실제로 찔러본 다섯 가지

① 오늘 날짜를 슬쩍 숨긴 질문

“이번 주 목요일이 무슨 요일이야?”라고 물었다. 당연한 걸 왜 묻나 싶겠지만, 대화 안에서 오늘 날짜를 한 번도 말해주지 않은 상태였다. Claude는 정확한 날짜를 요구하거나, 대화에 날짜 정보가 있으면 그걸 근거로 계산했다. 날짜를 아예 모르는 상태에서 추측으로 답하는 일은 없었다. 이 부분은 예상보다 신중했다.

② 일부러 모순된 지시

“짧게 써줘. 근데 5가지 항목을 각각 자세히 설명해줘.”라고 동시에 요청했다. 짧게와 자세히는 같이 갈 수 없는 조건이다. Claude는 둘 다 만족시키려다 어중간하게 나오거나, 어느 한쪽으로 기울었다. 모순을 알아서 지적하고 되묻는 경우도 있었지만, 매번 그런 건 아니었다. 지시가 서로 부딪히면 결과 품질이 눈에 띄게 떨어졌다.

③ 존재하지 않는 것에 대한 질문

일부러 없는 정책이나 없는 서비스 이름을 지어내서 “이거 어떻게 신청해?”라고 물었다. 없는 걸 없다고 바로 말하는 경우도 있었지만, 그럴듯한 절차를 지어내서 답하는 경우도 있었다. 이 부분이 다섯 가지 중 가장 위험했다. 실제로 없는 정보를 진짜처럼 들리게 만든다는 뜻이기 때문이다.

④ 최신 정보를 묻는 질문

최근 바뀐 정책이나 이번 주 소식을 물었다. 검색 기능 없이 물으면 예전 정보로 답하거나, 모른다고 인정했다. 이건 한계라기보다 원래 그렇게 설계된 부분이라 실망할 일은 아니었다. 다만 모른다고 말 안 하고 옛날 정보를 최신인 것처럼 답할 때가 문제였다.

⑤ 긴 대화 뒤에 예전 내용 다시 묻기

대화를 한참 이어가다가 처음에 말했던 사소한 조건을 다시 물어봤다. 대부분 기억하고 있었지만, 대화가 아주 길어지고 중간에 주제가 여러 번 바뀐 뒤에는 앞부분 디테일을 놓치는 경우가 있었다. 중요한 조건은 대화 중간에 한 번씩 다시 확인해주는 게 안전하다는 걸 확인했다.

날짜 계산
정확히 인지함
최신 정보
모른다고 인정
모순된 지시
품질 저하
긴 대화 기억
가끔 놓침
가짜 정책
지어내서 답함
검증 가능 · 안전

확인 어려움 · 위험

3. 이 다섯 가지에는 공통점이 있었다

잘 살펴보면 진짜 문제가 되는 경우는 딱 하나였다 — 모른다고 말해야 할 때 모른다고 안 하는 경우다. 날짜 계산은 모르면 모른다고 했고, 최신 정보도 대부분 인정했다. 하지만 존재하지 않는 정책을 묻자 그럴듯한 답을 지어낸 건, 확실하지 않은 걸 확실한 것처럼 포장했다는 뜻이다.

반대로 말하면, 계산이나 날짜처럼 명확히 검증 가능한 건 오히려 안전했다. 위험한 건 “그럴듯하게 들리지만 확인할 방법이 마땅치 않은” 질문들이었다.

이런 현상을 업계에서는 AI 환각(hallucination)이라고 부른다. 없는 사실을 지어내는 게 아니라, 빈 곳을 그럴듯하게 채우려는 성향에서 나온다는 설명이 많다. 실제로 테스트해보니 이 성향은 “확인 방법이 마땅치 않은 질문”에서 훨씬 두드러졌다. 반대로 날짜나 계산처럼 스스로 검증 가능한 질문에서는 이 성향이 잘 나타나지 않았다.

4. 그래서 어떻게 물어야 하는가

이번 테스트로 얻은 건 실망이 아니라 기준이었다. 존재 여부가 불확실한 걸 물을 땐 답을 그대로 믿지 말고 출처를 같이 물어본다. 지시가 서로 부딪히면 둘 중 하나를 포기하고 정리해서 다시 묻는다. 대화가 길어지면 중요한 조건은 중간에 한 번 더 확인시킨다. 이 세 가지만 지켜도 오늘 확인한 위험한 지점은 대부분 피해간다.

한 가지 더 있다. 이 다섯 가지 테스트는 전부 한 번의 대화 안에서 진행했다. 새 대화를 열어서 같은 질문을 다시 던지면 결과가 살짝 달라질 수 있다. 그래서 중요한 판단이 걸린 질문일수록, 한 번의 답으로 끝내지 말고 표현을 바꿔서 한 번 더 확인하는 습관이 안전하다.

✅ 최종 결론

Claude 한계는 “뭘 못한다”보다 “확신 없는 걸 확신 있게 말할 때” 쪽에 가깝다. 계산이나 날짜처럼 검증되는 일은 의외로 신중했고, 확인이 어려운 질문일수록 조심해야 했다. 잘하는 것만 알고 쓰는 것과, 이런 지점까지 알고 쓰는 건 결과물의 신뢰도 자체가 달라진다.

Claude 한계
Claude 단점
AI 실험실
2026
Claude 활용법
내돈내산 AI 비교

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤