AI 환각은 언제 생길까? 27개 모델 6,561건으로 본 AI 진단의 함정

2026. 10. 10. · 배소율 (선임매니저)

AI 환각은 언제 가장 위험할까?

AI 환각이 가장 위험한 순간은 모델이 모른다고 답해야 할 자리에서 그럴듯한 결론을 내놓을 때입니다. 2026년 8월 공개된 WARRANT-SEO 벤치마크에서 27개 모델은 결정적 근거가 들어 있는 SEO 진단 문항을 99% 정확도로 맞혔습니다. 같은 문항에서 그 근거 한 줄만 삭제하자 판단을 적절히 유보한 비율은 51.5%로 내려앉았습니다. 47.5%p라는 격차가 AI 환각이 숨어 있는 구간입니다. 지식이 모자라서 벌어지는 일은 아닙니다. 근거가 충분한지를 스스로 재지 못하는 탓입니다.

AI 환각은 언제 가장 위험할까? 인포그래픽

목차

AI 환각이란 무엇일까?

AI 환각은 모델이 사실로 뒷받침되지 않는 내용을 사실처럼 서술하는 현상입니다. 흔히 없는 논문을 만들어내는 식의 노골적인 거짓말이 먼저 떠오르지만 마케팅 현장에서 실제로 손해를 내는 쪽은 훨씬 조용합니다. 트래픽이 떨어진 원인을 묻자 "키워드 자기잠식 때문입니다"라고 단정하는 답변이 대표적입니다. 문장은 매끄럽고 용어도 정확합니다. 다만 그 데이터만으로 그 결론을 지목할 수 있느냐는 다른 문제입니다.

WARRANT-SEO 벤치마크는 이 구분을 측정 대상으로 끌어올렸습니다. 이 연구가 쓰는 '워런트(warrant)'는 법률에서 말하는 영장이 아니라 논증학의 정당화 근거를 뜻합니다. 제시된 관찰값이 경쟁하는 다른 설명을 모두 지우고 그 진단 하나만 남길 때 비로소 워런트가 성립합니다. 반대로 설명이 둘 이상 살아 있는데 하나를 고르면 그건 추론이 아니라 베팅입니다.

벤치마크 설계는 단순합니다. 동일한 SEO 진단 시나리오 27개를 세 가지 판본으로 나눴습니다. 1판은 결정적 관찰값을 포함했고 2판은 거기에 "이 정보로는 알 수 없다"라는 선택지를 더했습니다. 3판은 결정적 관찰값 하나만 지웠습니다. 문항은 모두 81개, 수집된 응답은 6,561건, 채점이 끝난 응답은 6,427건입니다. 채점 신뢰도는 0.969로 보고됐습니다. 세 판본의 점수 차이가 곧 AI 환각의 발생 지점을 가리킵니다.

이 설계는 지식을 묻지 않습니다. 똑같은 질문을 근거만 바꿔 던지기 때문에 모델이 SEO를 아느냐가 아니라 자기가 가진 정보의 한계를 아느냐가 드러납니다. GEO 업무에 AI를 붙이려는 입장에서는 후자가 훨씬 값비싼 능력입니다.

근거 한 줄을 빼면 왜 정답률이 반 토막 날까?

결정적 근거가 있으면 모델은 거의 틀리지 않습니다. 그 근거가 사라지면 절반은 모른다고 말하지 못합니다. 1판과 2판에서 27개 모델의 정확도는 99%였습니다. 3판에서 적절한 유보를 선택한 비율은 51.5%였습니다. 나머지 절반가량은 사라진 근거를 눈치채지 못했습니다. 1판에서 내렸던 것과 비슷한 수준의 확신으로 하나의 원인을 지목했습니다.

반복 질문 결과는 더 눈에 걸립니다. 같은 질문을 세 번 던졌을 때 일부 모델은 세 번 모두 같은 진단을 불확실성 표시 없이 내놓았습니다. 사람 입장에서는 세 번의 일치가 교차 검증처럼 보입니다. 실제로는 근거가 없는 같은 결론이 세 번 복사된 것에 가깝습니다. AI 환각을 반복 질의로 검증하려는 시도는 그래서 잘 통하지 않습니다.

연구진은 지식 시험도 따로 치렀습니다. 테크니컬 SEO 지식 78문항을 같은 27개 모델에 물어 2,106회를 호출하고 2,050건을 평가했습니다. 지식 점수와 워런트 점수의 상관은 스피어만 계수 +0.803으로 꽤 높았습니다. 그런데 역전 사례가 선명했습니다. 한 모델은 지식 0.808에 판단 0.500을 받았습니다. 지식 0.897을 받은 모델이 판단에서는 0.728에 그쳤고 지식이 0.794로 더 낮은 모델은 0.887로 앞섰습니다.

불확실성을 명시적으로 지시한 실험은 결과가 또 달랐습니다. 시점이 걸린 사실 질문 22개에 "학습 데이터가 이 기간을 다루지 않으면 추론하지 말고 그렇다고 말하라"는 한 줄을 붙였습니다. 유보율은 20.7%에서 85%로 뛰었습니다. 오답률은 14.5%에서 1.2%로 떨어졌습니다. 정답률마저 64.8%에서 13.8%로 무너졌습니다. 어떤 모델은 95.5%였던 정답률이 0%가 됐습니다. AI 환각을 줄이는 프롬프트가 쓸모를 함께 줄일 수 있다는 뜻입니다.

지오랭크는 AI 진단에서 어떤 시행착오를 겪었을까?

지오랭크도 AI 진단을 그대로 실행에 옮겼다가 4개월을 되돌린 적이 있습니다. 국내 B2B SaaS 기업 E사의 AI 인용률이 3주 만에 31% 떨어진 사례였습니다. GSC 데이터와 인용 로그를 LLM에 넣고 원인을 물었더니 세 번 모두 "내부 링크 구조 개편으로 인한 권위 희석"이라는 답이 돌아왔습니다. 세 번 일치했으니 믿을 만 하다고 판단했습니다.

링크 구조를 되돌리는 작업에 6주, 담당 2명이 들어갔습니다. 인용률은 회복되지 않았습니다. 뒤늦게 서버 로그를 다시 뜯어보니 원인은 다른 곳에 있었습니다. CDN 설정이 바뀌면서 특정 봇의 User-Agent에 대해 응답 시간이 평균 4.2초로 늘어 있었습니다. 처음 LLM에 넘긴 자료에는 봇 로그가 아예 없었습니다. 결정적 근거가 빠진 상태였고 모델은 그 사실을 알려주지 않았습니다. WARRANT-SEO의 3판 상황을 현장에서 그대로 재현한 셈입니다.

이후 지오랭크는 진단 요청 방식을 바꿨습니다. 결론만 묻지 않고 "이 결론을 뒤집을 수 있는 관찰값은 무엇인가"와 "지금 자료에서 빠진 데이터는 무엇인가"를 같은 프롬프트에서 함께 요구했습니다. 국내 의료기기 유통사 K사의 가시성 하락 건에서는 이 방식으로 모델이 "제품 카테고리 페이지의 변경 이력이 없어 판단할 수 없다"는 응답을 냈습니다. 그 한 줄 덕분에 엉뚱한 공사를 시작하지 않았습니다. 원인은 경쟁사 신규 콘텐츠였고 대응 기간은 7주로 끝났습니다.

성과만 적자면 깔끔하겠지만 이 방식에도 대가가 있었습니다. 유보 응답이 늘면서 담당자가 직접 데이터를 더 모아야 하는 일이 2.5배로 늘었습니다. AI 환각을 막는 비용은 결국 사람의 시간으로 지불됩니다.

AI 환각을 걸러내는 절차는 어떻게 만들까?

브레인스토밍과 진단을 같은 창에서 하지 않는 것이 출발점입니다. "무엇이 원인일 수 있는가"는 가능한 설명을 넓게 벌리는 질문입니다. "무엇이 원인인가"는 하나로 좁히는 질문입니다. 두 질문을 섞어 던지면 모델은 넓게 벌린 목록 중 하나를 확신의 어조로 집어 옵니다. AI 환각은 거기서 자랍니다.

점검 항목모델에 요구할 것통과 기준
근거 추적결론을 지지하는 관찰값을 번호로 나열관찰값이 실제 제출 자료에 존재
경쟁 가설같은 데이터로 가능한 다른 설명 2개 이상각 설명을 왜 배제했는지 서술
결정적 관찰값이 결론만 남게 만든 한 가지 지목그것이 빠지면 결론이 흔들림을 인정
결손 데이터지금 자료에서 없는 항목 목록없다고 답하면 재질문 대상
유보 허용"이 자료로는 알 수 없다" 선택지 명시유보가 감점이 아님을 프롬프트에 기재
반복 금지같은 질문 재질의로 검증하지 않음교차 검증은 데이터로 수행

적용 순서는 이렇게 잡습니다.

  1. 자료를 넘기기 전에 어떤 데이터가 들어갔는지 목록을 적습니다. 서버 로그, 봇 접근 기록, 변경 이력 중 빠진 게 있으면 표시합니다.
  2. 진단 프롬프트에 유보 선택지를 명시합니다. 모른다고 답해도 감점이 아니라는 문장을 넣습니다.
  3. 답을 받으면 결론보다 근거 목록을 먼저 읽습니다. 근거가 제출 자료 밖에서 왔다면 그 자리에서 폐기합니다.
  4. 경쟁 가설 배제 논리를 검토합니다. "가능성이 낮다" 같은 표현만 있으면 배제가 아니라 회피입니다.
  5. 실행 비용이 큰 결론은 사람이 데이터로 한 번 더 확인합니다. 지오랭크는 작업 2주 이상이 걸리는 건에 이 절차를 걸어 둡니다.

모델별 AI 환각 내구성은 얼마나 다를까?

근거가 사라진 상황을 알아채는 능력은 모델별로 2배 가까이 벌어지고 가격과는 거의 무관합니다. 워런트 점수 1.000을 받은 모델이 7개 있었습니다. 반대쪽 끝에는 0.500대가 몰려 있었습니다. 같은 질문에 같은 자료를 줬는데 한쪽은 모른다고 말하고 한쪽은 단정합니다.

구간워런트 점수지식 점수1,000회 진단 비용해석
만점군 7종1.0000.79~0.95약 $4.5~$128유보 판단이 안정적
상위 경계0.8870.794중간지식보다 판단이 앞섬
중간군0.7280.897중간지식 대비 판단이 처짐
하위군0.500~0.5560.80 내외저가 구간 포함근거 결손을 거의 못 잡음

비용 쪽이 특히 흥미롭습니다. 1,000회 진단 기준으로 한 모델은 약 4.49달러에 만점이었습니다. 같은 만점을 받은 다른 모델은 10.33달러로 2.3배였습니다. 또 다른 만점 모델은 약 128달러로 28.5배였습니다. 비싼 모델이 판단력을 더 준다는 가정은 이 데이터에서 성립하지 않습니다. AI 환각 위험을 낮추려고 최상위 모델에 예산을 몰아주는 선택은 재검토할 여지가 있습니다.

다만 해석에는 선이 필요합니다. 이 숫자는 2026년 8월에 고정한 응답 집합에서 나온 것이고 모델은 계속 갱신됩니다. 시나리오 본문은 암기를 막으려고 비공개로 유지됩니다. 특정 모델명을 외워 두는 쪽보다 유보 가능성을 자체 데이터로 재는 습관이 오래 갑니다. 지오랭크는 진단 사례 20건을 근거 포함본과 제거본으로 나눠 분기마다 다시 돌립니다.

AI 환각의 구조적 원인은 무엇일까?

AI 환각은 모델이 답을 내도록 보상받고 유보에는 보상이 없는 학습 구조에서 나옵니다. 학술 쪽에서도 같은 결론이 축적되고 있습니다. 유보 능력을 따로 측정하는 벤치마크 연구들은 정답 여부와 질문 자체의 답변 가능성을 두 개의 독립 축으로 분리해야 한다고 지적합니다. 한 축만 보면 "많이 맞히는 모델"이 "많이 단정하는 모델"과 구별되지 않습니다. 추론 능력을 강화하는 미세조정이 오히려 유보율을 평균 24% 떨어뜨렸다는 보고도 있습니다. 더 잘 생각하도록 훈련하면 더 많이 결론을 내는 쪽으로 기울 수 있다는 뜻입니다.

제도 쪽 흐름도 같은 방향을 가리킵니다. 국내에서는 AI 기본법 시행으로 생성형 AI 산출물에 대한 표시 의무와 투명성 요구가 구체화됐습니다. 언론계는 생성형 AI 준칙으로 출처 확인 단계를 규정에 넣었습니다. 산출물의 품질을 사후에 다투는 대신 생성 경로를 기록하게 만드는 접근입니다. 마케팅 조직도 같은 구조를 가져올 수 있습니다. AI 진단 결과를 보고서에 넣을 때 어떤 자료가 입력됐고 어떤 결론이 유보됐는지를 함께 남기는 것만으로 AI 환각의 책임 소재가 분명해집니다.

GEO 관점에서 이 문제는 두 방향으로 갈라집니다. 하나는 방금 다룬 내부 운영, 즉 AI를 진단 도구로 쓸 때의 위험입니다. 다른 하나는 외부 노출, 곧 AI가 우리 브랜드를 설명할 때 근거 없는 서술을 섞는 위험입니다. 후자는 입력 자료를 우리가 통제하지 못하기 때문에 더 까다롭습니다. 지오랭크가 쓰는 대응은 정량 정보를 한 페이지에 모으고 변경 이력을 남겨 모델이 참조할 결정적 관찰값을 사이트 안에 심어 두는 것입니다. 국내 전문직 서비스 A사의 경우 서비스 범위, 가격 구간, 자격 요건을 표 형태로 정리한 뒤 3개월 동안 잘못된 서술을 포함한 AI 답변 비율이 38%에서 11%로 내려갔습니다.

완전한 해결은 아닙니다. 모델이 참조하지 않으면 아무 효과가 없고 서드파티 언급이 우리 페이지보다 강하게 작동하는 주제에서는 효과가 제한적입니다. 그래서 지오랭크는 AI 환각 대응을 콘텐츠 작업으로만 보지 않고 측정과 로그를 포함한 운영 과제로 다룹니다.

AI 환각 자주 묻는 질문

AI 환각을 완전히 없앨 수 있나요?

현재 기술로는 어렵습니다. 불확실성을 명시적으로 지시했을 때 오답률은 14.5%에서 1.2%까지 떨어졌지만 정답률도 64.8%에서 13.8%로 함께 무너졌습니다. 환각을 0으로 밀면 쓸 수 있는 답변도 거의 남지 않습니다. 현실적인 목표는 제거가 아니라 실행 비용이 큰 결론에만 사람의 검증을 집중시키는 선별입니다.

같은 질문을 여러 번 물어보면 AI 환각을 걸러낼 수 있나요?

권하지 않습니다. 벤치마크에서 일부 모델은 동일한 질문 세 번에 모두 같은 진단을 불확실성 표시 없이 내놓았습니다. 반복 일치는 검증이 아니라 같은 결론의 복사입니다. 교차 검증은 질문을 늘리는 쪽이 아니라 데이터를 늘리는 쪽에서 해야 합니다.

비싼 모델을 쓰면 AI 환각이 줄어드나요?

가격과 판단력의 상관은 약합니다. 1,000회 진단 비용이 약 4.49달러인 모델과 128달러인 모델이 같은 워런트 만점을 받았습니다. 반대로 지식 점수가 0.89를 넘는 모델이 유보 판단에서는 0.728에 머문 사례도 있습니다. 예산 배분보다 프롬프트 설계와 입력 자료 점검이 먼저입니다.

SEO 지식이 많은 모델을 고르면 되지 않나요?

지식과 판단은 상관계수 +0.803으로 연결돼 있지만 역전이 일어납니다. 지식 0.808에 판단 0.500을 받은 모델이 있고 지식이 더 낮은 0.794인데 판단은 0.887로 앞선 모델이 있습니다. 용어를 아는 것과 근거가 부족함을 아는 것은 다른 능력입니다.

AI 환각 위험을 줄이는 프롬프트는 어떻게 쓰나요?

결론과 함께 세 가지를 요구하면 됩니다. 결론을 지지하는 관찰값 목록, 같은 데이터로 가능한 다른 설명 2개 이상과 배제 이유, 지금 자료에서 빠진 데이터 항목입니다. "이 자료로는 알 수 없다"는 선택지를 허용한다는 문장을 함께 넣으면 유보 응답이 실제로 늘어납니다.

AI가 우리 브랜드를 잘못 설명할 때는 어떻게 하나요?

내부 진단과는 다른 과제입니다. 서비스 범위나 가격, 자격 요건처럼 정량 정보를 한 곳에 표로 모으고 변경 이력을 남겨 모델이 집을 결정적 관찰값을 사이트 안에 만들어 두는 방식이 기본입니다. 서드파티 언급이 강한 주제에서는 효과가 제한적이므로 외부 인용 관리가 함께 필요합니다.

함께 보면 좋은 지오랭크 리포트

AI 환각을 운영 과제로 다루려면 측정과 방어를 같이 봐야 합니다.

참조논문

START GEO NOW

AI 검색에서 먼저 추천되고 싶다면
지오랭크에 문의하세요

브랜드의 현재 상황과 목표를 알려주시면, 지오랭크가 GEO 전략과 예상 로드맵을 제안해 드립니다. 지금 문의하면 3개월 안에 AI 답변에서의 변화를 함께 확인할 수 있습니다.