AI 가시성 측정, 왜 도구마다 숫자가 다를까? 정확도 아닌 정밀도

2026. 09. 22. · 오채윤 (매니저)

AI 가시성 측정, 정확도가 아니라 정밀도의 문제입니다

AI 검색 가시성 측정에는 맞히고 틀리는 정답이 없습니다. 생성형 AI의 답변은 같은 질문에도 매번 달라지기 때문에, 도구 두 개가 41%와 23%라는 다른 숫자를 보여줘도 한쪽이 틀린 게 아닙니다. 서로 다른 조건에서 서로 다른 분포를 잰 것뿐입니다. 그래서 GEO 성과 측정에서 물어야 할 질문은 "이 숫자가 맞습니까"가 아니라 "같은 방법으로 다시 재면 같은 숫자가 나옵니까"입니다. 정확도(accuracy)가 아니라 정밀도(precision)를 봐야 한다는 뜻인데요, 이 기준을 세우고 나면 측정 도구를 고르는 방식도, 보고서를 읽는 방식도 완전히 달라집니다.

AI 가시성 측정, 정확도가 아니라 정밀도의 문제입니다 인포그래픽

목차

지오랭크는 측정 신뢰도를 어떻게 확보했을까?

측정 횟수를 프롬프트당 1회에서 20회로 올리자, 그동안 "성과"라고 보고하던 변동의 상당 부분이 사라졌습니다. 지오랭크가 B2B SaaS 기업 A사와 6개월간 진행한 GEO 프로젝트에서 실제로 겪은 일입니다.

처음 3개월은 흔한 방식으로 측정했습니다. 핵심 프롬프트 40개를 매일 1회씩 ChatGPT에 던지고, 브랜드가 언급되면 1, 아니면 0으로 기록했습니다. 주간 리포트에는 "이번 주 노출률 45%, 지난주 대비 12%p 상승"같은 문장이 올라갔고요. 문제는 다음 주에 아무것도 바꾸지 않았는데 노출률이 28%로 떨어졌다는 것입니다. 클라이언트는 당연히 물었습니다. 지난주에 뭘 잘못한 거냐고요.

원인을 찾느라 2주를 썼습니다. 콘텐츠 변경 이력, 크롤러 로그, 경쟁사 신규 콘텐츠까지 다 뒤졌지만 설명되는 게 없었습니다. 그러다 같은 프롬프트를 하루에 20번 연속으로 던져 봤더니 답이 나왔습니다. 20회 중 브랜드가 언급된 횟수가 그날 8회, 다음 날 11회, 그 다음 날 7회였습니다. 즉 하루 1회 측정은 동전을 한 번 던져 놓고 "오늘은 앞면이 나오는 날"이라고 기록한 것과 다르지 않았습니다.

4개월 차부터 설계를 바꿨습니다. 프롬프트당 하루 20회 반복, 로그아웃 상태 고정, 모델 버전 명시, 결과는 단일 숫자가 아니라 신뢰구간과 함께 보고하는 방식으로요. 측정 비용은 약 3.8배 늘었지만 주간 변동 폭이 ±17%p에서 ±6%p로 줄었습니다. 그러자 6주 차에 잡힌 9%p 상승이 진짜 신호라는 확신을 갖고 해당 콘텐츠 유형에 예산을 더 넣을 수 있었습니다. 6개월간 브랜드 언급률은 31%에서 52%로 올랐는데, 더 중요한 성과는 "무엇이 효과가 있었는지"를 처음으로 구분해 낼 수 있게 됐다는 점입니다.

물론 모든 프로젝트에 20회 반복을 권하지는 않습니다. 프롬프트 300개를 추적하는 커머스 클라이언트 B사에서는 같은 설계가 예산을 감당하지 못했고, 핵심 30개만 20회로 정밀 측정하고 나머지 270개는 주 1회 5회 반복으로 낮춰 운영 중입니다. 측정 예산은 유한하고, 어디에 정밀도를 쓸지 고르는 것도 전략입니다.

정확도와 정밀도는 무엇이 다를까?

정확도는 참값에 얼마나 가까운지를, 정밀도는 반복 측정이 서로 얼마나 모여 있는지를 뜻합니다. AI 검색에는 참값이 존재하지 않으므로 정밀도만이 유효한 기준입니다.

과녁을 떠올리면 쉽습니다. 정확도가 높다는 건 화살이 정중앙에 꽂혔다는 뜻이고, 정밀도가 높다는 건 화살 열 발이 한 곳에 모였다는 뜻입니다. 전통적인 검색 순위 추적은 정확도를 말할 수 있었습니다. 특정 시점, 특정 지역, 특정 기기에서 그 키워드의 순위는 하나로 정해져 있었으니까요.

AI 검색은 다릅니다. 같은 질문을 두 번 던지면 두 번 다른 답이 나옵니다. 모델의 확률적 샘플링, 실시간 검색 결과의 변동, 사용자 개인화, 라우팅되는 모델 버전이 모두 답을 흔듭니다. 이 상황에서 "우리 브랜드의 진짜 노출률"이라는 단일한 참값은 애초에 존재하지 않습니다. 존재하는 것은 분포뿐입니다.

구분전통 순위 추적AI 가시성 측정
참값 존재있음 (특정 조건의 순위)없음 (확률 분포)
핵심 기준정확도정밀도
올바른 보고 형태"3위""41% ±9%p, 20회 반복"
도구 간 비교의미 있음의미 없음
신뢰의 근거크롤링 정확성방법론 공개와 고정
실패 양상순위 오기재노이즈를 성과로 오독

함의는 분명합니다. 도구 A와 도구 B의 숫자를 나란히 놓고 "어느 쪽이 맞느냐"를 따지는 회의는 답이 나올 수 없습니다. 하나의 도구를 고르고, 그 방법론을 고정한 뒤, 같은 조건에서의 시계열 변화만 해석해야 합니다.

왜 도구마다 측정 숫자가 다를까?

도구마다 수집 방식, 로그인 상태, 모델 모드, 샘플링 횟수, 언급의 정의가 전부 다르기 때문입니다. 이것들은 구현 세부사항이 아니라 무엇을 측정하는지를 규정하는 요소입니다.

가장 큰 차이는 수집 경로입니다. 소비자용 웹 인터페이스를 스크래핑하는 도구와 개발자 API를 호출하는 도구는 사실상 다른 제품을 재고 있습니다. API에는 웹 UI에만 있는 검색 증강이나 개인화 로직이 빠져 있곤 합니다.

모델 모드도 결정적입니다. Semrush가 2026년 6월에 내놓은 분석에 따르면 ChatGPT의 즉답 모드와 추론 모드가 인용한 도메인은 약 25%만 겹쳤습니다. 추론 모드는 쿼리 팬아웃을 4배 더 많이 발생시켰고 응답당 인용 출처도 2배 많았습니다. 99개 도메인은 추론 모드에서만 등장했고요. 어느 모드로 측정했는지 모르면 그 숫자는 해석이 불가능합니다.

프롬프트 형태도 결과를 바꿉니다. 5개 엔진의 응답 38,000건을 분석한 연구에서는 순위를 매겨 달라는 형태의 프롬프트가 개방형 질문보다 최대 20% 더 많은 브랜드를 노출시켰습니다. "GEO 대행사 추천해 줘"와 "GEO 대행사 5곳을 순위로 알려 줘"는 같은 의도처럼 보이지만 측정값은 다르게 나옵니다.

여기에 로그인 여부, 메모리 사용 여부, 요청 IP의 지역, 기기 유형이 더해집니다. 마지막으로 "언급"의 정의가 있습니다. 브랜드명이 본문에 나오면 언급인지, 링크가 걸려야 인용인지에 따라 같은 응답도 다르게 집계됩니다. Otterly가 2026년 초 100만 건 이상의 인용을 분석한 자료를 보면 플랫폼마다 언급과 링크의 관계가 제각각이라, 정의 하나만 바꿔도 순위가 뒤집힙니다.

몇 번을 물어봐야 믿을 만한 측정이 될까?

참 등장률이 50% 부근일 때 5회 반복의 95% 신뢰구간은 ±44%p에 달합니다. 실무에서 의미 있는 변화를 잡으려면 최소 20회, 중요한 의사결정에는 그 이상이 필요합니다.

이항 표준오차로 계산한 반복 횟수별 신뢰구간은 아래와 같습니다. 참 등장률 50%를 가정한 값입니다.

프롬프트당 반복 횟수95% 신뢰구간실무 해석
1회사실상 측정 불가동전 던지기를 사실로 보고
5회±44%p30%와 70%를 구분 못 함
10회±31%p대형 변화만 겨우 감지
20회±22%p월 단위 추세 판단 가능
50회±14%p캠페인 효과 검증 가능
100회±10%p경쟁사 비교까지 가능

하루 1회 측정으로 "노출률 45%"라고 보고하는 리포트는 노이즈를 성과로 포장하고 있을 가능성이 큽니다. ±44%p의 흔들림을 가진 계기로는 참 등장률이 35%에서 50%로 개선됐는지를 판별할 수 없습니다.

실제 관측 데이터도 같은 방향입니다. 구매 의도 프롬프트 12개를 로그아웃 상태의 ChatGPT에 각각 100회씩 던진 2026년 조사에서, 프롬프트 하나당 등장한 브랜드는 누적 약 44개였지만 개별 응답 하나에 들어간 브랜드는 약 10개였습니다. 80% 이상의 빈도로 꾸준히 등장한 브랜드는 프롬프트당 5개 남짓, 전체의 11%에 불과했고요. 언급된 브랜드의 72%는 다섯 번에 한 번도 나오지 않았습니다. 이 72% 구간에 있는 브랜드를 1회 측정으로 잡으면, 어떤 날은 1이고 어떤 날은 0인 무의미한 시계열이 만들어집니다.

측정 체계는 어떻게 설계해야 할까?

측정은 대시보드를 켜는 일이 아니라 실험 장비를 세팅하는 일입니다. 조건을 고정하고, 충분히 반복하고, 원본을 보관하고, 실제 성과와 연결하는 네 가지가 뼈대입니다.

1단계 - 조건을 문서로 못 박습니다. 수집 경로(API인지 스크래핑인지), 로그인 상태, 메모리 온오프, 모델 버전과 모드, 요청 지역과 기기, 프롬프트당 반복 횟수를 문서로 남깁니다. 이 문서가 없으면 3개월 뒤의 숫자와 오늘의 숫자를 비교할 근거가 사라집니다.

2단계 - 언급의 정의를 확정합니다. 브랜드명 노출, 링크 인용, 추천 목록 포함을 각각 분리해 집계합니다. 하나로 뭉뚱그리면 AI 답변에 이름만 스쳐도 인용으로 잡혀 성과가 부풀려집니다.

3단계 - 반복 횟수를 목적에 맞춰 배분합니다. 전체 프롬프트를 똑같이 20회씩 돌릴 필요는 없습니다. 의사결정에 직결되는 핵심 프롬프트에 정밀도를 몰아주고, 나머지는 탐색용으로 낮게 가져가는 편이 예산 효율이 좋습니다.

4단계 - 원본 응답을 통째로 보관합니다. 추출된 지표만 저장하면 나중에 정의를 바꿔 재분석할 수 없습니다.

5단계 - 계기 자체의 드리프트를 점검합니다. 분기에 한 번은 동일한 프롬프트 세트를 같은 조건으로 재수집해 측정 도구의 흔들림을 계측합니다. 도구가 조용히 방법론을 바꾸면 성과가 변한 것처럼 보이기 때문입니다.

6단계 - 실제 성과와 짝을 맞춥니다. 가시성은 선행 지표이고, 유입 트래픽과 전환이 실제 지표입니다. 두 시계열이 합리적인 기간 안에서 같이 움직이지 않는다면 그 가시성 지표는 비즈니스 의미가 없습니다. 이 연결 고리에 관해서는 AI Mode 트래픽의 실체를 10만 명 데이터로 분석한 글에서 더 자세히 다뤘습니다.

연구 데이터는 측정 오차를 어떻게 설명할까?

2026년에 나온 분산 분해 연구는 AI 답변의 흔들림 중 34.8%가 같은 프롬프트를 반복하는 것만으로 발생한다고 보고했습니다. 브랜드 자체가 설명하는 분산은 0.7%에 그쳤습니다.

브랜드 20곳을 3개 모델(GPT-5.2, Gemini 3 Flash, Perplexity)과 8개 언어, 프롬프트 15종으로 교차해 12,933건의 응답을 모은 연구가 있습니다. 응답 단위 감성 극성의 분산을 분해했더니 구성은 이렇습니다. 같은 프롬프트 내 재질의 34.8%, 질의 언어 31.6%, 고차 상호작용 22.3%, 브랜드와 언어의 상호작용 8.6%, 모델 정체성 1.7%, 브랜드 자체 0.7%, 프롬프트 주효과 0.3%입니다. 단일 응답 하나에서 브랜드 정체성이 설명하는 분산은 1.5%(ICC 0.0146)였습니다.

해석하면 이렇습니다. AI 답변 한 건을 놓고 "우리 브랜드가 이렇게 평가받는구나"라고 결론 내리는 건 98.5%의 노이즈를 1.5%의 신호로 착각하는 일입니다. 질의 언어가 만들어 내는 분산이 31.6%나 된다는 것도 중요한데요, 국내 브랜드가 해외 도구의 영어 기반 리포트만 보고 있다면 자기 시장과 무관한 숫자를 보고 있을 수 있습니다.

흥미롭게도 이 연구는 반복 횟수에 대해서는 다소 다른 결론을 냅니다. 여섯 번째 반복부터는 상대 오차 분산이 0.0003밖에 줄지 않으므로, 예산이 있다면 반복보다 언어와 모델을 다양화하라고 권합니다. 반면 같은 해에 나온 다른 프로토콜 연구는 약 190,000건의 관측과 270개 이상의 브랜드를 재분석해, 탐색 목적이면 5~7회, 확인 목적이면 10~12회, 엄밀한 검증에는 15~20회를 제시했습니다. 반복 5회에서 큰 효과(Cliff's δ=0.474)를 잡아낼 검출력 중앙값은 0.44에 불과했고, 80% 검출력에 도달하려면 약 15회가 필요했습니다. 급내 상관은 8회에서 0.74, 10회에서 0.81을 넘었습니다.

두 연구가 충돌하는 것처럼 보이지만 재는 대상이 다릅니다. 앞은 감성 극성이라는 연속형 지표의 분산을, 뒤는 브랜드 추천 여부라는 이분형 사건의 검출력을 다룹니다. 지오랭크의 경험으로는 "언급됐는가"를 세는 국내 GEO 실무에 후자의 기준이 더 맞습니다.

빠지기 쉬운 관점이 하나 더 있습니다. 브랜드 전체를 하나의 점수로 압축하면 아무리 반복 횟수를 늘려도 그 숫자는 해석되지 않습니다. 주제별로 쪼개야 하는 이유는 AI 가시성 점수 하나의 함정을 다룬 글에 정리해 뒀습니다.

AI 가시성 측정 자주 묻는 질문

측정 도구 두 개가 다른 숫자를 보여주는데 어느 쪽을 믿어야 하나요?

둘 다 맞고 둘 다 다릅니다. 수집 경로와 로그인 상태, 모델 모드, 반복 횟수가 다르면 서로 다른 분포를 재게 되므로 숫자가 갈리는 게 정상입니다. 도구를 하나 정해 방법론을 고정하고, 그 안에서의 시계열 변화만 해석하세요. 도구를 바꿀 때는 과거 데이터와의 비교를 포기하거나, 두 도구를 한동안 병행해 차이를 보정해야 합니다.

프롬프트당 몇 번을 돌려야 충분한가요?

목적에 따라 다릅니다. 시장 탐색 단계라면 57회로도 대략의 지형은 보이지만, 캠페인 효과를 판단하려면 최소 1520회가 필요합니다. 참 등장률 50% 기준으로 5회 반복의 95% 신뢰구간은 ±44%p이고, 20회에서 ±22%p, 100회에서 ±10%p까지 좁혀집니다. 잡아내고 싶은 변화의 크기보다 신뢰구간이 작아야 그 측정은 의미가 있습니다.

온도(temperature)를 0으로 맞추면 답이 고정되지 않나요?

고정되지 않습니다. 온도 0이라도 GPU 연산의 부동소수점 비결정성 때문에 완전히 같은 출력이 보장되지 않고, 실시간 검색을 쓰는 AI 검색 제품은 그날의 검색 결과까지 바뀌기 때문에 변동 폭이 훨씬 큽니다. seed나 버전 고정을 쓰더라도 그건 변동을 줄이는 장치이지 없애는 장치가 아닙니다.

한국어로만 측정해도 되나요?

국내 시장이 타깃이라면 한국어 측정이 기본이 되어야 합니다. 다만 분산 분해 연구에서 질의 언어가 만든 분산이 31.6%로 나타난 만큼, 영어 프롬프트 결과와 상당히 다를 수 있다는 점을 전제해야 합니다. 해외 도구의 영어 기반 리포트만 보고 국내 성과를 판단하는 건 위험합니다.

가시성 지표가 올랐는데 트래픽은 그대로입니다. 측정이 잘못된 건가요?

측정 오류일 수도, 지표 설계 문제일 수도 있습니다. 먼저 신뢰구간을 확인해 그 상승이 노이즈 범위 안인지 보세요. 노이즈가 아니라면 추적 중인 프롬프트가 실제 구매 여정과 무관한 질문일 가능성이 큽니다. 가시성은 선행 지표일 뿐이고, 유입과 전환이라는 실제 지표와 합리적인 기간 안에서 같이 움직이지 않으면 그 지표는 재설계 대상입니다.

함께 보면 좋은 글

참조논문

START GEO NOW

AI 검색에서 먼저 추천되고 싶다면
지오랭크에 문의하세요

브랜드의 현재 상황과 목표를 알려주시면, 지오랭크가 GEO 전략과 예상 로드맵을 제안해 드립니다. 지금 문의하면 3개월 안에 AI 답변에서의 변화를 함께 확인할 수 있습니다.