AI 검색 KPI 어떻게 정할까? 인용 1건의 가치를 숫자로 만드는 법

2026. 10. 04. · 배소율 (선임매니저)

AI 검색 KPI는 무엇을 봐야 할까?

AI 검색 KPI는 인용·점유·유입 품질·매출 기여 네 축으로 다시 짜야 합니다. 순위와 클릭만 보던 지표판은 AI가 답을 직접 만들어 주는 환경에서 더 이상 의사결정을 돕지 못합니다. 중요한 건 지표를 많이 만드는 일이 아니라 실제로 예산과 인력을 움직이는 KPI를 골라내는 일입니다. 맥킨지 조사에서 경영진의 61%는 의사결정에 쓰는 시간의 절반 이상이 비효율적이라고 답했는데요. 대시보드가 늘어날수록 이 비율은 더 나빠집니다. 지오랭크가 보기에 AI 검색 KPI의 핵심 질문은 하나입니다. 이 숫자가 바뀌면 다음 분기 예산이 바뀌는가.

AI 검색 KPI는 무엇을 봐야 할까? 인포그래픽

목차

지오랭크가 겪은 KPI 교체 사례

KPI를 바꿨더니 점수는 떨어졌고 매출은 올랐습니다. 2026년 상반기에 함께 일한 B2B SaaS 기업 E사의 이야기인데요. 숫자가 좋아지는 것과 사업이 좋아지는 것이 다르다는 걸 가장 선명하게 보여 준 프로젝트였습니다.

E사는 처음에 'AI 가시성 점수' 하나만 KPI로 잡았습니다. 3개월 동안 그 점수는 41에서 68로 올랐습니다. 보고서는 훌륭해 보였습니다. 그런데 AI 경유 상담 신청은 월 3건에서 꿈쩍도 하지 않았습니다. 원인을 뜯어 보니 측정에 쓰던 질문 세트 30개 중 19개가 브랜드명이 들어간 질문이었습니다. 자기 이름을 넣고 물으면 당연히 자기가 나옵니다. KPI가 쉬운 쪽으로 기울어 있었던 겁니다.

질문 세트를 구매 단계별 42개로 다시 짰습니다. 인지 단계 12개, 비교 검토 18개, 도입 직전 12개로 나누고 브랜드명이 들어간 질문은 4개만 남겼습니다. 그러자 가시성 점수는 68에서 39로 떨어졌습니다. 내부 보고가 껄끄러운 구간이었습니다. 대신 '도입 검토 단계 질문에서의 인용률'을 핵심 KPI로 올렸고 이 수치를 4개월간 12%에서 31%로 끌어올렸습니다. 같은 기간 AI 경유 상담 신청은 월 3건에서 14건이 됐습니다.

시행착오도 있었습니다. 프로젝트 초반 2개월은 '인용 건수'를 KPI로 삼았습니다. 숫자를 올리려면 글을 늘리는 게 가장 빠릅니다. 두 달 만에 콘텐츠를 23편 찍어 냈습니다. 인용 건수는 분명히 늘었습니다. 문제는 늘어난 인용의 대부분이 '~란 무엇인가' 류의 정보성 질문에서 나왔다는 점입니다. 그 구간에서 발생한 상담 신청은 0건이었습니다. 두 달치 제작비는 지표를 꾸미는 데 쓴 셈이 됐습니다. 이후 지오랭크는 신규 프로젝트에서 인용 건수를 단독 KPI로 쓰지 않습니다.

AI 검색 KPI란 무엇이고 어떻게 고르나?

AI 검색 KPI는 ChatGPT·퍼플렉시티·AI 오버뷰 같은 생성형 검색에서 브랜드가 얼마나 등장하고 그 등장이 매출로 이어지는지를 재는 지표입니다. 기존 SEO 지표와 달리 여기서는 노출과 방문 사이의 연결이 끊어져 있습니다. AI가 답을 다 해 주면 방문은 일어나지 않지만 브랜드 선택에는 영향을 줍니다.

KPI를 단층으로 두면 왜곡을 피하기 어렵습니다. 지오랭크는 네 계층으로 나눠 보기를 권합니다.

계층대표 KPI측정 질문보고 주기
1. 인용인용률, 인용 출처 유형AI가 우리를 근거로 쓰는가주간
2. 점유AI 점유율(SOV), 경쟁사 동시 언급률경쟁사 대비 몇 번 불리는가월간
3. 유입 품질AI 경유 세션 전환율, 세션당 매출들어온 사람이 사는가월간
4. 사업 기여AI 기여 파이프라인, 획득 비용돈이 되는가분기

KPI를 고르는 순서는 이렇게 잡으면 됩니다.

  1. 가장 잘 돌아가는 기존 채널을 하나 고릅니다. 그 채널의 성과를 지금 무엇으로 재고 있는지 적습니다.
  2. 그 측정 단위를 AI 검색에 그대로 옮길 수 있는지 봅니다. ROAS를 쓰고 있다면 AI 경유 매출을 분모 분자에 넣을 수 있는지 확인합니다.
  3. 질문 세트를 구매 단계별로 나눕니다. 브랜드명이 들어간 질문 비중은 10%를 넘기지 않습니다.
  4. 4주치 기준선을 먼저 쌓습니다. 기준선 없이 시작한 KPI는 좋아졌는지 나빠졌는지 말할수 없습니다.
  5. 분기마다 KPI 자체를 재검토합니다. AI 검색은 아직 지표가 굳을 만큼 안정된 시장이 아닙니다.

KPI 4계층은 각각 무엇을 말해 주나?

네 계층은 서로 다른 질문에 답하므로 하나로 합치면 안 됩니다. 합쳐서 만든 단일 점수는 보기에 좋지만 어디를 고쳐야 하는지 알려 주지 않습니다.

1계층 인용은 가장 빨리 움직이는 지표입니다. 콘텐츠를 고치면 2~4주 안에 반응이 옵니다. 다만 인용 건수만 세면 앞서 말한 E사의 함정에 빠집니다. 인용이 어떤 질문에서 나왔는지, 그 답변에서 우리가 몇 번째로 언급됐는지를 같이 기록해야 의미가 생깁니다.

경쟁 맥락은 2계층 점유에서 드러납니다. 우리 인용률이 20%에서 25%로 올라도 경쟁사가 30%에서 45%로 갔다면 졌습니다. 같은 답변 안에 경쟁사가 함께 등장한 비율도 따로 봐야 합니다. 비교 질문에서 나란히 불리는 건 나쁘지 않은데 추천 질문에서 늘 두 번째로 불린다면 손봐야 할 신호입니다.

3계층 유입 품질은 AI 검색이 기존 검색과 가장 크게 갈라지는 지점입니다. AI를 거쳐 들어오는 사람은 숫자가 적은 대신 이미 결정을 거의 마친 상태입니다. 쇼피파이는 AI 세션의 절반 이상이 상품 상세 페이지에서 시작된다고 밝혔는데요. 오가닉 검색은 그 비율이 20% 안팎입니다. 대화창에서 조사를 마친 다음 사이트에 도착합니다.

유입 품질을 볼 때는 플랫폼을 묶지 말아야 합니다. 공개된 측정값을 보면 ChatGPT 경유 유입의 전환율이 가장 높습니다. 퍼플렉시티가 그 뒤를 잇고 클로드는 한참 아래입니다. 플랫폼마다 사용자가 질문을 던지는 맥락이 다르기 때문입니다. 세 곳을 평균 내면 ChatGPT에서 벌어지는 일이 나머지에 가려집니다. 트래픽 비중이 작은 플랫폼이라도 전환율이 좋으면 별도 행으로 따로 남겨 둡니다.

4계층 사업 기여는 분기 단위로만 봅니다. 주 단위로 보면 노이즈가 신호를 덮습니다. AI 경유 파이프라인 금액, 상담 1건당 획득 비용, 기존 채널 대비 기여 비중 정도면 충분합니다. 이 계층에서 욕심을 내 지표를 늘리면 숫자를 맞추느라 분기 리뷰가 통째로 소모됩니다.

측정 범위무료로 가능한 것유료 도구가 필요한 것월 비용 감각
인용·점유수동 프롬프트 30개 월 1회 점검질문 100개 이상 자동 추적, 신뢰구간30만~300만 원
유입 품질GA4 리퍼러 분류, UTM 정리세션 단위 LLM 출처 판별0~80만 원
사업 기여CRM 유입 경로 필드 추가멀티터치 기여 모델100만 원 이상

도구를 고를 때 순서를 조심해야 합니다. 도구를 먼저 사고 KPI를 나중에 정하면 도구가 주는 숫자가 KPI가 돼 버립니다. 순서를 뒤집어야 합니다. AI 답변은 같은 질문을 같은 날 물어도 결과가 달라지므로 한 번 측정한 값을 근거로 판단하지 않습니다. 반복 측정과 변동 폭을 함께 기록하는 쪽이 안전합니다.

인용 1건은 얼마의 가치일까?

인용 1건의 가치는 AI 경유 전환율과 평균 거래액을 알면 역산할 수 있습니다. 완벽하지는 않지만 예산 회의에서 쓸 수 있는 숫자가 나옵니다.

근거가 될 만한 데이터가 2026년 들어 꽤 쌓였습니다. 어도비는 미국 소매 사이트 1조 회 이상의 방문을 추적한 결과 2026년 3월 기준 AI 경유 트래픽의 전환율이 비AI 트래픽보다 42% 높았다고 밝혔습니다. 1년 전인 2025년 3월에는 오히려 절반 수준이었으니 1년 만에 뒤집힌 셈입니다. 방문당 매출도 37% 높았습니다. 같은 분기 미국 소매 사이트로 들어온 AI 경유 트래픽은 전년 대비 393% 늘었습니다.

서치엔진랜드에 GA4 13개월 분석이 실렸는데요. 이 분석도 비슷한 방향입니다. 2025년 1월부터 2026년 2월까지의 데이터에서 LLM 경유 유입의 전환율은 약 18%로 추적한 모든 채널 중 가장 높았습니다. 다만 같은 분석은 LLM 경유 유입이 전체 리퍼럴의 2%에 못 미친다는 점도 함께 보고했습니다. 전환율은 압도적인데 절대량은 아직 작습니다. KPI를 짤 때 이 두 사실을 같이 들고 가야 합니다. 비중만 보면 투자할 이유가 없어 보이고 전환율만 보면 과대평가하게 됩니다.

역산은 이렇게 합니다. 월간 AI 경유 세션 400건, 전환율 15%, 평균 거래액 80만 원이면 AI 경유 매출은 월 4,800만 원입니다. 같은 기간 추적 질문 100개 중 인용된 질문이 25개였다면 인용 1건당 월 192만 원이 붙습니다. 숫자 자체가 정밀하다고 주장할 생각은 없습니다. 대신 '인용 10건을 더 만들면 대략 얼마'라는 문장을 경영진 언어로 말할 수 있게 됩니다.

여기서 주의할 함정도 분명히 해 둡니다. 굿하트의 법칙에 따르면 지표는 목표가 되는 순간 지표로서의 쓸모를 잃습니다. 인용 1건의 가치를 정해 두면 조직은 인용을 늘리는 방향으로 최적화합니다. 그 과정에서 E사처럼 값싼 인용만 쌓일 수 있습니다. 금액 환산은 보상 체계가 아니라 예산 배분의 참고치로만 쓰는 편이 낫습니다.

반론도 짚어 둡니다. 지금까지 공개된 전환율 데이터는 대부분 미국 소매와 영어권 B2B에서 나왔습니다. 한국 시장은 네이버와 카카오가 끼어 있고 AI 검색 사용 습관도 다릅니다. 해외 수치를 그대로 자사 목표치로 옮기면 첫 분기부터 목표 미달 보고를 쓰게 됩니다. 지오랭크는 외부 벤치마크를 방향 확인용으로만 쓰고 목표치는 자사 4~8주 기준선에서 뽑으라고 권합니다. 측정 기간이 짧아 표본이 적을 때는 목표를 숫자 하나가 아니라 구간으로 잡아 두면 보고가 훨씬 수월해집니다.

또 하나, AI 검색 KPI가 좋아졌다고 그 성과가 전부 GEO 작업 덕분이라고 말하기는 어렵습니다. 같은 기간 언론 보도가 나갔거나 경쟁사가 콘텐츠를 줄였을 수도 있습니다. 기여를 가르려면 작업하지 않은 질문군을 대조군으로 남겨 두는 설계가 필요합니다. 전체 질문의 15% 정도를 손대지 않고 두면 분기 말에 비교할 기준이 생깁니다. 비용이 거의 들지 않는 장치인데도 실무에서 가장 자주 빠집니다.

조직 구조도 KPI만큼 중요합니다. 마케팅이 인용률을 보고 영업이 리드 수를 보면 두 숫자는 끝내 만나지 않습니다. CRM에 '최초 접점: AI 검색' 같은 필드 하나를 추가하는 작업이 고급 분석 도구보다 먼저입니다. 보스턴컨설팅그룹은 소비자의 브랜드 발견 경로가 스트리밍·스크롤·검색·쇼핑 네 갈래로 흩어졌다고 정리했는데요. 발견 경로가 흩어진 만큼 측정 책임도 한 팀에 몰아 둘 수 없습니다.

KPI는 한 번 정하고 끝나는 문서가 아닙니다. AI 검색 환경은 분기마다 모델과 인터페이스가 바뀝니다. 작년에 맞았던 지표가 올해도 맞다는 보장은 없습니다. 지오랭크의 경우 분기 리뷰에서 KPI 항목의 20~30%는 교체하거나 정의를 손봅니다.

AI 검색 KPI 자주 묻는 질문

AI 검색 KPI는 몇 개가 적당한가요?

계층별로 12개씩, 전체 57개를 권합니다. 그 중 경영진 보고에 올리는 건 2개면 충분합니다. 지표가 10개를 넘어가면 아무도 보지 않는 대시보드가 됩니다. 나머지는 실무 진단용으로 따로 두세요.

AI 가시성 점수 하나만 보면 안 되나요? 단일 점수는 질문 세트를 어떻게 짜느냐에 따라 쉽게 움직입니다. 브랜드명이 들어간 질문을 늘리면 점수는 올라가지만 사업은 그대로입니다. 점수를 쓰더라도 질문 세트 구성을 함께 공개해야 합니다.
AI 경유 유입은 GA4에서 구분되나요? chatgpt.com, perplexity.ai 같은 리퍼러는 잡힙니다. 다만 앱 내 브라우저나 복사·붙여넣기로 들어오는 경우는 직접 유입으로 섞입니다. 실제 규모는 측정값보다 큽니다. 그래서 절대 수치보다 추세와 전환율을 보는 게 낫습니다.
KPI 기준선은 얼마나 쌓아야 하나요? 최소 4주, 가능하면 8주입니다. AI 답변은 같은 질문에도 흔들리기 때문에 1~2회 측정으로는 변동 폭조차 알 수 없습니다. 기준선 없이 시작하면 첫 보고에서 할 말이 없어집니다.
B2B도 AI 검색 KPI가 필요한가요? 오히려 B2B가 더 급합니다. 거래액이 크고 검토 기간이 길어 인용 1건의 금액 환산치가 B2C보다 훨씬 높게 나옵니다. 대신 전환까지의 시차가 길어 분기 단위 KPI 설계가 필수입니다.

함께 보면 좋은 글

AI 가시성 점수 하나로 보고하는 방식의 위험이 궁금하시다면? AI 가시성 점수 하나로 브랜드를 평가하면 왜 위험할까?에서 토픽 단위로 쪼개 보는 방법을 다뤘습니다.

측정 도구마다 숫자가 다른 이유가 궁금하시다면? AI 가시성 측정, 왜 도구마다 숫자가 다를까? 정확도 아닌 정밀도를 보시면 변동 폭을 다루는 기준이 잡힙니다.

KPI 개선을 실험으로 증명하고 싶으시다면? SEO 실험 설계 가이드: 수천 건 테스트로 GEO 성과 증명하기에서 분할 테스트 설계를 정리했습니다.

참조논문

START GEO NOW

AI 검색에서 먼저 추천되고 싶다면
지오랭크에 문의하세요

브랜드의 현재 상황과 목표를 알려주시면, 지오랭크가 GEO 전략과 예상 로드맵을 제안해 드립니다. 지금 문의하면 3개월 안에 AI 답변에서의 변화를 함께 확인할 수 있습니다.