2026. 10. 04. · 배소율 (선임매니저)
AI 검색 KPI는 인용·점유·유입 품질·매출 기여 네 축으로 다시 짜야 합니다. 순위와 클릭만 보던 지표판은 AI가 답을 직접 만들어 주는 환경에서 더 이상 의사결정을 돕지 못합니다. 중요한 건 지표를 많이 만드는 일이 아니라 실제로 예산과 인력을 움직이는 KPI를 골라내는 일입니다. 맥킨지 조사에서 경영진의 61%는 의사결정에 쓰는 시간의 절반 이상이 비효율적이라고 답했는데요. 대시보드가 늘어날수록 이 비율은 더 나빠집니다. 지오랭크가 보기에 AI 검색 KPI의 핵심 질문은 하나입니다. 이 숫자가 바뀌면 다음 분기 예산이 바뀌는가.

KPI를 바꿨더니 점수는 떨어졌고 매출은 올랐습니다. 2026년 상반기에 함께 일한 B2B SaaS 기업 E사의 이야기인데요. 숫자가 좋아지는 것과 사업이 좋아지는 것이 다르다는 걸 가장 선명하게 보여 준 프로젝트였습니다.
E사는 처음에 'AI 가시성 점수' 하나만 KPI로 잡았습니다. 3개월 동안 그 점수는 41에서 68로 올랐습니다. 보고서는 훌륭해 보였습니다. 그런데 AI 경유 상담 신청은 월 3건에서 꿈쩍도 하지 않았습니다. 원인을 뜯어 보니 측정에 쓰던 질문 세트 30개 중 19개가 브랜드명이 들어간 질문이었습니다. 자기 이름을 넣고 물으면 당연히 자기가 나옵니다. KPI가 쉬운 쪽으로 기울어 있었던 겁니다.
질문 세트를 구매 단계별 42개로 다시 짰습니다. 인지 단계 12개, 비교 검토 18개, 도입 직전 12개로 나누고 브랜드명이 들어간 질문은 4개만 남겼습니다. 그러자 가시성 점수는 68에서 39로 떨어졌습니다. 내부 보고가 껄끄러운 구간이었습니다. 대신 '도입 검토 단계 질문에서의 인용률'을 핵심 KPI로 올렸고 이 수치를 4개월간 12%에서 31%로 끌어올렸습니다. 같은 기간 AI 경유 상담 신청은 월 3건에서 14건이 됐습니다.
시행착오도 있었습니다. 프로젝트 초반 2개월은 '인용 건수'를 KPI로 삼았습니다. 숫자를 올리려면 글을 늘리는 게 가장 빠릅니다. 두 달 만에 콘텐츠를 23편 찍어 냈습니다. 인용 건수는 분명히 늘었습니다. 문제는 늘어난 인용의 대부분이 '~란 무엇인가' 류의 정보성 질문에서 나왔다는 점입니다. 그 구간에서 발생한 상담 신청은 0건이었습니다. 두 달치 제작비는 지표를 꾸미는 데 쓴 셈이 됐습니다. 이후 지오랭크는 신규 프로젝트에서 인용 건수를 단독 KPI로 쓰지 않습니다.
AI 검색 KPI는 ChatGPT·퍼플렉시티·AI 오버뷰 같은 생성형 검색에서 브랜드가 얼마나 등장하고 그 등장이 매출로 이어지는지를 재는 지표입니다. 기존 SEO 지표와 달리 여기서는 노출과 방문 사이의 연결이 끊어져 있습니다. AI가 답을 다 해 주면 방문은 일어나지 않지만 브랜드 선택에는 영향을 줍니다.
KPI를 단층으로 두면 왜곡을 피하기 어렵습니다. 지오랭크는 네 계층으로 나눠 보기를 권합니다.
| 계층 | 대표 KPI | 측정 질문 | 보고 주기 |
|---|---|---|---|
| 1. 인용 | 인용률, 인용 출처 유형 | AI가 우리를 근거로 쓰는가 | 주간 |
| 2. 점유 | AI 점유율(SOV), 경쟁사 동시 언급률 | 경쟁사 대비 몇 번 불리는가 | 월간 |
| 3. 유입 품질 | AI 경유 세션 전환율, 세션당 매출 | 들어온 사람이 사는가 | 월간 |
| 4. 사업 기여 | AI 기여 파이프라인, 획득 비용 | 돈이 되는가 | 분기 |
KPI를 고르는 순서는 이렇게 잡으면 됩니다.
네 계층은 서로 다른 질문에 답하므로 하나로 합치면 안 됩니다. 합쳐서 만든 단일 점수는 보기에 좋지만 어디를 고쳐야 하는지 알려 주지 않습니다.
1계층 인용은 가장 빨리 움직이는 지표입니다. 콘텐츠를 고치면 2~4주 안에 반응이 옵니다. 다만 인용 건수만 세면 앞서 말한 E사의 함정에 빠집니다. 인용이 어떤 질문에서 나왔는지, 그 답변에서 우리가 몇 번째로 언급됐는지를 같이 기록해야 의미가 생깁니다.
경쟁 맥락은 2계층 점유에서 드러납니다. 우리 인용률이 20%에서 25%로 올라도 경쟁사가 30%에서 45%로 갔다면 졌습니다. 같은 답변 안에 경쟁사가 함께 등장한 비율도 따로 봐야 합니다. 비교 질문에서 나란히 불리는 건 나쁘지 않은데 추천 질문에서 늘 두 번째로 불린다면 손봐야 할 신호입니다.
3계층 유입 품질은 AI 검색이 기존 검색과 가장 크게 갈라지는 지점입니다. AI를 거쳐 들어오는 사람은 숫자가 적은 대신 이미 결정을 거의 마친 상태입니다. 쇼피파이는 AI 세션의 절반 이상이 상품 상세 페이지에서 시작된다고 밝혔는데요. 오가닉 검색은 그 비율이 20% 안팎입니다. 대화창에서 조사를 마친 다음 사이트에 도착합니다.
유입 품질을 볼 때는 플랫폼을 묶지 말아야 합니다. 공개된 측정값을 보면 ChatGPT 경유 유입의 전환율이 가장 높습니다. 퍼플렉시티가 그 뒤를 잇고 클로드는 한참 아래입니다. 플랫폼마다 사용자가 질문을 던지는 맥락이 다르기 때문입니다. 세 곳을 평균 내면 ChatGPT에서 벌어지는 일이 나머지에 가려집니다. 트래픽 비중이 작은 플랫폼이라도 전환율이 좋으면 별도 행으로 따로 남겨 둡니다.
4계층 사업 기여는 분기 단위로만 봅니다. 주 단위로 보면 노이즈가 신호를 덮습니다. AI 경유 파이프라인 금액, 상담 1건당 획득 비용, 기존 채널 대비 기여 비중 정도면 충분합니다. 이 계층에서 욕심을 내 지표를 늘리면 숫자를 맞추느라 분기 리뷰가 통째로 소모됩니다.
| 측정 범위 | 무료로 가능한 것 | 유료 도구가 필요한 것 | 월 비용 감각 |
|---|---|---|---|
| 인용·점유 | 수동 프롬프트 30개 월 1회 점검 | 질문 100개 이상 자동 추적, 신뢰구간 | 30만~300만 원 |
| 유입 품질 | GA4 리퍼러 분류, UTM 정리 | 세션 단위 LLM 출처 판별 | 0~80만 원 |
| 사업 기여 | CRM 유입 경로 필드 추가 | 멀티터치 기여 모델 | 100만 원 이상 |
도구를 고를 때 순서를 조심해야 합니다. 도구를 먼저 사고 KPI를 나중에 정하면 도구가 주는 숫자가 KPI가 돼 버립니다. 순서를 뒤집어야 합니다. AI 답변은 같은 질문을 같은 날 물어도 결과가 달라지므로 한 번 측정한 값을 근거로 판단하지 않습니다. 반복 측정과 변동 폭을 함께 기록하는 쪽이 안전합니다.
인용 1건의 가치는 AI 경유 전환율과 평균 거래액을 알면 역산할 수 있습니다. 완벽하지는 않지만 예산 회의에서 쓸 수 있는 숫자가 나옵니다.
근거가 될 만한 데이터가 2026년 들어 꽤 쌓였습니다. 어도비는 미국 소매 사이트 1조 회 이상의 방문을 추적한 결과 2026년 3월 기준 AI 경유 트래픽의 전환율이 비AI 트래픽보다 42% 높았다고 밝혔습니다. 1년 전인 2025년 3월에는 오히려 절반 수준이었으니 1년 만에 뒤집힌 셈입니다. 방문당 매출도 37% 높았습니다. 같은 분기 미국 소매 사이트로 들어온 AI 경유 트래픽은 전년 대비 393% 늘었습니다.
서치엔진랜드에 GA4 13개월 분석이 실렸는데요. 이 분석도 비슷한 방향입니다. 2025년 1월부터 2026년 2월까지의 데이터에서 LLM 경유 유입의 전환율은 약 18%로 추적한 모든 채널 중 가장 높았습니다. 다만 같은 분석은 LLM 경유 유입이 전체 리퍼럴의 2%에 못 미친다는 점도 함께 보고했습니다. 전환율은 압도적인데 절대량은 아직 작습니다. KPI를 짤 때 이 두 사실을 같이 들고 가야 합니다. 비중만 보면 투자할 이유가 없어 보이고 전환율만 보면 과대평가하게 됩니다.
역산은 이렇게 합니다. 월간 AI 경유 세션 400건, 전환율 15%, 평균 거래액 80만 원이면 AI 경유 매출은 월 4,800만 원입니다. 같은 기간 추적 질문 100개 중 인용된 질문이 25개였다면 인용 1건당 월 192만 원이 붙습니다. 숫자 자체가 정밀하다고 주장할 생각은 없습니다. 대신 '인용 10건을 더 만들면 대략 얼마'라는 문장을 경영진 언어로 말할 수 있게 됩니다.
여기서 주의할 함정도 분명히 해 둡니다. 굿하트의 법칙에 따르면 지표는 목표가 되는 순간 지표로서의 쓸모를 잃습니다. 인용 1건의 가치를 정해 두면 조직은 인용을 늘리는 방향으로 최적화합니다. 그 과정에서 E사처럼 값싼 인용만 쌓일 수 있습니다. 금액 환산은 보상 체계가 아니라 예산 배분의 참고치로만 쓰는 편이 낫습니다.
반론도 짚어 둡니다. 지금까지 공개된 전환율 데이터는 대부분 미국 소매와 영어권 B2B에서 나왔습니다. 한국 시장은 네이버와 카카오가 끼어 있고 AI 검색 사용 습관도 다릅니다. 해외 수치를 그대로 자사 목표치로 옮기면 첫 분기부터 목표 미달 보고를 쓰게 됩니다. 지오랭크는 외부 벤치마크를 방향 확인용으로만 쓰고 목표치는 자사 4~8주 기준선에서 뽑으라고 권합니다. 측정 기간이 짧아 표본이 적을 때는 목표를 숫자 하나가 아니라 구간으로 잡아 두면 보고가 훨씬 수월해집니다.
또 하나, AI 검색 KPI가 좋아졌다고 그 성과가 전부 GEO 작업 덕분이라고 말하기는 어렵습니다. 같은 기간 언론 보도가 나갔거나 경쟁사가 콘텐츠를 줄였을 수도 있습니다. 기여를 가르려면 작업하지 않은 질문군을 대조군으로 남겨 두는 설계가 필요합니다. 전체 질문의 15% 정도를 손대지 않고 두면 분기 말에 비교할 기준이 생깁니다. 비용이 거의 들지 않는 장치인데도 실무에서 가장 자주 빠집니다.
조직 구조도 KPI만큼 중요합니다. 마케팅이 인용률을 보고 영업이 리드 수를 보면 두 숫자는 끝내 만나지 않습니다. CRM에 '최초 접점: AI 검색' 같은 필드 하나를 추가하는 작업이 고급 분석 도구보다 먼저입니다. 보스턴컨설팅그룹은 소비자의 브랜드 발견 경로가 스트리밍·스크롤·검색·쇼핑 네 갈래로 흩어졌다고 정리했는데요. 발견 경로가 흩어진 만큼 측정 책임도 한 팀에 몰아 둘 수 없습니다.
KPI는 한 번 정하고 끝나는 문서가 아닙니다. AI 검색 환경은 분기마다 모델과 인터페이스가 바뀝니다. 작년에 맞았던 지표가 올해도 맞다는 보장은 없습니다. 지오랭크의 경우 분기 리뷰에서 KPI 항목의 20~30%는 교체하거나 정의를 손봅니다.
계층별로 12개씩, 전체 57개를 권합니다. 그 중 경영진 보고에 올리는 건 2개면 충분합니다. 지표가 10개를 넘어가면 아무도 보지 않는 대시보드가 됩니다. 나머지는 실무 진단용으로 따로 두세요.
AI 가시성 점수 하나로 보고하는 방식의 위험이 궁금하시다면? AI 가시성 점수 하나로 브랜드를 평가하면 왜 위험할까?에서 토픽 단위로 쪼개 보는 방법을 다뤘습니다.
측정 도구마다 숫자가 다른 이유가 궁금하시다면? AI 가시성 측정, 왜 도구마다 숫자가 다를까? 정확도 아닌 정밀도를 보시면 변동 폭을 다루는 기준이 잡힙니다.
KPI 개선을 실험으로 증명하고 싶으시다면? SEO 실험 설계 가이드: 수천 건 테스트로 GEO 성과 증명하기에서 분할 테스트 설계를 정리했습니다.
브랜드의 현재 상황과 목표를 알려주시면, 지오랭크가 GEO 전략과 예상 로드맵을 제안해 드립니다. 지금 문의하면 3개월 안에 AI 답변에서의 변화를 함께 확인할 수 있습니다.