SEO 실험 설계 가이드: 수천 건 테스트로 GEO 성과 증명하기

2026. 09. 28. · 배소율 (선임매니저)

SEO·GEO 성과는 왜 실험으로만 증명될까?

순위표와 가시성 점수는 예산을 지켜주지 않습니다. 재무 담당자를 설득하는 건 "이 변경이 트래픽을 24% 올렸다"는 실험 결과 한 줄입니다. 엔터프라이즈 이커머스에서 수천 건의 SEO 실험을 돌린 SearchPilot 데이터는 같은 결론을 반복합니다. 상식처럼 통용되던 최적화 관행이 실험에서 뒤집히는 경우가 흔하다는 것입니다. 메타 디스크립션을 정성껏 쓰는 대신 지우는 쪽이 이겼고 제목 태그에서 비교 표현을 빼자 트래픽이 24% 올랐습니다. AI 검색으로 넘어와도 구조는 같습니다. 인용률이 올랐는지 내렸는지는 반복 측정과 대조군 없이는 판단이 불가능합니다. 이 글은 SEO 실험 설계법, 트래픽 감가상각을 예산 언어로 번역하는 방법, 그리고 GEO 실험이 기존 A/B 테스트와 어디서 갈라지는지를 정리합니다.

SEO·GEO 성과는 왜 실험으로만 증명될까? 인포그래픽

목차

지오랭크는 실험 설계에서 어떤 시행착오를 겪었을까?

지오랭크가 처음 돌린 GEO 실험은 실패했습니다. 대조군을 두지 않고 전 페이지를 한꺼번에 바꿨기 때문입니다. 국내 B2B SaaS 기업 A사와 진행한 첫 회차가 그랬습니다. 상품 설명 페이지 180개의 구조를 동시에 개편하고 6주 뒤 ChatGPT 인용률을 재봤더니 12%에서 19%로 올라 있었습니다. 성공처럼 보였습니다. 문제는 같은 기간에 A사가 언론 보도 3건을 냈고 경쟁사 한 곳이 사이트를 리뉴얼하다 인용 대상에서 이탈한 것입니다. 상승분 7%p 중 얼마가 구조 개편의 몫인지 아무도 답할 수 없었습니다.

두 번째 회차부터 페이지를 절반으로 갈랐습니다. 트래픽과 계절 변동 패턴이 비슷한 페이지끼리 짝을 지어 대조군 90개, 변경군 90개로 나눴습니다. 같은 실험을 다시 돌린 결과 변경군의 인용률 상승은 4.1%p, 대조군은 2.3%p였습니다. 순효과는 1.8%p로 처음 믿었던 7%p의 4분의 1이었습니다. 실망스러웠지만 이 1.8%p는 방어 가능한 숫자였습니다. A사 마케팅 팀장이 이 결과로 다음 분기 GEO 예산을 승인받았습니다.

커머스 기업 E사에서는 반대 방향의 교훈을 얻었습니다. 상품 상세 페이지 FAQ 블록을 접힌 상태에서 펼친 상태로 바꾸는 실험을 4주 돌렸더니 비브랜드 오가닉 유입이 6.8% 올랐습니다. 지오랭크 내부에서는 "모바일 화면이 길어져 이탈이 늘 것"이라는 반대가 강했는데 실험이 그 직관을 뒤집었습니다. 반면 같은 페이지에서 시도한 구조화 데이터 확장 실험은 8주를 돌려도 신뢰구간 하한이 음수를 벗어나지 못했습니다. 효과가 없었다고 단정하긴 어렵고 E사 트래픽 규모로는 그 크기의 변화를 검출할 수 없었다는 뜻입니다. 실험을 설계할 때 검출 가능한 최소 효과 크기를 먼저 계산해야 한다는 걸 이때 배웠습니다.

SEO 실험이란 무엇인가?

SEO 실험은 사용자를 나누는 일반 A/B 테스트와 달리 페이지를 나눕니다. 같은 템플릿을 쓰는 페이지 군을 통계적으로 닮은 두 그룹으로 쪼개고 한쪽에만 변경을 적용해 검색엔진의 반응 차이를 봅니다. 검색엔진은 페이지 하나에 버전 하나만 인식하므로 사용자 단위 분할이 성립하지 않습니다. SearchPilot은 이 원칙을 "사용자를 쪼개지 않고 페이지를 쪼갠다"고 표현합니다.

실험 방식별 특징을 정리하면 다음과 같습니다.

실험 유형분할 단위필요 조건판정 기간적합한 검증 대상
페이지 분할 실험템플릿 단위 페이지 군동일 템플릿 100개 이상2~4주제목 태그, 내부 링크, 스키마
전후 비교 실험단일 페이지·섹션안정적 기준선 8주8~12주랜딩 페이지 전면 개편
프롬프트 반복 실험질의 집합프롬프트 10~20개2~3주AI 인용률, 브랜드 점유율
지역 분할 실험지점·지역 페이지지점 30개 이상4~6주로컬 GEO, 지도 노출

실행 순서는 다섯 단계입니다.

  1. 가설을 숫자로 쓴다. "제목 태그를 짧게 하면 좋아진다"가 아니라 "상품 목록 페이지 제목에서 비교 표현을 제거하면 비브랜드 클릭이 5% 이상 오른다"로 적습니다.
  2. 검출 가능한 최소 효과를 계산한다. 월 유입이 적은 페이지 군에서 3% 변화를 잡으려면 현실적인 기간 안에 결론이 나오지 않습니다. 목표 효과가 기간 안에 검출 불가능하면 실험 자체를 접는 게 맞습니다.
  3. 대조군과 변경군을 짝짓는다. 무작위 배정만으로는 부족합니다. 유입량과 변동 패턴이 닮은 페이지끼리 묶어야 사전 편향이 줄어듭니다.
  4. 변경군에만 적용하고 관측한다. 이 구간에 다른 작업을 끼워넣으면 실험은 무효가 됩니다. 실험 기간 중 배포 동결 합의가 필요합니다.
  5. 신뢰구간으로 판정한다. 평균값 비교가 아니라 구간 하한이 0을 넘는지를 봅니다.

실험 설계는 어디서부터 손대야 할까?

비브랜드 오가닉 유입이 가장 많이 발생하는 페이지 유형부터 손대는 게 효율적입니다. 이커머스 실측에서 비브랜드 트래픽 비중은 홈페이지 4%, 상품 목록 페이지 70%, 상품 상세 페이지 85%로 갈립니다. 홈페이지 히어로 영역을 놓고 몇 주를 쓰는 조직이 많지만 실험 가치는 목록·상세 페이지 쪽에 몰려 있습니다. 페이지 수가 많아 통계적 검출력도 확보됩니다.

실제 실험에서 뒤집힌 관행 몇 가지를 보겠습니다.

검증 대상통념실험 결과
제목 태그의 비교 표현클릭을 유도한다제거 후 트래픽 +24%
모바일 콘텐츠 접기화면이 짧아 유리하다펼친 상태가 +7.5%
캐노니컬 구조기존 설정이 최적이다재구성 후 상품 페이지 +22%
메타 디스크립션잘 쓰면 CTR이 오른다제거 시 상승, 검색엔진이 문맥별 스니펫을 더 잘 만듦
키워드를 넣은 SEO 문구 블록관련성을 높인다제거 후 유입 증가

메타 디스크립션 사례는 특히 시사적입니다. 검색엔진은 질의마다 다른 스니펫을 조립할 수 있는데 고정된 설명문을 박아두면 그 유연성을 스스로 빼앗는 셈입니다. AI 검색에서도 같은 논리가 작동합니다. 요약을 너무 강하게 고정하면 모델이 문맥에 맞는 문장을 뽑아갈 여지가 줄어듭니다.

판정 기준도 짚어야 합니다. SearchPilot은 p값 대신 베이지안 사전확률 기반 신뢰구간을 쓰고 구간 하한이 양수로 유지될 때만 승리로 기록합니다. A/A 테스트 오탐률은 5% 수준입니다. 최근에는 신경망 예측 모델로 민감도를 두 배 높여 기존 절반 크기의 상승폭까지 검출합니다. 대형 사이트에서 1~2% 상승도 매출로는 큰 금액이라 이 감도 차이가 실행 근거를 가릅니다.

함정도 있습니다. 알고리즘 업데이트나 계절성은 두 그룹에 동시에 작용해 대부분 상쇄됩니다. 문제는 한쪽에만 걸리는 외부 사건입니다. 특정 상품군에 프로모션이 붙거나 재고가 빠지면 짝짓기가 깨집니다. 실험 기간 중 대조군 예측값을 갱신하며 변경군 예측을 보정하는 절차가 필요합니다.

트래픽 감가상각을 예산 언어로 바꾸는 방법

오가닉 트래픽은 가만히 두면 매년 10~20% 줄어듭니다. 이 감가상각을 재무 모델에 명시하면 SEO·GEO 예산 논의의 전제가 바뀝니다. 엔터프라이즈 이커머스 실측에서 연 -13%, -12% 수준의 자연 감소가 관측됐습니다. 즉 투자를 유지해 전년과 같은 트래픽을 만들었다면 그건 정체가 아니라 12~13%의 손실을 막아낸 성과입니다. 이 프레임 없이 보고하면 "작년과 같네요"라는 평가를 받습니다.

거시 데이터도 같은 방향입니다. 2025년 상반기 퍼블리셔 중간값은 전년 대비 -10%였고 뉴스는 -7%, 비뉴스 사이트는 -14%였습니다. AI Overviews가 붙은 정보성 질의의 오가닉 CTR은 2024년 6월부터 2025년 9월까지 61% 떨어졌습니다. Seer Interactive가 노출 2,510만 건을 분석한 수치입니다. 콘텐츠 유형별로는 How to 형식이 1년 뒤에도 피크 트래픽의 30% 정도를 유지해 가장 오래 버팁니다. 나머지 70%는 사라진다는 뜻입니다.

예산 배분의 불균형은 여기서 드러납니다. 한 이커머스 기업의 재무 책임자는 이렇게 말했다고 합니다. "신규 고객의 60%가 오가닉 검색에서 오는데 예산의 80%는 유료 검색에 씁니다." Gartner의 2026년 CMO 지출 조사에서 마케팅 예산은 매출의 7.8% 수준이고 유료 미디어가 31%로 단일 항목 최대입니다. 오운드·언드 미디어 안에서 SEO는 9.4%로 가장 큰 비중을 차지했습니다. 전년 8.9%에서 소폭 올랐습니다. AI 관련 투자에는 15.3%가 배정됐습니다. 마케터 49%가 오가닉 검색을 최고 ROI 채널로 꼽는데도 예산은 그쪽으로 가지 않습니다.

이 격차를 좁히는 건 논리가 아니라 실험 기록입니다. "이 변경으로 비브랜드 유입이 22% 올랐고 해당 페이지군의 월 매출 기여는 X원이다"라는 문장 열 개가 쌓이면 SEO·GEO는 브랜딩 항목에서 성과 채널로 옮겨갑니다. 지오랭크가 제안서에 실험 로그 템플릿을 넣는 이유입니다. 다만 한계도 인정해야 합니다. 실험은 검증된 변경의 효과만 말해줄 뿐 검증하지 않은 영역의 잠재력은 알려주지 않습니다. 실험 결과를 절대 기준으로 쓰면 탐색적 투자가 위축됩니다.

GEO 실험은 SEO 실험과 무엇이 다를까?

가장 큰 차이는 응답 자체가 확률적이라는 점입니다. 같은 프롬프트를 같은 모델에 열 번 넣으면 열 번 다른 출처 목록이 나올 수 있어 단발 측정으로는 실험 결론을 낼 수 없습니다. AI 가시성 측정의 통계적 성질을 다룬 연구는 인용 가시성 지표를 고정값이 아니라 어떤 응답 분포에서 뽑은 표본 추정량으로 취급해야 한다고 정리합니다. 인용 분포는 멱함수 형태를 띠고 반복 표본 간 변동이 큽니다. 부트스트랩 신뢰구간을 계산해보면 도메인 간 차이라고 믿었던 값 상당수가 측정 잡음 범위에 들어갑니다. 이 연구는 Perplexity와 OpenAI SearchGPT, Gemini를 대상으로 9일간 일별 수집과 10분 간격 고빈도 샘플링을 병행했습니다.

실무적으로는 이렇게 번역됩니다. GEO 실험에서는 페이지를 쪼개는 것만으로 부족하고 프롬프트 반복 횟수를 함께 설계해야 합니다. 지오랭크는 탐색 단계에서 프롬프트당 5~7회, 변경 효과를 확인할 때 10~12회, 대외 보고용으로는 15~20회를 기준으로 삼습니다. 반복이 적으면 실제 변화와 잡음을 구분하지 못합니다.

측정 대상도 갈라집니다. 한 측정 프레임워크 연구는 인용을 두 단계로 나눕니다. 플랫폼이 검색을 발동해 출처를 고르는 인용 선택과 선택된 페이지가 최종 답변의 표현·근거·구조에 실제로 기여하는 인용 흡수입니다. 602개 통제 프롬프트를 ChatGPT와 구글 AI Overview·Gemini, Perplexity에 돌린 결과 인용 폭과 인용 깊이가 서로 다른 방향으로 움직였습니다. Perplexity와 구글은 평균적으로 더 많은 출처를 인용하고 ChatGPT는 출처 수가 적은 대신 가져온 페이지의 인용 영향력이 훨씬 높았습니다. 출처 목록에 이름이 오르는 것과 답변 내용에 실제로 반영되는 것은 다른 목표라는 뜻입니다. 실험 지표를 "인용 여부"로만 잡으면 흡수 단계의 개선을 놓칩니다.

GEO 최적화를 처음 체계화한 연구는 25개 도메인의 질의 1만 개로 기법을 비교하고 위치 보정 단어 수 지표로 가시성 상승을 측정했습니다. 실험실 결과를 Perplexity 실환경에서 재확인하는 절차까지 넣었습니다. 통제된 실험 설계가 GEO에서도 표준 방법론으로 자리잡고 있다는 신호입니다.

플랫폼별로 반응이 갈리는 것도 실험을 어렵게 만듭니다. 같은 변경이 ChatGPT에서는 인용률을 올리고 Perplexity에서는 변화가 없는 경우가 흔합니다. 지오랭크는 플랫폼별로 지표를 따로 기록하고 합산 점수를 만들지 않습니다. 하나로 묶으면 어느 플랫폼에서 무엇이 통했는지가 사라집니다. 이 주제는 AI 가시성 점수 하나로 브랜드를 평가하면 왜 위험한지를 함께 보시면 도움이 됩니다.

기간 문제도 남습니다. SEO 실험은 2~4주면 판정이 되지만 GEO 실험은 모델 업데이트가 중간에 끼면 기준선 자체가 움직입니다. 대상 모델의 버전 변경 이력을 기록해두고 전후를 분리해 분석하는 습관이 필요합니다. 완벽한 통제는 불가능하고 기록으로 방어하는 수밖에 없습니다.

실험 관련 자주 묻는 질문

페이지가 100개도 안 되는 사이트는 실험을 못 하나요?

페이지 분할 실험은 어렵습니다. 대신 프롬프트 반복 실험과 전후 비교 실험을 조합하는 방법이 있습니다. 프롬프트 10~20개를 정해 변경 전 2주, 변경 후 2주를 각각 10회 이상 반복 측정하면 방향성은 확인할 수 있습니다. 단 계절성과 외부 사건을 보정할 대조군이 없으므로 결론을 단정하지 말고 참고 지표로 다뤄야 합니다.

실험 기간에 다른 SEO 작업을 멈춰야 하나요?

같은 페이지 군에 대해서는 멈춰야 합니다. 다른 템플릿이나 다른 섹션 작업은 병행해도 무리가 없습니다. 실무에서는 실험 대상 템플릿에 한해 배포 동결을 걸고 나머지는 정상 진행하는 방식이 현실적입니다. 동결 합의가 안 되면 실험 결과는 해석이 불가능해집니다.

결과가 애매하게 나오면 실패인가요?

효과가 없다는 뜻이 아니라 그 크기의 변화를 검출할 데이터가 부족했다는 뜻일 가능성이 큽니다. 신뢰구간 폭을 보면 판단이 가능합니다. 구간이 -3%+8%처럼 넓게 걸쳐 있으면 검출력 부족이고, -0.5%+0.7%처럼 좁게 0을 감싸면 실제로 효과가 미미했을 가능성이 높습니다. 후자는 그 방향을 포기하는 근거로 쓸 수 있습니다.

GEO 실험 결과를 경영진에 어떻게 보고하면 좋을까요?

단일 숫자 대신 구간과 반복 횟수를 함께 적습니다. "ChatGPT 인용률 12%→19%" 같은 표현보다 "프롬프트 15개를 각 15회 반복, 인용률 순증 1.8%p, 95% 구간 0.4~3.2%p"가 방어에 유리합니다. 함께 트래픽 감가상각 가정을 명시하면 유지 성과도 성과로 인정받기 쉬워집니다.

실험 없이 업계 벤치마크만 따라가면 안 되나요?

벤치마크는 가설 후보를 좁히는 데 유용합니다. 문제는 같은 변경이 사이트 구조와 템플릿에 따라 반대로 작동하는 경우가 실제로 많다는 점입니다. 메타 디스크립션 제거나 모바일 콘텐츠 펼치기처럼 통념과 어긋난 결과가 나온 사례들이 그 증거입니다. 벤치마크로 후보를 만들고 실험으로 확정하는 순서를 권합니다.

함께 읽으면 좋은 리포트

측정 도구마다 숫자가 다른 이유가 궁금하시다면? 실험 반복 횟수 설계와 직접 연결되는 주제입니다. AI 가시성 측정, 왜 도구마다 숫자가 다를까? 정확도 아닌 정밀도

AI 검색이 실제로 얼마나 트래픽을 보내는지 궁금하시다면? 실험의 기준선을 잡을 때 참고할 실측 데이터입니다. AI Mode 트래픽의 실체: 10만 명 데이터로 본 AI 검색 유입과 GEO 대응

인용률을 올렸는데 매출이 안 따라오는 상황이 궁금하시다면? 실험 지표를 전환까지 연결하는 방법을 다뤘습니다. AI 검색에 인용됐는데 왜 안 팔릴까? 전환까지 잡는 GEO 전략

참조논문

START GEO NOW

AI 검색에서 먼저 추천되고 싶다면
지오랭크에 문의하세요

브랜드의 현재 상황과 목표를 알려주시면, 지오랭크가 GEO 전략과 예상 로드맵을 제안해 드립니다. 지금 문의하면 3개월 안에 AI 답변에서의 변화를 함께 확인할 수 있습니다.