2026. 07. 22. · 신빛나 (선임매니저)
AI 검색에서 노출되려면 정확한 키워드를 반복하는 것보다 의미를 또렷하게 정리하는 편이 유리합니다. ChatGPT나 Perplexity 같은 시스템은 사용자의 질문을 그대로 검색창에 넣지 않습니다. 오타를 고치고, 표현을 바꾸고, 질문을 여러 갈래로 쪼갠 뒤 뜻이 가까운 문서를 끌어옵니다. 이 과정을 지배하는 두 축이 퍼지 매칭과 시맨틱 검색인데요. 글자가 조금 달라도 이어주는 퍼지 매칭과, 표현이 달라도 뜻이 비슷하면 찾아내는 시맨틱 검색이 함께 작동하기 때문에, 브랜드는 특정 키워드 하나를 외우듯 반복하기보다 핵심 사실과 개념을 명확히 심어두는 쪽이 인용 확률을 높입니다. 지오랭크는 이 원리를 실제 프로젝트에 적용하며 쌓은 관점을 아래에 정리했습니다.

키워드를 빠짐없이 넣고도 AI 답변에서 사라지는 이유는, 검색 시스템이 글자가 아니라 의미 덩어리로 문서를 고르기 때문입니다. 지오랭크가 지원한 국내 B2B SaaS 기업 A사가 정확히 그런 경우였습니다. A사는 타깃 키워드를 페이지마다 촘촘히 넣어 전통 검색 순위는 상위권이었지만, 정작 ChatGPT와 Perplexity의 답변에는 좀처럼 인용되지 않았습니다.
처음 두 주 동안 저희도 방향을 잘못 잡았습니다. 인용이 안 되니 키워드 밀도를 더 높이자고 판단했는데, 오히려 문단마다 같은 표현이 반복되면서 임베딩 응집도가 흐려졌고 인용률은 더 떨어졌습니다. 시맨틱 검색은 "이 문단이 무슨 뜻인가"를 벡터로 요약하는데, 같은 단어만 도배하면 그 벡터가 뭉개져 오히려 어떤 질문에도 딱 맞지 않는 애매한 덩어리가 되어버린 겁니다.
방향을 바꾼 뒤로 흐름이 달라졌습니다. 질문 변형을 군집으로 묶어 FAQ와 소제목에 자연스러운 동의어와 다른 표현을 흩뿌리고, 각 문단을 하나의 완결된 답으로 다듬었습니다. 예를 들어 "AI 검색 최적화 비용"이라는 하나의 주제를 "GEO 대행 견적", "생성형 검색 최적화 요금", "AI 인용을 늘리는 데 드는 비용"처럼 여러 표현으로 나눠 담았습니다. 사람이 실제로 던지는 질문의 표현이 저마다 다르다는 점을 그대로 반영한 것입니다. 그 결과 특정 질문군에서 A사의 AI 인용 포함률은 약 12%에서 41%로, 4개월 만에 3배 넘게 올랐습니다.
커머스 브랜드 B사 사례는 결이 조금 달랐습니다. B사는 같은 제품을 상세페이지, 배너, 리뷰 답변에서 제각기 다른 이름으로 부르고 있었습니다. 시맨틱 검색은 이런 표기 흔들림에 특히 취약해서, AI가 같은 제품을 여러 개로 오해하거나 아예 어느 것도 확신하지 못하는 상황이 벌어졌습니다. 제품명 표기 변형을 하나로 통일하고 상품 설명을 100~300단어 자기완결 문단으로 재구성한 뒤, 5개월 차에 AI 검색을 경유한 상세페이지 유입 비중이 눈에 띄게 늘었습니다. 물론 모든 지표가 매끄럽게 오른 건 아니고, 초기 2개월은 변화가 미미해 담당자와 함께 조바심을 눌러야 했던 구간도 있었습니다. 두 사례의 공통점은 단순합니다. 키워드를 더 넣은 게 아니라, 의미를 더 또렷하게 만들었다는 것입니다.
시맨틱 검색은 글자의 일치가 아니라 뜻의 가까움으로 문서를 찾는 방식이고, 퍼지 매칭은 오타나 표현 차이를 메워 후보를 넓히는 방식입니다. 둘은 경쟁 관계가 아니라 역할이 다른 짝꿍입니다. 퍼지 매칭이 "비슷하게 생긴(looks-like)" 것을 잡아 후보를 모으면, 시맨틱 검색이 "비슷한 뜻(means-like)"을 기준으로 그중 진짜 맞는 것을 골라냅니다.
퍼지 매칭은 한 가지 기술이 아니라 여러 계열로 나뉩니다. 아래 표가 대표적인 다섯 가지입니다.
| 매칭 방식 | 작동 원리 | 잘 잡아내는 것 | 한계 |
|---|---|---|---|
| 정확 매칭 | 글자를 그대로 비교 | 완전히 같은 문자열 | 오타·변형에 취약 |
| 편집거리 매칭 | 글자를 몇 번 고쳐야 같아지는지 계산(Levenshtein) | 오타·자리바뀜 | 뜻은 못 봄 |
| 발음 매칭 | 발음 코드로 변환(Metaphone) | 동음이의·외래어 표기 | 발음 무관한 맥락엔 약함 |
| N그램 매칭 | 글자·단어를 겹치는 조각으로 쪼갬 | 부분 일치·확장성 | 문장 재구성엔 둔감 |
| TF-IDF 매칭 | 단어 가중치 + 코사인 유사도 | 문맥 반영 | 느리고 전처리 필요 |
시맨틱 검색은 여기서 한 걸음 더 나갑니다. 문장을 임베딩이라는 숫자 벡터로 바꾼 뒤, 동의어, 다른 이름으로 불리는 같은 대상, 바꿔 쓴 문장, 어형 변화까지 벡터 공간에서 가깝게 배치합니다. 그래서 "AI 검색 최적화"라고 쓴 페이지가 "생성형 엔진에 인용되는 법"이라는 질문에도 걸릴 수 있는 것입니다. 시맨틱 검색을 이해하고 대비하는 순서는 대략 이렇게 정리됩니다.
오늘날 AI 검색의 표준은 퍼지·키워드 방식과 시맨틱 방식을 함께 쓰는 하이브리드 리트리벌이며, 후보 생성 → 의미 검색 → 재정렬의 3단계로 움직입니다. 한쪽만으로는 놓치는 게 많기 때문입니다. 키워드 방식은 정확한 용어를 잘 잡지만 표현이 바뀌면 놓치고, 시맨틱 방식은 뜻은 잘 잡지만 고유명사나 숫자 같은 정확한 일치엔 약합니다. 그래서 둘을 겹쳐 씁니다.
1단계는 후보 생성입니다. BM25 같은 키워드 검색과 퍼지 매칭이 재현율을 넓게 잡아 일단 많은 후보를 끌어옵니다. 이 단계에서 오타 교정, "이것을 찾으셨나요", 질문 확장이 일어납니다. 2단계는 시맨틱 검색입니다. 문장을 임베딩으로 바꿔 뜻이 가까운 문서를 골라냅니다. 3단계는 재정렬(reranking)입니다. 크로스 인코더가 질문과 문서를 함께 읽어 진짜 관련성이 높은 순서로 다시 세우고, 흔히 상호 순위 융합(RRF) 같은 방법으로 두 갈래 결과를 합칩니다.
전통 검색과 LLM 기반 검색이 이 원리를 쓰는 방식은 조금 다릅니다.
| 구간 | 전통 검색 | LLM 기반 AI 검색 |
|---|---|---|
| 입력 처리 | 오타 교정·자동완성 | 서브워드 토큰화 + 질문 재작성 |
| 후보 확장 | 동의어·어형 확장 | 팬아웃으로 질문을 여러 갈래로 분해 |
| 핵심 매칭 | TF-IDF·BM25 | 임베딩 벡터 유사도(시맨틱) |
| 개인화 | 세션·클릭 이력 | 사용자 임베딩·대화 메모리 |
특히 음성 검색과 개인화가 이 구조를 한층 복잡하게 만듭니다. 음성으로 물을 때는 발음 인식 오류가 섞이기 때문에 발음 매칭과 여러 후보 가설을 저울질하는 과정이 더해집니다. 개인화 단계에서는 사용자의 과거 대화와 관심사를 담은 임베딩이 어떤 문서를 위로 올릴지에 영향을 줍니다. 같은 질문이라도 사람마다 다른 답이 나오는 이유가 여기에 있습니다. 표현을 다양하게 준비해두는 일이 중요한 것도, 어떤 표현으로 다가올지 미리 알 수 없기 때문입니다.
여기서 브랜드가 기억할 지점은 분명합니다. AI 검색은 우리 페이지를 "그대로" 읽지 않고, 질문을 바꿔가며 의미로 훑습니다. 그러니 한 가지 표현에만 최적화하면 시맨틱 검색의 그물에서 빠져나갈 위험이 커집니다. 지오랭크의 경우, 같은 주제를 여러 표현으로 겹쳐 쓴 콘텐츠가 단일 표현 콘텐츠보다 훨씬 넓은 질문군에서 후보로 잡히는 것을 반복해서 확인했습니다. 이 맥락은 AI 답변 체인에서 인용이 탈락하는 관문을 함께 보면 더 선명해집니다.
인용률을 높이는 핵심은 세 가지입니다. 질문을 문단에 정확히 대응시키고, 개체 표기를 통일하고, 문단을 임베딩이 좋아하는 크기로 자르는 것입니다. 이 세 가지는 화려한 기법이 아니라, 시맨틱 검색과 퍼지 매칭이 실제로 콘텐츠를 다루는 방식에서 역산한 결과입니다.
첫째, 질문-문단 매핑입니다. 하나의 질문 변형 묶음마다 짧고 명료한 소제목(H2·H3)을 두고, 그 아래 첫 문장에서 곧바로 답을 제시합니다. AI 시스템은 애매하게 긴 서술보다 짧고 분명한 문단을 인용하기 좋아합니다. 학술 벤치마크에서도 하이브리드 검색에 재정렬을 붙인 2단계 파이프라인이 단일 방식보다 큰 폭으로 앞선다는 결과가 반복해서 나옵니다. 결국 검색되기 좋은 구조가 곧 인용되기 좋은 구조입니다.
둘째, 개체 표기 통일입니다. 브랜드명, 제품명, 대표자명, 주소·연락처(NAP)가 페이지마다 조금씩 다르게 적혀 있으면, 임베딩은 이들을 서로 다른 대상으로 인식할수 있습니다. 정식 명칭과 별칭, 영문 표기, 자주 쓰이는 약칭을 구조화 데이터(JSON-LD)에 함께 명시하면 시맨틱 검색이 변형된 표기까지 하나의 개체로 묶어 인식합니다. 지오랭크가 지원한 A사에서 인용률이 오른 결정적 계기도 사실 이 표기 통일이었습니다.
셋째, 임베딩 친화적 청킹입니다. 하나의 문단은 하나의 완결된 뜻을 담은 100~300단어 안팎으로 유지하는 게 좋습니다. 너무 짧으면 맥락이 부족하고, 너무 길면 여러 주제가 섞여 벡터가 흐려집니다. 실제로 A사 프로젝트 초기의 실패도 여기서 비롯됐습니다. 키워드만 늘리다 문단이 비대해지자 인용률이 되레 꺾였고, 문단을 자기완결형으로 쪼갠 뒤에야 반등했습니다. 다만 주의할 점도 있습니다. 한 가지 표현에 과하게 맞추면 임베딩 응집도가 떨어질 수 있고, 개인화가 강해질수록 과거 사용자 행동과 어긋나는 틈새 콘텐츠는 밀릴 수 있습니다. 그래서 지오랭크는 "무조건 이렇게 하면 된다"는 식의 단정보다, 브랜드마다 질문 지형을 먼저 진단한 뒤 전략을 맞추는 편을 권합니다. 시맨틱 검색은 정답이 하나로 정해진 규칙이 아니라, 브랜드의 언어와 시장의 질문이 만나는 지점에서 매번 다르게 조율돼야 하는 문제이기 때문입니다. AI에 검색되어 후보에 들었는지(리트리벌 포함 여부)를 추적하는 습관이 있으면, 이 조정이 훨씬 수월해집니다. 반대로 이 데이터가 없으면 무엇을 고쳤을 때 무엇이 좋아졌는지 알기 어려워, 개선은 감에 의존할수밖에 없습니다.
꼭 그렇지는 않습니다. 같은 표현을 반복하면 문단의 임베딩 벡터가 흐려져 오히려 어떤 질문에도 딱 맞지 않는 애매한 덩어리가 됩니다. 키워드 횟수보다, 하나의 문단이 하나의 뜻을 또렷하게 담고 있는지가 시맨틱 검색에서는 더 중요합니다.
둘은 역할이 다릅니다. 퍼지 매칭은 오타와 표현 차이를 메워 후보를 넓게 모으는 단계이고, 시맨틱 검색은 그 후보 중 뜻이 맞는 것을 골라내는 단계입니다. 최신 AI 검색은 둘을 함께 쓰는 하이브리드 방식이 기본이라, 한쪽만 챙기면 반쪽짜리가 됩니다.
대체로 100~300단어 안팎의 자기완결 문단이 권장됩니다. 너무 짧으면 맥락이 부족해 벡터가 빈약해지고, 너무 길면 여러 주제가 섞여 뜻이 뭉개집니다. 소제목 아래 첫 문장에서 답을 먼저 제시하는 구조가 검색과 인용 모두에 유리합니다.
네, 개체 인식 측면에서 특히 그렇습니다. 브랜드명·제품명·별칭·주소를 JSON-LD로 명확히 선언하면 표기가 조금씩 달라도 AI가 하나의 개체로 묶어 인식합니다. 이는 잘못된 정보로 답변이 생성되는 환각 위험을 줄이는 데도 도움이 됩니다.
검색 순위만 보면 놓치기 쉽습니다. 내 콘텐츠가 실제로 후보로 검색되었는지(리트리벌 포함 여부)와 AI 답변에 인용되었는지를 함께 추적해야 합니다. 인용은 검색된 다음에야 가능하므로, 후보에 드는 것이 첫 관문입니다.
시맨틱 검색과 퍼지 매칭을 콘텐츠에 실제로 적용하려면, 문단을 어떻게 자를지가 궁금하시다면 AI 검색 청크 최적화 가이드를 참고하시면 좋습니다. 질문 변형을 어떻게 설계할지가 궁금하시다면 AI 검색 시대 키워드 리서치 포트폴리오 전략이 도움이 됩니다. 검색된 뒤에도 인용에서 탈락하는 단계가 궁금하시다면 AI 답변 체인의 5단계 관문을 함께 읽어보시길 권합니다.
브랜드의 현재 상황과 목표를 알려주시면, 지오랭크가 GEO 전략과 예상 로드맵을 제안해 드립니다. 지금 문의하면 3개월 안에 AI 답변에서의 변화를 함께 확인할 수 있습니다.