1년 내내 콘텐츠를 만들고 사이트 구조를 고치고 스키마를 붙였는데 연말 보고 자리에서 돌아온 평가가 "작년이랑 비슷하네요"였던 경험, 마케터라면 한 번쯤 있으실 겁니다. 그런데 엔터프라이즈 이커머스에서 수천 건의 SEO 실험을 돌린 데이터를 보면 이 평가 자체가 틀렸을 가능성이 큽니다. 문제는 성과가 아니라 증명 방식에 있습니다. 질문에 답하는 방식으로 풀어보겠습니다.

같은 트래픽이면 정말 제자리걸음인가요?

아닙니다. 오가닉 트래픽은 아무것도 하지 않으면 매년 10~20%씩 줄어듭니다. 엔터프라이즈 이커머스 실측에서는 연 -13%, -12% 같은 자연 감소가 관측됐습니다. 그러니까 전년과 같은 트래픽을 만들었다면 그건 정체가 아니라 12~13%의 손실을 막아낸 성과입니다. 이 감가상각 가정을 보고서에 명시하지 않으면 성과가 통째로 사라집니다. 거시 지표도 같은 방향입니다. AI Overviews가 붙은 정보성 질의의 오가닉 CTR은 2024년 6월부터 2025년 9월 사이 61% 떨어졌습니다. Seer Interactive가 노출 2,510만 건을 분석한 수치입니다.

그럼 성과는 무엇으로 증명하나요?

실험입니다. 다만 SEO 실험은 일반적인 A/B 테스트와 구조가 다릅니다. 사용자를 나누는 게 아니라 페이지를 나눕니다. 검색엔진은 페이지 하나에 버전 하나만 인식하기 때문에 사용자 단위 분할이 애초에 성립하지 않습니다. 같은 템플릿의 페이지 군을 트래픽 패턴이 닮은 두 그룹으로 쪼개고 한쪽에만 변경을 적용해 차이를 봅니다. 판정은 평균값 비교가 아니라 신뢰구간으로 합니다. 구간 하한이 0을 넘을 때만 승리로 기록합니다. 알고리즘 업데이트나 계절성은 두 그룹에 동시에 작용해 대부분 상쇄되므로 외부 변수에 강한 방식입니다.

실험 결과가 업계 상식과 다른 경우가 많나요?

생각보다 훨씬 많습니다. 제목 태그에서 비교 표현을 빼자 트래픽이 24% 올랐습니다. 모바일에서 접어뒀던 콘텐츠를 펼치자 7.5% 올랐는데 화면이 길어지면 이탈이 늘 거라는 직관과 정반대였습니다. 캐노니컬 구조를 재정비한 상품 페이지는 22% 상승했습니다. 가장 흥미로운 건 메타 디스크립션입니다. 정성껏 쓰는 대신 아예 지웠더니 성과가 올랐습니다. 검색엔진은 질의마다 다른 스니펫을 조립할 수 있는데 고정된 설명문이 그 유연성을 막고 있었던 겁니다. AI 검색에서도 같은 논리가 작동합니다.

어느 페이지부터 실험해야 하나요?

비브랜드 오가닉 트래픽이 몰려 있는 곳부터입니다. 이커머스 실측에서 비브랜드 트래픽 비중은 홈페이지 4%, 상품 목록 페이지 70%, 상품 상세 페이지 85%로 갈립니다. 회의 시간 대부분은 홈페이지 히어로 영역에 쓰이지만 실험 가치는 목록과 상세에 몰려 있습니다. 페이지 수가 많아 검출력도 그쪽이 유리합니다. 시작 전에 검출 가능한 최소 효과 크기를 계산해두는 것도 중요합니다. 목표 효과가 현실적인 기간 안에 검출 불가능하다면 그 실험은 돌리지 않는 게 맞습니다.

GEO 실험도 같은 방식으로 되나요?

절반만 그렇습니다. 지오랭크가 국내 B2B SaaS 기업과 진행한 첫 GEO 실험은 실패했습니다. 상품 페이지 180개를 한꺼번에 개편하고 6주 뒤 ChatGPT 인용률을 재봤더니 12%에서 19%로 올라 있었습니다. 성공처럼 보였지만 같은 기간에 그 회사는 언론 보도를 3건 냈고 경쟁사 한 곳은 리뉴얼 중 인용 대상에서 이탈했습니다. 상승분 7%p 중 얼마가 우리 몫인지 답할 수 없었습니다. 두 번째 회차에서 대조군 90개와 변경군 90개로 갈랐더니 순효과는 1.8%p, 처음 믿었던 숫자의 4분의 1이었습니다. 실망스러웠지만 방어할 수 있는 숫자였고 그 팀장은 이 결과로 다음 분기 예산을 승인받았습니다.

GEO 실험에만 있는 변수는 뭔가요?

응답 자체가 확률적이라는 점입니다. 같은 프롬프트를 열 번 넣으면 열 번 다른 출처 목록이 나올 수 있습니다. AI 가시성의 통계적 성질을 다룬 연구는 인용 지표를 고정값이 아니라 어떤 응답 분포에서 뽑은 표본 추정량으로 취급해야 한다고 정리합니다. 부트스트랩 신뢰구간을 계산해보면 도메인 간 차이라고 믿었던 값 상당수가 측정 잡음 범위에 들어갑니다. 그래서 페이지를 쪼개는 것만으로 부족하고 프롬프트 반복 횟수를 함께 설계해야 합니다. 지오랭크는 탐색 5~7회, 효과 확인 10~12회, 대외 보고용 15~20회를 기준으로 씁니다. 측정 대상도 갈라집니다. 출처 목록에 이름이 오르는 인용 선택과, 답변의 근거에 실제로 반영되는 인용 흡수는 다른 목표입니다. 602개 통제 프롬프트 실험에서 Perplexity와 구글은 더 많은 출처를 인용한 반면 ChatGPT는 출처 수가 적은 대신 가져온 페이지의 영향력이 훨씬 높았습니다.

경영진 보고서에는 어떻게 쓰면 좋을까요?

단일 숫자 대신 구간과 반복 횟수를 함께 적는 편이 낫습니다. "ChatGPT 인용률 12%에서 19%"보다 "프롬프트 15개를 각 15회 반복, 인용률 순증 1.8%p, 95% 구간 0.4~3.2%p"가 방어에 훨씬 유리합니다. 숫자가 작아 보여도 후자가 예산을 지킵니다. 마케터 49%가 오가닉 검색을 최고 ROI 채널로 꼽습니다. 그런데 어떤 재무 책임자는 이렇게 말했습니다. 신규 고객의 60%가 오가닉 검색에서 오는데 예산의 80%는 유료 검색에 쓴다고요. 이 격차를 좁히는 건 더 정교한 논리가 아니라 방어 가능한 실험 기록 열 줄입니다. 다만 실험은 검증한 변경의 효과만 말해줄 뿐 검증하지 않은 영역의 잠재력은 알려주지 않습니다. 절대 기준으로만 쓰면 탐색적 투자가 위축됩니다.

인포그래픽