"이번 주 AI 노출률 45%입니다." 리포트에서 이 문장을 보셨다면 한 가지만 확인해 보시기 바랍니다. 그 45%는 프롬프트당 몇 번을 물어본 결과일까요. 답이 "하루 1회"라면 그 리포트는 성과를 보고한 게 아니라 동전 던지기 결과를 기록한 것에 가깝습니다. 지오랭크가 B2B SaaS 클라이언트와 겪은 일이 정확히 그랬습니다. 핵심 프롬프트 40개를 매일 1회씩 던져 어느 주에 45%가 나왔는데, 다음 주에 아무것도 바꾸지 않았는데 28%로 떨어졌습니다. 클라이언트는 물었습니다. 지난주에 뭘 잘못했냐고요. AI 가시성 측정이 왜 이렇게 흔들리는지, 질문에 답하는 방식으로 정리해 보겠습니다.
왜 아무것도 안 바꿨는데 숫자가 움직일까요?
AI 답변 자체가 매번 다르기 때문입니다. 콘텐츠 변경 이력, 크롤러 로그, 경쟁사 신규 콘텐츠까지 2주에 걸쳐 뒤졌지만 설명되는 게 없었습니다. 그러다 같은 프롬프트를 하루에 20번 연속으로 던져 봤더니 답이 나왔습니다. 20회 중 브랜드가 언급된 횟수는 그날 8회, 다음 날 11회, 그 다음 날 7회였습니다. 원인은 콘텐츠가 아니라 계기였던 겁니다. 모델의 확률적 샘플링, 실시간 검색 결과의 변동, 개인화, 라우팅되는 모델 버전이 매번 답을 흔듭니다. 우리 브랜드의 진짜 노출률이라는 단일한 참값은 애초에 존재하지 않고, 존재하는 것은 분포뿐입니다.
도구마다 숫자가 다른데 어느 쪽이 맞나요?
둘 다 맞고 둘 다 다릅니다. 여기서 갈라야 할 개념이 정확도와 정밀도입니다. 정확도는 참값에 얼마나 가까운지를, 정밀도는 반복 측정이 서로 얼마나 모여 있는지를 뜻합니다. 전통적인 순위 추적은 정확도를 말할 수 있었습니다. 특정 시점, 특정 지역의 순위는 하나로 정해져 있었으니까요. AI 검색에는 그 참값이 없습니다. 그래서 도구 A가 41%, 도구 B가 23%를 보여줘도 한쪽이 틀린 게 아니라 서로 다른 조건에서 서로 다른 분포를 잰 것입니다. 웹 인터페이스를 스크래핑하느냐 개발자 API를 호출하느냐, 로그인 상태인가 아닌가, 즉답 모드인가 추론 모드인가에 따라 애초에 다른 것을 재게 됩니다. 실제로 ChatGPT의 즉답 모드와 추론 모드가 인용한 도메인은 약 25%만 겹쳤고, 추론 모드는 쿼리 팬아웃을 4배 더 발생시켰다는 분석이 올해 나왔습니다.
그럼 몇 번을 물어봐야 믿을 만한가요?
참 등장률이 50% 부근일 때 반복 5회의 95% 신뢰구간은 플러스마이너스 44%p입니다. 10회면 31%p, 20회면 22%p, 50회면 14%p, 100회면 10%p로 좁혀집니다. 5회 측정으로는 30%와 70%조차 구분하지 못한다는 뜻이죠. 캠페인이 노출률을 35%에서 50%로 올렸는지 판단하려면 그 변화 폭보다 신뢰구간이 작아야 합니다. 실제 데이터도 같은 방향입니다. 구매 의도 프롬프트 12개를 로그아웃 ChatGPT에 각각 100회씩 던진 올해 조사에서, 프롬프트당 누적 44개 브랜드가 등장했지만 응답 하나에 들어간 건 약 10개였습니다. 80% 이상 꾸준히 등장한 브랜드는 프롬프트당 5개, 전체의 11%뿐이었고 나머지 72%는 다섯 번에 한 번도 나오지 않았습니다.
연구는 이 문제를 어떻게 설명하나요?
브랜드 20곳을 3개 모델과 8개 언어, 프롬프트 15종으로 교차해 응답 12,933건을 분해한 2026년 연구가 있습니다. 답변 변동의 34.8%가 같은 프롬프트를 반복하는 것만으로 발생했고, 질의 언어가 31.6%, 브랜드 자체는 0.7%를 설명했습니다. 단일 응답에서 브랜드 정체성이 차지하는 비중은 1.5%에 불과했고요. AI 답변 하나를 캡처해 우리가 이렇게 평가받는다고 결론 내리는 일이 왜 위험한지 보여주는 수치입니다. 질의 언어 요인이 31.6%라는 점도 중요한데, 해외 도구의 영어 기반 리포트만 보고 국내 성과를 판단하고 계시다면 자기 시장과 무관한 숫자를 보고 있을 수 있습니다. 같은 해 나온 다른 프로토콜 연구는 약 190,000건의 관측을 재분석해 탐색 목적이면 5회에서 7회, 확인 목적이면 10회에서 12회, 엄밀한 검증에는 15회에서 20회를 제시했습니다.
실무에서는 무엇부터 바꿔야 할까요?
도구가 아니라 설계를 바꾸는 것이 먼저입니다. 앞의 클라이언트 사례에서는 프롬프트당 20회 반복, 로그아웃 상태 고정, 모델 버전 명시, 결과는 단일 숫자가 아니라 범위로 보고하는 방식으로 바꿨습니다. 측정 비용은 3.8배 늘었지만 주간 변동 폭이 17%p에서 6%p로 줄었고, 6주 차에 잡힌 9%p 상승이 진짜 신호라는 확신을 갖고 예산을 옮길 수 있었습니다. 물론 전부를 20회로 돌릴 필요는 없습니다. 프롬프트 300개를 추적하는 커머스 클라이언트는 핵심 30개만 정밀 측정하고 나머지는 주 1회 5회 반복으로 운영합니다. 측정 예산은 유한하고, 어디에 정밀도를 쓸지 고르는 것도 전략이니까요. 온도를 0으로 맞추면 되지 않느냐는 질문도 자주 받는데 그렇지 않습니다. GPU 연산의 부동소수점 비결정성 탓에 같은 출력이 보장되지 않고, 실시간 검색을 쓰는 제품은 그날의 검색 결과까지 바뀝니다. 마지막으로 가시성은 선행 지표일 뿐입니다. 유입 트래픽과 전환이라는 실제 지표와 합리적인 기간 안에서 같이 움직이지 않는다면, 아무리 정밀하게 잰 가시성이라도 비즈니스 의미는 없습니다.


