AI에게 "트래픽이 왜 떨어졌냐"고 물으면 답은 거의 항상 돌아옵니다. 문장은 매끄럽고 용어도 정확합니다. 그런데 그 답이 맞는지 확인할 방법이 마땅치 않습니다. 최근 공개된 벤치마크 하나가 이 질문을 정면으로 쟀습니다. 실무에서 받는 질문 순서대로 짚어보겠습니다.

AI가 내놓은 진단, 얼마나 믿어도 되나요?

근거가 충분할 때만 믿을 수 있습니다. 연구진은 27개 AI 모델에게 동일한 SEO 진단 시나리오를 던지되 판본을 셋으로 나눴습니다. 첫 판본은 원인을 하나로 좁혀 주는 결정적 관찰값을 그대로 담았습니다. 둘째는 거기에 "이 정보로는 알 수 없다"는 선택지를 더했고 셋째는 결정적 관찰값 하나만 지웠습니다. 문항 81개에 응답 6,561건을 모았습니다. 결정적 근거가 있을 때 정확도는 99%였습니다. 그 한 줄을 지우자 적절히 판단을 유보한 비율은 51.5%로 떨어졌습니다. 나머지 절반은 근거가 사라진 줄도 모른 채 있을 때와 비슷한 확신으로 원인 하나를 지목했습니다. 자기가 가진 정보의 한계를 재지 못해서 생기는 공백입니다. 지식의 양과는 상관이 없습니다.

같은 질문을 여러 번 물어보면 검증이 되나요?

되지 않습니다. 이 벤치마크의 측정 대상은 지식이 아닙니다. 논증학에서 말하는 워런트입니다. 제시된 관찰값이 경쟁하는 다른 설명을 모두 지우고 그 진단 하나만 남기느냐를 봅니다. 설명이 둘 이상 살아 있는데 하나를 고르면 추론이 아니라 베팅입니다. 같은 질문을 세 번 던졌을 때 일부 모델은 세 번 모두 같은 진단을 내놓았고 불확실성 표시는 없었습니다. 사람 눈에 세 번의 일치는 교차 검증처럼 보이지만 실제로는 근거 없는 같은 결론이 세 번 복사된 것에 가깝습니다. 검증은 데이터를 늘리는 쪽에서 해야 합니다. 질문을 늘리는 쪽은 소용이 없습니다.

"모르면 모른다고 하라"고 시키면 되지 않나요?

절반만 해결됩니다. 시점이 걸린 사실 질문 22개에 "학습 데이터가 이 기간을 다루지 않으면 추론하지 말고 그렇다고 말하라"는 한 줄을 붙여 봤습니다. 유보율은 20.7%에서 85%로 뛰었고 오답률은 14.5%에서 1.2%로 내려갔습니다. 여기까지는 성공입니다. 그런데 정답률도 64.8%에서 13.8%로 무너졌습니다. 어떤 모델은 95.5%였던 정답률이 0%가 됐습니다. 환각을 0으로 밀면 쓸 수 있는 답변도 거의 남지 않습니다. 안전장치 한 줄로는 끝나지 않습니다.

비싼 모델을 쓰면 더 안전한가요?

가격은 판단력을 설명하지 못했습니다. 1,000회 진단 기준으로 약 4.49달러인 모델이 만점을 받았는데 같은 만점을 받은 다른 모델은 128달러였습니다. 28.5배 차이인데 판단력은 같았습니다. 지식 점수와도 어긋났습니다. SEO 지식 시험에서 0.897을 받은 모델이 유보 판단에서는 0.728에 그쳤고 지식이 더 낮은 0.794짜리 모델이 판단에서는 0.887로 앞섰습니다. 용어를 아는 능력과 근거가 부족하다는 걸 아는 능력은 별개였습니다.

그럼 실무에서 무엇을 바꾸면 되나요?

창을 나누는 일부터 하시면 됩니다. "무엇이 원인일 수 있는가"는 가능성을 넓게 벌리는 질문이고 "무엇이 원인인가"는 하나로 좁히는 질문입니다. 두 질문을 한 자리에서 섞어 던지면 모델은 넓게 벌려 둔 목록 중 하나를 확신의 어조로 집어 옵니다. 그다음 진단 프롬프트에 세 가지를 요구합니다. 결론을 지지하는 관찰값을 번호로 나열할 것, 같은 데이터로 가능한 다른 설명 두 개 이상과 각각을 배제한 이유, 지금 자료에서 빠진 데이터 항목입니다. 마지막으로 "이 자료로는 알 수 없다"는 답에 감점이 없다는 문장을 넣습니다. 답을 받으면 결론보다 근거 목록을 먼저 읽고 그 근거가 제출 자료 밖에서 왔다면 그 자리에서 버립니다.

실제로 효과가 있었나요?

지오랭크도 먼저 크게 당했습니다. 국내 B2B SaaS 기업의 AI 인용률이 3주 만에 31% 떨어진 적이 있습니다. GSC 데이터와 인용 로그를 넣고 물었더니 세 번 모두 "내부 링크 구조 개편"이라는 답이 나왔습니다. 세 번 일치했으니 믿었습니다. 링크 구조를 되돌리는 데 6주와 담당 2명을 썼지만 인용률은 회복되지 않았습니다. 뒤늦게 서버 로그를 뜯어보니 CDN 설정 변경으로 특정 봇의 응답 시간이 평균 4.2초까지 늘어 있었습니다. 처음 넘긴 자료에는 봇 로그가 아예 없었습니다. 방식을 바꾼 뒤 의료기기 유통사 건에서는 모델이 "제품 카테고리 페이지 변경 이력이 없어 판단할 수 없다"고 답했고 그 한 줄 덕분에 엉뚱한 공사를 시작하지 않았습니다. 실제 원인은 경쟁사 신규 콘텐츠였고 대응은 7주로 끝났습니다.

이 방식에 대가는 없나요?

있습니다. 유보 응답이 늘면서 담당자가 직접 데이터를 모으는 일이 2.5배가 됐습니다. AI 환각을 막는 비용은 결국 사람의 시간으로 치릅니다. 다만 6주를 날리는 것보다는 쌉니다. 그래서 지오랭크는 작업 기간이 2주를 넘는 건에만 이 절차를 걸어 둡니다. 모든 질의에 검증을 붙이면 속도가 죽습니다. 모델 이름을 외우는 것도 권하지 않습니다. 이 숫자는 2026년 8월에 고정한 응답 집합에서 나왔고 모델은 계속 갱신됩니다. 지오랭크는 진단 사례 20건을 근거 포함본과 제거본으로 나눠 분기마다 다시 돌려 봅니다. 쓰는 모델이 바뀌어도 측정 방식은 남습니다.

인포그래픽