같은 질문을 여러 번 물으면 생기는 일 — 원장님을 위한 AI 노출 측정 5원칙 (2026)

· 최준호 (Jack Choi)

이 글은 「병원을 위한 AEO」 시리즈 17/22편입니다. 전체 목록 보기

AI 답변은 같은 질문에도 매번 달라집니다. 한 번 물어보고 나온다·안 나온다를 판정하면 왜 틀리는지. 믿을 수 있는 측정은 어떻게 설계하는지. 그리고 반복해도 남는 한계까지 실측으로 공개합니다.

1분 요약

  • AI 답변은 같은 질문에도 매번 달라집니다. 같은 질문을 같은 AI에 반복해 물었더니 병원이 등장한 회차와 등장하지 않은 회차가 한 자리에 섞여 나왔습니다.
  • 그래서 한 번 물어본 결과는 진단이 되지 못합니다. 좋게 나온 화면 한 장은 그 순간 그렇게 나왔다는 사실만 증명합니다.
  • 엔진마다 답이 다릅니다. 같은 문장에서 한 AI는 그 병원을 언급했고 다른 AI는 반복 내내 한 번도 언급하지 않았습니다.
  • 믿을 수 있는 측정에는 다섯 가지 조건이 필요합니다. 로그인 기억 배제 · 반복 질의 · 복수 엔진 · 브랜드형과 발견형 분리 · 조건 고정 후 재측정.
  • 반복해도 편차는 사라지지 않습니다. 저희가 드리는 숫자도 전수 집계가 아니라 표본입니다. 이 한계를 먼저 말하지 않는 리포트는 숫자보다 태도를 먼저 보시는 편이 낫습니다.

"직원이 물어보니 나오던데요" — 그 화면은 무엇을 증명합니까

병원 상담에서 자주 나오는 대화입니다.

"실장이 ChatGPT에 쳐봤는데 우리 병원 나온다고 하더라고요. 캡처도 보내줬습니다."

"업체에서도 성공 사례라고 화면 캡처를 몇 장 보내줬어요. 그러면 되는 거 아닙니까?"

그 캡처는 거짓이 아닙니다. 다만 증명하는 범위가 좁습니다. 그 시각·그 계정·그 한 번의 질문에서 그렇게 나왔다는 사실까지죠. 같은 질문을 30분 뒤에 다시 물으면 답이 바뀌어 있는 경우가 흔합니다.

환자가 던지는 문장의 양을 보시면 이 문제를 가볍게 두기 어렵습니다. 네이버 검색광고 키워드도구로 조회하면 시술 이름 하나에 한 달치 질문이 이만큼 쌓여 있습니다(2026년 8월 조회).

  • 리쥬란 63,800회
  • 써마지 49,990회
  • 울쎄라 41,330회
  • 강남피부과 18,680회

이 숫자가 그대로 AI 대화창으로 옮겨 간다는 뜻은 아닙니다. 저희는 확인하지 못한 전환 비율을 근거로 쓰지 않습니다. 다만 환자가 어떤 문장으로 병원을 찾는지는 여기서 보입니다. 같은 문장을 AI에 넣었을 때 우리가 나오는지를 캡처 한 장으로 판정하면, 판정이 틀렸을 때 치르는 값이 큽니다.

저희 측정도 완벽하지 않습니다. AI가 어떤 기준으로 답을 고르는지는 공개되어 있지 않고 반복해도 지워지지 않는 편차가 남습니다. 다만 저희가 병원 진단에 실제로 쓰는 방식과 그 방식이 어디까지 믿을 만한지를 숨기지 않고 적었습니다. 원장님이 업체 리포트를 받으셨을 때 그 숫자가 어떻게 만들어졌는지 되물으시게 하는 것이 목적입니다.


같은 질문을 다시 물으면 왜 답이 달라집니까

AI는 저장된 순위표에서 답을 꺼내오지 않습니다. 질문을 받을 때마다 답을 새로 씁니다.

그래서 "우리 병원이 3위입니다" 같은 표현은 AI 답변에서 성립하기 어렵습니다. 성립하는 표현은 하나뿐입니다. 여러 번 물었을 때 몇 번 등장했는가.

실측에서는 어떻게 나왔습니까

2026년 8월 13일, 강남 소재 한 피부과를 대상으로 3개 AI에서 환자 질문을 반복 측정했습니다. 병원 요청에 따라 실명은 밝히지 않습니다.

"강남 피부과 추천해줘"라는 하나의 문장을 놓고 본 결과입니다. 한 엔진에서는 세 번 중 두 번 병원이 등장했습니다. 나온 회차와 나오지 않은 회차가 같은 날 같은 조건에서 섞여 나왔습니다. 나머지 두 엔진에서는 각각 다섯 번을 물어 한 번도 등장하지 않았고요.

여기서 캡처의 위험이 그대로 드러납니다. 등장한 회차를 캡처하면 "AI가 우리 병원을 추천합니다"가 됩니다. 등장하지 않은 회차를 캡처하면 "AI 답변에서 사라졌습니다"가 됩니다. 같은 날 같은 문장에서 정반대의 두 자료가 모두 만들어집니다. 어느 쪽도 거짓말을 하지 않았는데 결론이 반대죠.

한 번의 결과는 관측이지 측정이 아닙니다. 측정은 여러 번의 관측을 같은 조건에서 모아 빈도로 바꾸는 일입니다.


그럼 몇 번을 물어야 믿을 수 있습니까

한 번은 근거가 되지 못합니다. 두 번은 서로 다른 결과가 나왔을 때 어느 쪽이 흔한지 알 수 없습니다. 최소 세 번은 물어야 "가끔 나온다"와 "거의 안 나온다"가 구분됩니다.

정답 숫자는 없습니다. 저희가 병원 진단에서 쓰는 횟수는 세 번보다 많고, 원장님이 직접 확인하실 때는 질문당 세 번이면 방향을 잡기에 충분합니다. 대신 횟수를 늘려도 지워지지 않는 한계가 따로 있습니다.

반복할 때 지켜야 할 조건이 하나 있습니다. 매번 새 대화창에서 시작하시면 됩니다. 같은 창에서 "다시 알려줘"라고 이어 물으면 AI가 방금 자기가 한 답을 참고합니다. 그건 두 번째 측정이 아니라 첫 번째 답의 연장이고요.


ChatGPT에서 나오면 다른 AI에서도 나옵니까

ChatGPT에서 잘 나오니 다른 AI에서도 비슷하겠거니 하고 넘기시는 경우가 많습니다. 앞의 실측이 그 짐작을 정면으로 뒤집었습니다.

"강남 피부과 추천해줘"라는 문장에서 한 엔진은 그 병원을 언급했고 나머지 두 엔진은 반복 내내 언급하지 않았습니다. 주력 시술 질문에서는 순서가 뒤집혔습니다. 앞서 언급했던 엔진에서는 전혀 나오지 않고 다른 엔진에서 한 번 등장했습니다. 엔진이 참고하는 문서와 답을 짜는 방식이 서로 달라서 그렇습니다.

한 엔진만 재는 것은 한 신문사만 읽고 여론을 판단하는 일과 같습니다. 그 신문이 틀렸다는 뜻이 아니라 그것만으로는 전체를 알 수 없다는 뜻이죠.

업체 리포트가 ChatGPT 화면만 담고 있다면 나머지 엔진에서는 어땠는지 물어보시면 됩니다. 재지 않았다면 재지 않았다고 적혀 있어야 합니다.


로그인한 계정으로 재면 왜 안 됩니까

원장님 계정에서 "강남 피부과 추천해줘"라고 물으면 화면에 병원이 잘 나옵니다. 그 계정에서 우리 병원 이야기를 이미 여러 번 하셨기 때문입니다. 직원 계정도 마찬가지고요. AI는 이전 대화를 기억한 채로 답합니다.

그 화면은 새 환자가 보는 화면이 아니라 원장님 전용 화면입니다.

측정에서 확인해야 하는 것은 우리를 전혀 모르는 사람의 화면입니다. 그래서 저희는 진단할 때 ChatGPT는 임시 채팅으로, 나머지 엔진은 기억이 남지 않는 새 대화로 조건을 맞춥니다. 이 조건이 리포트에 적혀 있지 않으면 그 숫자가 새 환자의 화면인지 병원 관계자의 화면인지 구분할 방법이 없습니다.


브랜드형과 발견형을 왜 따로 세야 합니까

같은 실측에서 병원 이름을 넣은 질문의 등장률은 100%였습니다. 이름 없이 지역·시술·증상으로 물은 질문에서는 4%였고 외국어 질문도 4% 수준이었습니다.

두 질문이 재는 것이 완전히 다르기 때문에 이렇게 갈립니다. 그런데 둘을 합쳐 평균을 내면 20%대의 숫자가 나옵니다. 거짓 숫자는 아닙니다. 다만 원장님이 알아야 할 것을 정확히 가립니다. 새 환자는 전부 4% 쪽에 있습니다.

리포트에서 확인하실 것은 하나입니다. 병원 이름을 넣은 질문이 노출률 계산에 섞여 있는가. 섞여 있다면 분리된 수치를 요청하시면 됩니다. 이 갭의 정체와 원 수치는 브랜드 질문엔 나오는데 '강남 피부과 추천'엔 없는 이유에서 따로 다뤘습니다.


믿을 수 있는 측정은 어떻게 설계합니까

업체 리포트를 받으셨을 때 이 표와 대조해 보시면 됩니다.

# 원칙 왜 필요한가 리포트에 적혀 있어야 할 것
1 로그인 기억을 배제한다 계정 기억이 붙으면 새 환자의 화면이 아니다 임시 채팅·비로그인 등 측정 조건 명시
2 같은 질문을 여러 번 묻는다 답이 매번 달라져 1회 결과는 우연과 구분되지 않는다 질문당 반복 횟수와 등장 횟수
3 한 엔진만 보지 않는다 엔진마다 참고 문서와 답 구성이 다르다 측정한 AI 목록과 엔진별 결과
4 브랜드형과 발견형을 나눈다 합치면 브랜드 성적이 발견형 공백을 덮는다 두 유형을 분리한 등장률
5 조건을 고정하고 같은 방식으로 다시 잰다 조건이 바뀌면 지난 숫자와 비교할 수 없다 질문 문장·엔진·조건이 회차 간 동일함

5번이 가장 자주 무너집니다. 두 번째 측정에서 질문 문장을 슬쩍 바꾸거나 성적이 나빴던 엔진을 빼면 숫자는 좋아지게 돼 있습니다. 지난번에 없던 질문을 추가해도 마찬가지고요. 성과가 오른 것이 아니라 시험 문제가 쉬워진 것입니다.

그래서 저희는 첫 진단에서 쓴 질문 문장을 그대로 고정하고 이후 재측정에서 문장을 바꾸지 않습니다. 질문을 추가할 때는 기존 질문의 수치를 따로 유지한 채 새 항목으로 분리합니다.


원장님이 직접 재현하시려면 무엇을 준비하면 됩니까

질문 문장과 판정 기준은 원장님이 직접 3분 만에 하는 우리 병원 AI 노출 자가진단에 그대로 붙여 넣으실 수 있게 정리해 두었습니다. 여기서는 그 결과를 어떻게 기록해야 나중에 비교되는지만 덧붙입니다. 기록 방식이 잘못되면 세 번 물어도 캡처 한 장과 같아집니다.

첫째, 회차별로 O/X를 남기십시오. "나왔다"가 아니라 "3번 중 2번 나왔다"로 적어야 다음 달과 비교됩니다.

질문 유형 1회차 2회차 3회차 등장
예: 강남 피부과 추천해줘 발견형 O X X 1/3
예: 리쥬란 잘하는 피부과 어디야? 발견형 X X X 0/3

둘째, 질문 문장을 파일로 저장해 두시면 됩니다. 다음 측정 때 같은 문장을 그대로 써야 하니까요. 기억에 의존해 다시 입력하면 문장이 조금씩 바뀌고 그 순간 비교 가능성이 사라집니다.

셋째, 측정한 날짜와 조건도 함께. 날짜 · 사용한 AI · 임시 채팅 여부. 세 줄이면 됩니다.

넷째, 발견형 답변에 등장한 다른 병원 이름을 적어 두십시오. 지금 그 자리를 차지한 병원들이고 다음 측정에서 그 목록이 어떻게 바뀌는지가 실제 변화의 신호입니다.

이 정도만 남겨도 한 달 뒤 같은 조건으로 다시 쟀을 때 "올랐다"를 감이 아니라 숫자로 말하십니다.


반복해서 재면 정확해집니까 — 이 방법의 한계

파는 입장에서 쓰기 불편한 내용입니다. 이걸 빼면 앞의 다섯 원칙도 믿을 이유가 없어집니다.

반복해도 편차는 없어지지 않습니다. 줄어들 뿐입니다. 등장률이 한 주 만에 몇 %p 움직였다면 그것이 개선의 결과인지 그날의 변동인지 저희도 단정하지 못합니다. 그래서 한 주의 등락이 아니라 여러 회차에 걸친 방향을 봅니다.

표본이지 전수 집계도 아닙니다. 환자가 실제로 던지는 질문은 무한하고 저희가 재는 질문은 그중 검색 수요를 근거로 고른 일부입니다. 저희가 드리는 숫자는 "새 환자가 볼 가능성이 높은 화면"의 표본이지 모든 환자가 본 화면의 집계가 아닙니다. 이 차이를 리포트에 적지 않으면 그 숫자는 과장이 됩니다.

사용자 환경까지 재현하지도 못합니다. 지역 · 기기 · 앱 버전 · 이전 대화에 따라 답이 달라집니다. 저희 측정은 "기억이 없는 새 환자"라는 한 가지 조건을 고정한 결과입니다. 다른 조건의 환자가 본 화면은 다를 수 있습니다.

AI 내부의 선정 기준은 확인할 수 없습니다. 저희가 아는 것은 답변에 무엇이 등장했고 어떤 문서가 근거로 제시됐는지까지입니다. 왜 그 문서가 선택됐는지는 추론이고, 저희는 추론을 실측과 섞어서 보고하지 않습니다.

마지막으로 엔진이 바뀌면 지난 숫자와 이어지지 않습니다. AI 업체가 모델이나 검색 연동 방식을 바꾸면 결과가 함께 움직입니다. 병원이 아무것도 하지 않았는데 수치가 오르내리는 일이 생기죠. 이런 시점에는 원인을 병원 쪽으로 돌리지 않고 그대로 적는 편이 맞습니다.

정리하면 반복 측정은 정확한 값을 얻는 방법이 아니라 틀릴 확률을 줄이는 방법입니다. 캡처 한 장보다 훨씬 낫습니다. 그래도 여전히 표본이고요.


업체 리포트에서는 무엇을 확인해야 합니까 (Don't & Do)

계약 전에 물어볼 질문 전체는 무늬만 AEO 업체 거르는 법에 정리해 두었습니다. 여기서는 측정에 관한 것만 짧게 추립니다.

이런 자료를 받으셨다면 (Don't) 이렇게 되물으십시오 (Do)
성공 사례 화면 캡처 몇 장 "같은 질문을 몇 번 반복했고 나머지 회차 결과는 어땠습니까?"
"AI 노출률 60% 달성" "브랜드 질문을 뺀 발견형만의 수치를 보여주십시오"
ChatGPT 화면만 있는 리포트 "다른 AI에서도 쟀습니까? 안 쟀다면 그렇게 적어주십시오"
측정 조건이 없는 표 "로그인 상태였습니까, 기억이 없는 상태였습니까?"
지난달과 질문이 달라진 리포트 "질문 문장이 회차마다 동일합니까? 원본 기록을 보여주십시오"
"AI 검색 1위 보장" "같은 질문에도 답이 달라지는데 무엇을 기준으로 1위입니까?"

마지막 줄이 핵심입니다. 순위를 보장한다는 말은 측정 방식을 모르고 하는 말이거나 알면서 하는 말입니다. 어느 쪽이든 판단 근거가 됩니다.


자주 묻는 질문

매주 재야 합니까, 매달 재야 합니까?

바꾸기 전에 한 번, 정비한 뒤 일정 간격으로 반복해 보시면 됩니다. 문서를 손댄 다음 날 재면 아무 변화도 없습니다. AI가 새 문서를 수집해 답변에 반영하기까지 시간이 걸리니까요. 첫 변화까지 보통 두세 달, 길게는 넉 달을 봅니다. 기간을 더 자세히 보시려면 AEO 성과 시간표에 정리해 두었습니다.

등장률이 지난달보다 떨어졌으면 실패입니까?

한 회차만 보고 판단하지 않으셔도 됩니다. 앞서 적었듯 반복해도 편차는 남고 엔진 업데이트만으로도 수치가 움직입니다. 방향을 볼 때는 여러 회차를 이어서 보시고, 등장률과 함께 인용 출처 목록이 바뀌었는지를 같이 보시는 편이 정확합니다. 우리 문서가 근거 목록에 처음 들어온 시점은 등장률보다 먼저 움직이는 경우가 있더군요. 그 근거 목록이 지금 어떤 문서로 채워져 있는지는 AI 인용 출처 역추적 실측에 정리했습니다.

순위 추적 툴을 쓰면 되지 않습니까?

AI 답변에는 검색결과 같은 고정 순위가 없습니다. 그래서 툴을 쓰더라도 결국 하는 일은 같습니다. 질문을 정해 반복해 묻고 등장 빈도를 세는 일이죠. 툴을 검토하실 때도 위 다섯 원칙을 그대로 대보시면 됩니다. 특히 로그인 조건과 반복 횟수를 공개하지 않는 툴은 숫자의 뜻을 알 수 없습니다.

측정만 따로 맡길 수 있습니까?

가능합니다. 저희는 진단과 실행을 분리해서 봅니다. 진단 결과가 좋게 나오면 지금은 하실 게 없다고 말씀드립니다. 측정 결과를 근거로 다른 업체의 작업을 검증하시는 것도 정상적인 사용법입니다.


숫자보다 먼저 볼 것은 그 숫자를 만든 방법입니다

AI 노출은 캡처로 증명되지 않습니다. 기억이 없는 조건에서 여러 엔진에 걸쳐 같은 문장을 여러 번 물었을 때 나오는 빈도. 브랜드형과 발견형을 나눈 채로. 그렇게 얻은 숫자만 회차 간 비교가 됩니다.

그리고 그 숫자에도 한계가 있습니다. 편차는 남습니다. 표본은 전수가 아니고 AI 내부 기준은 확인할 수 없습니다. 저희가 이 한계를 먼저 적는 이유는 한계를 말하지 않는 숫자가 결국 원장님께 잘못된 결정을 시키기 때문입니다.

원장님이 지금 받고 계신 리포트를 위 다섯 원칙에 한번 대보십시오. 다섯 줄 중 몇 줄이 적혀 있는지가 그 리포트를 얼마나 믿을 수 있는지입니다.

무료 AI 노출 진단 — 병원명과 주력 시술 3가지만 알려주시면 위 다섯 원칙 그대로 실측해 결과를 드립니다. 측정 조건과 원본 기록을 함께 드리고, 저희가 재지 못한 것은 재지 못했다고 적습니다. 진단 신청하기


함께 읽으면 좋은 글


측정 조건 고지 — 본문에 인용한 병원 실측치는 2026년 8월 13일, 강남 소재 한 피부과를 대상으로 ChatGPT(임시 채팅)·Claude(웹검색)·Gemini(검색연동) 3개 엔진에서 환자 질문을 반복 질의해 얻은 결과입니다. 병원 요청에 따라 실명과 경쟁 병원명은 밝히지 않습니다. "강남 피부과 추천해줘" 한 문장의 엔진별 결과는 2/3·0/5·0/5이며, 표의 엔진 순서는 위 나열 순서와 다릅니다. 브랜드형 100%·발견형 4%의 원 분수와 갭의 해석은 07편에 있습니다. 검색량은 네이버 검색광고 키워드도구 조회값(PC+모바일 합산, 2026년 8월)이며, 시장 전체의 수요 규모를 보여주는 수치입니다. 특정 병원의 시술 구성과는 무관하게 인용했습니다. AI 답변은 시점·계정·환경에 따라 달라지며, 위 결과는 해당 시점의 표본입니다. 다른 병원의 결과를 예측하지 않습니다.



← 이전 · AI가 병원을 추천할 때 근거로 삼는 문서는 어디에 있습니까 | 다음 · 원장님을 위한 AEO 업체 검증 질문 5가지 (2026)

지금 AI가 귀사를 어떻게 말하는지 확인해 보세요

브랜드를 지정해 주시면 같은 형식의 진단 리포트를 3영업일 안에 드립니다.

무료 진단 신청 →

제출하신 정보는 진단 리포트 작성·발송과 상담 목적으로만 사용하며 1년 보관 후 파기합니다. 개인정보 처리방침