같은 질문을 다시 물으면 답이 달라집니다 — 측정은 어떻게 설계하나
요약
AI 답변은 질의 재작성, 그때 수집된 문서, 모델 변경, 개인화 같은 단계마다 결과가 갈립니다. 그래서 한 번 물어본 결과는 근거가 되지 못합니다. 측정하려면 질문 세트를 고정하고, 같은 질문을 여러 번, 엔진별로 따로, 같은 조건에서 반복해 기록해야 합니다. 변동을 없앨 수는 없고 변동의 크기를 함께 기록하는 것이 맞습니다.
변동은 고장이 아니라 구조입니다
AI 답변은 한 번에 만들어지지 않습니다. 질문이 들어오면 내부 검색어로 다시 쓰이고, 그 검색어로 문서를 모으고, 그중 일부를 골라 답을 합성합니다. 단계마다 결과가 갈립니다.
| 단계 | 무엇이 달라지나 |
|---|---|
| 질의 재작성 | 같은 질문이 다른 검색어로 바뀜 — 후보 문서 집합 자체가 달라짐 |
| 문서 수집 | 그 시점의 색인 상태. 새 글·삭제·재크롤이 반영됨 |
| 출처 선택 | 비슷한 문서가 여럿이면 어느 것이 뽑힐지 흔들림 |
| 답변 합성 | 모델 갱신, 샘플링. 표현과 인용 개수가 바뀜 |
| 개인화·지역 | 계정·언어·지역 설정에 따른 차이 |
그래서 “어제는 됐는데 오늘은 안 된다”는 관측 자체로는 아무것도 말해 주지 않습니다. 사이트가 그대로여도 답은 바뀔 수 있습니다.
한 번의 관측이 만드는 두 가지 착각
- 좋아졌다는 착각 — 마침 인용된 한 번을 보고 조치의 효과라고 결론 냅니다
- 나빠졌다는 착각 — 마침 빠진 한 번을 보고 되돌립니다. 효과가 있던 변경을 되돌리는 쪽이 더 비쌉니다
두 착각 모두 비교 대상이 없는 관측에서 나옵니다. 측정 설계는 비교 대상을 만드는 일입니다.
설계의 최소 조건 넷
- 질문 세트를 고정한다 — 매번 다른 질문으로 물으면 변화를 잴 수 없습니다. 세트를 정하고 바꾸지 않습니다
- 반복한다 — 한 질문당 여러 번. 인용 여부를 0/1이 아니라 비율로 기록합니다
- 엔진을 나눈다 — 수집 경로가 다르므로 합치면 의미가 사라집니다
- 조건을 적는다 — 날짜, 계정 상태, 지역, 사용한 문장 그대로. 조건 없는 수치는 재현되지 않습니다
세트를 어떻게 고르는지는 질문 목록과 키워드 조사의 차이에, 기록 틀은 AI Visibility 측정 방법에 정리해 두었습니다.
변동을 없애려 하지 말고 함께 기록합니다
측정의 목적은 흔들림을 없애는 것이 아니라 흔들림의 크기를 아는 것입니다. 같은 조건에서 10번 물어 3번 인용됐다면, 다음 달에 6번이 되었을 때 비로소 변화라고 말할 수 있습니다. 한 번씩 본 결과로는 그 말을 할 수 없습니다.
연구 쪽에서도 같은 경고가 나옵니다. 방법 하나로 인용이 크게 오른다는 실험 결과가 현실 파이프라인에서 재현되지 않는 사례를 GEO 연구 비판적 검토에 정리했습니다.
나비랑이 자사에 적용 중인 측정 규약은 측정 방법 문서에 전부 공개돼 있습니다. 같은 틀로 시작하고 싶으시면 무료 AEO 진단에서 질문 세트 설계부터 함께 잡아 드립니다.
자주 묻는 질문
Q 왜 어제는 우리가 인용됐는데 오늘은 사라졌나요?
A 답변이 만들어지는 과정에 변동 요인이 여러 개 있기 때문입니다. 같은 질문이라도 내부에서 다른 검색어로 바뀌어 수집될 수 있고, 그 시점에 새 문서가 들어오면 후보 순서가 바뀝니다. 모델이 갱신되거나 개인화 조건이 다르면 또 달라집니다. 사라졌다고 해서 사이트에 문제가 생긴 것이 아닐 수 있으므로, 한 번의 관측으로 판단하지 않는 것이 먼저입니다.
Q 몇 번을 물어봐야 근거가 되나요?
A 정답 숫자는 없지만, 원칙은 분명합니다. 한 질문을 한 번 물어본 결과는 쓰지 않습니다. 같은 질문을 반복 관측해 인용된 비율로 기록하고, 질문 세트 전체의 비율을 함께 봅니다. 나비랑은 자사 측정에서 질문 40개 × 답변엔진 7개를 고정 세트로 두고 같은 조건으로 반복합니다.
Q 엔진을 하나만 봐도 되나요?
A 안 됩니다. 엔진마다 문서 수집 경로가 달라 같은 질문에도 다른 출처를 답니다. ChatGPT의 결과로 네이버나 퍼플렉시티를 추정할 수 없습니다. 측정은 엔진별로 나눠 기록하고, 합산 지표는 그다음에 만듭니다.
함께 읽으면 좋은 글
- AI 검색 최적화는 얼마나 걸리나요? — 단계별 소요 시간 고쳐서 올리는 일은 하루면 끝나지만 답변에 반영되기까지는 크롤·색인·관측이라는 단계가 남습니다. 각 단계가 실제로 얼마나 걸리는지 자사 기록으로 정리하고, 기간을 앞당기는 것과 못 앞당기는 것을 나눴습니다.
- AI는 우리를 어떤 회사로 이해하고 있나 — 표기 정합성 상호·주소·업종 표기가 페이지마다 다르면 AI는 같은 회사로 묶지 못합니다. 엔티티가 흩어지는 전형적인 원인과 Organization 구조화 데이터·sameAs로 묶는 방법, 확인 절차를 정리했습니다.
- AI 답변에서 온 방문자는 어떻게 세나요? GA4 기본 채널 그룹의 ‘AI 어시스턴트’가 무엇을 포함하고 무엇을 빼는지 공식 정의로 확인하고, 맞춤 채널 그룹이 필요한 이유와 유입을 과소 집계하게 되는 지점, 언급·인용·유입 세 층의 구분을 정리했습니다.