ChatGPT·퍼플렉시티·구글 AI 개요는 인용하는 기준이 다른가요?
요약
다릅니다. 여러 연구가 같은 방향을 가리킵니다. 영어 B2B SaaS 인용 1,702건에서 인용된 페이지의 평균 점수는 Brave 0.727, 구글 AI 개요 0.687, Perplexity 0.300으로 크게 갈렸고, 다른 연구에서는 ChatGPT가 출처를 적게 달되 한 출처의 영향이 컸습니다. 인용 품질 차이의 88~96%를 제공사 차이가 설명한다는 결과도 있습니다. 그래서 엔진은 합치지 말고 따로 재야 합니다.
세 연구가 같은 방향을 가리킵니다
엔진마다 인용 방식이 다르다는 것은 체감으로는 익숙하지만, 규모 있게 잰 연구는 드뭅니다. 서로 다른 목적으로 진행된 세 연구가 각자 이 차이를 관측했습니다.
| 연구 | 대상 엔진 | 엔진별로 갈린 것 |
|---|---|---|
| GEO-16 — 영어 B2B SaaS 인용 1,702건 | Brave · 구글 AI 개요 · Perplexity | 인용 페이지 평균 점수 0.727 · 0.687 · 0.300 / 인용률 78% · 72% · 45% |
| 인용 흡수 — 인용 21,143건 | ChatGPT · 구글 AI 개요/Gemini · Perplexity | Perplexity·구글은 출처를 더 많이 달고, ChatGPT는 적게 달되 한 출처의 영향이 뚜렷이 큼 |
| 인용 실패 — 인용 쌍 761,495건 | 5개 제공사 모델 10종 | 인용 품질 차이의 88~96%를 제공사 차이가 설명 |
무엇이 다른가 — 세 가지
출처를 다는 개수 — 출처를 많이 다는 엔진에서는 우리 링크가 여러 개 중 하나로 들어가기 쉽고, 적게 다는 엔진에서는 들어가기 어렵지만 들어가면 답에 미치는 영향이 큽니다. 출처 개수만 세면 이 차이가 거꾸로 읽힙니다.
고르는 페이지의 성격 — GEO-16에서 Perplexity가 인용한 페이지의 평균 점수는 다른 두 엔진의 절반에도 못 미쳤습니다. 메타데이터·구조화 데이터 같은 항목의 점수가 낮은 페이지도 인용한다는 뜻입니다. 기술 항목을 고치는 작업이 엔진마다 같은 무게를 갖지 않을 수 있습니다.
인용의 정확도 — 인용 품질의 차이 대부분을 제공사가 설명한다면, 우리 회사가 한 엔진에서는 정확히 인용되고 다른 엔진에서는 틀리게 인용될 수 있습니다. 이 부분은 출처가 달린 AI 답변은 믿어도 되나에서 다뤘습니다.
이 비교를 읽을 때의 조건
- 세 연구 모두 영어 데이터이고 대상 엔진 조합이 서로 다릅니다. 표의 숫자를 가로로 비교하면 안 됩니다
- GEO-16은 관측 연구이고 B2B SaaS에 한정됩니다. 인용 흡수 연구는 판정을 모델이 했고, 인용 실패 연구는 기술 Q&A 질문 기반입니다
- 모두 특정 시점의 동작입니다. 엔진은 수시로 바뀝니다
그래서 나비랑은 이 연구들을 엔진별 순위표로 쓰지 않습니다. 가져오는 것은 “엔진마다 다르다”는 방향 하나이고, 그 방향이 측정 설계를 바꿉니다.
측정에 뜻하는 것
- 엔진을 나눠 기록합니다 — 합산 인용률은 어느 엔진에서 무엇이 달라졌는지를 지웁니다. 나비랑은 자사 측정에서 질문 40개 × 답변엔진 7개를 각각 한 칸으로 셉니다. 규약은 측정 방법 문서에 공개돼 있습니다
- 한 엔진의 결과로 다른 엔진을 추정하지 않습니다 — ChatGPT에서 인용됐다고 네이버나 Perplexity에서도 그렇다고 말할 수 없습니다
- 엔진별 공식 조건을 따로 확인합니다 — 어떤 크롤러를 쓰는지, 어떤 색인에 기대는지는 엔진마다 다릅니다. 엔진별 사양과 확인 방법은 답변엔진 레퍼런스에 정리했습니다
같은 질문을 넣었을 때 반복할 때마다 답이 흔들리는 문제는 같은 질문을 다시 물으면 답이 달라집니다에서 따로 다뤘습니다. 우리 브랜드가 엔진별로 어떻게 보이는지는 무료 AEO 진단에서 확인해 드립니다.
자주 묻는 질문
Q ChatGPT에 잘 나오면 다른 AI에도 잘 나오나요?
A 그렇게 볼 근거가 없습니다. 엔진마다 문서를 모으는 경로와 출처를 고르는 방식이 다르고, 연구에서도 인용하는 페이지의 성격과 인용 개수가 엔진별로 크게 갈렸습니다. 한 엔진의 결과로 다른 엔진을 추정하지 말고 각각 확인해야 합니다.
Q Perplexity가 점수 낮은 페이지를 인용한다면 나쁜 엔진인가요?
A 그렇게 읽으면 안 됩니다. GEO-16 연구에서 Perplexity가 인용한 페이지의 평균 점수가 0.300으로 낮았던 것은, 그 연구가 정한 16개 기준으로 점수가 낮은 페이지도 인용한다는 뜻입니다. 엔진마다 고르는 기준이 다르다는 증거이지, 품질의 우열을 말해 주지는 않습니다.
Q 엔진별 인용률을 한 숫자로 합쳐서 보고해도 되나요?
A 합산 숫자만 내면 안 됩니다. 인용 품질 차이의 대부분을 제공사 차이가 설명한다면, 합산값은 어느 엔진에서 무엇이 달라졌는지를 지워 버립니다. 엔진별로 따로 기록하고, 합산 지표는 그다음에 분모와 함께 냅니다.
함께 읽으면 좋은 글
- AI 답변에 인용된 것과 실제로 쓰인 것은 다른가요? 출처 목록에 우리 페이지가 올라가도 답변 문장은 다른 문서에서 나올 수 있습니다. 인용 21,143건을 분석한 연구가 나눈 '인용 선택'과 '인용 흡수'의 차이, 흡수되는 페이지의 특징, 측정에 넣을 때의 주의점을 정리했습니다.
- 영어 자료만 있으면 한국어로 묻는 AI 답변에서 불리한가요? AI는 검색과 답변 생성 두 단계 모두에서 질문과 같은 언어의 문서를 선호했습니다. 5개 언어로 실험한 NAACL 2025 연구의 수치를 조건과 함께 정리하고, 한국어가 실험에 없다는 한계와 한국어 자산을 어떻게 갖출지를 적었습니다.
- AI 답변에서 온 방문자는 어떻게 세나요? GA4 기본 채널 그룹의 ‘AI 어시스턴트’가 무엇을 포함하고 무엇을 빼는지 공식 정의로 확인하고, 맞춤 채널 그룹이 필요한 이유와 유입을 과소 집계하게 되는 지점, 언급·인용·유입 세 층의 구분을 정리했습니다.