본문 바로가기

ChatGPT·퍼플렉시티·구글 AI 개요는 인용하는 기준이 다른가요?

나비랑 발행 LLMO답변엔진측정논문 분석

요약

다릅니다. 여러 연구가 같은 방향을 가리킵니다. 영어 B2B SaaS 인용 1,702건에서 인용된 페이지의 평균 점수는 Brave 0.727, 구글 AI 개요 0.687, Perplexity 0.300으로 크게 갈렸고, 다른 연구에서는 ChatGPT가 출처를 적게 달되 한 출처의 영향이 컸습니다. 인용 품질 차이의 88~96%를 제공사 차이가 설명한다는 결과도 있습니다. 그래서 엔진은 합치지 말고 따로 재야 합니다.

세 연구가 같은 방향을 가리킵니다

엔진마다 인용 방식이 다르다는 것은 체감으로는 익숙하지만, 규모 있게 잰 연구는 드뭅니다. 서로 다른 목적으로 진행된 세 연구가 각자 이 차이를 관측했습니다.

연구대상 엔진엔진별로 갈린 것
GEO-16 — 영어 B2B SaaS 인용 1,702건Brave · 구글 AI 개요 · Perplexity인용 페이지 평균 점수 0.727 · 0.687 · 0.300 / 인용률 78% · 72% · 45%
인용 흡수 — 인용 21,143건ChatGPT · 구글 AI 개요/Gemini · PerplexityPerplexity·구글은 출처를 더 많이 달고, ChatGPT는 적게 달되 한 출처의 영향이 뚜렷이 큼
인용 실패 — 인용 쌍 761,495건5개 제공사 모델 10종인용 품질 차이의 88~96%를 제공사 차이가 설명

무엇이 다른가 — 세 가지

출처를 다는 개수 — 출처를 많이 다는 엔진에서는 우리 링크가 여러 개 중 하나로 들어가기 쉽고, 적게 다는 엔진에서는 들어가기 어렵지만 들어가면 답에 미치는 영향이 큽니다. 출처 개수만 세면 이 차이가 거꾸로 읽힙니다.

고르는 페이지의 성격 — GEO-16에서 Perplexity가 인용한 페이지의 평균 점수는 다른 두 엔진의 절반에도 못 미쳤습니다. 메타데이터·구조화 데이터 같은 항목의 점수가 낮은 페이지도 인용한다는 뜻입니다. 기술 항목을 고치는 작업이 엔진마다 같은 무게를 갖지 않을 수 있습니다.

인용의 정확도 — 인용 품질의 차이 대부분을 제공사가 설명한다면, 우리 회사가 한 엔진에서는 정확히 인용되고 다른 엔진에서는 틀리게 인용될 수 있습니다. 이 부분은 출처가 달린 AI 답변은 믿어도 되나에서 다뤘습니다.

이 비교를 읽을 때의 조건

  • 세 연구 모두 영어 데이터이고 대상 엔진 조합이 서로 다릅니다. 표의 숫자를 가로로 비교하면 안 됩니다
  • GEO-16은 관측 연구이고 B2B SaaS에 한정됩니다. 인용 흡수 연구는 판정을 모델이 했고, 인용 실패 연구는 기술 Q&A 질문 기반입니다
  • 모두 특정 시점의 동작입니다. 엔진은 수시로 바뀝니다

그래서 나비랑은 이 연구들을 엔진별 순위표로 쓰지 않습니다. 가져오는 것은 “엔진마다 다르다”는 방향 하나이고, 그 방향이 측정 설계를 바꿉니다.

측정에 뜻하는 것

  1. 엔진을 나눠 기록합니다 — 합산 인용률은 어느 엔진에서 무엇이 달라졌는지를 지웁니다. 나비랑은 자사 측정에서 질문 40개 × 답변엔진 7개를 각각 한 칸으로 셉니다. 규약은 측정 방법 문서에 공개돼 있습니다
  2. 한 엔진의 결과로 다른 엔진을 추정하지 않습니다 — ChatGPT에서 인용됐다고 네이버나 Perplexity에서도 그렇다고 말할 수 없습니다
  3. 엔진별 공식 조건을 따로 확인합니다 — 어떤 크롤러를 쓰는지, 어떤 색인에 기대는지는 엔진마다 다릅니다. 엔진별 사양과 확인 방법은 답변엔진 레퍼런스에 정리했습니다

같은 질문을 넣었을 때 반복할 때마다 답이 흔들리는 문제는 같은 질문을 다시 물으면 답이 달라집니다에서 따로 다뤘습니다. 우리 브랜드가 엔진별로 어떻게 보이는지는 무료 AEO 진단에서 확인해 드립니다.

자주 묻는 질문

Q ChatGPT에 잘 나오면 다른 AI에도 잘 나오나요?

A 그렇게 볼 근거가 없습니다. 엔진마다 문서를 모으는 경로와 출처를 고르는 방식이 다르고, 연구에서도 인용하는 페이지의 성격과 인용 개수가 엔진별로 크게 갈렸습니다. 한 엔진의 결과로 다른 엔진을 추정하지 말고 각각 확인해야 합니다.

Q Perplexity가 점수 낮은 페이지를 인용한다면 나쁜 엔진인가요?

A 그렇게 읽으면 안 됩니다. GEO-16 연구에서 Perplexity가 인용한 페이지의 평균 점수가 0.300으로 낮았던 것은, 그 연구가 정한 16개 기준으로 점수가 낮은 페이지도 인용한다는 뜻입니다. 엔진마다 고르는 기준이 다르다는 증거이지, 품질의 우열을 말해 주지는 않습니다.

Q 엔진별 인용률을 한 숫자로 합쳐서 보고해도 되나요?

A 합산 숫자만 내면 안 됩니다. 인용 품질 차이의 대부분을 제공사 차이가 설명한다면, 합산값은 어느 엔진에서 무엇이 달라졌는지를 지워 버립니다. 엔진별로 따로 기록하고, 합산 지표는 그다음에 분모와 함께 냅니다.

함께 읽으면 좋은 글

SERVICES

서비스 바로가기

전체 서비스 자세히 보기
무료진단 전화상담 이메일 블로그