PAPER
구글 AI 개요 대규모 측정 — 언제 뜨고, 무엇을 인용하고, 그 인용이 맞는가
구글 AI 개요는 어떤 질의에서 뜨고, 어떤 출처를 인용하며, 그 인용이 실제로 주장을 뒷받침하는가?
Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact
- 저자
- Haofei Xu · Umar Iqbal · Jacob M. Montgomery
- 소속
- 워싱턴대학교 세인트루이스(Washington University in St. Louis)
- 게재
- arXiv 프리프린트
- 제출
- 2026-05-13
- arXiv
- arXiv:2605.14021
- 나비랑 확인일
- 2026-08-24
이 논문이 말하는 것
질문형 질의에서 특히 자주 떴고, 인용 출처는 일반 검색 결과보다 신뢰도가 높았지만, 생성된 주장의 상당 부분이 인용된 페이지로 뒷받침되지 않았습니다. 40일간 질의 55,393건을 관측한 결과 AI 개요 활성화율은 전체 13.7%, 질문형 질의에서는 64.7%였습니다. 원자적 주장 98,020개 중 11.0%가 인용 페이지의 뒷받침을 받지 못했고, 저자들은 크롤 제외 때문에 이 값이 부풀려졌을 수 있어 하한은 약 5.3%라고 밝혔습니다.
원문 보기 (arXiv) ↗METHOD
어떻게 쟀나
수치를 읽기 전에 조건을 먼저 봅니다. 같은 숫자도 표본과 환경이 다르면 다른 뜻입니다.
- 질의
- 트렌딩 질의 55,393건 · 19개 주제 카테고리
- 기간
- 40일 (2026-03-13 ~ 04-21)
- 주장 검증
- AI 개요를 자기완결적 사실 단위로 쪼갠 뒤(대명사를 실체명으로 치환·중복 제거) Clear / Vague / Ambiguous / Incorrect / Omitted 다섯으로 분류
- 검증 정확도
- 사람 주석 대비 파이프라인 정확도 95.6%
FINDINGS
무엇이 나왔나
- 활성화율
- 전체 질의의 13.7%, 질문형 질의에서는 64.7%. 정치적으로 민감한 주제에서는 뚜렷하게 낮았다
- 주장 충실도
- 원자적 주장 98,020개 중 11.0% 가 인용된 페이지로 뒷받침되지 않음
- ⚠️ 그 11.0% 의 조건
- 저자들이 페이스북·인스타그램·Reddit·틱톡·X·유튜브를 크롤 대상에서 제외했고, 그 때문에 값이 부풀려졌을 수 있어 하한을 약 5.3% 로 제시했다. 즉 실제 값은 5.3~11.0% 구간으로 읽어야 한다
- 출처 품질
- AI 개요가 인용한 도메인의 평균 신뢰도 0.732 vs 같은 화면 1페이지 결과 0.645 — 0~1 척도에서 +0.087 차이. 즉 인용 출처는 일반 결과보다 신뢰도가 높은 쪽으로 치우친다
- 퍼블리셔
- AI 개요가 인용한 페이지의 절반을 훨씬 넘는 비율이 디스플레이 광고를 싣고 있었다
LIMITATIONS
논문이 스스로 밝힌 한계
우리가 지적한 것이 아니라 저자들이 논문에 적어 둔 내용입니다.
- 소셜미디어(페이스북·인스타그램·Reddit·틱톡·X·유튜브)를 크롤에서 제외해 미뒷받침 주장 비율이 부풀려졌을 수 있다 — 하한은 약 5.3%.
- 페이월 페이지 262건(<1%)은 보이는 부분만 수집했다.
- 날씨·휴교처럼 실시간으로 바뀌는 질의는 크롤러가 몇 시간~며칠 뒤에 잡아 값이 이미 달라져 있었다.
- 상업적 의도 질의의 비중이 낮아 광고 동시노출에 대한 결론이 제한된다.
- 별도의 Limitations 절을 두지 않고 본문 곳곳에서 한계를 다룬다.
나비랑의 해석 — 논문의 결론이 아닙니다
두 수치를 실무에서 가장 자주 쓰게 될 것 같습니다. 하나는 **질문형 질의에서 활성화 64.7%** — 회사 소개나 상품 목록이 아니라 질문에 답하는 문서를 만들어야 하는 이유가 숫자로 나온 셈입니다. 다른 하나는 **주장의 5.3~11.0%가 인용 출처로 뒷받침되지 않는다** 는 것입니다. 이건 우리가 오정보 정정 작업에서 계속 만나던 현상에 규모를 붙여 줍니다 — 출처 링크가 붙어 있다고 해서 그 문장이 그 출처에서 나온 것은 아닙니다. 다만 이 논문을 인용할 때 11.0%만 떼어 쓰면 저자의 뜻을 왜곡하는 것입니다. 그리고 전부 미국 구글 기준이라 네이버 AI 검색이나 한국어 질의에는 확인된 바가 없습니다.
IN COMPARISON
다른 논문과 갈리는 지점
이 논문이 등장하는 주장 대조표 항목입니다.
논문 말고 우리 브랜드의 값이 궁금하시다면
여기 있는 수치는 다른 표본에서 나온 것입니다. 홈페이지 주소만 주시면 답변엔진 7개에 직접 물어 우리 브랜드의 값을 재 드립니다.
영업일 기준 1일 내 회신드립니다.