본문 바로가기

통계·인용 추가 같은 GEO 기법은 정말 효과가 있나요?

나비랑 발행 GEO논문 분석콘텐츠방법론

요약

어떤 환경에서 쟀느냐에 따라 결과가 갈립니다. GEO 원 논문은 자체 벤치마크에서 가시성을 최대 40% 높였다고 했지만, 검색·재순위·생성 단계를 모두 넣은 SAGEO Arena에서는 본문만 고친 문서가 검색 단계에서 오히려 9% 덜 걸렸습니다. 문구 최적화가 무의미하다는 뜻이 아니라 검색을 통과한 다음에야 의미가 있다는 뜻입니다. 같은 기법을 모든 문서에 똑같이 적용하는 것도 근거가 약합니다.

같은 질문에 세 논문이 다른 답을 냈습니다

“콘텐츠 문구를 AI 친화적으로 고치면 인용이 올라가는가”는 GEO 업계의 기본 전제입니다. 이 질문에 대한 연구 결과는 한 방향이 아닙니다.

논문결론잰 환경빠진 단계
GEO 원 논문 (KDD 2024)오른다 — 가시성 최대 40%저자들이 만든 벤치마크 GEO-bench실제 검색·재순위
SAGEO Arena (KDD 2026)현실 파이프라인에서는 떨어졌다검색(BM25) → 재순위 → 생성, 질의 2,700개 · 문서 171,003건없음
AgenticGEO (프리프린트)고정 규칙이라 그렇고, 문서마다 바꾸면 오른다오픈 모델(Qwen·Llama) 생성 단계실제 검색·재순위

왜 갈리나 — 검색 단계가 있느냐 없느냐

효과를 보고한 두 논문은 모두 검색·재순위 단계가 빠진 환경에서 쟀습니다. 문서가 이미 후보로 주어진 상태에서 생성 모델이 무엇을 인용하는지를 본 것입니다.

SAGEO Arena는 그 단계를 넣고 같은 계열 방법을 재현했습니다. 본문만 고친 문서는 이렇게 됐습니다.

단계고치기 전 → 후변화
검색 (Hit@20)0.58 → 0.53-9%
재순위 (Hit@10)1.00 → 0.84-16%
생성 (인용률)0.50 → 0.47-6%

생성 단계에 맞춰 고친 문구가 앞 단계인 검색·재순위에서 오히려 불리하게 작용한 셈입니다. 반대로 본문 대신 구조 정보를 손본 조건에서는 검색 적중이 22% 올랐고, 단계별로 나눠 최적화한 제안 방법은 검색 Hit@20 0.75, 생성 인용률 0.58을 냈습니다. 다만 이것도 재순위·생성 모델을 특정 모델로 고정한 한 가지 구성의 결과이고, 저자들은 질문 표현이 바뀌면 대응력이 떨어진다는 한계를 밝혔습니다.

체크리스트를 모든 문서에 똑같이 적용하면

AgenticGEO는 다른 각도에서 같은 경고를 합니다. 키워드 추가 · 권위성 강조 · 인용 추가 · 통계 추가 같은 고정 규칙이 샘플의 절반가량에서 최적화에 실패한다는 것입니다. 저자들이 제안한 방법은 문서마다 전략을 바꿔 기존 최고 방법보다 나은 점수를 냈지만, 평가 대상이 상용 답변엔진이 아닌 오픈 모델이라 그 개선폭을 실제 서비스의 인용률로 옮길 수는 없습니다.

그래서 이 논문에서 가져올 것은 수치가 아니라 방향입니다. 문서마다 처방이 달라야 한다는 것입니다. 정의를 묻는 질문에 답하는 페이지에 통계를 억지로 끼워 넣는 것은 도움이 되지 않을 수 있습니다.

실무에서의 순서

  1. 검색을 통과하는지부터 — 색인되지 않은 문서는 후보에도 오르지 못합니다. 서치콘솔 제외 사유와 AI 크롤러 허용이 먼저입니다
  2. 문서 구조 — 질문형 제목, 바로 아래의 직답, 표와 목록처럼 기계가 경계를 알 수 있는 구조
  3. 문단의 내용 — 그 질문에 필요한 것이 수치인지 절차인지 비교인지 보고 그에 맞게 씁니다. 방법은 AI가 인용하는 글에 있습니다

제안서에서 “논문에 따르면 40% 오른다”는 문장을 보시면 어느 환경에서 잰 값인지 물어보시면 됩니다. 수치를 검증하는 질문은 대행사가 말하는 성과 수치, 어디까지 믿을 수 있나에, 45편을 검토한 서베이 해석은 GEO 연구 45편 분석에, 세 논문을 나란히 놓은 나비랑의 판단은 주장 대조표에 있습니다.

우리 사이트에서 어느 단계가 막혀 있는지부터 보고 싶으시면 무료 AEO 진단에서 확인해 드립니다.

자주 묻는 질문

Q 'GEO 하면 AI 노출 40% 증가'는 틀린 말인가요?

A 조건을 떼면 틀린 말이 됩니다. 40%는 GEO를 처음 제안한 논문이 직접 만든 벤치마크(GEO-bench) 안에서 보고한 최대값이고, ChatGPT나 Perplexity 같은 실제 서비스에서 보장되는 수치가 아닙니다. 논문도 그렇게 주장하지 않았습니다.

Q 그러면 본문 문구는 손대지 않아도 되나요?

A 그런 뜻은 아닙니다. 검색 단계를 통과한 문서 사이에서는 문구와 문단 구조가 인용에 영향을 줄 수 있습니다. 다만 순서가 있습니다. 색인되지 않았거나 검색에서 걸리지 않는 문서는 문구를 아무리 다듬어도 생성 단계까지 가지 못합니다.

Q 업체가 체크리스트대로 모든 페이지에 통계와 인용을 넣자고 합니다.

A 근거가 약한 제안입니다. AgenticGEO 연구는 키워드·인용·통계 추가 같은 고정 규칙이 샘플의 절반가량에서 최적화에 실패한다고 지적했습니다. 페이지마다 그 질문에 필요한 것이 수치인지, 절차인지, 비교인지 먼저 봐야 합니다.

함께 읽으면 좋은 글

SERVICES

서비스 바로가기

전체 서비스 자세히 보기
무료진단 전화상담 이메일 블로그