통계·인용 추가 같은 GEO 기법은 정말 효과가 있나요?
요약
어떤 환경에서 쟀느냐에 따라 결과가 갈립니다. GEO 원 논문은 자체 벤치마크에서 가시성을 최대 40% 높였다고 했지만, 검색·재순위·생성 단계를 모두 넣은 SAGEO Arena에서는 본문만 고친 문서가 검색 단계에서 오히려 9% 덜 걸렸습니다. 문구 최적화가 무의미하다는 뜻이 아니라 검색을 통과한 다음에야 의미가 있다는 뜻입니다. 같은 기법을 모든 문서에 똑같이 적용하는 것도 근거가 약합니다.
같은 질문에 세 논문이 다른 답을 냈습니다
“콘텐츠 문구를 AI 친화적으로 고치면 인용이 올라가는가”는 GEO 업계의 기본 전제입니다. 이 질문에 대한 연구 결과는 한 방향이 아닙니다.
| 논문 | 결론 | 잰 환경 | 빠진 단계 |
|---|---|---|---|
| GEO 원 논문 (KDD 2024) | 오른다 — 가시성 최대 40% | 저자들이 만든 벤치마크 GEO-bench | 실제 검색·재순위 |
| SAGEO Arena (KDD 2026) | 현실 파이프라인에서는 떨어졌다 | 검색(BM25) → 재순위 → 생성, 질의 2,700개 · 문서 171,003건 | 없음 |
| AgenticGEO (프리프린트) | 고정 규칙이라 그렇고, 문서마다 바꾸면 오른다 | 오픈 모델(Qwen·Llama) 생성 단계 | 실제 검색·재순위 |
왜 갈리나 — 검색 단계가 있느냐 없느냐
효과를 보고한 두 논문은 모두 검색·재순위 단계가 빠진 환경에서 쟀습니다. 문서가 이미 후보로 주어진 상태에서 생성 모델이 무엇을 인용하는지를 본 것입니다.
SAGEO Arena는 그 단계를 넣고 같은 계열 방법을 재현했습니다. 본문만 고친 문서는 이렇게 됐습니다.
| 단계 | 고치기 전 → 후 | 변화 |
|---|---|---|
| 검색 (Hit@20) | 0.58 → 0.53 | -9% |
| 재순위 (Hit@10) | 1.00 → 0.84 | -16% |
| 생성 (인용률) | 0.50 → 0.47 | -6% |
생성 단계에 맞춰 고친 문구가 앞 단계인 검색·재순위에서 오히려 불리하게 작용한 셈입니다. 반대로 본문 대신 구조 정보를 손본 조건에서는 검색 적중이 22% 올랐고, 단계별로 나눠 최적화한 제안 방법은 검색 Hit@20 0.75, 생성 인용률 0.58을 냈습니다. 다만 이것도 재순위·생성 모델을 특정 모델로 고정한 한 가지 구성의 결과이고, 저자들은 질문 표현이 바뀌면 대응력이 떨어진다는 한계를 밝혔습니다.
체크리스트를 모든 문서에 똑같이 적용하면
AgenticGEO는 다른 각도에서 같은 경고를 합니다. 키워드 추가 · 권위성 강조 · 인용 추가 · 통계 추가 같은 고정 규칙이 샘플의 절반가량에서 최적화에 실패한다는 것입니다. 저자들이 제안한 방법은 문서마다 전략을 바꿔 기존 최고 방법보다 나은 점수를 냈지만, 평가 대상이 상용 답변엔진이 아닌 오픈 모델이라 그 개선폭을 실제 서비스의 인용률로 옮길 수는 없습니다.
그래서 이 논문에서 가져올 것은 수치가 아니라 방향입니다. 문서마다 처방이 달라야 한다는 것입니다. 정의를 묻는 질문에 답하는 페이지에 통계를 억지로 끼워 넣는 것은 도움이 되지 않을 수 있습니다.
실무에서의 순서
- 검색을 통과하는지부터 — 색인되지 않은 문서는 후보에도 오르지 못합니다. 서치콘솔 제외 사유와 AI 크롤러 허용이 먼저입니다
- 문서 구조 — 질문형 제목, 바로 아래의 직답, 표와 목록처럼 기계가 경계를 알 수 있는 구조
- 문단의 내용 — 그 질문에 필요한 것이 수치인지 절차인지 비교인지 보고 그에 맞게 씁니다. 방법은 AI가 인용하는 글에 있습니다
제안서에서 “논문에 따르면 40% 오른다”는 문장을 보시면 어느 환경에서 잰 값인지 물어보시면 됩니다. 수치를 검증하는 질문은 대행사가 말하는 성과 수치, 어디까지 믿을 수 있나에, 45편을 검토한 서베이 해석은 GEO 연구 45편 분석에, 세 논문을 나란히 놓은 나비랑의 판단은 주장 대조표에 있습니다.
우리 사이트에서 어느 단계가 막혀 있는지부터 보고 싶으시면 무료 AEO 진단에서 확인해 드립니다.
자주 묻는 질문
Q 'GEO 하면 AI 노출 40% 증가'는 틀린 말인가요?
A 조건을 떼면 틀린 말이 됩니다. 40%는 GEO를 처음 제안한 논문이 직접 만든 벤치마크(GEO-bench) 안에서 보고한 최대값이고, ChatGPT나 Perplexity 같은 실제 서비스에서 보장되는 수치가 아닙니다. 논문도 그렇게 주장하지 않았습니다.
Q 그러면 본문 문구는 손대지 않아도 되나요?
A 그런 뜻은 아닙니다. 검색 단계를 통과한 문서 사이에서는 문구와 문단 구조가 인용에 영향을 줄 수 있습니다. 다만 순서가 있습니다. 색인되지 않았거나 검색에서 걸리지 않는 문서는 문구를 아무리 다듬어도 생성 단계까지 가지 못합니다.
Q 업체가 체크리스트대로 모든 페이지에 통계와 인용을 넣자고 합니다.
A 근거가 약한 제안입니다. AgenticGEO 연구는 키워드·인용·통계 추가 같은 고정 규칙이 샘플의 절반가량에서 최적화에 실패한다고 지적했습니다. 페이지마다 그 질문에 필요한 것이 수치인지, 절차인지, 비교인지 먼저 봐야 합니다.
함께 읽으면 좋은 글
- AI 답변을 조작해서 우리 회사를 넣을 수 있나요? AI 검색 개요의 선택을 끌어올 수 있다는 연구는 있지만 근거가 약하고, 나비랑은 그 방식을 쓰지 않습니다. 연구가 실제로 보인 것과 보이지 못한 것, 조작 영업을 가려내는 법, 그리고 조작 논의에서 실무로 가져올 관찰 하나를 정리했습니다.
- 같은 질문을 다시 물으면 답이 달라집니다 — 측정은 어떻게 설계하나 같은 질문에 AI가 매번 다르게 답하는 이유를 단계별로 나누고, 한 번의 관측을 근거로 쓰면 왜 틀리는지, 질문 세트 고정·반복 관측·엔진 분리·조건 기록이라는 측정 설계의 최소 조건 네 가지를 정리했습니다.
- 2023~2026 GEO 연구 45편 분석: AI 검색 노출에 실제로 중요한 것은 무엇인가? 2026년 공개된 GEO critical survey(45편 검토)를 바탕으로 Discoverability와 Citation의 차이, '가시성 40% 증가'의 정확한 의미, 재현성이 확인된 요소와 반복 측정 프로토콜을 실무 관점에서 해석했습니다.