AI가 출처를 달았으면 그 내용은 믿어도 되나요?
요약
출처가 달렸다는 것만으로는 믿을 수 없습니다. 10개 모델의 인용 761,495건을 검증한 연구에서 30.6%가 출처의 내용을 왜곡했고, 구글 AI 개요의 주장 98,020개를 본 연구에서는 5.3~11.0%가 인용된 페이지로 뒷받침되지 않았습니다. 브랜드 입장에서는 인용됐는지와 별개로, 우리 출처를 달고 나간 문장이 실제로 우리 페이지에 있는 말인지 따로 확인해야 합니다.
출처가 진짜여도 내용은 틀릴 수 있습니다
AI 답변의 출처 링크를 눌러 보면 페이지는 대개 멀쩡히 열립니다. 그래서 “출처가 있으니 맞겠지”라고 넘어가기 쉽습니다. 2026년에 나온 두 연구는 바로 그 전제를 검증했습니다.
| 인용 실패 연구 | 구글 AI 개요 측정 | |
|---|---|---|
| 연구진 | 연세대·건국대·이화여대 등 | 워싱턴대(세인트루이스) |
| 대상 | 5개 제공사(OpenAI·Anthropic·Google·xAI·Perplexity)의 모델 10종 | 미국 구글 AI 개요 |
| 규모 | Stack Exchange 실제 질문 11,200건 · 인용 쌍 761,495건 | 질의 55,393건 · 원자적 주장 98,020개 |
| 핵심 결과 | 인용의 30.6%가 출처 내용을 왜곡 · 27.1%가 그 분야에 맞지 않는 출처 | 주장의 5.3~11.0%가 인용 페이지로 뒷받침되지 않음 |
| 수치의 방향 | 저자들이 보수적 하한이라고 밝힘 — 실제는 더 높을 수 있음 | 저자들이 부풀려졌을 수 있다고 밝힘 — 하한 약 5.3% |
두 수치는 서로 반대 방향의 단서를 달고 있습니다. 하나는 “이보다 높을 수 있다”, 다른 하나는 “이보다 낮을 수 있다”입니다. 그래서 둘을 나란히 놓고 어느 쪽이 맞다고 고를 수 없고, 한쪽 숫자만 떼어 인용하면 저자의 뜻을 왜곡하게 됩니다. 그럼에도 대상이 다른 두 연구가 같은 방향을 가리킨다는 점은 분명합니다.
엔진마다 차이가 큽니다
인용 실패 연구에서 인용 품질 차이의 88~96%를 제공사 차이가 설명했습니다. 어느 엔진에 물었느냐가 결과를 크게 가른다는 뜻입니다. 한 엔진에서 우리 회사가 정확히 인용됐다고 다른 엔진에서도 그렇다고 볼 수 없습니다. 이 차이는 엔진마다 인용 기준이 다른가에서 따로 다뤘습니다.
브랜드에 뜻하는 것
- 인용됐다고 안심할 수 없습니다 — 우리 페이지에 없는 말이 우리 출처를 달고 나갈 수 있습니다. 인용 횟수만 세는 측정은 이것을 성과로 잘못 셉니다
- 경쟁사에 대한 틀린 서술도 같은 방식으로 돕니다 — 비교 질문에서 AI가 경쟁사 출처를 달고 우리에 대해 부정확하게 말할 수도 있습니다
- 사실을 한 문단에 완결되게 적어 둔 페이지가 방어선입니다 — 가격·서비스 범위·연혁처럼 틀리기 쉬운 사실은 조건과 함께 한 자리에 모아 둡니다
어떻게 확인하나
측정할 때 인용 여부 옆에 칸을 하나 더 둡니다.
| 답변 문장 | 붙은 출처 | 그 페이지에 그 사실이 있나 |
|---|---|---|
| AI가 쓴 문장 그대로 | 링크 주소 | 있음 / 다르게 있음 / 없음 |
“다르게 있음”과 “없음”이 정정 대상입니다. 정정 절차는 AI가 우리 브랜드 정보를 틀리게 답할 때에 단계별로 정리했습니다.
두 연구 모두 한국어 데이터가 아닙니다. 인용 실패 연구는 기술 Q&A 질문, AI 개요 연구는 미국 구글 기준입니다. 국내 업종 질문에서 같은 비율이 나온다는 보장은 없으므로 비율은 직접 재야 합니다. 원문 조건은 인용 실패 연구 정리와 AI 개요 측정 정리에 있고, 두 연구를 나란히 놓은 판단은 주장 대조표에 있습니다.
우리 회사에 대한 AI 답변이 정확한지 엔진별로 대조해 보고 싶으시면 무료 AEO 진단에서 시작하실 수 있습니다.
자주 묻는 질문
Q AI가 없는 출처를 지어내는 문제와 같은 이야기인가요?
A 다릅니다. 여기서 다루는 것은 실제로 존재하고 접근할 수 있는 출처를 인용하면서도, 그 출처의 내용을 왜곡하거나 그 분야에 맞지 않는 출처를 가져오는 경우입니다. 링크를 눌러 보면 페이지는 멀쩡히 열리기 때문에 오히려 알아차리기 어렵습니다.
Q 30.6%와 11.0% 중 어느 쪽이 맞나요?
A 둘 다 각자의 조건에서 맞고, 서로 비교할 수 있는 숫자가 아닙니다. 30.6%는 기술 Q&A 질문에 대한 10개 모델의 인용을 본 값이고 저자들은 보수적인 하한이라고 밝혔습니다. 11.0%는 미국 구글 AI 개요의 주장 단위 값이고, 저자들은 소셜미디어를 크롤에서 뺀 탓에 부풀려졌을 수 있다며 하한을 약 5.3%로 제시했습니다.
Q 우리 회사에 대해 틀린 말이 우리 사이트 링크를 달고 나오면 어떻게 하나요?
A 먼저 답변 문장, 붙은 출처 주소, 그 페이지에 실제로 적힌 내용을 나란히 기록합니다. 우리 페이지에 없는 말이 붙어 있다면, 해당 사실을 한 문단 안에서 완결되게 명시한 페이지를 만들거나 기존 문단을 고쳐 다시 색인시킵니다. AI에 직접 정정을 요청하는 창구는 없습니다.
함께 읽으면 좋은 글
- AI 답변에 인용된 것과 실제로 쓰인 것은 다른가요? 출처 목록에 우리 페이지가 올라가도 답변 문장은 다른 문서에서 나올 수 있습니다. 인용 21,143건을 분석한 연구가 나눈 '인용 선택'과 '인용 흡수'의 차이, 흡수되는 페이지의 특징, 측정에 넣을 때의 주의점을 정리했습니다.
- AI가 우리 브랜드 정보를 틀리게 답합니다. 어떻게 고치나요? 가격·서비스·연혁이 사실과 다르게 답변되는 문제를 다룹니다. 원인은 대개 공신력 있는 출처에 정확한 정보가 없거나 오래된 정보가 더 잘 참조되는 것이고, AI 에 직접 정정을 요청하는 방법은 없습니다. 정정 근거가 될 페이지를 만들고 재인용까지 추적하는 절차를 정리했습니다.
- AEO·GEO 대행사, 무엇을 확인하고 골라야 하나요? — 15곳을 같은 기준으로 봤습니다 국내 AEO·GEO 대행사 15곳의 공개 페이지 71장을 같은 기준으로 확인했습니다. 원본 데이터를 공개한 곳은 0곳, 조건 없는 성과 수치를 내건 곳은 10곳이었습니다. 발행자인 나비랑이 앞선 기준과 뒤진 기준을 함께 적었습니다.