본문 바로가기

AI가 출처를 달았으면 그 내용은 믿어도 되나요?

나비랑 발행 AEO인용 정확도오정보논문 분석

요약

출처가 달렸다는 것만으로는 믿을 수 없습니다. 10개 모델의 인용 761,495건을 검증한 연구에서 30.6%가 출처의 내용을 왜곡했고, 구글 AI 개요의 주장 98,020개를 본 연구에서는 5.3~11.0%가 인용된 페이지로 뒷받침되지 않았습니다. 브랜드 입장에서는 인용됐는지와 별개로, 우리 출처를 달고 나간 문장이 실제로 우리 페이지에 있는 말인지 따로 확인해야 합니다.

출처가 진짜여도 내용은 틀릴 수 있습니다

AI 답변의 출처 링크를 눌러 보면 페이지는 대개 멀쩡히 열립니다. 그래서 “출처가 있으니 맞겠지”라고 넘어가기 쉽습니다. 2026년에 나온 두 연구는 바로 그 전제를 검증했습니다.

인용 실패 연구구글 AI 개요 측정
연구진연세대·건국대·이화여대 등워싱턴대(세인트루이스)
대상5개 제공사(OpenAI·Anthropic·Google·xAI·Perplexity)의 모델 10종미국 구글 AI 개요
규모Stack Exchange 실제 질문 11,200건 · 인용 쌍 761,495건질의 55,393건 · 원자적 주장 98,020개
핵심 결과인용의 30.6%가 출처 내용을 왜곡 · 27.1%가 그 분야에 맞지 않는 출처주장의 5.3~11.0%가 인용 페이지로 뒷받침되지 않음
수치의 방향저자들이 보수적 하한이라고 밝힘 — 실제는 더 높을 수 있음저자들이 부풀려졌을 수 있다고 밝힘 — 하한 약 5.3%

두 수치는 서로 반대 방향의 단서를 달고 있습니다. 하나는 “이보다 높을 수 있다”, 다른 하나는 “이보다 낮을 수 있다”입니다. 그래서 둘을 나란히 놓고 어느 쪽이 맞다고 고를 수 없고, 한쪽 숫자만 떼어 인용하면 저자의 뜻을 왜곡하게 됩니다. 그럼에도 대상이 다른 두 연구가 같은 방향을 가리킨다는 점은 분명합니다.

엔진마다 차이가 큽니다

인용 실패 연구에서 인용 품질 차이의 88~96%를 제공사 차이가 설명했습니다. 어느 엔진에 물었느냐가 결과를 크게 가른다는 뜻입니다. 한 엔진에서 우리 회사가 정확히 인용됐다고 다른 엔진에서도 그렇다고 볼 수 없습니다. 이 차이는 엔진마다 인용 기준이 다른가에서 따로 다뤘습니다.

브랜드에 뜻하는 것

  • 인용됐다고 안심할 수 없습니다 — 우리 페이지에 없는 말이 우리 출처를 달고 나갈 수 있습니다. 인용 횟수만 세는 측정은 이것을 성과로 잘못 셉니다
  • 경쟁사에 대한 틀린 서술도 같은 방식으로 돕니다 — 비교 질문에서 AI가 경쟁사 출처를 달고 우리에 대해 부정확하게 말할 수도 있습니다
  • 사실을 한 문단에 완결되게 적어 둔 페이지가 방어선입니다 — 가격·서비스 범위·연혁처럼 틀리기 쉬운 사실은 조건과 함께 한 자리에 모아 둡니다

어떻게 확인하나

측정할 때 인용 여부 옆에 칸을 하나 더 둡니다.

답변 문장붙은 출처그 페이지에 그 사실이 있나
AI가 쓴 문장 그대로링크 주소있음 / 다르게 있음 / 없음

“다르게 있음”과 “없음”이 정정 대상입니다. 정정 절차는 AI가 우리 브랜드 정보를 틀리게 답할 때에 단계별로 정리했습니다.

두 연구 모두 한국어 데이터가 아닙니다. 인용 실패 연구는 기술 Q&A 질문, AI 개요 연구는 미국 구글 기준입니다. 국내 업종 질문에서 같은 비율이 나온다는 보장은 없으므로 비율은 직접 재야 합니다. 원문 조건은 인용 실패 연구 정리와 AI 개요 측정 정리에 있고, 두 연구를 나란히 놓은 판단은 주장 대조표에 있습니다.

우리 회사에 대한 AI 답변이 정확한지 엔진별로 대조해 보고 싶으시면 무료 AEO 진단에서 시작하실 수 있습니다.

자주 묻는 질문

Q AI가 없는 출처를 지어내는 문제와 같은 이야기인가요?

A 다릅니다. 여기서 다루는 것은 실제로 존재하고 접근할 수 있는 출처를 인용하면서도, 그 출처의 내용을 왜곡하거나 그 분야에 맞지 않는 출처를 가져오는 경우입니다. 링크를 눌러 보면 페이지는 멀쩡히 열리기 때문에 오히려 알아차리기 어렵습니다.

Q 30.6%와 11.0% 중 어느 쪽이 맞나요?

A 둘 다 각자의 조건에서 맞고, 서로 비교할 수 있는 숫자가 아닙니다. 30.6%는 기술 Q&A 질문에 대한 10개 모델의 인용을 본 값이고 저자들은 보수적인 하한이라고 밝혔습니다. 11.0%는 미국 구글 AI 개요의 주장 단위 값이고, 저자들은 소셜미디어를 크롤에서 뺀 탓에 부풀려졌을 수 있다며 하한을 약 5.3%로 제시했습니다.

Q 우리 회사에 대해 틀린 말이 우리 사이트 링크를 달고 나오면 어떻게 하나요?

A 먼저 답변 문장, 붙은 출처 주소, 그 페이지에 실제로 적힌 내용을 나란히 기록합니다. 우리 페이지에 없는 말이 붙어 있다면, 해당 사실을 한 문단 안에서 완결되게 명시한 페이지를 만들거나 기존 문단을 고쳐 다시 색인시킵니다. AI에 직접 정정을 요청하는 창구는 없습니다.

함께 읽으면 좋은 글

SERVICES

서비스 바로가기

전체 서비스 자세히 보기
무료진단 전화상담 이메일 블로그