← 매거진 목록
LISTAI MAGAZINE · 측정 노트 #06

같은 질문, 같은 날, 4개의 다른 시장 — 엔진 합의율 0%와 인용 표시의 비대칭

비브랜드 질문 47개를 같은 날 4개 엔진에 동시에 입력했다. 네 엔진이 공통으로 지목한 업체가 있는 질문은 0개였고, 두 엔진이라도 하나라도 겹친 질문은 12개(25.5%)에 그쳤다. 인용 도메인 618개 중 510개(83%)는 단 한 엔진에만 나타났다. 게다가 인용을 드러내는 방식 자체가 엔진마다 다르다 — Perplexity는 응답 100%에 출처를 달았고, Gemini는 133건 전부를 리다이렉터로 표기해 원문 도메인을 알 수 없게 했다. "AI 검색 노출"은 단일 시장이 아니다.

리스트AI · 2026-08-06 · 측정일 2026-08-03 · 응답 200건
원본 데이터는 공개 실측 리포트에 전량 있습니다.

"4엔진 측정합니다"라는 문장은 업계에서 사양처럼 쓰인다. 그런데 네 엔진이 같은 것을 재고 있다면 4엔진은 정확도를 높이는 중복 측정이고, 다른 것을 재고 있다면 4엔진은 서로 다른 네 개의 시장을 각각 재는 일이다. 어느 쪽인지는 재보면 알 수 있다.


1 인용을 드러내는 방식부터 다르다

엔진별 인용 표시 · 2026-08-03 · 엔진당 응답 50건, 전부 웹검색 도구 켜짐
엔진인용이 달린 응답유효 인용응답당표시 방식
Perplexity sonar50 / 50 (100%)98419.7답변에 출처 각주를 상시 표기
Claude claude-sonnet-547 / 50 (94%)95019.0검색 도구를 쓴 응답에 인용 표기
ChatGPT gpt-528 / 50 (56%)57911.6검색이 트리거된 응답에만 링크
Gemini gemini-3-flash0 / 50 (0%)00133건을 표기했으나 전부 vertexaisearch 리다이렉터

마지막 행이 이 표의 핵심이다. Gemini도 인용을 표기하긴 한다 — 133건이 잡혔다. 그런데 133건 전부vertexaisearch.cloud.google.com으로 시작하는 중계 주소였다. 원문이 어느 사이트였는지가 주소에 남지 않는다.

그래서 우리 집계에서 Gemini의 인용 기여도는 0이다. 이건 Gemini가 문서를 안 읽었다는 뜻이 아니라 어느 문서를 읽었는지 밖에서 알 수 없다는 뜻이다. 바꿔 말해, 이 노트와 노트 #02의 인용 통계는 실질적으로 3엔진 통계다. 이 사실을 밝히지 않고 "4엔진 인용 분석"이라고 부르면 과장이 된다.

측정 도구를 검토할 때 물어볼 질문 — "제미나이 인용 URL을 원문 도메인으로 보여줍니까, 아니면 구글 리다이렉터 주소로 보여줍니까?" 후자라면 그 도구의 제미나이 인용 표는 전부 구글이 1위다.

2 합의율 — 네 엔진이 같은 업체를 지목한 질문은 0개

질문마다 각 엔진이 지목한 업체 집합을 만들고 교집합을 셌다. 집계에서 플랫폼 이름과 질문에 이미 있던 이름은 제외했다 (노트 #04의 되받기 규칙).

엔진 간 합의 · 비브랜드 47문항
기준해당 질문비율
4엔진이 공통으로 지목한 업체가 하나라도 있는 질문00%
3엔진이 공통으로 지목한 업체가 있는 질문12.1%
2엔진이라도 공통으로 지목한 업체가 있는 질문1225.5%
어떤 두 엔진도 겹치지 않은 질문3574.5%

엔진을 두 개씩 짝지어 계산한 평균 자카드 유사도는 2.0%였다(짝 204개). 질문 하나당 네 엔진이 도합 평균 9.7개 업체를 언급하는데, 그 9.7개가 거의 겹치지 않고 흩어진다는 뜻이다.

인용 도메인에서도 같다

엔진 간 인용 도메인 겹침 (Gemini 제외 — 원문 도메인 없음)
엔진 쌍공통 도메인합집합자카드
Perplexity × Claude8948318.4%
Perplexity × ChatGPT334816.9%
Claude × ChatGPT263806.8%

전체 618개 인용 도메인 중 세 엔진 모두가 인용한 도메인은 20개, 단 한 엔진에만 나타난 도메인은 510개(83%)였다.


3 엔진마다 다른 "업체"를 떠올린다

겹치지 않는 이유는 무작위가 아니다. 엔진별로 지목 성향이 뚜렷하게 다르다.

엔진별 최다 지목 업체 · 비브랜드 47문항
엔진업체 언급고유 업체상위 지목
Perplexity18997A사 16 · D사 11 · G사 10 · F사 7
→ 국내 GEO 전문 대행사에 집중
Gemini156113K사 15 · L사 7 · D사 4 · O사 3
→ 검색 데이터 분석·퍼포먼스 광고 계열로 치우침
ChatGPT9386해외 SEO 툴 3 · 로컬 등록 서비스 2 · 포털 웹마스터 도구 2
→ 대행사가 아니라 글로벌 SaaS 도구를 답함
Claude5036G사 4 · C사 3 · A사 3 · 해외 GEO 측정 툴 3
→ 언급 자체가 적음. 확신 없으면 업체를 안 댐

ChatGPT의 지목 상위가 해외 SEO 툴·로컬 등록 서비스 같은 도구라는 점이 특징적이다. "AI 검색 노출을 도와주는 곳"을 물으면 대행사가 아니라 소프트웨어를 답한다. Claude는 언급 총량이 50회로 다른 엔진의 3분의 1 이하다 — 업체를 대는 대신 판단 기준을 설명하고 되묻는 응답이 많다.

대표 사례 하나. q30 "병원 GEO 마케팅 어디가 잘해?"에 대해 Perplexity와 Gemini는 A사·D사·I사·M사·N사을 다섯씩 겹쳐 답했는데, ChatGPT와 Claude는 업체를 한 곳도 대지 않았다. 같은 질문에서 두 엔진에는 시장이 있고 두 엔진에는 시장이 없다.


4 해석 — 이게 실무에 뜻하는 것

LIMITATIONS

1회 측정이라 합의율 0%의 상당 부분은 무작위 변동일 수 있다. LLM 응답은 같은 입력에도 매번 달라진다. 같은 엔진을 두 번 부르면 그 둘 사이 겹침도 100%가 아닐 것이다. 엔진 간 겹침(2.0%)이 엔진 내 겹침보다 낮은지를 우리는 아직 확인하지 못했다. 그 비교가 없으면 "엔진이 다르다"와 "응답이 원래 흔들린다"를 가를 수 없다. 이건 이 노트의 가장 큰 약점이고, 반복 측정으로만 해결된다.

다만 인용 도메인 겹침의 비대칭은 무작위로 설명되지 않는다. Perplexity×Claude가 18.4%인데 나머지 두 쌍이 6.8~6.9%라면, 단순 변동이 아니라 검색·선별 계층의 구조적 차이가 있다는 쪽에 가깝다.

Gemini의 0은 측정 실패이지 성능 평가가 아니다. 리다이렉터를 되따라가 원문을 복원하는 작업은 하지 않았다. 하면 Gemini도 집계에 들어온다. 현재 표의 0은 "우리가 아직 못 본다"는 뜻으로 읽어야 한다.

구글 AI 개요와 네이버 AI 브리핑은 이 측정에 없다. API로 잡히지 않는 표면이라 어댑터가 없다. "전부 측정됩니다"라고 말하는 곳이 있다면 그 구간을 어떻게 잡는지 물어볼 만하다.


5 재현 방법

  1. 질문 30개 이상을 준비하고 같은 날 여러 엔진에 던진다. 날짜가 다르면 비교가 무의미하다.
  2. 응답에서 업체명을 추출해 질문×엔진 행렬을 만든다.
  3. 질문마다 엔진 집합의 교집합을 센다. 교집합 ÷ 합집합이 자카드 유사도다.
  4. 인용 도메인으로도 같은 계산을 한다. 리다이렉터는 먼저 걸러낸다 — 안 그러면 Gemini 때문에 겹침이 0으로 나오고, 그건 계산 결과가 아니라 파싱 실패다.
RELATED NOTES
#02 — AI가 인용한 2,513회를 분해했다 #04 — "GEO 대행사 추천"을 ChatGPT는 글로벌 인사대행으로 읽었다 #07 — SEO와 GEO는 다른 게임이다