Divergent Recommendations, Convergent Diagnoses: Cross-Provider Failure-Mode Convergence in AI Commercial Recommendation
ChatGPT와 Claude 사이의 구체적인 제품 추천 방식에는 상당한 차이가 있음에도 불구하고, 본 연구는 이들 AI 제공업체가 공동 추천 실패의 근본 원인을 진단하는 데 있어 거의 완벽한 일치도(95.1%)를 보인다는 점을 밝혀냈으며, 이는 최상위 브랜드의 경우 제공업체별로 특화된 최적화 전략이 필요할 수 있으나 롱테일 브랜드의 경우에는 근본 원인을 해결하기 위한 통일된 접근 방식이 매우 효과적임을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 질문: AI 어시스턴트들은 서로 의견이 일치할까요?
당신이 유명한 브랜드(나이키나 동네 빵집 같은)라고 상상해 보세요. 당신은 사람들이 ChatGPT(OpenAI)나 Claude(Anthropic) 같은 AI 어시스턴트에게 조언을 구할 때 당신의 제품이 추천되기를 원합니다.
저자들이 던진 핵심 질문은 이것입니다: "만약 내가 ChatGPT를 위해 마케팅을 수정한다면, 그것이 Claude에도 자동으로 적용될까?" 아니면 완전히 다른 두 가지 전략이 필요할까요?
이를 알아내기 위해 그들은 대규모 실험을 진행했습니다. 그들은 두 AI에게 제품에 관한 215개의 질문을 동일하게 던졌고, 그들이 무엇을 추천하는지 관찰했습니다.
첫 번째 발견: 그들은 서로 다른 승자를 선택합니다
비유: 두 명의 서로 다른 음식 평론가(셰프 A와 셰프 B)가 500가지 요리가 담긴 메뉴를 리뷰한다고 상상해 보세요.
- 결과: 상위 10가지 요리를 고르라는 요청을 받았을 때, 셰프 A와 셰프 B가 일치한 요리는 약 3~4개뿐이었습니다. 나머지 6~7개의 요리는 완전히 달랐습니다.
- 논문의 데이터: 두 AI가 브랜드를 추천하는 데 있어 의견이 일치하는 경우는 약 **35%**였습니다. 만약 동일한 AI에게 같은 질문을 두 번 던진다면, 그 AI는 자기 자신과 약 50~60%의 확률로 일치하는 답변을 내놓습니다. 하지만 다른 AI로 바꾸면 추천 결과가 크게 달라집니다.
핵가치: 당신이 큰 브랜드라면, 한 AI에서 통하는 방식이 다른 AI에서도 통할 것이라고 가정해서는 안 됩니다. 그들은 서로 다른 "취향"을 가지고 있습니다.
두 번째 발견: 그들은 '실패하는 이유'에 대해서는 동의합니다
여기서 흥-미로운 점이 등장합니다. 연구자들은 단순히 AI가 무엇을 추천했는지만 본 것이 아니라, 무엇을 놓쳤는지를 살펴보았습니다.
그들은 "누락된" 브랜드들을 세 가지 유형의 실패로 분류했습니다:
- "들어본 적 없음" (발견 가능성 - Discoverability): AI가 검색 결과에서 해당 브랜드를 전혀 찾지 못했습니다. 이는 마치 도서관 사서가 그 책의 존재 자체를 모르는 것과 같습니다.
- "찾았지만, 마음에 들지 않음" (매력도 - Compellingness): AI가 브랜드를 찾았지만 최종 답변에는 언급하지 않았습니다.
- "언급은 했으나, 선택은 안 함" (포지셔닝 - Positioning): AI가 브랜드를 언급하기는 했지만, 최고의 선택지로 추천하지는 않았습니다.
비유: 두 평론가에게 식당을 추천해달라고 요청했다고 상상해 보세요.
- 만약 그들이 서로 다른 곳을 추천한다면, 그것은 '취향'에 대해 논쟁하고 있는 것입니다.
- 하지만 그들이 특정 로컬 맛집을 추천하지 못했다면, 왜 그러한 걸까요?
결과: 두 AI가 모두 특정 브랜드를 추천하지 못했을 때, 그들은 거의 항상 정확히 같은 이유로 실패했습니다 (95%의 경우).
- 만약 두 AI 모두 브랜드를 놓쳤다면, 대개 두 AI 모두 그 브랜드를 찾을 수 없었기 때문이었습니다 (발견 가능성 문제).
- 그들은 왜 놓쳤는지에 대해 의견이 일치하지 않았습니다. 단지 둘 다 같은 이유로 놓쳤을 뿐입니다.
"롱테일(Long Tail)" 효과:
이 일치성은 규모가 작고 덜 유명한 브랜드(롱테일)로 갈수록 더 강력해집니다.
- 유명 브랜드 (상위 계층): AI들은 왜 그들을 놓쳤는지에 대해 더 자주 의견이 엇갈렸습니다 (예를 들어, 한 명은 봤지만 마음에 안 들어 했고, 다른 한 명은 아예 못 봤을 수도 있음).
- 무명 브랜드 (롱테일): AI들은 그 브랜드를 단순히 찾을 수 없었다는 점에 대해 **99.6%**의 확률로 일치했습니다.
그들의 사고방식: 같은 목적지에 도달하는 서로 다른 길
논문은 또한 AI가 어떻게 선택을 내리는지(방법)를 살펴보았습니다.
- OpenAI (ChatGPT): 연구자와 같습니다. 이 모델은 거의 항상 먼저 웹을 검색하고, 결과를 읽은 다음, 그 후에 추천을 합니다. 검색을 통해 찾아낸 정보에 크게 의존합니다.
- Anthropic (Claude): 박식한 교수님과 같습니다. 이 모델은 종종 자신의 학습 데이터(기억)에 의존합니다. 웹 검색을 먼저 수행하지 않고도 43~52%의 확률로 브랜드를 추천합니다.
비유:
- ChatGPT는 질문에 답하기 전에 교과서를 펼쳐보는 학생과 같습니다.
- Claude는 확신이 서지 않을 때만 교과서를 펼치는, 기억에 의존해 답하는 학생과 같습니다.
이러한 방식(검색 vs 기억)의 차이에도 불구하고, 그들은 유명하지 않은 브랜드들을 똑같이 놓치게 되는데, 그 이유는 그 브랜드들이 교과서에도 없고 그들이 검색하는 웹 페이지에도 존재하지 않기 때문입니다.
브랜드들을 위한 실질적인 조언
이러한 발견을 바탕으로, 논문은 브랜드들을 위한 구체적인 전략을 제안합니다:
작고 잘 알려지지 않은 브랜드들을 위해 (롱테일):
- 문제점: AI들이 당신을 찾지 못하고 있습니다.
- 해결책: 당신은 단 하나의 전략만 있으면 됩니다. 만약 당신이 웹상에서 당신의 브랜드를 더 찾기 쉽게 만든다면(더 나은 SEO, 더 많은 기사 등), 두 AI 모두 당신을 추천하기 시작할 것입니다. ChatGPT 대 Claude로 나누어 메시지를 맞출 필요 없이, 그저 "발견 가능성" 문제를 해결하면 두 곳 모두에 효과가 있습니다.
크고 유명한 브랜드들을 위해 (상위 계층):
- 문제점: AI들이 당신을 찾을 수는 있지만, 서로 다른 이유로 추천하지 않을 수 있습니다 (예를 들어, 한 곳은 당신의 콘텐츠가 지루하다고 생각하고, 다른 한 곳은 포지셔닝이 약하다고 생각할 수 있음).
- 해결책: 당신은 두 가지 서로 다른 전략이 필요합니다. ChatGPT가 당신을 추천하게 만드는 방식이 Claude에게는 통하지 않을 수 있습니다. 그들을 서로 다른 타겟 오디언스로 대우해야 합니다.
요약
- 추천: AI들은 서로 다른 승자를 선택합니다 (의견이 불일치함).
- 실패: 두 AI가 모두 브랜드를 놓쳤을 때, 그들은 보통 같은 이유로 놓칩니다 (의견이 일치함).
- 해결책: 당신이 작은 브랜드라면, "가시성"을 한 번만 개선하면 어디서든 효과를 볼 수 있습니다. 만약 당신이 큰 브랜드라면, 각 특정 AI에 맞춰 메시지를 미세하게 조정해야 할 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.