← 최신 논문
📊 statistics

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

본 연구는 멀티모달 거대언어모델(LLM)이 신뢰할 수 없는 레이블에 대한 공통된 편향으로 인해 스크린샷만으로는 실제 A/B 테스트 결과를 안정적으로 예측할 수 없음을 보여주지만, 불확실한 사례를 식별하고 이를 기권하도록 예측을 보정함으로써 유의미한 정확도를 달取得할 수 있으며, 이러한 한계는 높은 평가자 간 일치도에도 불구하고 우연보다 나은 성과를 내지 못하는 인간 전문가의 무능력을 반영한다.

원저자: Tyler Dooskin, Squoosh Technical Staff

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tyler Dooskin, Squoosh Technical Staff

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 해결하려는 탐정이라고 상상해 보세요. "두 명의 용의자 중 누가 유죄인가?"라는 질문 말이죠. 웹사이트의 세계에서 '용의자'는 약간씩 다른 두 가지 버전의 페이지를 의미하며, '유죄'인 쪽은 더 많은 사람을 구매하게 하거나 가입하게 만드는 버전입니다. 이것을 A/B 테스트라고 부릅니다. 보통 이 승자를 찾아내려면 실제 사람들이 사이트와 상호작용하는 것을 며칠, 혹은 몇 주 동안 기다리며 지켜봐야 합니다. 하지만 최근에 새로운 종류의 탐정이 등장했습니다. 바로 인공지능(AI)입니다. 모두가 던지는 큰 질문은 이것입니다. "AI가 두 웹사이트의 사진을 보고 즉시 어느 쪽이 승리할지 알려주어, 우리 모두의 기다리는 시간을 줄여줄 수 있을까?"

이 논문을 이해하려면 과학에서 '좋음'을 측정하는 방법에 대해 몇 가지 알아야 합니다. 첫째, '운에 의한 정답'과 '실력에 의한 정답'의 차이입니다. 동전 던지기에서 "앞면"이라고 추측한다면, 당신은 운 좋게 50%의 확률로 맞힐 것입니다. 만약 어떤 탐정이 천재라고 주장하면서 겨우 51%만 맞힌다면, 그는 정말 특별한 일을 하고 있는 것이 아닙니다. 과학자들은 운을 걷어내고 그 탐정이 실제로 머리를 쓰고 있는지 확인하기 위해 '코헨의 카파(Cohen's kappa)'라는 특별한 점수(이를 "실력 점수"라고 부릅시다)를 사용합니다. 둘째, "공유된 편향(Shared Bias)"의 문제입니다. 예를 들어, 선생님과 학생이 같은 마을에서 자랐다고 상상해 보세요. 그들이 모든 것에 대해 의견이 일치하는 이유는 학생이 똑똑해서가 아니라, 두 사람 모두 부모님으로부터 잘못된 사실을 똑같이 배웠기 때문일 수 있습니다. 만약 AI와 테스트 데이터를 만든 사람들이 동일한 "민간 지식(folk wisdom)"을 학습했다면, 그들은 정답에 동의할 수는 있겠지만, 그것이 AI가 미래를 예측한다는 것을 의미하지는 않습니다.

이 논문은 이 질문에 답하기 위해 노력한 'Squoosh'라는 팀의 매우 정직하고 엄격한 보고서입니다. 그들은 단순히 AI에게 추측하라고 시킨 것이 아닙니다. 그들은 마치 요리하기 전에 레시피를 미리 적어두는 과학자처럼, 나중에 AI가 더 잘하는 것처럼 보이도록 규칙을 바꾸지 못하도록 사전에 규칙을 확정하는 '함정'을 설치했습니다. 그들은 AI가 실제로 승자를 예측할 수 있는지 확인하기 위해 방대한 양의 실제 웹사이트 테스트 라이브러리를 사용했습니다.

반전이 있습니다. AI는 본래의 임무에 있어서 대부분 실패했다는 점입니다. 팀이 AI에게 330개의 실제 테스트를 보고 매번 승자를 고르라고 요청했을 때, AI는 무작위 추측보다 간신히 나은 수준에 불과했습니다. 사실, AI는 "신뢰할 수 없는" 테스트(결과가 명확하지 않은 경우)에서 "신뢰할able한" 테스트보다 더 많이 동의하는 모습을 보였습니다. 알고 보니 AI와 테스트 데이터를 만든 사람들은 웹사이트를 좋게 만드는 요소에 대한 오래된 미신을 반복하고 있었을 뿐, 실제로 어떤 일이 일어날지를 예측하고 있었던 것이 아니었습니다. 훨씬 더 똑똑하고 비싼 AI를 사용하는 것도 도움이 되지 않았습니다. 결과는 똑같이 좋지 않았습니다. 이 논문은 단순히 "더 좋은 AI를 사거나" "더 나은 프롬프트를 작성하는 것"만으로 이 문제를 해결할 수 있다는 생각을 명시적으로 배제합니다. 스크린샷만 보고 웹사이트의 승자를 예측하는 "마법의 수정구슬"은 존재하지 않습니다.

하지만 이 논문이 AI가 쓸모없다고 말하는 것은 아닙니다. 논문은 AI가 '정직한' 탐정이라고 말합니다. 팀은 특별한 기술을 발견했습니다. 만약 그들이 AI에게 "절대로 확신할 수 있을 때만 추측하고, 그렇지 않으면 '모르겠다'고 말하라"고 지시하면, AI는 자신이 목소리를 높이는 순간에는 놀라울 정도로 성능이 좋아진다는 것입니다. AI 내부의 심판단이 하나의 답에 강력하게 동의했을 때, AI는 신뢰할 수 있는 테스트에서 약 31%의 확률로 정답을 맞혔습니다. 이 수치는 낮아 보일 수 있지만, 기억하세요. 수년간의 경험을 가진 실제 인간 전문가들도 평균적으로 약 29% 정도만 정답을 맞힙니다. AI는 초천재가 아닙니다. 단지 자신이 언제 추측하고 있는지, 그리고 언제 추측하지 말아야 하는지를 아는 도구일 뿐입니다.

가장 중요한 발견은 '신뢰'에 관한 것입니다. 이 논문은 한 그룹의 AI들이 서로 동의한다는 것이 반드시 그들이 옳다는 것을 의미하지는 않으며, 오히려 그들이 모두 동일한 공유된 편향을 반복하고 있다는 것을 의미할 때가 많다는 것을 보여줍니다. 이는 마치 친척들로 구성된 배심원단과 같습니다. 그들은 모두 같은 방식으로 투표하겠지만, 그것이 판결의 정확성을 보장하지는 않습니다. 이 논문은 이러한 "공유된 편향"이 인간에게도 발생한다는 것을 증명합니다. 15명의 실제 전문가에게 승자를 맞혀보라고 요청했을 때, 전문가들은 서로 강력하게 동의했지만, AI만큼이나 자주 틀렸습니다.

그래서 최종적인 결론은 무엇일까요? 논문은 우리가 100% 확실하게 웹사이트의 승자를 예측하는 도구를 만들 수는 없다고 결론짓습니다. 대신, 가장 좋은 도구는 "보정된 스크리닝 도구(Calibrated Screening Instrument)"입니다. 즉, "나는 이것이 승리할 것이라고 확신한다"라고 말하거나, "잘 모르겠으니 나에게 묻지 마라"라고 말할 수 있는 시스템입니다. 이 시스템은 자신의 한계에 대해 정직합니다. 또한, 이 작업을 수행하기 위해 엄청나게 비싸고 거대한 AI가 필요하지 않다는 것도 보여줍니다. "정직함"의 기술을 사용한다면 더 작고 저렴한 버전도 충분히 잘 작동합니다. 진짜 가치는 모든 답을 얻어내는 데 있는 것이 아니라, 당신이 언제 답을 믿지 말아야 하는지를 정확히 아는 데 있습니다. 논문은 자신의 데이터, 실패한 실험, 그리고 규칙들을 모두 공개하며 마무리됩니다. 이는 때때로 가장 중요한 발견은 마법 같은 기술이 작동하지 않는다는 것을 인정하는 것이지만, 매우 신중하고 정직한 버전의 기술은 충분히 유용할 수 있다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →