Beyond Questions: Evaluating What Large Language Models (Actually) Know
본 논문은 사전 정의된 질문이 아닌 개방형 유도 과정을 통해 대규모 언어 모델이 자연스럽게 표현하는 지식을 평가하는 새로운 개방형 지식 평가 패러다임인"Beyond Questions(BeQu)"를 소개하며, 이는 규모와 추론 노력과 같은 다양한 요인 across 모델 능력에 대한 중요한 통찰을 제공합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
한 명의 유명한 역사적 인물, 예를 들어 마틴 루터 킹 주니어에 대해 한 학생이 실제로 무엇을 알고 있는지 파악하려고 한다고 상상해 보세요.
구식 방법 ("퀴즈 쇼" 접근법)
수년 동안 연구자들은 AI 모델을 엄격한 퀴즈 쇼 진행자처럼 테스트해 왔습니다. 그들은 구체적이고 좁은 질문을 던집니다: "그의 생일은 언제였습니까?" 또는 "그의 아내는 누구였습니까?"
- 문제점: 이는 요리사를 평가할 때 그에게 치즈 샌드wich만 만들어 보라고 하는 것과 같습니다. 만약 그 요리사가 마스터 제과사이지만 샌드wich 만드는 데는 서툴다면, 퀴즈는 그를 나쁜 요리사로 판단합니다. 이 테스트는 퀴즈 설계자가 생각해 내서 질문한 것만 측정합니다. 설계자가 요리사의 좋아하는 색깔에 대해 결코 질문하지 않았다면, AI 가 그 사실에 대해 알고 있는 지식은 보이지 않게 됩니다. 이를 **가용성 편향 (availability bias)**이라고 합니다.
새로운 방법 ("쇼 앤 텔" 접근법)
이 논문은 **오픈 지식 평가 (Open Knowledge Evaluation)**라는 새로운 방법을 소개합니다. 퀴즈 대신 AI 에게 다음과 같이 물어본다고 상상해 보세요: "마틴 루터 킹 주니어에 대해 알고 있는 모든 것을 말해 보세요."
- 목표: 우리는 AI 가 특정 질문에 대한 정답을 맞혔는지 여부만 확인하지 않습니다. 우리가 보는 것은 AI 가 들려주는 전체 이야기입니다. 우리는 다음을 확인합니다:
- 정밀도 (Precision): 사실을 지어냈나요 (환각)?
- 재현율 (Recall): 알고 있는 모든 것을 기억해 냈나요, 아니면 중요한 세부 사항을 빼먹었나요?
도구: BeQu(질문 너머)
이를 테스트하기 위해 저자들은 BeQu라는 거대한 놀이터를 구축했습니다.
- 그들은 위키피디아에서 10,000 개의 무작위 항목(사람, 장소, 사건)을 선정했습니다.
- 각 항목에 대해 위키피디아와 웹에서 사실을 수집하여 "참고 도서관 (Reference Library)"을 구축했습니다.
- 그들은 20 개의 서로 다른 AI 모델에게 이 10,000 개의 항목에 대해 "알고 있는 모든 것을 말해 달라"고 요청했습니다.
- 그런 다음, 매우 똑똑한 AI 심판이 모델들이 들려준 이야기와 참고 도서관을 비교하여 무엇이 진실이고, 무엇이 거짓이며, 무엇이 빠졌는지 확인했습니다.
그들이 발견한 것 (결과)
큰 모델이 여전히 승리하지만 (열린 모델들이 따라잡고 있음):
AI 모델을 학생이라고 생각하세요. "상용" 학생들 (유료, Claude Opus 와 같은 대형 모델) 은 여전히 가장 높은 점수를 받고 있습니다. 그러나 일부 "오픈 소스" 학생들 (무료 모델) 이 놀라울 정도로 근접한 점수를 기록하며 매우 경쟁력이 있음을 증명하고 있습니다.열심히 생각하는 것이 크게 도움이 되지 않음:
"AI 에게 답변하기 전에 '더 열심히 생각하라'거나 '더 추론하라'고 말하면 더 많은 것을 알게 될 것"이라고 생각할 수 있습니다. 그러나 이 논문은 이 특정 작업에 대해서는 이것이 대부분 신화임을 발견했습니다. AI 가 1 초를 "생각"하든 10 초를 "생각"하든, 끌어낸 사실의 양은 크게 변하지 않았습니다. 지식은 이미 존재했을 뿐, 단지 말로 표현되어야 했을 뿐입니다."엄격한 교사" 대 "창의적인 작가":
연구자들은 AI 에게 스프레드시트의 특정 열과 같은 엄격한 형식으로 답변하도록 강요해 보았습니다.- 결과: AI 는 매우 정확해졌지만 (높은 정밀도) 많은 사실을 공유하지 않게 되었습니다 (낮은 재현율). 이는 교사가 묻는 것만 정확히 답변하고 추가적인 맥락을 추가하는 것을 거부하는 학생과 같았습니다.
- 반대로, 자유롭게 개방적으로 답변할 수 있게 허용되었을 때, AI 는 가끔 작은 실수를 하더라도 더 많은 사실을 공유했습니다.
더 많이 요청하면 더 많이 얻는다 (어느 정도까지는):
연구자들이 AI 에게 "5 개의 사실"을 나열하라고 요청했을 때와 "100 개의 사실"을 나열하라고 요청했을 때, 더 큰 요청을 받은 AI 가 일반적으로 더 많은 지식을 공유했습니다. 그러나 AI 를 수백 개의 사실을 나열하도록 너무 강하게 밀어붙이면, 할당량을 채우기 위해 사실을 지어내기 시작했습니다 (환각)."가짜 사람" 테스트:
그들은 AI 에게 존재하지 않는 것들 (예: "안도라 국제공항") 에 대해 질문했습니다. 가장 뛰어난 모델들은 단순히 "그것에 대해 아는 바가 없습니다"라고 말했습니다. 반면, 더 약한 모델들은 가짜 세부 사항을 만들어내기 시작했는데, 이는 그들이 알고 있는 것이 아니라 추측하고 있음을 보여주었습니다.
결론
이 논문은 우리가 AI 를 객관식 테스트 기계처럼 취급하는 것을 멈춰야 한다고 주장합니다. AI 가 무엇을 알고 있는지 진정으로 이해하려면, AI 가 자유롭게 말하게 하여 실제 세계를 얼마나 많이 묘사할 수 있는지, 그 묘사가 얼마나 정확한지, 그리고 무엇을 선택적으로 생략하는지 살펴봐야 합니다. 새로운 "BeQu" 벤치마크는 이러한 "쇼 앤 텔" 능력을 측정하는 도구이며, AI 가 더 똑똑해지고 있지만 여전히 항상 공유하려는 것이 아닌 숨겨진 지식을 많이 보유하고 있음을 드러냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.