Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
이 논문은 거대 언어 모델들이 후보군이 올바른 집합에 속하는지 판단하는 데에는 뛰어나지만, 과잉 포함보다는 침묵적 누락을 보이는 체계적인 경향성으로 인해 완전한 수용 가능한 집합을 작성하는 데에는 현저히 실패하며, 이러한 결함은 다양한 도메인과 파라미터 규모에 걸쳐 지속된다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
위대한 역할의 역전: AI가 스승이 될 때
학생들이 더 이상 질문에 답하는 것에 그치지 않고, 교과서를 쓰고, 시험 문제를 출제하며, 무엇이 '정답'인지를 결정하는 교실을 상상해 보십시오. 이것은 지금 인공지능 세계에서 실제로 일어나고 있는 일입니다. 거대 언어 모델(LLM)은 '수험생'(시험을 치는 존재)에서 '시험 출제자'(시험을 만드는 존재)로 승격되고 있습니다. 이들은 다른 AI 시스템이 일을 잘하고 있는지 판단하는 규칙, 정답지, 그리고 체크리스트를 작성하고 있습니다.
왜 이것이 까다로운 문제인지 이해하기 위해 두 가지 서로 다른 기술을 생각해 보십시오. 첫 번째는 **판단(Judging)**입니다. 하나의 답변을 보고 "네, 맞습니다" 또는 "아니요, 틀렸습니다"라고 말하는 것입니다. 두 번째는 **저술(Authoring)**입니다. 가능한 모든 정답의 전체 목록을 처음부터부터 만들어내는 것입니다. 이는 선수가 라인 밖으로 나갔을 때 휘슬을 부는 심판와, 선수가 발생 가능한 모든 탈선 경로를 하나도 빠짐없이 기록한 규칙서를 쓰려는 코치의 차이와 같습니다. 우리가 이 문제에 주목하는 이유는, 만약 시험을 만드는 AI가 실수를 한다면 단순히 문제 하나를 틀리는 데 그치지 않고, 모두에게 적용되는 '정답'의 정의를 바꿔버려 잠재적으로 좋은 답은 벌하고 나쁜 답은 보상하게 만들 수 있기 때문입니다.
논문의 중대한 발견: 기계 속의 침묵하는 유령
이 논문은 AI가 이러한 새로운 역할을 수행할 때 발생하는 기묘하고 위험한 결함을 조사합니다. 연구진은 AI 모델이 판단(특정 답변이 맞는지 틀린지 식별하는 것)에는 매우 뛰어나지만, 저술(모든 정답의 완전한 목록을 작성하는 것)에는 놀라울 정도로 서투르다는 사실을 발견했습니다.
이것을 "사이먼 가라사대" 게임에 비유해 보십시오. 만약 당신이 AI에게 "'사과'가 과일인가요?"라고 묻는다면, AI는 거의 항상 "예"라고 올바르게 답할 것입니다. 하지만 "존재하는 모든 과일을 나열하세요"라고 요청하면, AI는 사과와 바나나를 나열하다가 그냥... 멈춰버릴 것입니다. 키위나 망고를 잊어버리는 것이 아닙니다. 그것들을 몰라서 잊는 것이 아니라, 전체 목록을 작성하는 특정한 작업 자체에 서투르기 때문에 잊는 것입니다.
저자들은 이를 **"판단-열거 가위(Judging-Enumerating Scissors)"**라고 부릅니다. 한쪽 날은 '판단'(날카롭고 강함)이고 다른 쪽 날은 '저술'(무디고 약함)인 가위를 상상해 보십시오. AI 모델이 커지고 똑똑해질수록(소형에서 대규모로 스케일업될수록), '판단'의 날은 더 날카로워지지만, '저술'의 날은 거의 날카로워지지 않습니다. 둘은 결코 따라잡지 못합니다. 얼마나 많은 컴퓨팅 파워를 투입하더라도, 판단 능력과 열거 능력 사이의 격차는 여전히 넓게 유지됩니다.
침묵하는 유령: 왜 우리는 실수를 알아차리지 못하는가
이 발견의 가장 무서운 점은 AI가 실패하는 방식에 있습니다. AI가 정답 목록을 작성할 때, 보통 가짜 답을 추가하지는 않습니다(예를 들어 "바위"를 과일이라고 부르는 식). 대신, AI는 **침묵하는 누락(Silent Omissions)**을 저지릅니다. 단순히 실제 정답을 빠뜨리는 것입니다.
이것이 왜 위험한지 설명하겠습니다:
- 과잉 포함 (틀린 것을 추가함): 만약 AI가 실수로 과일 목록에 "바위"를 추가했다면, 인간 검토자는 쉽게 찾아낼 수 있습니다. "이봐요, 바위는 과일이 아니잖아요!"라고 말할 수 있죠. 이것은 눈에 보이는 오류입니다.
- 누락 (맞는 것을 빠뜨림): 만약 AI가 "키위"를 목록에서 빠뜨렸다면, 눈에 띄는 오류가 없습니다. 목록이 그냥 조금 짧아 보일 뿐입니다. 빠진 키위를 찾으려면 검토자가 직접 정답을 알고 있어야 하며, 그것을 찾아내기 위해 뒤져야 합니다.
논문은 AI 모델이 자신이 실수로 추가한 것을 찾아내는 능력보다, 무언가를 놓쳤다는 것을 깨닫는 능력이 6~7배 더 낮다는 것을 보여줍니다. 이는 에세이의 오타는 잘 찾아내지만, 결론을 쓰는 것을 잊어버린 사실은 전혀 모르는 학생과 같습니다. 누락된 부분은 눈에 보이지 않기 때문에, AI의 '정답지'는 불완전해지며, 그 정답지로 채점하는 AI 시스템은 정답을 제대로 작성했음에도 불구하고 목록에 없다는 이유만으로 그 답을 오답 처리하게 됩니다.
"마법의 규칙" 루프홀(Loophole)
연구진은 영리한 우회 방법을 테스트했습니다. 그들은 AI에게 과일을 나열하라고 하는 대신, 무엇이 과일을 과일로 만드는지에 대한 규칙(예: "나무에서 자라고 씨가 있는 경우")을 쓰라고 요청했습니다. 그렇게 했을 때, AI는 거의 완벽해졌습니다(90% 이상의 정확도 기록).
이는 AI가 멍청해서가 아님을 증명합니다. AI는 규칙을 알고 있습니다. 문제는 순수하게 목록을 만드는 행위에 있습니다. 이는 케이크 레시피를 완벽하게 설명할 수 있지만, 전체 쇼핑 리스트를 써달라는 요청을 받으면 마지막 세 가지 재료를 계속 까먹는 요리사와 같습니다. 논문은 AI에게 목록 대신 규칙을 쓰게 하면 문제가 사라진다는 것을 보여줍니다. 하지만 컴퓨터 코드의 테스트 스위트를 작성하는 것과 같은 많은 실제 사례에서는 단순한 규칙을 쓸 수 없습니다. 반드시 구체적인 테스트 케이스를 나열해야만 하며, 바로 그 지점에서 AI가 비틀거립니다.
"자기 자신의 작업 확인하기"가 도움이 되지 않는 이유
당신은 이렇게 생각할 수도 있습니다. "음, AI가 목록을 만드는 데 서투르다면, 목록을 만든 뒤 스스로 확인해서 실수를 고칠 수 있지 않을까?" 연구진은 이것도 테스트했습니다. 그들은 AI에게 목록을 생성하게 하고, 그다음 두 번째 목록을 생성하게 한 뒤, 두 번째 목록을 사용하여 첫 번째 목록을 필터링하도록 했습니다.
결과는 어떠했을까요? 효과가 없었습니다. AI는 자신의 누락을 스스로 고칠 수 없었습니다. 이는 숫자를 세는 데 서툰 사람에게 손가락 개수를 다시 세어보라고 하여 빠진 것이 없는지 확인하라고 하는 것과 같습니다. AI의 '판단' 기술은 명확하게 미리 만들어진 목록을 볼 때는 강력하지만, 스스로 만든 엉망인 목록을 판단하려고 할 때는 무너집니다. 논문은 AI에게 자신의 정답지를 확인하라고 요구하는 것은 함정이며, 누락된 부분을 잡아내기 위해서는 외부의, 인간이 검증한 '골드 스탠더드(Gold Standard)'가 필요하다고 결론짓습니다.
현실 세계의 비용: AI에 대한 "세금"
마지막으로, 논문은 이 고장 난 정답지가 다른 AI를 훈련할 때 어떤 영향을 미치는지 측정했습니다. 그들은 AI가 정답을 맞힐 때마다 점수를 얻는 시나리오를 설정했습니다.
- AI가 완벽한 인간 제작 정답지를 사용했을 때, 학습이 잘 되었습니다.
- AI가 모델이 만든 정답지를 사용했을 때, 학습 효율이 현저히 떨어졌습니다.
특정 언어 작업에서, 모델이 만든 정답지를 사용한 AI는 완벽한 정답지를 사용한 것보다 18.5점 더 낮은 점수를 받았습니다. 규칙이 간단한 수학 작업에서도 여전히 1.9점의 손실이 발생했습니다. 이 "세금"은 모델이 만든 정답지가 너무 엄격하기 때문에 발생합니다. 즉, AI가 생성했지만 정답 목록에 포함되지 않은 좋은 답들을 거부해 버리는 것입니다. AI는 자신의 정답이 틀렸다고 생각하여 혼란에 빠지고, 창의적인 시도를 멈추게 됩니다.
핵심 요약
이 논문은 AI가 쓸모없다고 말하는 것이 아닙니다. 우리가 AI에게 '시험 출제자'가 되어 정답의 규칙을 쓰라고 요청할 때는 매우 주의해야 한다는 것입니다.
- 목록을 요청하지 말고, 규칙을 요청하십시오. 만약 AI가 정답을 확인할 수 있는 규칙(예: 파이썬 스크립트)을 쓸 수 있다면 그것을 사용하십시오. 그 방식은 거의 완벽합니다.
- 목록을 맹목적으로 믿지 마십시오. 만약 AI가 정답 목록을 작성해야 한다면, 반드시 무언가를 빠뜨릴 것입니다.
- "문지기(Gatekeeper)"를 활용하십시오. AI의 정답지를 신뢰하기 전에, 그것이 이미 알려진 정답을 수용하는지 확인하십시오. 만약 정답을 거부한다면, 그 정답지는 버려야 합니다.
- 버리기보다 수정하십시오. 만약 정답지가 정답을 거부한다면, 전체를 버리기보다는 특정 실수(예: 예상 출력값)를 직접 수정하는 것이 훨씬 효과적입니다.
결론적으로, AI는 오류를 찾아내는 데는 뛰어나지만, 자신이 무언가를 놓치지 않았는지 확인하는 데는 서툽니다. 이 "침묵하는 누락" 문제를 해결하기 전까지는, AI가 스스로의 숙제를 채점하도록 온전히 신뢰할 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.