← 최신 논문
🤖 AI

Evaluating Multiple LLM Generations with Validated Task Coverage

이 논문은 여러 LLM 생성물을 하나의 집합체로서 평가하기 위한 VTC-Bench와 검증된 작업 커버리지(Validated Task Coverage, VTC) 지표를 소개하며, 단일 출력 품질에 최적화된 구성이 반드시 구별되고 유용한 결과의 다양성을 극대화하는 것은 아님을 입증한다.

원저자: Florian Le Bronnec, Rio Yokota

게시일 2026-08-26
📖 6 분 읽기🧠 심층 분석

원저자: Florian Le Bronnec, Rio Yokota

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 거대 언어 모델은 종종 하나의 단순한 질문, 즉 '정답을 맞힐 수 있는가?'라는 질문으로 평가받습니다. 사용자가 수학 문제의 해법, 코드 한 줄, 또는 의학적 진단을 요구할 때, 표준적인 테스트는 모델이 하나의 정답을 생성하느냐에 달려 있습니다. 이러한 접근 방식은 기계를 마치 단 하나의 높은 점수만이 중요한 기말고사를 치르는 학생처럼 취급합니다. 그러나 현실 세계의 많은 상황에서는 단 하나의 답변만으로는 충분하지 않습니다. 새로운 약물을 설계하는 과학자는 제조하기 가장 쉬운 것을 선택할 수 있도록 작동하는 서로 다른 열 가지의 화학 구조를 볼 필요가 있을 수 있습니다. 보안 취약점을 수정하는 소프트웨어 엔지니어는 어떤 패치가 가장 안전한지 확인하기 위해 코드를 수정하는 여러 가지 방법이 필요할 수 있습니다. 이러한 시나리오에서 기계의 가치는 하나의 완벽한 출력을 만들어내는 능력이 아니라, 구별되고 유용한 옵션의 풍부한 집합을 생성하는 능력에 있습니다. 연구자들의 과제는 이 능력을 어떻게 측정할 것인가였습니다. 전통적인 테스트는 모델이 얼마나 자주 정답을 맞히는지 계산하거나, 단순히 목록에서 가장 좋은 답을 하나 골라내고 나머지는 무시합니다. 이는 다양하고 유효한 가능성의 모음을 갖는 것이 목표일 때 그 본질을 완전히 놓치는 것입니다.

일본의 RIKEN 계산과학 연구소(RIKEN Center for Computational Science)의 연구진은 이 문제를 바라보는 새로운 방법을 개발했습니다. 그들은 인공지능이 하나의 과업에 대해 얼마나 다양한 유용한 답변을 생성할 수 있는지 확인하기 위해 특별히 설계된 테스트 환경, 즉 벤치마크를 만들었습니다. 그들의 방식은 "정답을 맞혔는가?"라고 묻는 대신, "얼마나 많은 서로 다르고 진정으로 유용한 답변을 찾아냈는가?"라고 묻습니다. 그들은 화학 분자 설계부터 소프트웨어 버그 수정, 의료 증거 검색에 이르기까지 매우 다양한 다섯 가지 유형의 실제 문제를 사용하여 이 테스트를 구축했습니다. 각 문제에 대해 무엇이 '유용한' 결과인지, 그리고 두 결과가 실제로 어떻게 다른지를 명확히 정의했습니다. 예를 들어, 분자 설계에서 두 답변은 표면적으로는 달라 보일 수 있지만, 만약 동일한 핵심 화학 구조를 공유한다면 그것은 동일한 유용한 결과로 간주됩니다. 연구진은 다양한 모델을 이 과업들에 투입하여 여러 번 시도하게 했고, 그들이 축적한 고유하고 유효한 솔루션의 개수를 세었습니다.

이 연구의 결과는 이 기계들이 어떻게 작동하는지에 대한 놀라운 진실을 드러냅니다. 연구진은 하나의 고품질 답변을 내놓는 데 가장 뛰어난 모델이 반드시 다양하고 풍부한 답변을 만들어내는 데 가장 뛰어난 모델은 아니라는 사실을 발견했습니다. 실제로 어떤 모델이 '최고'인지에 대한 순위는 허용된 시도 횟수에 따라 변합니다. 단 한 번의 시도에서 선두를 달리는 모델이 스무 번의 시도가 주어졌을 때는 뒤처질 수 있는 반면, 처음에는 느리게 시작하는 모델이 결국 더 넓은 범위의 유용한 솔루션을 찾아낼 수도 있습니다. 이는 모델을 실행하는 설정이 이전에 생각했던 것보다 더 중요하다는 것을 시사합니다. 연구진은 모델의 출력을 더 무작위적이고 다양하게 만드는 설정인 '온도(temperature)'를 높이는 것이, 비록 개별 답변의 품질은 때때로 낮아질지라도 훨씬 더 넓은 범위의 유용한 결과들을 이끌어낸다는 것을 발견했습니다. 반대로, 모델이 답변하기 전에 단계별로 추론하도록 장려하는 '사고(thinking)' 기능은 개별 답변의 품질은 향상시켰지만, 모델이 더 뚜렷한 솔루션을 찾는 데에는 항상 도움이 되지는 않았습니다.

아마도 가장 중요한 것은, 답변들이 표면적으로 얼마나 달라 보이는지를 보는 것만으로는 그것들이 정말로 유용한지를 판단하기에 충분하지 않다는 점을 이 연구가 보여주었다는 것입니다. 다양성을 판단하는 흔한 방법은 답변 속의 단어나 문자가 서로 다른지를 확인하는 것입니다. 연구진은 이러한 표면적인 확인이 모델이 실제로 새로운 유효한 솔루션을 찾아냈는지를 예측하는 데 있어 형편없는 지표라는 것을 발견했습니다. 모델은 서로 매우 달라 보이는 열 개의 답변을 생성할 수 있지만, 그 답변들이 모두 동일한 근본적인 솔루션을 나타낼 수 있으며, 이 경우 사용자가 실제로 필요로 하는 다양성을 제공하지 못하게 됩니다. 연구진은 답변의 실제 내용과 의미를 과업의 특정 규칙에 대조하여 검증하는 시스템을 사용함으로써, 결과의 진정한 '커버리지(coverage)'를 측정할 수 있었습니다. 그들은 이 더 깊은 측정이 어떤 모델과 설정이 가장 잘 수행하는지에 대해 종종 다른 결론을 도출한다는 것을 발견했습니다.

연구팀은 다섯 가지 영역(분자 설계, 소프트웨어 저장소 수리, 코드 내 버그 찾기, 의료 사례 진단, 복잡한 질문을 뒷받end하는 증거 검색)에 걸쳐 네 가지 서로 다른 거대 언어 모델을 테스트했습니다. 그들은 무작위성 수준을 달리하거나 '사고' 과정을 활성화하거나 비활성화하는 등 다양한 설정을 적용하여 각 모델을 실행했습니다. 그런 다음 시도 횟수가 증가함에 따라 각 모델이 생성한 구별되는 유효한 결과의 수를 측정했습니다. 데이터에 따르면 대부분의 과업에서 초기에 가장 성적이 좋았던 모델이 많은 시도 후에 가장 성적이 좋아지는 모델은 아니었습니다. 예를 들어, 분자 설계 과업에서 한 모델은 단 한 번의 시도 후에는 선두였지만, 스무 번의 시도가 이루어졌을 때는 다른 모델이 현저히 더 많은 고유한 화학 구조를 찾아냈습니다. 이 패턴은 전반적으로 일관되게 나타났으며, 이는 단일 답변을 생성하기 위한 최선의 전략이 여러 답변의 집합을 생성하기 위한 최선의 전략과 종종 다르다는 것을 나타냅니다.

연구는 또한 모델에게 자기 자신을 반복하지 말라고 명시적으로 지시하는 것이 도움이 될지를 조사했습니다. 어떤 경우에는 모델에게 방금 말한 것과 다른 새로운 아이디어를 생성하도록 강제함으로써 다양성을 유도하려는 시도가 있었습니다. 연구진은 이러한 접근 방식이 신뢰할 만한 결과를 내지 못한다는 것을 발견했습니다. 증거 검색과 같은 특정 과업에서는 도움이 되었지만, 소프트웨어 수리와 같은 다른 과업에서는 오히려 유용한 솔루션의 수를 감소시켰습니다. 이는 단순히 다양성을 요구하는 것이 모델이 새로운 유효한 영역을 찾도록 보장하지 않는다는 것을 시사합니다. 대신, 모델의 무작위성을 제어하는 설정과 같이 모델이 구성되는 방식이 모델이 넓은 범위의 유용한 가능성을 탐색할 수 있는지 결정하는 데 더 결정적인 역할을 합니다.

이러한 발견은 우리가 인공지능을 평가하는 방식을 어떻게 바꾸어야 하는지에 대해 시사하는 바가 큽니다. 수년 동안 초점은 단 하나의 최선의 답을 얻는 것에 맞춰져 왔습니다. 그러나 이 기계들이 옵션을 갖는 것이 중요한 더 복적인 과업에 사용됨에 따라, 기존의 성공 측정 방식은 불충분합니다. 연구진의 작업은 유한한 후보 답변의 집합 자체가 그 자체로 의미 있는 연구 대상임을 입증합니다. 그것은 단지 한 명의 승자를 뽑기 위한 시도의 모음이 아니라, 지도화되고 측정될 수 있는 가능성의 풍경입니다. 그들이 '검증된 과업 커버리지(validated task coverage)'라고 부르는 새로운 방법을 사용하여, 우리는 모델이 이 풍경을 얼마나 잘 탐색하는지 직접 평가할 수 있음을 보여주었습니다. 결과는 우리가 이 도구들을 최대한 활용하기 위해서, 단 하나의 최선의 답을 찾는 것을 멈추고 그들이 제공할 수 있는 옵션의 폭을 가치 있게 여기기 시작해야 할 수도 있음을 시사합니다.

이 연구의 함의는 단순히 적절한 모델을 선택하는 것을 넘어섭니다. 이는 우리가 이러한 시스템과 상호작용하는 방식이 변해야 할 수도 있음을 시사합니다. 만약 사용자가 다양한 솔루션을 필요로 한다면, 개별 답변이 약간 덜 완벽해지는 것을 감수하더라도 더 많은 탐색을 장려하도록 설정을 조정해야 할 수도 있습니다. 이 연구는 막연한 '창의성'이나 '다양성'이라는 개념을 넘어, 명확하고 측정 가능한 유용한 결과의 수로 이러한 다양한 접근 방식을 테스트하고 비교할 수 있는 구체적인 방법을 제공합니다. 연구진은 자신들의 도구와 데이터를 공개하여 다른 이들이 이 새로운 표준에 따라 새로운 모델과 설정을 테스트할 수 있도록 했습니다. 이는 이 기계들이 무엇을 할 수 있는지에 대한 더 미묘한 이해를 위한 문을 열어주며, 성공의 단일 지점에서 잠재력의 전체 범위로 초점을 전환합니다.

결국, 이 논문은 관점의 작지만 중요한 변화를 제안합니다. 인공지능의 가치는 단순히 정답을 맞히는 능력이 아니라, 다양한 방식으로 유용해질 수 있는 능력에 있다고 주장합니다. 구별되는 유효한 결과의 축적을 측정하는 테스트를 구축함으로써, 연구진은 이 강력한 도구들을 바라보는 새로운 렌즈를 제공했습니다. 그들은 최고의 단일 답변을 찾는 경로가 반드시 최고의 답변 집합을 찾는 경로와 같지는 않으며, 우리가 선택하는 설정이 우리가 받는 솔루션의 다양성에 심오한 차이를 만들 수 있다는 것을 보여주었습니다. 이 작업은 인공지능을 평가하는 모든 문제를 해결했다고 주장하는 것이 아니라, 너무 오랫동안 간과되어 온 질문, 즉 "이 기계는 실제로 얼마나 많은 유용한 것들을 찾아낼 수 있는가?"를 묻는 명확하고 재현 가능한 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →