On the Role of Citations in Preference Data
이 논문은 인간 평가자와 오픈 소스 LLM이 과학적 질의응답에서의 인용을 어떻게 평가하는지 조사하며, 인간은 다양하지만 적은 수의 인용을 선호하는 반면 LLM은 모델과 데이터에 따라 달라지는 인용 관련 선호도를 보인다는 점을 밝힘으로써, 보상 모델링을 위한 선호도 데이터 수집을 개선하기 위한 중요한 통찰을 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급변하는 인공지능의 세계에서, 컴퓨터에게 두 가지 답변 중 더 나은 것을 선택하도록 요청하는 특정 유형의 작업이 이러한 시스템이 학습하고 개선되는 방식의 핵심이 되었습니다. 선호도 학습(preference learning)이라고 알려진 이 과정은 현대 AI 훈련의 엔진입니다. 시스템이 질문에 대해 두 가지 서로 다른 응답을 생성하면, 판사(인간 전문가 또는 다른 AI 프로그램)가 어느 것이 더 우수한지를 결정합니다. 이러한 선택은 원래의 시스템이 어떻게 신뢰할 수 있는 전문가처럼 행동할지를 가르치는 데 사용됩니다. 그러나 중요한 퍼즐 조각 하나가 여전히 불분명한 상태로 남아 있습니다. 바로 이 판사들이 외부 출처를 참조하는 것, 즉 인용(citations)이 포함된 답변을 검토할 때 정확히 무엇을 보고 있는가 하는 점입니다. 그들은 단순히 출처의 개수를 중요하게 생각할까요, 출처의 다양성을 볼까요, 아니면 정보의 신선도를 볼까요? 인용은 사용자가 AI가 진실을 말하고 있는지 확인할 수 있도록 하여 조작에 대한 방패 역할을 하기 때문에, 이를 이해하는 것은 매우 중요합니다. 만약 AI를 훈련하는 시스템이 이러한 참조를 올바르게 가중치를 두어 평가하는 방법을 이해하지 못한다면, 결과적으로 만들어진 모델은 품질을 확인하지 않고 많은 출처를 나열하거나 정보의 신뢰성을 완전히 무시하는 것과 같이 잘못된 것을 우선시하도록 학습될 수 있습니다.
한 연구팀은 인간 전문가와 인공지능 프로그램이 인용이 포함된 과학적 답변을 어떻게 평가하는지 조사함으로써 바로 이 질문을 탐구하기 위해 나섰습니다. 그들은 AI가 복잡한 과학적 질문을 받고 학술 논문을 참조하여 길고 상세한 응답을 제공하는 시나리오에 집중했습니다. 연구진은 인간 전문가에 의해 한쪽이 다른 쪽보다 선택된 수천 개의 응답 쌍을 수집한 후, 네 가지 서로 다른 대규모 언어 모델(LLM)에게 동일한 선택을 하도록 요청했습니다. 결정 뒤에 숨겨진 규칙을 이해하기 위해, 연구팀은 답변의 길이를 조절하는 등의 다른 요인들을 통제하면서 인용 횟수, 출처의 다양성, 그리고 참조가 본문과 일치하는지 여부와 같은 답변의 특정 특징들을 분리해낼 수 있는 통계적 방법을 사용했습니다.
연구 결과, 인간이 이러한 응답을 판단하는 방식에서 뚜렷하고 다소 놀라운 패턴이 드러났습니다. 사람들이 과학적 답변을 검토할 때, 그들은 다양한 출처로부터 폭넓게 자료를 가져온 응답을 선호했는데, 이는 그들이 폭과 관점을 가치 있게 여긴다는 것을 시사합니다. 그러나 사람들은 전체 인용 횟수가 적은 답변을 선호하기도 했습니다. 이는 사람들이 답변이 충분히 잘 조사되기를 원하면서도, 과도한 참조들로 인해 답변이 번잡하게 느껴지는 것에는 거부감을 느낀다는 것을 나타냅ers. 더욱이, 인간은 본문 내의 참조가 마지막의 출처 목록과 일치하지 않는 경우, 즉 AI가 출처를 지어내고 있을 가능성을 시사하는 흔한 오류가 발생했을 때 이를 빠르게 처벌했습니다. 흥미롭게도, 출처의 연령은 인간 판사들에게 거의 영향을 미치지 않았으며, 그들은 새로운 논문을 오래된 논문보다 선호하는 강한 경향을 보이지 않았습니다.
대조적으로, 인공지능 판사들은 상당히 다르게 행동했으며, 그들의 선호도는 어떤 특정 모델이 판단을 수행하느냐에 따라 달랐습니다. AI 모델들 또한 다양한 출처를 선호하는 경향이 있었지만, 인간에 비해 인용 횟수에 훨씬 더 강하게 반응하는 경우가 많았습니다. 일부 AI 판사들은 많은 인용이 포함된 답변을 매우 싫어했고, 다른 모델들은 무관심했습니다. 더 결정적으로, AI 모델들은 인간이 문제라고 느꼈던 '일치하지 않는 참조'를 감지하거나 처벌하지 못했습니다. 대신, AI 판사들은 답변의 길이와 같은 표면적인 특징에 크게 영향을 받았습니다. 여러 모델은 내용의 가치 여부와 상관없이 긴 답변을 지속적으로 선호했습니다. 이는 이 AI 시스템들이 실제 출처 문서를 확인하기 위해 인용을 진정으로 "읽는" 것이 아니라, 텍스트의 시각적 또는 구조적 패턴에 반응하고 있음을 시사합니다.
연구진은 이러한 차이가 단순한 사소한 특성이 아니라 미래의 AI 시스템을 훈련시키는 방식에 영향을 줄 수 있는 중요한 격차라는 것을 발견했습니다. AI 모델은 종-종 다른 모델을 훈련시키기 위한 데이터를 라벨링하는 데 사용되기 때문에, 특정 편향을 이해하지 못한 채 AI에 의존하는 것은 시스템이 실제 정확성이나 출처의 다양성보다 길이 또는 인용 횟수를 우선시하도록 학습하게 만들 수 있습니다. 이 연구는 AI가 많은 면에서 인간의 판단을 모방할 수 있지만, 무엇이 신뢰할 수 있고 일관된 참조를 만드는지에 대한 직관적인 이해는 부족하다는 점을 강조합니다. 저자들은 더 나은 시스템을 구축하기 위해서 개발자들이 선호도 데이터를 수집할 때 더 주의를 기울여야 하며, 인용의 품질에 대한 인간의 가이드라인을 명확히 하고, AI 판사에게 출처를 검증할 수 있는 도구를 제공하거나 특정 편향에 대한 깊은 이해를 바탕으로 모델을 선정해야 한다고 제안합니다. 궁극적으로, 이 연구는 AI를 더 신뢰할 수 있게 만들기 위한 여정에서, 우리가 AI에게 답변 사이의 선택을 요구하는 방식의 세부 사항이 답변 자체만큼이나 중요하다는 사실을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.