Neural Diversity Regularizes Hallucinations in Language Models
이 논문은 "신경 다양성(neural diversity)"을 언어 모델의 세 번째 스케일링 축으로 도입하며, 상관관계가 낮은 병렬 표현과 Barlow Twins 정규화를 통해 환각 현상을 최대 25.6%까지 줄이는 ND-LoRA 방법을 제안하는 동시에, 낮은 신경 상관관계가 어떻게 더 높은 신뢰도로 이어지는지를 연결하는 공식적인 경계(formal bounds)를 확립한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 까다로운 수수께끼를 풀려고 노력 중이라고 상상해 보세요. 그런데 단 한 명에게만 묻는 대신, 팀 전체에 물어봅니다. 만약 팀원 모두가 똑같이 생각한다면, 그들은 모두 똑같은 어리석은 실수를 저질러 함께 틀린 답을 내놓을 수도 있습니다. 이것이 바로 현대의 '언어 모델'—이야기를 쓰고, 질문에 답하며, 우리와 대화하는 초지능형 컴퓨터 프로그램—이 가진 핵심적인 문제입니다. 이 프로그램들이 점점 더 커지고 똑똑해지고 있음에도 불구하고, 그들은 여전히 가끔씩 무언가를 지어내곤 하는데, 이를 '환각(hallucination)'이라는 결함이라고 부릅니다. 그들은 자신 있게 가짜 사실을 말하거나 일어나지도 않은 이야기를 지어낼 수 있습니다.
이를 해결하기 위해 과학자들은 보통 모델을 더 크게 만들거나 더 많은 데이터를 주입하려고 노력합니다. 마치 더 큰 퍼즐 상자를 사는 것으로 퍼즐을 풀려는 것과 같습니다. 하지만 이 논문은 다른 접근 방식을 제안합니다. 팀을 더 크게 만드는 대신, 팀원들을 '다르게' 만드는 것입니다. 저자들은 금융에서 빌려온 '다각화(diversification)'라는 개념을 사용합니다. 투자자가 한 종목에 모든 돈을 걸지 않는 이유는, 그 종목이 실패하면 모든 것을 잃기 때문이며, 대신 여러 다양한 종목에 돈을 분산 투자합니다. 한 종목이 폭락하더라도 다른 종목들이 버텨주어 포트폴리오를 안전하게 유지할 수 있기 때문입니다. 논문은 이렇게 묻습니다. "우리가 컴퓨터의 뇌에도 똑같이 할 수 있을까? 만약 모델의 서로 다른 부분들이 약간씩 다르고 상관관계가 없는 방식으로 생각하도록 강제한다면, 그들이 동시에 똑같은 실수를 저지르는 것을 막을 수 있을까?"
이것이 바로 연구자들이 테스트하고자 했던 내용입니다. 그들은 컴퓨터의 뇌를 위한 '다양성 코치' 역할을 하는 **뉴럴 다이버시티(Neural Diversity)**라는 새로운 방법을 제안합니다. 모델의 내부 경로들이 모두 똑같은 방식으로 생각하도록 붕괴되는 대신, 이 경로들이 독특하고 독립적인 상태를 유지하도록 강제하는 것입니다. 그들은 이를 수행하기 위해 ND-LoRA라는 도구를 만들었습니다. 이것은 하나의 컴퓨터 모델에게 동시에 쓸 수 있는 네 가지 서로 다른 '모자'를 씌워주는 것과 같습니다. 각 모자는 동일한 문장을 처리하는 약간씩 다른 방식을 나타냅니다. 그런 다음 모델은 이 네 가지 모자의 답변을 결합합니다.
결과는 상당히 유망합니다. 이 '네 개의 모자' 접근 방식을 사용하고, 모자들이 너무 비슷해지지 않도록 하는 특별한 수학적 기법을 사용함으로써, 연구자들은 특정 테스트에서 지어낸 사실의 수를 최대 25.6% 줄일 수 있었으며, 평균 **14.6%**의 개선을 발견했습니다. 이는 컴퓨터 모델을 더 크게 만들거나 더 많은 데이터를 학습시키지 않고도 이루어졌습니다. 실제로, 이는 약 **0.008%**의 추가적인 학습 시간과 단 1.1배의 실행 속도만을 필요로 했습니다.
하지만 논문은 반전도 발견했습니다: 다양성이 항상 더 좋은 것은 아니라는 점입니다. 이것은 합창단와 같습니다. 만약 모두가 서로 다른 음을 노래한다면 소음처럼 들릴 것입니다. 반대로 모두가 정확히 같은 음을 노래한다면 지루하고 실수하기 쉽습니다. 오류를 잡아낼 만큼 충분히 다르면서도 진실에 동의할 만큼 충분히 유사한 '스위트 스팟(최적의 지점)'이 존재합니다. 연구자들은 이 스위트 스팟이 컴퓨터가 무엇을 하느냐에 따라 달라진다는 것을 발견했습니다. 창의적인 스토리텔링이나 사실 확인과 관련된 작업의 경우, 더 많은 '다른' 목소리(구체적으로 4개에서 8개의 병렬 스트림)를 갖는 것이 가장 효과적이었습니다. 하지만 특정 이름을 기억해내는 것과 같은 단순한 기억 작업의 경우에는 단 하나의 목소리를 갖는 것이 실제로 가장 신뢰할 수 있었습니다.
저자들은 자신들의 수학적 증명이 이것이 '왜' 작동해야 하는지를 보여주고, 작은 모델에 대한 실험이 이것이 '실제로' 작동함을 보여주지만, 이것은 특정 유형의 오류에 대한 구체적인 해결책임을 주의 깊게 밝히고 있습니다. 그들은 환각이 단순히 지식이 부족해서 발생하는 것이 아니라, 모델의 내부 구성 요소들이 유사하고 잘못된 생각의 루프에 갇혀서 발생하는 경우가 많다고 주장합니다. 다양성을 통해 그 루프를 깨뜨림으로써, 거대하고 비싼 슈퍼컴퓨터를 구축하지 않고도 모델을 더 신뢰할 수 있게 만들 수 있습니다. 이는 AI가 거짓말을 덜 하게 만드는 영리하고 저비용의 방법이며, 때로는 한 번에 여러 가지 다른 질문을 던지는 것이 더 나은 답을 얻는 방법임을 입증합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.