← 최신 논문
🤖 machine learning

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

이 논문은 검색 에이전트의 환각 현상을 완화하기 위해 검색이 실패했을 때 모델이 답변을 자제하도록 유도함으로써, 미미한 정확도 손실만으로 정밀도와 신뢰성을 크게 향상시키는, 절제 보상(abstention rewards)을 동적으로 형성하는 새로운 학습 패러다임인 절제 인지 강화 학습(Abstention-Aware Reinforcement Learning, AWA-RL)을 소개한다.

원저자: Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

게시일 2026-07-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 질문을 아주 좋아하는 똑똑한 로봇 친구가 있다고 상상해 보세요. 당신이 "프랑스의 수도는 어디인가요?"라고 물으면, 로봇은 "파리입니다!"라고 대답합니다. 아주 좋습니다. 하지만 그 다음 당신이 "황제의 투명 수프의 비밀 레시피는 무엇인가요?"라고 묻자, 로봇은 "모릅니다"라고 말하는 대신 "고스트 칠리와 달빛 가루로 만듭니다"라며 자신 있게 이야기를 지어냅니다. 로봇이 당신을 괴롭히려고 그러는 게 아닙니다. 그저 당신을 기쁘게 해주고 싶어서 너무 의욕이 앞선 것뿐이죠. AI의 세계에서는 이를 **환각(hallucination)**이라고 부르며, 로보가 인터넷에서 실제 사실을 검색해야 할 때 이는 큰 문제가 됩니다.

오랫동안 과학자들은 로봇에게 웹을 검색하도록 가르쳐 이 문제를 해결하려고 노력했습니다. 그들은 **강화 학습(Reinforcement Learning, RL)**이라는 훈련 방법을 사용했는데, 이는 로봇이 정답을 찾으면 점수를 얻는 비디오 게임과 같습니다. 하지만 여기에는 함정이 있습니다. 이 게임은 오직 정답을 맞혔을 때만 점수를 줄 뿐, 언제 멈춰야 하는지에 대해서는 점수를 주지 않았습니다. 그래서 로봇은 답을 찾지 못할 때 그냥 추측을 해서라도 점수를 얻으려고 사실을 지어내곤 했습니다. 이는 마치 학생이 "모르겠습니다"라고 손을 드는 대신, 바보처럼 보이지 않으려고 시험에서 그냥 답을 찍어버리는 것과 같습니다.

이 논문의 저자인 펑지 장(Fengji Zhang)과 그의 팀은 이렇게 말합니다. "잠깐만요! 우리는 로봇이 막혔을 때 '모릅니다'라고 말하는 법을 가르쳐야 합니다." 하지만 그들은 단순히 로봇에게 "모른다"고 말하라고 지시하는 것만으로는 충분하지 않다는 것도 깨달았습니다. 만약 로봇이 추측하는 것에 대해 너무 강하게 벌을 준다면, 로봇은 겁을 먹고 쉬운 질문조차 대답하지 않을 수도 있습니다. 이를 "게으른 거절(lazy refusal)"이라고 하며, 이는 사실을 지어내는 것만큼이나 나쁜 현상입니다.

그래서 그들은 AWA-RL(Abstention-Aware Reinforcement Learning, 절제 인지 강화 학습)이라는 새로운 훈련 방법을 고안했습니다. 이것은 로봇이 게임을 하는 것을 지켜보는 매우 영리한 코치와 같습니다. 고정된 규칙인 "확신이 없으면 대답하지 마"라고 말하는 대신, 코치는 질문의 특성을 살펴봅니다.

  • "용기" 요소: 코치는 "용기" 요소(그리스 문자 감마, γ\gamma로 표현됨)라는 특별한 다이얼을 가지고 있습니다. 이 다이얼은 로봇이 얼마나 용감해져야 하는지를 조절합니다.
    • 다이얼을 높게 설정하면, 로봇은 매우 용감해져서 확신이 없더라도 모든 것에 답하려고 노력합니다.
    • 다이얼을 낮게 설정하면, 로봇은 매우 신중해져서 거의 모든 질문에 "모릅니다"라고 답합니다.
    • AWA-RL의 핵심은 코치가 질문의 난이도와 현재 로봇의 상태에 따라 보상을 동적으로 조정한다는 것입니다. 로봇이 잘하고 있다면 코치는 계속 시도하도록 격려합니다. 만약 로봇이 너무 많이 추측하기 시작하면, 코치는 부드럽게 제동을 겁니다.

팀은 이 방법을 세 가지 까다로운 퍼즐 게임(HotpotQA, 2WikiMultiHopQA, MuSiQue 데이터셋)에서 테스트했습니다. 여기서 로봇은 답을 찾기 위해 위키피디아를 검색해야 했습니다. 그들은 이 새로운 방법을 기존 방식들과 비교했습니다:

  1. "모릅로습니다" 예시를 단순히 섞어 넣는 방식: 이 방법은 잘 작동하지 않았습니다. 로봇은 혼란에 빠지거나, 쉬운 질문에도 너무 자주 "모릅니다"라고 말하기 시작했습니다.
  2. 추측에 대해 고정된 "벌칙"을 주는 방식: 이것은 호두를 깨는 데 망치를 사용하는 것과 같았습니다. 벌칙이 너무 강하면 로봇은 모든 대답을 거부했고(99.9% 거절!), 벌칙이 너무 약하면 로봇은 계속해서 사실을 지어냈습니다.

그들은 무엇을 발견했을까요?
AWA-RL 방식은 판도를 바꾸어 놓았습니다. 그 "용기" 다이얼을 사용하여, 그들은 로봇이 훨씬 더 신뢰할 수 있게 되는 최적의 지점(용기 요소 약 0.20)을 찾아냈습니다.

  • 이 방법은 로봇의 정밀도(Precision)(대답을 했을 때 얼마나 자주 맞는지)를 최대 **10.3%**까지 높였습니다.
  • 또한, 유용함과 정직함의 균형을 맞춘 새로운 점수인 RA-F1을 설정에 따라 **2.9%에서 5.2%**까지 향상시켰습니다.
  • 가장 좋은 점은 무엇일까요? 로봇은 질문에 답하는 전반적인 능력 자체를 크게 잃지 않았다는 것입니다. 단지 막혔을 때 사실을 지어내는 행동을 멈췄을 뿐입니다.

이 논문은 이 방법이 특정 테스트에서는 매우 효과적임을 보여주지만, 저자들은 아직 모든 종류의 로봇이나 모든 종류의 질문에 대해 테스트한 것은 아니라고 신중하게 밝히고 있습니다. 또한, 현재로서는 "용기" 다이얼을 사람이 직접 조정해야 하며, 향후에는 이를 자동화하기를 희망한다고 덧붙였습니다.

요약하자면, AWA-RL은 AI에게 아는 척하며 말을 지어내는 '박학다식한 척하는 사람'이 아니라, 자신의 한계를 아는 '자신감 있는 전문가'가 되는 법을 가르칩니다. 이는 AI 에이전트가 단순히 똑똑한 것을 넘어, 신뢰할 수 있는 존재가 되기 위한 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →