← 최신 논문
💻 computer science

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

이 논문은 추론 모델이 잘못된 응답을 강요받는 대신, 누락된 정보를 요청하거나 미지의 정보에 따라 답변을 조건화하거나, 또는 답변을 유보하는 법을 학습함으로써 불충분하게 결정된 쿼리를 효과적으로 처리할 수 있도록 하는 강화 학습 프레임워크인 ACA-RL과 결측 전제 벤치마크(Missing-Premise Benchmark, MPB)를 소개한다.

원저자: Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 박식한 비서에게 질문을 던지고 있다고 상상해 보십시오. 하지만 당신은 퍼즐을 풀기 위해 필요한 결정적인 정보 하나를 실수로 빠뜨렸습니다. 예를 들어, 여행의 총 비용을 물어보면서 목적지를 언급하는 것을 잊었거나, 수학 문제의 해답을 구하면서 특정 숫자를 누락했을 수 있습니다. 현실 세계에서 유능한 인간이라면 잠시 멈추어 서서, 빈틈을 알아차리고 누락된 세부 정보를 요청할 것입니다. 그들은 답을 내기 위해 목적지를 추측하거나 숫자를 지어내지 않을 것입니다. 오랫동안 문제를 해결하도록 훈련된 인공지능 시스템들은 바로 이 특정한 상황에서 어려움을 겪어 왔습니다. 불완전한 질문에 직면했을 때, 이 시스템들은 스스로 빈칸을 채워 넣어야 한다는 강박을 느껴, 자신 있게 틀린 답을 내놓거나 가짜 사실을 만들어내곤 합니다. 이러한 행동은 '환각(hallucination)'이라고 알려져 있는데, 이는 모델들이 정답을 찾는 데 주로 훈련되었을 뿐, 답을 찾는 것이 불가능하다는 것을 인식하도록 훈련되지 않았기 때문에 발생합니다.

연구자들은 이러한 시스템에게 불확실성을 인식하도록 가르치기 위해 노력해 왔지만, 단순히 "모릅니다"라고 말하라고 지시하는 것만이 항상 가장 도움이 되는 반응은 아닙니다. 때로는 누락된 정보를 요청하는 것이 최선의 반응일 수 있습니다. 또 다른 경우에는, "여행지가 파리라면 비용은 10달러이지만, 런던이라면 20달러가 될 것입니다"와 같이 변수에 따라 달라지는 유용한 답변을 제공할 수도 있습니다. 이 논문은 인공지능이 이러한 불완전한 질문을 인간과 같은 세심함으로 처리하도록 훈련하는 새로운 방법을 소개합니다. 연구진은 모델이 누락된 정보를 묻거나, 조건부 답변을 제공하거나, 혹은 유용한 응답이 불가능할 때 정중하게 답변을 거부하도록 가르치는 시스템을 개발했습니다.

Ant International과 절강대학교(Zhejiang University)의 연구진이 이끄는 팀은 'Ask-Condition-Abstain(질문-조건-기권) 강화 학습'이라는 새로운 훈련 접근법을 만들었습니다. 모델에게 이러한 행동을 가르치기 위해, 그들은 먼저 의도적으로 망가뜨린 방대한 연습 문제 라이브러리를 구축해야 했습니다. 그들은 잘 구성된 해결 가능한 문제 120,000개를 가져와서, 각 문제에서 결정적인 정보 하나를 정교하게 제거하거나 변경했습니다. 이 과정은 무작위가 아니었습니다. 그들은 문제 해결을 위한 구조적 지도를 사용하여 어떤 사실이 정답에 필수적인지를 정확히 식별했습니다. 이러한 사실들을 정교하게 제거함으로써, 그들은 오직 질문이 불완전함을 인정하는 것만이 유일한 정답인 데이터셋을 만들어냈습니다.

이 훈련 데이터가 준비되자, 연구진은 특정 행동을 장려하는 보상 체계를 사용하여 모델을 가르쳤습니다. 시스템은 단순히 정답을 맞히는 것에만 보상을 주는 대신, 명확한 질문을 던지거나 무엇이 누락되었는지 설명하는 것에 점수를 주었습니다. 단순히 답변을 거부하는 것에는 더 적은 점수를 주었고, 사실을 지어내거나 추측하는 것에는 감점을 부여했습니다. 목표는 모델의 본능을 '답을 추측하는 것'에서 '빈틈을 식별하는 것'으로 전환하는 것이었습니다. 이 훈련이 실제로 효과가 있는지 테스트하기 위해, 연구진은 'Missing-Premise Benchmark(전제 누락 벤치마크)'라는 새로운 기준을 구축했습니다. 이 테스트 세트에는 수학, 논리, 실생활 문장제 문제를 아우르는, 정보가 누락된 것으로 엄격히 검증된 274개의 문제가 포함되었습니다.

결과는 새로운 훈련 방법이 불완전한 질문을 처리하는 능력을 크게 향상시켰음을 보여주었습니다. 이 방법으로 훈련된 모델은 단순히 정답을 찾도록 훈련되었거나 단순히 "모른다"고 말하도록 훈련된 모델보다 새로운 벤치마크에서 훨씬 높은 점수를 기록했습니다. 훈련된 모델들은 환각을 일으키거나 사실을 지어낼 가능성이 훨씬 낮았습니다. 대신, 그들은 자주 누락된 정보를 묻거나, 알 수 없는 변수에 따라 답이 어떻게 변하는지 설명하는 쪽을 택했습니다. 결정적으로, 이러한 개선은 정상적인, 완전한 문제를 해결하는 능력의 희생을 통해 이루어진 것이 아니었습니다. 모든 정보가 제공된 표준 수학 및 논리 퍼즐에 대해 테스트했을 때, 모델들은 이전과 마찬가지로 잘 수행되었으며, 이는 불확실성을 인식하도록 배우는 것이 해결 가능한 과제를 해결하는 능력을 저하시키지 않았음을 보여줍니다.

이 연구는 지능형 시스템의 다음 단계가 단순히 문제를 해결하는 속도가 빠르거나 정확해지는 것이 아니라, 문제가 제시된 대로 해결될 수 없는 때를 아는 능력이 되어야 함을 시사합니다. 모델에게 정보를 지어내는 대신 누락된 정보를 드러내도록 가르침으로써, 이 접근법은 더 안전하고 신뢰할 수 있는 비서를 만드는 데 기여합니다. 이러한 시스템은 잘못된 답을 자신 있게 제공하는 대신, 사용자에게 도움을 요청하거나 누락된 사실을 찾기 위해 도구를 사용할지 여부를 결정할 수 있습니다. 연구진은 자신들의 방법이 구조화된 문제의 논리적 공백에는 잘 작동하지만, 현실 세계의 질문은 더 복잡하고 모호할 수 있다고 언급했습니다. 그러나 이 연구는 인공지능이 자신의 지식의 한계를 인식하고 정보가 불완전할 때 건설적으로 대응하도록 가르치는 명확한 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →