← 최신 논문
🤖 AI

Preference Reasoning under Indeterminacy in Large Language Models

이 논문은 불완전한 정보와 존재하지 않는 해답에서 비롯되는 부정형성(indeterminacy)이 AI 선호 추론의 핵심 과제임을 주장하며, 최첨단 거대 언어 모델들이 결정된 사례와 결정되지 않은 사례를 체계적으로 구분하지 못해 추론의 미스캘리브레이션(miscalibrated reasoning)을 초래한다는 것을 입증한다.

원저자: Hadi Hosseini, Samarth Khanna, Xiyuan Wang

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hadi Hosseini, Samarth Khanna, Xiyuan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 개인 비서, 집단 의사결정의 중재자, 또는 복잡한 시스템의 매처(matchmaker)로서 역할을 수행하는 세상을 상상해 보십시오. 이러한 역할에서 기계는 사람의 욕구가 모호하거나, 불완전하거나, 심지어 모순적일 때조차 그들이 무엇을 원하는지 이해해야 합니다. 기계는 단지 최선의 선택이 무엇인지뿐만 아니라, 최선의 선택이 아예 존재할 수 없을 때는 어떻게 해야 하는지도 결정해야 합니다. 이것이 바로 컴퓨터가 인간의 욕망을 탐색하는 법을 배우는 분야인 선호 추론(preference reasoning)의 영역입니다. 수년 동안 연구자들은 모든 문제에 기다리고 있는 정답이 있는 수학 시험처럼, 명확하고 단일한 정답이 있는 퍼즐들을 사용하여 이 시스템들을 테스트해 왔습니다. 하지만 현실 세계는 그렇게 깔끔하지 않습니다. 현실에서는 정보가 누락되기도 하고, 상황의 규칙 자체가 해결책을 구성하는 것을 불가능하게 만들기도 합니다. 오늘날 과학자들이 직면한 질문은, 우리의 가장 진보된 AI가 해결이 필요한 문제와 답이 전혀 없는 문제를 구별할 수 있는지 여부입니다.

펜실베이니아 주립 대학교의 연구팀은 바로 이 능력을 테스트하기 위해 나섰습니다. 그들은 사람들에게 집을 배정하거나 시장에서 파트너를 매칭하는 것과 같은 고전적인 경제학 문제에 기반한 일련의 도전 과제들을 구축했습니다. 이러한 시나리오에서는 모든 사람에게 각자의 선호 목록이 있습니다. 연구진은 10개의 항목이 담긴 단순한 목록부터 수백 명의 에이전트가 포함된 복잡한 네트워크에 이르기까지 수천 개의 시나리오를 만들었습니다. 그들은 두 가지 유형의 불확실성을 포함하도록 테스트를 설계했습니다. 첫 번째 유형은 어떤 사람이 자신이 좋아하는 음식의 절반만을 나열하는 것처럼 제공된 정보가 단순히 불완전할 때 발생합니다. 두 번째 유형은 선호 구조 자체가 해결책을 불가능하게 만드는 경우로, 예를 들어 누군가는 반드시 불행해질 수밖에 없는 공정한 배치가 결코 존재할 수 없는 선호 체계와 같은 경우입니다. 연구진은 현재 사용 가능한 가장 강력한 네 가지 언어 모델에게 이 퍼즐들을 풀도록 요청했습니다. 그들은 기계가 언제 질문에 답할 수 없는지를 올바르게 식별할 수 있는지, 그리고 만약 그렇다면 추측하는 대신 모른다고 인정할 수 있는지를 확인하고자 했습니다.

결과는 이 시스템들의 사고방식에 심각한 사각지대가 있음을 드러냈습니다. 명확한 답이 있는 문제에 직면했을 때 모델들은 상세한 내용을 정확히 맞히며 잘 수행했습니다. 그러나 정보가 불완전하거나 해결책이 불가능한 경우, 모델들은 막다른 길을 인식하는 데 지속적으로 실패했습니다. "이것을 결정할 수 없다"라고 말하는 대신, 그들은 자신만만하게 답을 지어냈습니다. 그들은 누락된 간극을 채우기 위해 암묵적으로 가정을 세움으로써 이를 수행했습니다. 예를 들어, 어떤 사람의 선호 목록이 짧게 끊겨 있다면, 모델은 누락된 항목들이 알파벳 순서나 다른 임의의 규칙에 따라 배열되어 있다고 가정하고, 그 추측에 근거하여 확정적인 답을 내놓았습니다. 해결책이 존재하지 않는 경우에도 모델들은 종 often 가짜 해결책을 생성하거나, 해결책이 존재하지 않음에도 존재한다고 주장하곤 했습니다. 이러한 행동은 무작위적인 오류가 아니었습니다. 이는 체계적인 패턴이었습니다. 모델들은 더 열심히 생각해야 하는 상황과, 답이 존재하지 않기 때문에 더 열심히 생각하는 것이 도움이 되지 않는 상황을 구분하지 못하는 것처럼 보였습니다.

연구진은 모델에게 "모른다"라고 말할 수 있는 방법을 제공하는 것이 문제를 해결할 수 있는지도 테스트했습니다. 그들은 정보가 불충분하다고 느낄 때 모델이 선택할 수 있는 특정 옵션을 추가했습니다. 이것이 모델이 불확실성을 인정하는 데 도움을 주기는 했지만, 새로운 문제를 야기했습니다. 모델들은 이 옵션을 과도하게 사용하여, 해결책이 완벽하게 가능함에도 불구하고 해결책이 존재하지 않는다고 선언하기 시작했습니다. 그것은 마치 모델들이 맹목적인 자신감의 극단에서 과도한 신중함의 극단으로 휘둘려, 중간 지점을 찾지 못하는 것과 같았습니다. 연구진이 모델에게 문제를 풀기 위해 컴퓨터 코드를 작성하도록 허용했을 때도(이는 보통 정확도를 높이는 방법입니다), 모델들은 어려움을 겪었습니다. 그들은 모든 가능성을 확인하며 작고 단순한 버전의 문제는 풀 수 있었지만, 문제가 커짐에 따라 다시 추측하거나 포기하는 모습으로 돌아갔으며, 실제 세계의 응용 규모로 추론을 확장하지 못했습니다.

아마도 가장 결정적인 결과는 모델들에게 해결책을 만들라고 요구하는 대신, 단순히 선택지 중에서 올바른 것을 고르라고 요청한 테스트에서 나왔을 것입니다. 모델이 직접 구축하는 대신 답을 검증하기만 하면 되는 이 더 간단한 작업에서도, 그들은 빈번하게 틀린 옵션을 선택했습니다. 그들은 그럴듯해 보이지만 문제의 엄격한 규칙을 충족하지 못하는 해결책을 선택하곤 했습니다. 이 연구는 이러한 모델들이 정확성보다 유능하고 결단력 있게 보이는 것을 우선시하는 깊은 성향을 가지고 있음을 보여주었습니다. 그들은 패턴을 완성하고 그럴싸한 텍스트를 생성하도록 훈련받았기에, 이야기의 빈칸을 채우는 데는 뛰어나지만 이야기에 끝이 없다는 것을 인식하는 데는 서툽니다.

이 연구는 우리가 이러한 시스템을 중요한 의사결정 역할에 통합함에 있어, 그들에게 무엇을 기대해야 하는지 주의해야 함을 시사합니다. 질문에 답할 수 있는 능력만큼이나, 질문에 답할 수 없음을 인식하는 능력 또한 중요합니다. 현재 가장 진보된 모델들은 아직 그 차이를 신뢰할 수 있게 구별할 준비가 되어 있지 않습니다. 그들은 데이터가 누락되었거나 규칙상 해결책이 불가능한 상황에서도 자신감 있고 그럴듯한 답변을 계속해서 제공할 가능성이 높습니다. 이것이 바뀌기 전까지, 인간의 선호를 다루는 고위험 결정에 이러한 시스템을 의존하려면, 답변 자체뿐만 아니라 그 답변의 가능성 자체를 검증할 인간의 개입이 필요합니다. 이 연구는 모델들이 고장 났다고 주장하는 것이 아니라, 인간과는 다른 종류의 논리, 즉 알 수 있는 것의 한계를 받아들이는 데 어려움을 겪는 논리로 작동하고 있음을 밝히고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →