← 최신 논문
🤖 AI

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

이 논문은 MT-InfoSeek을 소개하며, 대규모 언어 모델이 불충분하게 정의된 다회차 작업에서 추가 정보의 필요성을 인식할 수는 있지만, 필요한 양을 체계적으로 과소평가하고, 최소한으로 충분한 질의를 식별하는 데 실패하며, 질의 순서 정하기에 어려움을 겪는다는 것을 입증함으로써 이들의 정보 탐색 능력과 현재의 평가 지표 사이에 뚜렷한 격차가 존재함을 보여준다.

원저자: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

의사가 환자 맞은편에 앉아 있는데, 환자가 단지 "통증이 있어요"라고만 말한다고 상상해 보십시오. 진단을 내리기 위해 의사는 추측할 수 없습니다. 반드시 구체적인 질문을 던져 빠져 있는 세부 사항을 채워 넣어야 합니다. 통증이 날카로운가요, 아니면 둔한가요? 정확히 어디에 위치해 있나요? 얼마나 오래 지속되었나요? 인공지능의 세계에서 대규모 언어 모델은 질문에 답하는 능력으로 자주 테스트되지만, 정보가 부족하여 아예 답을 할 수 없다는 사실을 인지하는 능력에 대해서는 거의 테스트받지 못합니다. 이것은 결정적인 격차입니다. 유능한 AI라면 상황이 불완전하다는 것을 인식하고, 무엇이 누락되었는지 정확히 파악하여, 결론을 내리기 전에 그것을 요청해야 합니다. 너무 빨리 추측한다면, 자신 있게 틀릴 위험이 있습니다.

하버드 대학교와 구글 딥마인드의 연구진은 이 특정한 기술을 테스트하기 위한 새로운 방법을 구축했습니다. 그들은 인공지능에게 누락된 조각이 있는 퍼즐을 제공하는 통제된 환경을 만들었습니다. 퍼즐은 숨겨진 숫자가 있는 수학 문제일 수도 있고, 누락된 사실이 있는 논리 퀴즈일 수도 있으며, 묻지 않은 증상이 있는 의료 시나리오일 수도 있습니다. AI의 목표는 단순히 퍼즐을 푸는 것이 아니라, 답이 명확해질 때까지 적절한 질문을 적절한 순서로 던지는 과정을 탐색하는 것입니다. 연구진은 이 모델들이 정확히 어떤 증거가 필요한지 아는 숙련된 조사관처럼 행동할 수 있는지, 아니면 불충분한 단서를 가지고 성급하게 결론을 내리려 할 것인지를 확인하고자 했습니다.

연구팀은 수학, 논리, 생물학, 의학, 일반 상식의 다섯 가지 분야에 걸쳐 5,000개 이상의 독특한 문제들을 포함하는 MT-INFOSEK이라는 테스트 스위트를 개발했습니다. 이 테스트에서 AI는 의도적으로 불완전한 시작점을 부여받습니다. 예를 들어, 의료 테스트에서 AI는 환자가 골반 통증을 앓고 있다는 것은 알지만, 통증이 얼마나 지속되었는지 또는 환자가 임신 중인지 여부는 모를 수 있습니다. AI는 그 후 '오라클(oracle)'—질문에 대한 진실된 답을 제공하는 시스템—와 한 번에 하나씩 질문을 주고받는 대화에 참여해야 합니다. AI는 언제 질문을 멈추고 최종 답변을 내놓을지 결정해야 합니다. 연구진은 성공 여부를 단순히 최종 답변이 맞았는지뿐만 아니라, AI가 그 답을 확신할 수 있을 만큼 충분한 정보를 실제로 수집했는지에 따라 측정했습니다.

결과는 현재 모델들의 심각한 약점을 드러냈습니다. AI 시스템들은 일반적으로 정보가 부족하다는 점은 인지했지만, 자신이 얼마나 많은 정보가 필요한지를 지속적으로 과소평가했습니다. 연구진이 두 개의 누락된 정보가 있어야 풀 수 있는 문제를 만들었을 때, 모델들은 종종 하나의 정보만 누락되었다고 추측했습니다. 논리 퀴즈에서 모델들은 정보를 과대평가하기보다 과소평가할 확률이 약 4배 더 높았습니다. 또한 그들은 문제를 해결할 수 있는 구체적인 질문을 식별하는 데 어려움을 겪었습니다. 심지 even 연구진이 모델들에게 몇 개의 질문을 해야 하는지 정확히 알려주었음에도 불구하고, 모델들은 종종 올바른 질문 세트를 선택하는 데 실패했습니다. 그들은 무관한 질문을 하거나 너무 일찍 질문을 멈추어 퍼즐을 풀지 못한 채로 남겨두곤 했습니다.

연구는 질문이 던져지는 순서도 살펴보았습니다. 의학 같은 분야에서는 정보의 순서가 중요합니다. 의사는 다음 검사를 결정하기 전에 통증이 급성인지 만성인지를 먼저 판단해야 합니다. 연구진은 AI 모델들이 올바른 질문을 하더라도 순서가 틀리면 최종 정확도가 크게 떨어진다는 것을 발견했습니다. 이는 무엇을 물어야 하는지 아는 것이 전투의 절반일 뿐이며, 언제 물어야 하는지를 아는 것이 똑같이 중요하다는 것을 시사합니다. 더욱이, 연구진은 모델이 첫 번째 질문을 잘못 던졌더라도 회복할 수 있다는 것을 발견했습니다. 만약 모델이 처음에 쓸모없는 질문을 했더라도 이후의 차례에서 관련 있는 질문들을 계속 던진다면, 여전히 올-바른 해결책에 도달할 수 있었습니다. 그러나 많은 모델은 지속하지 못하고, 충분한 증거를 수집하지 못했음에도 불구하고 몇 차례의 차례 후에 멈춰버리는 경우가 많았습니다.

아마도 가장 놀라운 발견은, 좋은 질문을 던지는 능력과 좋은 답을 주는 능력이 별개라는 점이었을 것입니다. 연구진은 AI가 필요한 모든 정보를 수집한 대화를 가져온 뒤, 다른 모델에게 그 대화만을 바탕으로 퍼즐을 풀어보라고 요청함으로써 이를 테스트했습니다. 그 결과, 일부 모델은 스스로 정보를 수집하는 데는 실패했을지라도, 전체 사실 세트가 주어지면 퍼즐을 완벽하게 풀 수 있다는 것을 발견했습니다. 이는 모델의 실패가 모델의 추론이나 지식의 문제가 아니라, 정보를 구하는 과정의 문제였음을 의미합니다. 모델들은 문제를 푸는 데 서툰 것이 아니라, 자신이 무엇을 모르는지 아는 데 서툴렀던 것입니다.

연구진은 현재의 인공지능 평가가 불완전하다고 결론지었습니다. 모델의 최종 답변 정확도만을 측정하는 것은 모델이 추측을 통해 답에 도달했는지, 혹은 누락된 정보를 무시하고 답에 도달했는지를 숨깁니다. AI가 세상과 어떻게 상호작용하는지를 진정으로 이해하려면, 불확실성을 인식하고, 무엇이 누락되었는지 식별하며, 그 누락된 정보를 단계별로 획득하는 능력을 측정해야 합니다. 이 새로운 프레임워크는 바로 그렇게 할 수 있는 방법을 제공하며, 오늘날의 모델들이 강력하기는 하지만, 언제 추측을 멈추고 질문을 시작해야 하는지 아는 인간 전문가의 직관적인 감각은 여전히 부족하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →