← 최신 논문
📄 health informatics

Grounding Health AI: Architecture and Evaluation of a Domain-Expert Metabolic Health Agent

본 논문은 인구 수준의 표현형 데이터, 전문가용 임상 도구, 그리고 선언적 행동 제약 조건을 결ald하여 환각 현상을 제거하고 대사 건강 보고의 높은 정확도를 달성하는 도메인 특화 AI 시스템인 HPP 퍼스널 헬스 에이전트를 제시하며, 이는 신뢰할 수 있는 의료용 AI를 위해서는 범용 언어 모델에만 의존하기보다 엄격한 평가 중심의 시스템 아키텍처가 필요함을 입증한다.

원저자: Diament, A., Sapir, G., Gorodetski, M., Wolf, A., Rice, A., Azouri, D., Etzion-Fuchs, A., Gelbard Solodkin, D., Talmor-Barkan, Y., Lutsker, G., Segal, E., Rossman, H.

게시일 2026-08-14
📖 6 분 읽기🧠 심층 분석

원저자: Diament, A., Sapir, G., Gorodetski, M., Wolf, A., Rice, A., Azouri, D., Etzion-Fuchs, A., Gelbard Solodkin, D., Talmor-Barkan, Y., Lutsker, G., Segal, E., Rossman, H.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신에게 어떤 책이든 읽고, 어떤 이야기든 쓰고, 인간처럼 대화할 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 '대규모 언어 모델(LLM)'입니다. 이 로봇은 자신감 있고 유창하게 말하는 데 매우 능숙합니다. 하지만 여기 함정이 있습니다. 만약 당신이 이 로봇에게 수학 문제를 풀게 하거나 당신의 개인 데이터를 바탕으로 구체적인 의료 조언을 구한다면, 이 로봇은 그저 잘 들어 보이는 데 급급해 내용을 지어낼 수도 있습니다. 이는 마치 날씨에 대해 설득력 있는 연설을 할 수 있는 재능 있는 배우가, 정작 정확한 온도를 물었을 때 실제로는 비가 오고 몹시 추운 상황임에도 불구하고 "72도입니다"라고 대충 짐작해서 답하는 것과 같습니다. 건강의 세계에서 이것은 매우 위험합니다. 만약 로봇이 당신의 혈당이 정상이라고 말했는데 실제로는 그렇지 않거나, 당신에게 없는 위험 요소를 지어낸다면, 이는 잘못된 결정으로 이어질 수 있습니다. 과학자들은 이 로봇들이 "환각 현상(hallucinating, 사실이 아닌 것을 지어내는 것)"을 일으키는 것을 막고, 특히 우리 몸과 관련된 문제에 있어서는 엄격하게 사실에만 근거하도록 만드는 방법을 연구하고 있습니다.

"Grounding Health AI(건강 AI의 근거 확립)"라는 제목의 이 논문은 이러한 건강 로봇을 위한 안전망을 구축하는 것에 관한 내용입니다. 연구진은 "Human Phenotype Project Personal Health Agent(HPP PHA)"라고 불리는 시스템을 만들었습니다. 이것은 로봇에게 엄격한 규칙책과 전문가용 계산기 팀, 그리고 확인을 위한 방대한 실제 인간 데이터 라이브러리를 제공하는 것이라고 생각하면 됩니다. 그들은 사람들의 혈당을 추적하는 장치(연속 혈당 측정기)와 음식 기록 데이터를 사용하여 이 시스템을 테스트했습니다. 결과는 어떠했을까요? 로봇이 이 새로운 시스템을 사용했을 때, 로봇은 숫자를 지어내지 않았습니다. 대신 당신의 혈당 패턴을 짐작하는 대신 실제 도구를 사용하여 계산했습니다. 위험을 지어내는 대신, 정보가 부족할 때는 정보가 없다고 인정했습니다. 연구팀은 이러한 "도구(tools)"를 "기술(skills, 대화 규칙)"과 결합함으로써, 구조와 사실 관계에서 약 37%의 정확도만을 보이던 로봇을 91%의 정확도를 가진 로봇으로 바꿀 수 있다는 것을 발견했습니다. 이는 의사와 환자가 실제로 신뢰할 수 있는 AI를 만들기 위한 큰 진전입니다.

문제점: 멋있어 보이려고 거짓말을 하는 로봇

당신이 미래형 로봇에게 2주 동안 먹은 모든 음식의 일기와 혈당 수치 그래프를 건네주었다고 상상해 보세요. 그리고 "내 대사 상태는 어때?"라고 묻습니다. 일반적인 초지능형 AI라면 아름답고 유창한 보고서를 작성할 것입니다. 아마도 "당신은 172끼의 식사를 했습니다!"(실제로는 70끼였는데도)라고 하거나, 혈당 변화가 매우 심했음에도 "혈당 변동이 완만했습니다"라고 말할 수도 있습니다. 문장은 완벽하게 들리겠지만, 그것은 거짓말입니다. 로봇은 글을 너무 잘 쓰는 나머지, 빈칸을 그럴듯해 보이지만 완전히 틀린 추측으로 채워버립니다.

연구진은 세계 최고의 AI 모델들조차 이런 행동을 한다는 것을 발견했습니다. AI는 'MAGE'(혈당이 얼마나 오르내리는지를 측정하는 지표)라는 지표를 만들어내어, 실제 수학적 계산으로는 84.8이 나와야 함에도 불구하고 41이라고 말하곤 했습니다. 또한 데이터에는 70개의 식사 기록만 있는데도 172끼를 분석했다고 주장하기도 했습니다. 심지어 계산할 도구가 없음에도 미래의 건강 위험을 예측하기도 했습니다. 이는 마치 요리법을 모르면서 자신이 맛보지도 않은 음식에 대해 별 다섯 개짜리 리뷰를 쓰는 요리사와 같습니다. 일반인에게는 혼란스러운 일이지만, 의사에게는 위험한 일입니다.

해결책: "그라운딩(Grounding)" 스택

이를 해결하기 위해 연구팀은 PHA라는 새로운 종류의 AI 에이전트를 구축했습니다. 그들은 단순히 로봇에게 "조심하라"고 말한 것이 아닙니다. 대신 네 개의 층으로 이루어진 "그라운딩(근거 확립)" 시스템을 만들었습니다. 로봇이 시험을 치르는 학생이라고 상상해 보세요.

  1. 참조 라이브러리 (Human Phenotype Project): 첫째, 연구진은 로봇에게 13,000명 이상의 실제 사람들의 데이터가 담긴 거대한 라이브러리를 주었습니다. 이것은 단순한 무작위 숫자가 아니라, 음식과 운동에 대해 인간의 몸이 어떻게 반응하는지에 대한 깊이 있는 데이터입니다. 만약 로봇이 "당신의 혈당이 높습니다"라고 말하고 싶다면, 이 라이브러리를 확인하여 당신과 같은 연령대와 성별을 가진 다른 사람들이 어떤 수준을 보이는지 확인해야 합니다. 이는 단순히 점수가 잘 나왔는지 짐작하는 것이 아니라, 13,000명의 학생이 있는 거대한 학급의 성적과 비교하는 것과 같습니다.
  2. 전문가 도구 (계산기): 다음으로, 연구진은 로봇에게 21개의 특정 계산기로 구성된 도구 상자를 주었습니다. 로봇은 머릿속으로 수학 계산을 하는 것이 허용되지 않습니다. 만약 평균 혈당을 알아야 한다면, 반드시 특정 도구에 계산을 요청해야 합니다. 심장 위험을 알아야 한다면, 특정 심장 위험 계산기를 사용해야 합니다. 로봇은 단지 전달자일 뿐이며, 실제 힘든 작업은 도구들이 수행합니다.
  3. 행동 기술 (규칙책): 이 부분이 가장 영리한 부분입니다. 로봇은 단순한 텍스트 파일(규칙책과 같은)로 작성된 일련의 "기술(skills)"을 가지고 있습니다. 이 규칙들은 로봇이 무엇을 말할 수 있고 무엇을 말할 수 없는지를 알려줍니다. 예를 들어, "도구를 통해 식사 횟수를 계산하지 않았다면, 그 사람이 몇 끼를 먹었는지 말할 수 없다"라는 규칙이 있을 수 있습니다. 또 다른 규칙은 "혈압 데이터가 없다면, 심장 위험을 추측할 수 없다"라고 명시할 수 있습니다. 이 규칙들은 로봇이 아무리 말하고 싶더라도 멋대로 지어내는 것을 막아줍니다.
  4. 테스트 기반 사이클 (채점기): 마지막으로, 연구진은 로봇을 만드는 과정 중에 실시간으로 테스트하는 시스템을 구축했습니다. 로봇이 실수(예: 숫자를 지어내는 경우)를 할 때마다, 연구진은 다음에 똑같은 실수를 잡을 수 있도록 특정한 테스트를 추가로 작성합니다. 이는 비디오 게임에서 구덩이에 빠질 때마다, 다시는 그곳에 빠지지 않도록 새로운 함정을 추가하는 것과 같습니다.

무엇을 발견했는가: 도구 vs 규칙

연구진은 대규모 실험을 진행했습니다. 14명의 실제 데이터를 가져와서 서로 다른 설정으로 로봇에게 보고서를 쓰게 했습니다. 그들은 다음을 비교했습니다:

  • 베이스라인 (Baseline): 도구나 규칙이 없는 일반적인 스마트 로봇.
  • 도구만 사용 (Tools Only): 계산기는 있지만 규칙책은 없는 로봇.
  • 전체 시스템 (Full System): 계산기와 규칙책을 모두 갖춘 로봇.

결과는 명확하고 놀라웠습니다.

  • 베이스라인 로봇: "신뢰성" 테스트에서 0.37(1.0 만점)의 점수를 받았습니다. 문장은 유창했지만 가짜 사실들로 가득했습니다.
  • 도구만 사용: 계산기는 주었지만 규칙책은 주지 않았을 때, 점수는 0.49로 약간 상승했습니다. 이제 로봇은 수학 계산을 할 수 있게 되었지만, 여전히 그것을 올바르게 보고하는 법을 몰랐습니다. 계산 과정을 언급하는 것을 잊거나, 도구가 지원하지 않는 내용을 말하기도 했습니다.
  • 전체 시스템: 그 위에 규칙책(기술)을 더하자, 점수는 0.91로 급등했습니다.

여기서 얻은 큰 교훈은 도구와 규칙이 서로 다른 역할을 수행한다는 것입니다. 도구는 숫자를 정확하게 만들었습니다(정확도를 14%에서 90%로 향상). 하지만 규칙은 보고서를 완전하고 정직하며 적절한 구조로 만들었습니다. 규칙이 없으면 로봇은 답은 가지고 있지만 그것을 어떻게 제시해야 할지 모릅니다. 규칙이 더해지자, 로봇은 신뢰할 수 있는 조수가 되었습니다.

"거절"이라는 초능력

이 새로운 시스템이 배운 가장 멋진 것 중 하나는 "모른다"라고 말하는 법이었습니다. 이전 테스트에서는 데이터(예: 혈압 수치)가 부족할 때 로봇이 그냥 혈당 위험을 추측해 버렸습니다. 혈압 데이터가 없는데도 "당신의 위험도가 높습니다"라고 말하곤 했습니다.

하지만 새로운 시스템은 멈추는 법을 배웠습니다. 혈압 데이터 없이 심장 위험을 계산하려고 하면, 규칙에 의해 "혈압 데이터가 누락되어 이를 계산할 수 없습니다. 먼저 이 데이터를 확보해 주세요"라고 말하도록 강제되었습니다. 로봇은 거짓말하기를 거부했습니다. 이는 엄청난 변화입니다. 항상 답을 내놓으려 노력하는(비록 틀린 답일지라도) 로лот에서, 자신의 한계를 아는 로봇으로 변한 것입니다.

다른 분야에도 적용될 수 있을까?

연구진은 이 시스템이 다른 유형의 건강 질문도 처리할 수 있는지 테스트했습니다. 그들은 일반적인 대사 건강과 심혈관 위험에 대해 질문해 보았습니다. 시스템은 두 경우 모두 잘 작동하여, 낮은 점수인 0.37에서 0.70 또는 0.72까지 올라갔습니다. 이는 그들이 찾아낸 "레시피"—즉, 실제 데이터, 특정 도구, 그리고 엄격한 규칙을 결합하는 방식—가 혈당뿐만 아니라 의학의 다양한 분야에 사용될 수 있음을 시사합니다.

결론

이 논문은 건강을 위한 AI를 만들려면 단순히 AI를 더 "똑똑하게" 만드는 것만으로는 부족하다는 것을 보여줍니다. 우리는 AI가 반드시 실제 계산기를 사용하고, 실제 인간 데이터와 대조하며, 무엇을 말할 수 있는지에 대한 엄격한 규칙을 따르도록 강제하는 시스템을 구축해야 합니다. 그 결과, 무섭거나 틀린 사실을 지어낼 가능성이 훨씬 적은 시스템이 탄근되었습니다.

연구진은 아직 이것이 완벽한 해결책은 아니라고 인정합니다. 이들은 소규모 그룹을 대상으로 테스트했으며, 주로 서면 보고서에 집중했고 실시간 대화는 다루지 않았습니다. 또한, 보고서의 "본질"(환자에게 얼마나 도움이 되거나 친절하게 느껴지는지)은 컴퓨터로 테스트하기 어려우며 인간 의사의 검토가 필요하다고 언급했습니다. 하지만 보고서의 "형식"(숫자, 출처, 그리고 정직함)에 있어서, 이 새로운 시스템은 거대한 진전입니다. 이 시스템은 자신감 있게 들리지만 틀린 말을 하는 로봇을, 자신감 있게 들리는 이유가 바로 '옳기 때문'인 로봇으로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →